Data Poisoning
Aprende qué es el envenenamiento de datos y cómo afecta a la IA. Descubre cómo proteger los modelos Ultralytics YOLO26 y los datos de entrenamiento con Ultralytics Platform.
El envenenamiento de datos es una amenaza de ciberseguridad en la que agentes maliciosos manipulan intencionadamente los datos de entrenamiento utilizados para crear modelos de aprendizaje automático (ML). Al corromper el conjunto de datos antes de entrenar un modelo, los atacantes pueden introducir puertas traseras ocultas, generar sesgos o reducir el rendimiento general del modelo. A diferencia de otros ataques de seguridad que apuntan al código de un sistema, los ataques de envenenamiento de datos apuntan al propio proceso de aprendizaje, por lo que son muy difíciles de detectar una vez que el modelo se despliega en producción. Según el resumen de inteligencia sobre amenazas de IBM, estos ataques suponen graves riesgos para la integridad y fiabilidad de los sistemas de inteligencia artificial.
Cómo funciona el envenenamiento de la IA#
A medida que las organizaciones dependen cada vez más del aprendizaje profundo (DL) y los modelos de lenguaje grandes (LLMs), a menudo recopilan enormes cantidades de datos no verificados de Internet. Esta práctica abre la puerta a la inyección de datos, mediante la cual los atacantes insertan datos falsos o maliciosos en repositorios públicos. Los estudios sobre el envenenamiento de la IA publicados en 2025 revelan una realidad alarmante: incluso en modelos enormes con miles de millones de parámetros, un atacante solo necesita manipular un número casi constante y mínimo de muestras para comprometer el sistema.
El envenenamiento de LLM se produce cuando se inyectan frases desencadenantes específicas en los textos que consume el modelo durante el entrenamiento. Una vez desplegado, el modelo puede funcionar con normalidad hasta que un usuario introduce la frase desencadenante, lo que provoca que el sistema eluda los protocolos de seguridad o genere contenido tóxico. La investigación de Anthropic de 2025 sobre el envenenamiento de LLM demuestra que apenas 250 documentos envenenados pueden crear una puerta trasera en un modelo de 13.000 millones de parámetros.
Aplicaciones y ejemplos del mundo real#
El envenenamiento de datos no se limita a la generación de texto, sino que también afecta gravemente a los modelos de visión artificial (CV). Estos son dos ejemplos concretos de cómo se materializa esta amenaza en aplicaciones del mundo real:
- Alteración de modelos de arte generativo: Herramientas como el proyecto Nightshade permiten a los artistas digitales modificar sutilmente los píxeles de sus obras antes de subirlas a Internet. Cuando un modelo de IA generativa recopila estas imágenes para entrenarse, los píxeles modificados actúan como veneno y hacen que el modelo clasifique mal las indicaciones, por ejemplo, que genere la imagen de un gato cuando se le pide un coche.
- Compromiso de vehículos autónomos: en los sistemas de detección de objetos utilizados en coches autónomos, un atacante podría modificar sutilmente imágenes de señales de stop en un conjunto de datos de entrenamiento de código abierto. Al aplicar un ruido visual específico, los datos de entrenamiento envenenados enseñan al modelo a interpretar las señales de stop como señales de límite de velocidad, lo que supone riesgos catastróficos para la seguridad.
Diferencias con los ataques adversarios#
Aunque están estrechamente relacionados, es importante distinguir el envenenamiento de datos de los ataques adversarios. Los ataques adversarios se producen durante la inferencia: el atacante manipula los datos de entrada (por ejemplo, colocando una pegatina en una señal de stop real) para engañar a un modelo ya entrenado. En cambio, el envenenamiento de datos se produce durante el entrenamiento y altera por completo la lógica interna del modelo desde el principio. Para abordar ambos problemas, hacen falta protocolos sólidos de seguridad de la IA.
Mitigación de riesgos en el desarrollo de modelos#
Defenderse de estas amenazas requiere una monitorización rigurosa de los modelos y el uso de datos de validación impecables y fiables para verificar la integridad del modelo. Evaluar un modelo con un conjunto de datos verificado puede ayudar a los equipos a detectar caídas inesperadas del rendimiento que podrían indicar una manipulación. Las buenas prácticas descritas en la investigación sobre seguridad de OpenAI y el Proyecto de seguridad GenAI de OWASP hacen hincapié en la procedencia estricta de los datos y en el uso de conjuntos de datos seleccionados en lugar de la extracción indiscriminada de datos de la web.
Al crear y probar modelos, los equipos deben aprovechar frameworks consolidados como PyTorch o TensorFlow, junto con rutinas de validación exhaustivas. Puedes validar fácilmente tu modelo Ultralytics YOLO26 con un conjunto de datos limpio y fiable para asegurarte de que su precisión no se ha visto comprometida.
from ultralytics import YOLO
# Load a custom-trained Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Validate the model on a trusted dataset to detect performance drops
# Sudden decreases in precision/recall may indicate data poisoning
metrics = model.val(data="clean_validation_data.yaml")
print(f"mAP50-95: {metrics.box.map}") # Review core metricsEn proyectos de visión artificial a gran escala, es esencial hacer un seguimiento de estas métricas en varias ejecuciones de entrenamiento. Los desarrolladores pueden consultar información sobre la evaluación de modelos para conocer el rendimiento de referencia y utilizar la plataforma Ultralytics para anotar, entrenar y gestionar datos de forma segura sin depender de fuentes externas no verificadas. Combinar una selección segura de datos con técnicas controladas de aumento de datos ayuda a garantizar que los modelos sigan siendo precisos y resistentes a manipulaciones externas.









