Data Poisoning
Aprende sobre el envenenamiento de datos (data poisoning) y su impacto en la IA. Descubre cómo asegurar los modelos de Ultralytics YOLO26 y proteger los datos de entrenamiento con la Plataforma Ultralytics.
El envenenamiento de datos es una amenaza de ciberseguridad en la que actores malintencionados manipulan intencionadamente los datos de entrenamiento utilizados para construir modelos de Machine Learning (ML). Al corromper el conjunto de datos antes de entrenar un modelo, los atacantes pueden introducir puertas traseras ocultas, inducir sesgos o degradar el rendimiento general del modelo. A diferencia de otras vulnerabilidades de seguridad que se dirigen al código de un sistema, los ataques de envenenamiento de datos se dirigen al proceso de aprendizaje en sí, lo que hace que sean increíblemente difíciles de detectar una vez que el modelo se despliega en entornos de producción. Según el resumen de inteligencia sobre amenazas de IBM, estos ataques plantean graves riesgos para la integridad y la fiabilidad de los sistemas de inteligencia artificial.
La mecánica del envenenamiento de la IA#
A medida que las organizaciones dependen cada vez más del Deep Learning (DL) y de los Large Language Models (LLMs), a menudo recopilan grandes cantidades de datos no verificados de internet. Esta práctica crea oportunidades para la inyección de datos, donde los adversarios insertan puntos de datos fabricados o maliciosos en repositorios públicos. Estudios recientes sobre el envenenamiento de la IA de 2025 revelan una realidad alarmante: incluso en modelos masivos con miles de millones de parámetros, un atacante solo necesita manipular un número mínimo y casi constante de muestras para comprometer el sistema.
El envenenamiento de LLMs ocurre cuando se inyectan frases desencadenantes específicas en textos que el modelo consume durante el entrenamiento. Una vez desplegado, el modelo puede funcionar normalmente hasta que un usuario introduce la frase desencadenante, lo que hace que el sistema eluda los protocolos de seguridad o genere resultados tóxicos. La investigación de Anthropic de 2025 sobre el envenenamiento de LLMs demuestra que tan solo 250 documentos envenenados pueden crear una puerta trasera en un modelo de 13 mil millones de parámetros.
Aplicaciones y ejemplos en el mundo real#
El envenenamiento de datos va más allá de la generación de texto y afecta gravemente también a los modelos de Computer Vision (CV). Aquí tienes dos ejemplos concretos de cómo se materializa esta amenaza en aplicaciones del mundo real:
- Alteración de los modelos de arte generativo: Herramientas como el proyecto Nightshade permiten a los artistas digitales alterar sutilmente los píxeles de sus obras de arte antes de subirlas en línea. Cuando un modelo de Generative AI extrae estas imágenes para el entrenamiento, los píxeles alterados actúan como un veneno, provocando que el modelo clasifique erróneamente las indicaciones por completo, como generar la imagen de un gato cuando se le pide la de un coche.
- Compromiso de vehículos autónomos: En los sistemas de detección de objetos utilizados para coches autónomos, un atacante podría alterar sutilmente las imágenes de las señales de stop en un conjunto de datos de entrenamiento de código abierto. Al aplicar un ruido visual específico, los datos de entrenamiento envenenados enseñan al modelo a malinterpretar las señales de stop como señales de límite de velocidad, lo que plantea riesgos catastróficos para la seguridad.
Diferenciación de los ataques adversarios#
Aunque están estrechamente relacionados, es importante distinguir el envenenamiento de datos de los ataques adversarios. Los ataques adversarios ocurren durante la inferencia: el autor del ataque manipula los datos de entrada (como poner una pegatina en una señal de stop real) para engañar a un modelo ya entrenado. Por el contrario, el envenenamiento de datos ocurre durante el entrenamiento, alterando fundamentalmente la lógica interna del modelo desde cero. Abordar ambos requiere sólidos protocolos de AI Safety.
Mitigación de riesgos en el desarrollo de modelos#
Defenderse de estas amenazas requiere una monitorización de modelos rigurosa y el uso de datos de validación prístinos y de confianza para verificar la integridad del modelo. Evaluar un modelo frente a un conjunto de datos verificado puede ayudar a los equipos a detectar caídas de rendimiento inesperadas que puedan indicar manipulación. Las mejores prácticas descritas por la investigación de seguridad de OpenAI y el OWASP GenAI Security Project enfatizan una estricta procedencia de los datos y el uso de conjuntos de datos seleccionados en lugar de la extracción web sin procesar.
Al construir y probar modelos, los equipos deben aprovechar marcos establecidos como PyTorch o TensorFlow junto con rutinas de validación integrales. Puedes validar fácilmente tu modelo Ultralytics YOLO26 con un conjunto de datos limpio y de confianza para asegurarte de que la precisión no se ha visto comprometida.
from ultralytics import YOLO
# Load a custom-trained Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Validate the model on a trusted dataset to detect performance drops
# Sudden decreases in precision/recall may indicate data poisoning
metrics = model.val(data="clean_validation_data.yaml")
print(f"mAP50-95: {metrics.box.map}") # Review core metricsPara proyectos de visión artificial a gran escala, es fundamental realizar un seguimiento de estas métricas en múltiples ejecuciones de entrenamiento. Los desarrolladores pueden explorar perspectivas de evaluación de modelos para comprender el rendimiento de referencia y utilizar la Ultralytics Platform para anotar, entrenar y gestionar datos de forma segura sin depender de fuentes externas no verificadas. Combinar la curación segura de datos con técnicas controladas de aumentación de datos ayuda a garantizar que tus modelos sigan siendo tanto precisos como resistentes frente a la manipulación externa.






