AI Safety
Aprende los pilares fundamentales de la seguridad de la IA, incluida la alineación y la robustez. Descubre cómo desplegar modelos fiables con Ultralytics YOLO26 y garantizar la fiabilidad de la IA.
La seguridad de la IA es un campo multidisciplinar centrado en garantizar que los sistemas de Inteligencia Artificial (AI) funcionen de forma fiable, predecible y beneficiosa. A diferencia de la ciberseguridad, que protege los sistemas frente a ataques externos, la seguridad de la IA aborda los riesgos inherentes al propio diseño y funcionamiento del sistema. Esto incluye prevenir consecuencias no deseadas derivadas de una desalineación de objetivos, de la falta de robustez en entornos nuevos o de fallos en la generalización del aprendizaje profundo (DL). A medida que los modelos se vuelven más autónomos, investigadores de organizaciones como el Center for Human-Compatible AI trabajan para garantizar que estas tecnologías se ajusten a la intención humana y a los estándares de seguridad.
Pilares fundamentales de una IA segura#
La creación de un sistema seguro requiere abordar varios desafíos técnicos que van más allá de las simples métricas de precisión. Estos pilares garantizan que los modelos de aprendizaje automático (ML) permanezcan bajo control incluso cuando se implementan en escenarios complejos del mundo real.
- Robustez: Un modelo seguro debe mantener su rendimiento al enfrentarse a entradas corruptas o a cambios en el entorno. Esto incluye la defensa frente a ataques adversarios, en los que manipulaciones sutiles de los datos de entrada pueden engañar a un modelo para que cometa errores con un alto nivel de confianza.
- Alineación: Este principio garantiza que los objetivos de una IA coincidan con la verdadera intención de quien la diseña. La desalineación suele producirse en el aprendizaje por refuerzo, cuando un sistema aprende a «jugar» con su función de recompensa, como un robot de limpieza que rompe un jarrón para limpiar los restos más rápido. Para mitigar este problema se utilizan técnicas como el aprendizaje por refuerzo a partir de los comentarios humanos (RLHF).
- Interpretabilidad: También conocida como IA explicable (XAI), consiste en aportar transparencia a los modelos de «caja negra». La visualización de los mapas de características permite a los ingenieros comprender el proceso de toma de decisiones y garantizar que el modelo no dependa de correlaciones espurias.
- Supervisión: La supervisión continua del modelo es esencial para detectar la deriva de datos. Los protocolos de seguridad deben activar alertas o mecanismos de respaldo si los datos del mundo real empiezan a divergir significativamente de los datos de entrenamiento.
Aplicaciones en el mundo real#
La seguridad de la IA es primordial en ámbitos de alto riesgo, donde un fallo algorítmico podría provocar daños físicos o pérdidas económicas importantes.
-
Vehículos autónomos: En el campo de la IA en el sector automovilístico, los marcos de seguridad definen cómo reacciona un coche ante la incertidumbre. Si un modelo de detección de objetos no puede identificar un obstáculo con un alto nivel de confianza, el sistema debe pasar por defecto a un estado seguro, como frenar, en lugar de adivinar. Las directrices de la NHTSA sobre vehículos automatizados hacen hincapié en estos mecanismos a prueba de fallos.
-
Diagnóstico médico: Al aplicar la IA en la atención sanitaria, la seguridad implica minimizar los falsos negativos en los diagnósticos críticos. Los sistemas suelen ajustarse para lograr un alto recall y garantizar que no se pase por alto ninguna posible afección, funcionando en la práctica como una «segunda opinión» para los médicos. Organismos reguladores como el Centro de Salud Digital de la FDA establecen estándares rigurosos para el software como producto sanitario (SaMD).
Implementación de umbrales de seguridad#
Uno de los mecanismos de seguridad más básicos en la visión por ordenador es el uso de umbrales de confianza. Al filtrar las predicciones de baja probabilidad durante la inferencia, los desarrolladores evitan que los sistemas actúen basándose en información poco fiable.
El siguiente ejemplo muestra cómo aplicar un filtro de seguridad mediante Ultralytics YOLO26, garantizando que solo se procesen detecciones fiables.
from ultralytics import YOLO
# Load the YOLO26 model (latest standard for efficiency)
model = YOLO("yolo26n.pt")
# Run inference with a strict confidence threshold of 0.7 (70%)
# This acts as a safety gate to ignore uncertain predictions
results = model.predict("https://ultralytics.com/images/bus.jpg", conf=0.7)
# Verify detections meet safety criteria
print(f"Safety Check: {len(results[0].boxes)} objects detected with >70% confidence.")Seguridad de la IA frente a ética de la IA#
Aunque estos términos suelen utilizarse indistintamente, abordan aspectos diferentes de la IA responsable.
- La seguridad de la IA es una disciplina técnica de ingeniería. Se pregunta: «¿Funcionará este sistema correctamente sin provocar accidentes?». Aborda problemas como las alucinaciones del modelo y la exploración segura en el aprendizaje por refuerzo.
- La ética de la IA es un marco sociotécnico. Se pregunta: «¿Deberíamos crear este sistema y es justo?». Se centra en cuestiones como el sesgo algorítmico, los derechos de privacidad y la distribución equitativa de los beneficios, tal como se establece en la Ley de IA de la UE.
Perspectivas de futuro#
A medida que el sector avanza hacia la Inteligencia Artificial General (AGI), la investigación sobre seguridad adquiere una importancia cada vez mayor. Las organizaciones pueden aprovechar la Ultralytics Platform para gestionar sus conjuntos de datos y supervisar el despliegue de modelos, garantizando que sus soluciones de IA sigan siendo robustas, transparentes y estén alineadas con los estándares de seguridad durante todo su ciclo de vida.









