AI Guardrails
Aprende cómo las barreras de seguridad de la IA protegen los sistemas mediante controles por capas de seguridad, privacidad, protección, supervisión y control humano, además de un ejemplo de IA para visión con YOLO26.
Las barreras de protección de la IA son controles técnicos y organizativos que mantienen los sistemas de inteligencia artificial dentro de unos límites definidos de seguridad, privacidad y funcionamiento. Reducen riesgos como las respuestas perjudiciales, la inyección de prompts, las acciones no autorizadas y la exposición de datos sensibles. A diferencia de la seguridad de la IA en sentido amplio, las barreras de protección son salvaguardas específicas que se aplican antes, durante y después de la inferencia del modelo. El perfil de IA generativa del NIST recomienda gestionar estos controles durante todo el ciclo de vida de la IA. (nist.gov)
Cómo funcionan las barreras de protección de la IA#
Las barreras de protección utilizan varias capas complementarias, ya que ningún filtro por sí solo puede abordar todos los modos de fallo:
- Validación de entradas y filtrado de contenido: analiza prompts, imágenes, archivos y solicitudes de API en busca de instrucciones maliciosas, contenido prohibido o infracciones de la privacidad de los datos.
- Controles de herramientas de los agentes: restringe las herramientas a las que puede acceder un agente de IA, limita los permisos y exige aprobación para acciones de gran impacto, como pagos o cambios en bases de datos.
- Arquitectura segura de IA: combina controles de identidad, seguridad de la infraestructura, protecciones del modelo y supervisión humana, en lugar de depender únicamente de prompts del sistema.
- Validación de salidas: comprueba que las respuestas sigan los esquemas, las políticas, los límites de confianza y las reglas de negocio requeridos antes de que el software posterior las utilice.
- Supervisión en producción: detecta comportamientos inesperados, fallos y deriva de datos. La plataforma de Ultralytics permite supervisar las implementaciones mediante señales de estado del endpoint, latencia, solicitudes, errores y registros.
Las investigaciones recientes hacen hincapié en una evaluación medible. GuardBench presentó un benchmark a gran escala que abarca numerosos conjuntos de datos de seguridad, mientras que el tutorial sobre barreras de protección de ACL 2025 destacó las defensas por capas, la evaluación de seguridad y el red teaming automatizado de IA. (aclanthology.org)
Aplicaciones en el mundo real#
- Seguridad en el transporte: Un sistema de visión puede detectar peatones y vehículos, pero impedir el movimiento automatizado cuando las detecciones están por debajo de un umbral aprobado. Esto favorece un comportamiento a prueba de fallos, recomendado por las directrices de seguridad de la NHTSA para vehículos automatizados.
- Diagnóstico por imagen médica: El software de diagnóstico puede derivar los hallazgos inciertos a profesionales clínicos en lugar de tomar decisiones autónomas. El Centro de Excelencia en Salud Digital de la FDA supervisa el software médico pertinente, mientras que la visión artificial en sanidad suele utilizar la revisión humana para reducir el riesgo clínico.
Ejemplo de IA de visión#
Este ejemplo utiliza Ultralytics YOLO26 para impedir que las detecciones con un nivel bajo de confianza lleguen automáticamente a la lógica posterior:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg", conf=0.25)[0]
approved = [box for box in result.boxes if float(box.conf) >= 0.70]
if len(approved) != len(result.boxes):
print("Guardrail: send frame for human review")Este umbral es solo una capa; los sistemas en producción deben combinarlo con conjuntos de datos de validación, registros, controles de acceso y aprendizaje automático con intervención humana.
Mejores prácticas actuales#
Utiliza una defensa en profundidad, prueba tanto las aprobaciones erróneas como los rechazos innecesarios y mantén un estado alternativo seguro. Las barreras de protección también deben adaptarse: la investigación de AGrail explora controles evolutivos para agentes, mientras que LS-Guard propone una protección específica para cada modelo. Las pruebas multilingües también son importantes, como demuestra MrGuard. Unas restricciones más estrictas pueden reducir la facilidad de uso, por lo que los equipos deben medir continuamente la seguridad, la latencia y la finalización de tareas, en lugar de tratar las barreras de protección como una configuración puntual. (aclanthology.org)









