Hallucination (in LLMs)
Explora las causas y los riesgos de las alucinaciones de IA en LLM. Aprende a mitigar errores factuales usando RAG, RLHF y grounding con Ultralytics YOLO26.
En el ámbito de la Inteligencia Artificial (IA), una alucinación se refiere a un fenómeno en el que un Large Language Model (LLM) genera contenido que es seguro y sintácticamente correcto pero inexacto en los hechos, sin sentido o infiel a la entrada de origen. A diferencia de los errores de software estándar que pueden producir un bloqueo o un fallo visual, un modelo que alucina se comporta como un fabulador convincente, presentando información falsa con la misma autoridad que los hechos válidos. Esto plantea desafíos importantes para las organizaciones que implementan Generative AI en campos sensibles como la sanidad, el derecho y las finanzas, donde la integridad de los datos es primordial.
¿Por qué ocurren las alucinaciones?#
Para entender por qué alucinan los modelos, resulta útil observar cómo se construyen. Los LLM se basan normalmente en la arquitectura Transformer, que funciona como un sofisticado motor de predicción. En lugar de consultar una base de datos estructurada de hechos verificados, el modelo predice el siguiente token en una secuencia basándose en probabilidades estadísticas derivadas de sus training data.
Varios factores impulsan este comportamiento:
- Adivinanza probabilística: El modelo prioriza la fluidez y la coherencia por encima de la verdad fáctica. Si una secuencia específica de palabras es estadísticamente probable —incluso aunque sea objetivamente incorrecta—, el modelo puede generarla. Este concepto se debate a menudo en la investigación relacionada con los stochastic parrots, donde los modelos imitan patrones de lenguaje sin comprender el significado.
- Problemas de calidad de los datos: Si el corpus masivo de texto utilizado para el entrenamiento contiene contradicciones, información obsoleta o ficción, el modelo puede reproducir estas inexactitudes.
- Amnesia de origen: Los LLM comprimen grandes cantidades de información en model weights. En este proceso, a menudo pierden el vínculo con fuentes específicas, lo que lleva a una «confabulación» en la que se fusionan de forma incorrecta conceptos o eventos distintos.
Ejemplos reales de alucinación#
Las alucinaciones pueden manifestarse de varias formas, desde adornos creativos inofensivos hasta graves errores factuales:
- Fabricación jurídica: Ha habido casos documentados en los que profesionales del derecho utilizaron IA para redactar escritos legales, solo para descubrir que el modelo se había inventado non-existent court cases y citas para respaldar un argumento.
- Generación de código: Los desarrolladores que usan asistentes de IA pueden encontrar "alucinaciones de paquetes", donde el modelo sugiere importar una librería de software o llamar a una función que no existe realmente, simplemente porque el nombre sigue las convenciones de nomenclatura estándar.
- Errores biográficos: Cuando se pregunta por personas menos famosas, los modelos pueden atribuirles con seguridad logros, lugares de nacimiento o historiales profesionales incorrectos, mezclando detalles de varias personas.
Estrategias de mitigación#
Reducir la frecuencia de las alucinaciones es un objetivo principal de la AI Safety. Los ingenieros e investigadores emplean varias técnicas para anclar los modelos a la realidad:
- Generación Aumentada por Recuperación (RAG): Este método conecta el LLM a una base de conocimiento externa y de confianza, indexada a menudo en una vector database. Al recuperar documentos relevantes antes de generar una respuesta, el modelo queda limitado por los datos reales.
- Prompting de cadena de pensamiento: Esta técnica de prompt engineering anima al modelo a «mostrar su trabajo» descomponiendo el razonamiento complejo en pasos intermedios, lo que a menudo reduce los errores lógicos.
- Reinforcement Learning from Human Feedback (RLHF): Durante la etapa de ajuste fino, evaluadores humanos clasifican las respuestas del modelo. Al penalizar las alucinaciones y recompensar la veracidad, el modelo aprende a alinearse mejor con las expectativas humanas.
Anclaje de LLMs con Visión por Computador#
En los sistemas de Multimodal AI, la generación de texto puede fundamentarse utilizando datos visuales. Si a un LLM se le pide que describa una escena, podría alucinar objetos que no están ahí. Al integrar un detector de objetos de alta precisión como YOLO26, los desarrolladores pueden proporcionar una lista objetiva de los objetos presentes al LLM, limitando estrictamente su salida a las detecciones verificadas.
El siguiente ejemplo en Python muestra cómo utilizar el paquete ultralytics para extraer una lista verificada de objetos, que luego puede servir como restricción objetiva para el prompt de un modelo de lenguaje.
from ultralytics import YOLO
# Load the YOLO26n model (latest generation, efficient and accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to get ground-truth detections
results = model("https://ultralytics.com/images/bus.jpg")
# Extract the class names of actually detected objects
detected_objects = [model.names[int(c)] for c in results[0].boxes.cls]
# This factual list prevents the LLM from hallucinating items
print(f"Verified Objects for Prompt Context: {detected_objects}")
# Output example: ['bus', 'person', 'person', 'person', 'person']Diferenciación de conceptos relacionados#
Es importante distinguir las alucinaciones de otros errores comunes de la IA:
- Frente a Bias in AI: El sesgo se refiere a un perjuicio sistemático en los resultados (por ejemplo, favorecer a un grupo demográfico frente a otro), mientras que la alucinación es un fallo de precisión fáctica. Una respuesta puede estar libre de sesgos y aun así contener alucinaciones (por ejemplo, «La luna está hecha de queso»).
- Frente a Overfitting: El sobreajuste se produce cuando un modelo memoriza los datos de entrenamiento con demasiada precisión y no puede generalizar a nuevas entradas. Las alucinaciones suelen ocurrir cuando un modelo intenta generalizar demasiado en áreas donde carece de datos.
- Frente a la clasificación errónea: En la object detection, etiquetar un coche como un camión es un error de clasificación (problema de precisión), no una alucinación. La alucinación es específica de la creación generativa de contenido falso.
Para aquellos que buscan gestionar conjuntos de datos y entrenar modelos con una alta integridad de datos para prevenir errores posteriores, la Ultralytics Platform ofrece herramientas integrales para la anotación y la gestión de conjuntos de datos. Asimismo, las directrices del NIST AI Risk Management Framework proporcionan estándares para evaluar y mitigar estos riesgos en entornos de producción.






