Hallucination (in LLMs)
Explora las causas y los riesgos de las alucinaciones de IA en los LLM. Aprende a mitigar los errores factuales mediante RAG, RLHF y grounding con Ultralytics YOLO26.
En el ámbito de la Inteligencia artificial (AI), una alucinación se refiere a un fenómeno en el que un modelo de lenguaje de gran tamaño (LLM) genera contenido seguro de sí mismo y sintácticamente correcto, pero fácticamente inexacto, absurdo o infiel a los datos de entrada originales. A diferencia de los errores de software habituales, que pueden provocar un fallo o un problema visible, un modelo que alucina se comporta como un fabulador convincente y presenta información falsa con la misma autoridad que los hechos válidos. Esto plantea importantes desafíos para las organizaciones que implementan IA generativa en ámbitos sensibles como la sanidad, el derecho y las finanzas, donde la integridad de los datos es primordial.
¿Por qué se producen las alucinaciones?#
Para entender por qué los modelos alucinan, resulta útil analizar cómo se construyen. Los LLM suelen basarse en la arquitectura Transformer, que funciona como un sofisticado motor de predicción. En lugar de consultar una base de datos estructurada de hechos verificados, el modelo predice el siguiente token de una secuencia basándose en probabilidades estadísticas derivadas de sus datos de entrenamiento.
Varios factores impulsan este comportamiento:
- Conjeturas probabilísticas: El modelo prioriza la fluidez y la coherencia por encima de la verdad factual. Si una secuencia concreta de palabras es estadísticamente probable, aunque sea fácticamente incorrecta, el modelo puede generarla. Este concepto se analiza a menudo en investigaciones sobre loros estocásticos, en las que los modelos imitan patrones lingüísticos sin comprender el significado.
- Problemas de calidad de los datos: Si el enorme corpus de texto utilizado para el entrenamiento contiene contradicciones, información obsoleta o ficción, el modelo puede reproducir estas inexactitudes.
- Amnesia de la fuente: Los LLM comprimen enormes cantidades de información en los pesos del modelo. Durante este proceso, a menudo pierden el vínculo con las fuentes concretas, lo que da lugar a la «confabulación», en la que conceptos o acontecimientos distintos se fusionan de forma incorrecta.
Ejemplos reales de alucinaciones#
Las alucinaciones pueden manifestarse de diversas formas, desde adornos creativos inofensivos hasta errores fácticos graves:
- Fabricación jurídica: Se han documentado casos en los que profesionales del derecho utilizaron IA para redactar escritos y descubrieron que el modelo había inventado casos judiciales inexistentes y citas para respaldar un argumento.
- Generación de código: Los desarrolladores que utilizan asistentes de IA pueden encontrarse con «alucinaciones de paquetes», en las que el modelo sugiere importar una biblioteca de software o llamar a una función que en realidad no existe, simplemente porque el nombre sigue las convenciones habituales de nomenclatura.
- Errores biográficos: Cuando se pregunta por personas menos conocidas, los modelos pueden atribuirles con seguridad logros, lugares de nacimiento o trayectorias profesionales incorrectos, mezclando de hecho detalles de varias personas.
Estrategias de mitigación#
Reducir la frecuencia de las alucinaciones es uno de los principales objetivos de la seguridad de la IA. Los ingenieros e investigadores emplean varias técnicas para anclar los modelos en la realidad:
- Generación aumentada por recuperación (RAG): Este método conecta el LLM con una base de conocimientos externa y fiable, a menudo indexada en una base de datos vectorial. Al recuperar documentos relevantes antes de generar una respuesta, el modelo queda restringido por datos reales.
- Prompting de cadena de pensamiento: Esta técnica de ingeniería de prompts anima al modelo a «mostrar su trabajo» desglosando los razonamientos complejos en pasos intermedios, lo que a menudo reduce los errores lógicos.
- Aprendizaje por refuerzo a partir de comentarios humanos (RLHF): Durante la fase de ajuste fino, los evaluadores humanos clasifican las respuestas del modelo. Al penalizar las alucinaciones y recompensar la veracidad, el modelo aprende a alinearse mejor con las expectativas humanas.
Anclaje de los LLM con visión artificial#
En los sistemas de IA multimodal, la generación de texto puede anclarse mediante datos visuales. Si se pide a un LLM que describa una escena, podría alucinar objetos que no están presentes. Al integrar un detector de objetos de alta precisión como YOLO26, los desarrolladores pueden proporcionar al LLM una lista factual de los objetos presentes, limitando estrictamente su salida a detecciones verificadas.
El siguiente ejemplo de Python muestra cómo utilizar el paquete ultralytics para extraer una lista verificada de objetos, que después puede servir como restricción factual para el prompt de un modelo de lenguaje.
from ultralytics import YOLO
# Load the YOLO26n model (latest generation, efficient and accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to get ground-truth detections
results = model("https://ultralytics.com/images/bus.jpg")
# Extract the class names of actually detected objects
detected_objects = [model.names[int(c)] for c in results[0].boxes.cls]
# This factual list prevents the LLM from hallucinating items
print(f"Verified Objects for Prompt Context: {detected_objects}")
# Output example: ['bus', 'person', 'person', 'person', 'person']Diferenciación de conceptos relacionados#
Es importante distinguir las alucinaciones de otros errores habituales de la IA:
- Frente al sesgo en la IA: El sesgo se refiere a un prejuicio sistemático en las salidas, como favorecer a un grupo demográfico frente a otro, mientras que la alucinación es un fallo de precisión factual. Una respuesta puede no estar sesgada y, aun así, ser una alucinación, por ejemplo: «La Luna está hecha de queso».
- Frente al sobreajuste: El sobreajuste se produce cuando un modelo memoriza los datos de entrenamiento demasiado fielmente y no puede generalizar a nuevas entradas. Las alucinaciones suelen producirse cuando un modelo intenta generalizar demasiado hacia áreas sobre las que carece de datos.
- Frente a la clasificación errónea: En la detección de objetos, etiquetar un coche como un camión es un error de clasificación, es decir, un problema de precisión, no una alucinación. La alucinación es específica de la creación generativa de contenido falso.
Para quienes buscan gestionar conjuntos de datos y entrenar modelos con una alta integridad de los datos con el fin de prevenir errores posteriores, la Ultralytics Platform ofrece herramientas completas para la anotación y la gestión de conjuntos de datos. Además, las directrices del Marco de gestión de riesgos de IA del NIST proporcionan estándares para evaluar y mitigar estos riesgos en entornos de producción.









