Context Rot
La degradación del contexto es la pérdida de fiabilidad que se produce cuando un LLM recibe más contexto del que puede utilizar y pasa por alto datos o sigue instrucciones obsoletas. Se explican formas de limitarla.
La degradación del contexto es la pérdida gradual de fiabilidad que se produce cuando un modelo de IA recibe más contexto del que puede aprovechar eficazmente. Aunque una ventana de contexto anunciada pueda contener técnicamente cientos de miles de tokens, un modelo de lenguaje grande puede pasar por alto hechos relevantes, seguir instrucciones obsoletas o razonar con menos precisión a medida que crece la entrada. Un estudio de 2025 de Chroma sobre la degradación del contexto observó este rendimiento no uniforme en 18 modelos y varias tareas controladas.
Cómo se produce la degradación del contexto#
Las entradas largas exigen más del mecanismo de atención del modelo. La información importante debe competir con instrucciones repetidas, documentos irrelevantes, resultados de herramientas y turnos anteriores de la conversación. La posición en el contexto, la similitud semántica, los datos contradictorios y la complejidad de la tarea pueden influir en lo que utiliza el modelo.
La prueba de referencia de contexto largo RULER de 2024 concluyó que el rendimiento de los modelos, bueno en tareas sencillas de recuperación, solía disminuir al aumentar la longitud de la secuencia y la complejidad de la tarea. La prueba de referencia NoLiMa de 2025 reveló caídas mayores cuando encontrar una respuesta requería razonamiento semántico, en lugar de buscar palabras idénticas. Por tanto, no existe un número universal de tokens, ni siquiera para los modelos Gemini, a partir del cual comience la degradación del contexto: el umbral depende del modelo, la estructura del prompt y la tarea.
Ejemplos reales#
- Asistentes de atención al cliente: Un chatbot al que se le proporcionan años de solicitudes puede dar prioridad a una política obsoleta o pasar por alto una actualización reciente de una cuenta. Las investigaciones que utilizan la memoria conversacional LongMemEval y la prueba de referencia multimodal LoCoMo muestran que extraer, actualizar y razonar sobre historiales de interacción extensos sigue siendo difícil.
- Agentes de inspección visual: Un modelo de visión y lenguaje que supervisa una fábrica puede volverse menos fiable si se incluyen en un mismo prompt todos los fotogramas, las detecciones y los registros de mantenimiento. Un flujo de trabajo mejor utiliza Ultralytics YOLO26 para extraer datos visuales concisos antes del razonamiento del modelo de lenguaje.
- Agentes de programación: Cargar un repositorio completo, la definición de todas las herramientas y el historial íntegro del terminal puede hacer que el objetivo actual pase inadvertido. La guía de Anthropic sobre ingeniería de contexto recomienda seleccionar cuidadosamente el contexto, mientras que su enfoque Agent Skills carga recursos detallados solo cuando hacen falta.
Este flujo de trabajo predict de YOLO muestra cómo convertir detecciones sin procesar en un contexto estructurado y conciso:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)Cómo reducir la degradación del contexto#
- Recupera solo la información pertinente: Usa la segmentación semántica y un reordenador en lugar de enviar todos los documentos disponibles.
- Resume la información anterior: Sustituye los historiales extensos por resúmenes verificados, decisiones y tareas pendientes. Las investigaciones sugieren que la longitud de la entrada puede reducir el rendimiento incluso cuando la recuperación se realiza correctamente.
- Conserva los prefijos estables: La caché de prompts de OpenAI y la caché de contexto de Gemini pueden reducir los costes de procesamiento repetido, aunque la caché por sí sola no mejora la calidad del contexto.
- Usa ventanas deslizantes: Google recomienda la compresión de la ventana de contexto para sesiones largas en curso, que conserva la información reciente y descarta los tokens más antiguos.
- Evalúa con longitudes realistas: Aplica la supervisión de modelos y reproduce pruebas controladas con el kit de herramientas abierto para la degradación del contexto.
La degradación del contexto se diferencia de las alucinaciones, que son salidas sin fundamento; del olvido catastrófico, que altera los conocimientos del modelo durante el entrenamiento; y de la deriva de datos, que refleja los cambios en los datos de entrada de producción. La degradación del contexto es principalmente un fallo de inferencia en la selección y el razonamiento sobre el contexto, por lo que la ingeniería de contexto es su principal defensa.










