Context Rot
Aprende qué es el deterioro del contexto, por qué las entradas largas de IA reducen la fiabilidad y cómo la recuperación, la compresión y los flujos de trabajo de YOLO26 mejoran la ingeniería de contexto.
La degradación del contexto es la pérdida gradual de fiabilidad que se produce cuando un modelo de IA recibe más contexto del que puede utilizar de forma eficaz. Incluso cuando una context window anunciada puede contener técnicamente cientos de miles de tokens, un large language model puede pasar por alto hechos relevantes, seguir instrucciones desactualizadas o razonar con menos precisión a medida que crece la entrada. Un Chroma context rot study de 2025 observó este rendimiento no uniforme en 18 modelos y varias tareas controladas. (trychroma.com)
Cómo ocurre la degradación del contexto#
Las entradas largas imponen mayores exigencias al attention mechanism del modelo. Las pruebas importantes deben competir con instrucciones repetidas, documentos irrelevantes, salidas de herramientas y turnos de conversación anteriores. La posición del contexto, la similitud semántica, los hechos contradictorios y la complejidad de la tarea pueden afectar a lo que utiliza el modelo.
El RULER long-context benchmark de 2024 descubrió que los modelos que rinden bien en la recuperación simple a menudo empeoraban a medida que aumentaban la longitud de la secuencia y la complejidad de la tarea. El NoLiMa benchmark de 2025 reveló caídas mayores cuando encontrar una respuesta requería un razonamiento semántico en lugar de coincidir con palabras idénticas. Por lo tanto, no existe un recuento universal de tokens —incluidos los modelos de Gemini— en el que comience la degradación del contexto; el umbral depende del modelo, la estructura del prompt y la tarea. (arxiv.org)
Ejemplos del mundo real#
- Asistentes de atención al cliente: A un chatbot provisto de años de tickets se le puede dar prioridad a una política obsoleta o puede pasar por alto una actualización reciente de la cuenta. Las investigaciones que utilizan la memoria conversacional LongMemEval y el LoCoMo benchmark multimodal muestran que extraer, actualizar y razonar sobre historiales de interacción largos sigue siendo un reto. (arxiv.org)
- Agentes de inspección visual: Un vision-language model que supervisa una fábrica puede volverse menos fiable si cada fotograma, detección y registro de mantenimiento se introduce en un solo prompt. Un flujo de trabajo mejor utiliza Ultralytics YOLO26 para extraer datos visuales concisos antes del razonamiento del modelo de lenguaje.
- Agentes de programación: Cargar un repositorio entero, cada definición de herramienta y el historial completo del terminal puede oscurecer el objetivo actual. La Anthropic’s context-engineering guidance recomienda depurar el contexto, mientras que su enfoque de Agent Skills approach carga recursos detallados solo cuando es necesario. (anthropic.com)
Este YOLO predict workflow demuestra cómo convertir detecciones sin procesar en un contexto estructurado y compacto:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)Cómo reducir la degradación del contexto#
- Retrieve only relevant evidence: Utiliza semantic chunking y un reranker en lugar de enviar todos los documentos disponibles.
- Compress older information: Sustituye los historiales largos por resúmenes verificados, decisiones y tareas sin resolver. Las investigaciones sugieren que la longitud de la entrada puede reducir el rendimiento incluso después de una recuperación exitosa. (arxiv.org)
- Preservar los prefijos estables: OpenAI prompt caching y Gemini context caching pueden reducir los costes de procesamiento repetido, aunque el almacenamiento en caché por sí solo no mejora la calidad del contexto.
- Utilizar ventanas deslizantes: Google recomienda la context-window compression for long live sessions, reteniendo la información reciente y eliminando los tokens más antiguos. (ai.google.dev)
- Evaluar a longitudes realistas: Aplica model monitoring y reproduce pruebas controladas con el open context rot toolkit.
La degradación del contexto difiere de la alucinación, que es una salida no respaldada; del olvido catastrófico, que cambia el conocimiento del modelo durante el entrenamiento; y de la deriva de datos, que refleja los cambios en las entradas de producción. La degradación del contexto es principalmente un fallo en el momento de la inferencia de la selección y el razonamiento del contexto, lo que convierte a la context engineering eficaz en su principal defensa.






