Context Rot
Узнай, что такое деградация контекста, почему длинные входные данные для ИИ снижают надежность, и как методы поиска, сжатия и рабочие процессы YOLO26 улучшают работу с контекстом.
Деградация контекста — это постепенная потеря надежности, которая возникает, когда ИИ-модель получает больше контекста, чем может эффективно использовать. Даже когда заявленное окно контекста технически может содержать сотни тысяч токенов, большая языковая модель может упускать из виду релевантные факты, следовать устаревшим инструкциям или рассуждать менее точно по мере роста входных данных. Исследование Chroma context rot study 2025 года зафиксировало эту неоднородную производительность на 18 моделях и нескольких контролируемых задачах. (trychroma.com)
Почему происходит контекстное вырождение#
Длинные входные данные предъявляют более высокие требования к механизму внимания модели. Важные свидетельства должны конкурировать с повторяющимися инструкциями, нерелевантными документами, выводами инструментов и более старыми шагами беседы. Позиция контекста, семантическая схожесть, противоречивые факты и сложность задачи могут влиять на то, что именно использует модель.
Бенчмарк RULER long-context benchmark 2024 года показал, что модели, хорошо справляющиеся с простым поиском, часто ухудшают результаты по мере увеличения длины последовательности и сложности задачи. Бенчмарк NoLiMa benchmark 2025 года выявил более серьезные падения, когда для поиска ответа требовались семантические рассуждения, а не сопоставление идентичных слов. Следовательно, не существует универсального количества токенов (включая модели Gemini), при котором начинается деградация контекста; порог зависит от модели, структуры промпта и задачи. (arxiv.org)
Примеры из реальной жизни#
- Ассистенты техподдержки: Чат-бот, получивший тикеты за много лет, может отдать приоритет устаревшей политике или пропустить недавнее обновление аккаунта. Исследования с использованием разговорной памяти LongMemEval conversational memory и мультимодального бенчмарка LoCoMo benchmark показывают, что извлечение, обновление и рассуждение на основе длинных историй взаимодействия остаются сложной задачей. (arxiv.org)
- Агенты визуального осмотра: Визуально-языковая модель, отслеживающая работу завода, может стать менее надежной, если каждый кадр, обнаружение и журнал обслуживания помещаются в один промпт. Лучший рабочий процесс использует Ultralytics YOLO26 для извлечения кратких визуальных фактов до рассуждений языковой модели.
- Агенты написания кода: Загрузка всего репозитория, каждого определения инструмента и полной истории терминала может затмить текущую цель. Руководство Anthropic по инженерии контекста рекомендует тщательно отбирать контекст, в то время как его подход Agent Skills approach загружает подробные ресурсы только при необходимости. (anthropic.com)
Этот рабочий процесс предсказания YOLO демонстрирует преобразование необработанных обнаружений в компактный, структурированный контекст:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)Как уменьшить контекстное вырождение#
- Извлекай только релевантные свидетельства: Используй семантическую разбивку на чанки и реранкер вместо отправки каждого доступного документа.
- Сжимай более старую информацию: Заменяй длинные истории проверенными сводками, решениями и нерешенными задачами. Исследования показывают, что длина входных данных может снижать производительность даже после успешного поиска. (arxiv.org)
- Сохраняй стабильные префиксы: Кэширование промптов OpenAI и кэширование контекста Gemini могут снизить затраты на повторную обработку, хотя само по себе кэширование не повышает качество контекста.
- Используй скользящие окна: Google рекомендует сжатие окна контекста для длинных сессий в реальном времени, сохраняя недавнюю информацию и удаляя более старые токены. (ai.google.dev)
- Оценивай при реалистичной длине: Применяй мониторинг моделей и воспроизводи контролируемые тесты с помощью открытого набора инструментов для деградации контекста.
Деградация контекста отличается от галлюцинаций, которые представляют собой неподдерживаемый результат; катастрофического забывания, которое изменяет знания модели во время обучения; и дрейфа данных, который отражает изменяющиеся производственные входные данные. Деградация контекста — это в первую очередь сбой отбора контекста и рассуждений во время инференса, что делает эффективную инженерию контекста главной защитой от него.






