Context Rot
Деградация контекста — это снижение надёжности, когда большой языковой модели (LLM) передают больше контекста, чем она способна использовать: модель упускает факты или следует устаревшим инструкциям. Рассматриваются способы ограничить это явление.
Деградация контекста — это постепенное снижение надежности, возникающее, когда модель ИИ получает больше контекста, чем может эффективно использовать. Даже если заявленное контекстное окно технически вмещает сотни тысяч токенов, большая языковая модель может упускать важные факты, следовать устаревшим инструкциям или рассуждать менее точно по мере роста объема ввода. В исследовании Chroma деградации контекста за 2025 год такое неоднородное снижение качества наблюдалось у 18 моделей на нескольких контролируемых задачах.
Как возникает деградация контекста#
Длинные входные данные повышают нагрузку на механизм внимания модели. Важным свидетельствам приходится конкурировать с повторяющимися инструкциями, нерелевантными документами, выходными данными инструментов и более ранними репликами разговора. На то, что использует модель, могут влиять положение информации в контексте, семантическое сходство, противоречивые факты и сложность задачи.
В бенчмарке RULER для длинного контекста за 2024 год обнаружено, что качество моделей, хорошо справляющихся с простым поиском, часто снижается при увеличении длины последовательности и сложности задачи. В бенчмарке NoLiMa за 2025 год выявлено более значительное снижение, когда для поиска ответа требовались семантические рассуждения, а не сопоставление одинаковых слов. Поэтому не существует универсального количества токенов — в том числе для моделей Gemini, — при котором начинается деградация контекста: порог зависит от модели, структуры промпта и задачи.
Примеры из реальной практики#
- Ассистенты службы поддержки: Чат-бот с многолетней историей обращений может отдать приоритет устаревшим правилам или пропустить недавнее изменение учетной записи. Исследования с использованием данных о диалоговой памяти LongMemEval и мультимодального бенчмарка LoCoMo показывают, что извлечение, обновление и анализ длинных историй взаимодействий остаются сложными задачами.
- Агенты визуального контроля: Мультимодальная модель компьютерного зрения и языка, отслеживающая состояние завода, может работать менее надёжно, если в один промпт помещать каждый кадр, каждое обнаружение и каждый журнал обслуживания. Лучше использовать Ultralytics YOLO26, чтобы извлекать краткие визуальные факты перед рассуждениями языковой модели.
- Агенты для программирования: Загрузка всего репозитория, определений каждого инструмента и полной истории терминала может заслонить текущую цель. В рекомендациях Anthropic по инженерии контекста советуют отбирать контекст, а подход Agent Skills загружает подробные ресурсы только по мере необходимости.
Этот рабочий процесс YOLO predict показывает, как преобразовать исходные обнаружения в компактный структурированный контекст:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)Как уменьшить деградацию контекста#
- Извлекай только релевантные свидетельства: используй семантическое разбиение на фрагменты и переранжировщик, а не отправляй все доступные документы.
- Сжимай устаревшую информацию: Заменяй длинные истории проверенными сводками, решениями и нерешенными задачами. Исследования показывают, что увеличение длины входных данных может ухудшать качество даже после успешного поиска нужной информации.
- Сохраняй стабильные префиксы: кэширование промптов OpenAI и кэширование контекста Gemini могут снизить затраты на повторную обработку, хотя само по себе кэширование не повышает качество контекста.
- Используй скользящие окна: Google рекомендует сжимать контекстное окно во время длительных активных сессий, сохраняя недавнюю информацию и удаляя более старые токены.
- Оценивай на реалистичной длине контекста: применяй мониторинг моделей и воспроизводи контролируемые тесты с помощью открытого набора инструментов для анализа деградации контекста.
Контекстное загнивание отличается от галлюцинации, то есть неподтвержденного ответа; катастрофического забывания, то есть изменения знаний модели во время обучения; и дрейфа данных, который отражает изменения входных данных в производственной среде. Контекстное загнивание в первую очередь является сбоем выбора контекста и рассуждений во время инференса, поэтому главным способом защиты служит эффективная работа с контекстом.










