Context Rot
컨텍스트 로트는 LLM이 처리할 수 있는 범위를 넘어서는 컨텍스트를 받아 신뢰성이 떨어지는 현상으로, 사실을 놓치거나 오래된 지시를 따르게 됩니다. 이를 줄이는 방법을 다룹니다.
컨텍스트 로트는 AI 모델이 효과적으로 활용할 수 있는 양보다 더 많은 컨텍스트를 입력받을 때 신뢰성이 점진적으로 저하되는 현상입니다. 광고된 컨텍스트 윈도우가 기술적으로 수십만 개의 토큰을 담을 수 있더라도, 입력이 길어질수록 대규모 언어 모델은 관련 사실을 놓치거나, 오래된 지침을 따르거나, 추론 정확도가 낮아질 수 있습니다. 2025년 Chroma 컨텍스트 로트 연구는 18개 모델과 여러 통제된 작업에서 이러한 불균일한 성능을 관찰했습니다.
컨텍스트 로트가 발생하는 방식#
긴 입력은 모델의 어텐션 메커니즘에 더 큰 부담을 줍니다. 중요한 근거는 반복되는 지침, 관련 없는 문서, 도구 출력 및 이전 대화 내용과 경쟁해야 합니다. 컨텍스트 내 위치, 의미적 유사성, 서로 충돌하는 사실 및 작업 복잡성은 모두 모델이 어떤 정보를 사용하는지에 영향을 줄 수 있습니다.
2024년 RULER 장문 컨텍스트 벤치마크는 단순 검색에서 좋은 성능을 보인 모델도 시퀀스 길이와 작업 복잡도가 커지면 성능이 저하되는 경우가 있음을 확인했습니다. 2025년 NoLiMa 벤치마크는 동일한 단어를 찾는 것보다 의미적 추론으로 답을 찾아야 할 때 성능 저하가 더 커진다는 점을 밝혔습니다. 따라서 Gemini 모델을 포함해 컨텍스트 로트가 시작되는 보편적인 토큰 수는 없습니다. 임계값은 모델, 프롬프트 구조 및 작업에 따라 달라집니다.
실제 사례#
- 고객 지원 어시스턴트: 수년간의 문의 티켓을 입력받은 챗봇은 폐기된 정책을 우선시하거나 최근 계정 업데이트를 놓칠 수 있습니다. LongMemEval 대화형 메모리와 멀티모달 LoCoMo 벤치마크를 사용한 연구는 긴 상호작용 기록에서 정보를 추출하고 업데이트하며 추론하는 일이 여전히 어렵다는 점을 보여줍니다.
- 시각 검사 에이전트: 공장을 모니터링하는 비전-언어 모델에 모든 프레임, 탐지 결과 및 유지보수 로그를 하나의 프롬프트로 입력하면 신뢰성이 떨어질 수 있습니다. 더 나은 워크플로에서는 Ultralytics YOLO26을 사용해 언어 모델의 추론에 앞서 간결한 시각 정보를 추출합니다.
- 코딩 에이전트: 전체 저장소, 모든 도구 정의 및 전체 터미널 기록을 불러오면 현재 목표가 흐려질 수 있습니다. Anthropic의 컨텍스트 엔지니어링 지침은 컨텍스트를 선별할 것을 권장하며, Agent Skills 접근 방식은 필요할 때만 상세 리소스를 불러옵니다.
이 YOLO predict 워크플로는 원시 탐지 결과를 간결하고 구조화된 컨텍스트로 변환하는 방법을 보여 줍니다:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)컨텍스트 로트 줄이는 방법#
- 관련 근거만 검색: 사용 가능한 모든 문서를 보내는 대신 의미 기반 청킹과 재순위화 모델을 사용합니다.
- 오래된 정보 압축: 긴 기록을 검증된 요약, 결정 사항 및 미해결 작업으로 대체합니다. 연구에 따르면 검색에 성공한 후에도 입력 길이가 길어지면 성능이 저하될 수 있습니다.
- 안정적인 접두부 유지: OpenAI 프롬프트 캐싱과 Gemini 컨텍스트 캐싱은 반복 처리 비용을 낮출 수 있지만, 캐싱만으로 컨텍스트 품질이 향상되지는 않습니다.
- 슬라이딩 윈도우 사용: Google은 긴 실시간 세션을 위한 컨텍스트 윈도우 압축을 권장합니다. 이 방식은 최근 정보를 유지하면서 오래된 토큰을 제거합니다.
- 실제와 유사한 길이로 평가: 모델 모니터링을 적용하고 공개 컨텍스트 로트 툴킷을 사용해 통제된 테스트를 재현합니다.
컨텍스트 로트는 뒷받침 근거가 없는 출력인 환각, 학습 중 모델 지식이 바뀌는 치명적 망각, 프로덕션 입력의 변화를 반영하는 데이터 드리프트와 다릅니다. 컨텍스트 로트는 주로 추론 시 컨텍스트 선택과 추론의 실패이므로 효과적인 컨텍스트 엔지니어링이 주요 방어책입니다.










