Context Rot
コンテキスト腐敗(Context Rot)とは何か、なぜ長いAI入力が信頼性を低下させるのか、そして検索、圧縮、およびYOLO26のワークフローがどのようにコンテキストエンジニアリングを改善するのかを学びます。
コンテキスト腐敗(Context rot)とは、AIモデルが効果的に処理できる容量を超えるコンテキストを受け取ったときに発生する、信頼性の段階的な低下のことです。広告されているコンテキストウィンドウが技術的に数十万トークンを保持できる場合でも、入力が大きくなるにつれて、大規模言語モデルは関連する事実を見落としたり、古い指示に従ったり、推論の精度が低下したりすることがあります。2025年のChromaコンテキスト腐敗に関する調査では、18個のモデルと複数の管理されたタスクにおいて、この不均一なパフォーマンスが観測されました。(trychroma.com)
Context Rotが発生する仕組み#
入力が長くなると、モデルのアテンション機構に対する負担が増加します。重要なエビデンスは、繰り返される指示、無関係なドキュメント、ツールの出力、古い会話のターンと競合する必要があります。コンテキストの位置、意味的な類似性、矛盾する事実、タスクの複雑さはすべて、モデルが何を使用するかに影響を与える可能性があります。
2024年のRULER長文コンテキストベンチマークでは、単純な検索で良好なパフォーマンスを発揮するモデルが、シーケンス長とタスクの複雑さが増すにつれて低下することがわかりました。2025年のNoLiMaベンチマークでは、答えを見つけるために同一の単語の一致ではなく意味的な推論が必要な場合、より大きな低下が明らかになりました。したがって、Geminiモデルを含め、コンテキスト腐敗が始まる普遍的なトークン数は存在せず、その閾値はモデル、プロンプトの構造、およびタスクによって異なります。(arxiv.org)
現実世界の例#
- カスタマーサポートアシスタント: 長年のチケットを与えられたチャットボットは、古いポリシーを優先したり、最近のアカウント更新を見落としたりする可能性があります。LongMemEval会話型メモリとマルチモーダルなLoCoMoベンチマークを使用した研究では、長いインタラクションの履歴の抽出、更新、およびそれらを跨いだ推論が依然として困難であることが示されています。(arxiv.org)
- 視覚検査エージェント: 工場を監視するビジョン言語モデルは、すべてのフレーム、検出結果、およびメンテナンスログが1つのプロンプトに配置されると、信頼性が低下する可能性があります。より優れたワークフローでは、言語モデルによる推論の前に、Ultralytics YOLO26を使用して簡潔な視覚的ファクトを抽出します。
- コーディングエージェント: リポジトリ全体、すべてのツール定義、および完全な端末履歴を読み込むと、現在の目的が分かりにくくなる可能性があります。Anthropicのコンテキストエンジニアリングガイダンスではコンテキストのキュレーションが推奨されており、そのエージェントスキルアプローチでは必要な時のみ詳細なリソースが読み込まれます。(anthropic.com)
このYOLO予測ワークフローは、生出力をコンパクトで構造化されたコンテキストに変換する方法を示しています。
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)Context Rotを軽減する方法#
- 関連するエビデンスのみを検索する: 利用可能なすべてのドキュメントを送信する代わりに、セマンティックチャンキングとリランカーを使用します。
- 古い情報を圧縮する: 長い履歴を、検証済みの要約、決定事項、および未解決のタスクに置き換えます。研究によると、検索が成功した後でも、入力の長さによってパフォーマンスが低下する可能性があります。(arxiv.org)
- 安定したプレフィックスを保持する: OpenAIプロンプトキャッシュとGeminiコンテキストキャッシュは繰り返し処理のコストを削減できますが、キャッシュ単体ではコンテキストの品質は向上しません。
- スライディングウィンドウを使用する: Googleは、長期のライブセッション向けコンテキストウィンドウ圧縮を推奨しており、古いトークンを削除しながら最近の情報を保持します。(ai.google.dev)
- 現実的な長さで評価する: モデルモニタリングを適用し、オープンなコンテキスト腐敗ツールキットを使用して制御されたテストを再現します。
コンテキスト腐敗は、根拠のない出力であるハルシネーション、トレーニング中にモデルの知識を変更するカタストロフィック・フォーゲティング、および変化する本番入力を反映するデータドリフトとは異なります。コンテキスト腐敗は主に推論時におけるコンテキストの選択と推論の失敗であり、効果的なコンテキストエンジニアリングがその主な防御策となります。






