Context Rot
Context rot là hiện tượng độ tin cậy suy giảm khi LLM nhận lượng context vượt quá khả năng sử dụng, dẫn đến bỏ sót dữ kiện hoặc làm theo chỉ dẫn đã lỗi thời. Nội dung đề cập đến cách hạn chế hiện tượng này.
Context rot là tình trạng suy giảm độ tin cậy dần xảy ra khi model AI nhận nhiều ngữ cảnh hơn khả năng sử dụng hiệu quả. Ngay cả khi cửa sổ ngữ cảnh được quảng bá có thể chứa về mặt kỹ thuật hàng trăm nghìn token, large language model vẫn có thể bỏ sót thông tin liên quan, làm theo hướng dẫn lỗi thời hoặc suy luận kém chính xác hơn khi đầu vào tăng lên. Nghiên cứu context rot của Chroma năm 2025 ghi nhận hiệu năng không đồng đều này trên 18 model và một số tác vụ được kiểm soát.
Context rot xảy ra như thế nào#
Đầu vào dài đặt ra yêu cầu lớn hơn đối với cơ chế attention của model. Bằng chứng quan trọng phải cạnh tranh với các hướng dẫn lặp lại, tài liệu không liên quan, đầu ra công cụ và các lượt hội thoại cũ. Vị trí trong ngữ cảnh, độ tương đồng ngữ nghĩa, thông tin mâu thuẫn và độ phức tạp của tác vụ đều có thể ảnh hưởng đến thông tin model sử dụng.
Benchmark ngữ cảnh dài RULER năm 2024 cho thấy các model có kết quả tốt trên tác vụ truy xuất đơn giản thường suy giảm khi độ dài chuỗi và độ phức tạp của tác vụ tăng. Benchmark NoLiMa năm 2025 cho thấy mức suy giảm lớn hơn khi tìm câu trả lời đòi hỏi suy luận ngữ nghĩa thay vì khớp các từ giống hệt nhau. Vì vậy, không có số lượng token chung nào—kể cả với model Gemini—đánh dấu thời điểm context rot bắt đầu; ngưỡng này phụ thuộc vào model, cấu trúc prompt và tác vụ.
Ví dụ thực tế#
- Trợ lý hỗ trợ khách hàng: Chatbot được cung cấp dữ liệu ticket trong nhiều năm có thể ưu tiên chính sách lỗi thời hoặc bỏ sót bản cập nhật tài khoản gần đây. Nghiên cứu sử dụng bộ nhớ hội thoại LongMemEval và benchmark LoCoMo đa phương thức cho thấy việc trích xuất, cập nhật và suy luận trên lịch sử tương tác dài vẫn là thách thức.
- Agent kiểm tra trực quan: Model thị giác-ngôn ngữ giám sát nhà máy có thể trở nên kém đáng tin cậy hơn nếu mọi khung hình, kết quả phát hiện và log bảo trì đều được đưa vào cùng một prompt. Workflow tốt hơn là dùng Ultralytics YOLO26 để trích xuất các dữ kiện trực quan ngắn gọn trước khi suy luận bằng model ngôn ngữ.
- Coding agent: Tải toàn bộ repository, mọi định nghĩa công cụ và toàn bộ lịch sử terminal có thể làm lu mờ mục tiêu hiện tại. Hướng dẫn thiết kế ngữ cảnh của Anthropic khuyến nghị chọn lọc ngữ cảnh, còn cách tiếp cận Agent Skills của Anthropic chỉ tải tài nguyên chi tiết khi cần.
Workflow predict của YOLO minh họa cách chuyển kết quả phát hiện thô thành ngữ cảnh có cấu trúc, cô đọng:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls]
context = {"frame": 1, "objects": sorted(set(labels))}
print(context)Cách giảm Context Rot#
- Chỉ truy xuất bằng chứng liên quan: Sử dụng phân đoạn ngữ nghĩa và reranker thay vì gửi mọi tài liệu có sẵn.
- Nén thông tin cũ: Thay lịch sử dài bằng các bản tóm tắt đã xác minh, quyết định và tác vụ chưa giải quyết. Nghiên cứu cho thấy độ dài đầu vào có thể làm giảm hiệu năng ngay cả sau khi truy xuất thành công.
- Giữ nguyên các tiền tố ổn định: Bộ nhớ đệm prompt của OpenAI và bộ nhớ đệm ngữ cảnh của Gemini có thể giảm chi phí xử lý lặp lại, dù chỉ dùng bộ nhớ đệm không cải thiện chất lượng ngữ cảnh.
- Dùng cửa sổ trượt: Google khuyến nghị nén cửa sổ ngữ cảnh cho các phiên trực tiếp dài, giữ lại thông tin gần đây và loại bỏ các token cũ hơn.
- Đánh giá với độ dài thực tế: Áp dụng giám sát model và tái tạo các bài kiểm thử có kiểm soát bằng bộ công cụ context rot mã nguồn mở.
Suy thoái ngữ cảnh khác với ảo giác, tức đầu ra không có căn cứ; quên thảm họa, tức tri thức của model thay đổi trong quá trình huấn luyện; và data drift, phản ánh sự thay đổi của dữ liệu đầu vào production. Suy thoái ngữ cảnh chủ yếu là lỗi xảy ra trong inference do lựa chọn ngữ cảnh và suy luận, vì vậy kỹ thuật ngữ cảnh hiệu quả là biện pháp phòng vệ chính.










