Contextual Retrieval
Tìm hiểu cách contextual retrieval cải thiện RAG với các chunk nhận biết tài liệu, hybrid search và reranking — đồng thời khám phá Ultralytics YOLO26 cho ngữ cảnh hình ảnh đa phương thức.
Truy xuất theo ngữ cảnh là một kỹ thuật tiền xử lý giúp cải thiện tạo sinh tăng cường truy xuất (RAG) bằng cách thêm một phần giải thích ngắn, dành riêng cho tài liệu, vào mỗi phân đoạn dữ liệu trước khi lập chỉ mục. Được giới thiệu trong hướng dẫn truy xuất theo ngữ cảnh năm 2024 của Anthropic, kỹ thuật này giúp các hệ thống tìm kiếm hiểu một đoạn văn vốn mơ hồ thuộc về đâu, từ đó cải thiện bằng chứng được cung cấp cho một model ngôn ngữ lớn. (anthropic.com)
Cách Truy xuất theo ngữ cảnh hoạt động#
RAG tiêu chuẩn chia tài liệu thành các phân đoạn và chuyển chúng thành embedding. Tuy nhiên, một phân đoạn như “doanh thu tăng 3%” có thể không nêu rõ công ty, kỳ báo cáo và loại tài liệu. Truy xuất theo ngữ cảnh sử dụng toàn bộ tài liệu để tạo một tiền tố súc tích, chẳng hạn như “Đoạn này mô tả kết quả tài chính quý 2 năm 2025 của ACME,” trước khi lập chỉ mục văn bản đã kết hợp.
Một quy trình điển hình bao gồm:
- Phân đoạn ngữ nghĩa: Chia tài liệu thành các đoạn mạch lạc, phù hợp với giới hạn truy xuất và giới hạn của model. Mục đích chính của việc phân đoạn là giúp các nguồn lớn có thể tìm kiếm được mà không vượt quá cửa sổ ngữ cảnh của model.
- Tạo ngữ cảnh: Sử dụng một model để tóm tắt mối quan hệ của mỗi phân đoạn với nguồn của nó, theo quy trình tương tự sổ tay hướng dẫn contextual embeddings của Claude.
- Tìm kiếm kết hợp: Lập chỉ mục các phân đoạn đã được bổ sung ngữ cảnh bằng vector dense và các phương pháp từ vựng như xếp hạng từ khóa BM25.
- Xếp hạng lại: Sắp xếp lại các ứng viên được truy xuất bằng cách so sánh sâu hơn giữa truy vấn và phân đoạn trước khi gửi bằng chứng tốt nhất đến bộ tạo sinh.
Anthropic báo cáo rằng contextual embeddings kết hợp với contextual BM25 đã giảm 49% tỷ lệ thất bại khi truy xuất top-20, trong khi việc bổ sung xếp hạng lại giúp giảm 67% trong các thử nghiệm của họ. Kết quả thay đổi tùy theo dataset, vì vậy nên xem các con số này là benchmark thay vì sự bảo đảm. (anthropic.com)
Truy xuất theo ngữ cảnh trong Thị giác máy tính#
Trong RAG đa phương thức, ngữ cảnh tài liệu có thể bao gồm các đối tượng được phát hiện, chú thích hình ảnh, timestamp, vị trí camera hoặc các sự kiện video xung quanh. Ví dụ dưới đây sử dụng Ultralytics YOLO26 để tạo ngữ cảnh có thể tìm kiếm cho một hình ảnh:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls.tolist()]
context = f"Street-scene image containing: {', '.join(labels)}."
print(context)Văn bản được tạo có thể được đặt ở đầu chú thích hình ảnh hoặc bản ghi metadata trước khi tạo embedding. Nhà phát triển có thể khám phá các workflow dự đoán YOLO và tìm kiếm độ tương đồng hình ảnh liên quan.
Các ứng dụng trong thực tế#
- Tìm kiếm doanh nghiệp và pháp lý: Các trợ lý chính sách bảo toàn tên tài liệu, ngày tháng, phòng ban và mối quan hệ giữa các điều khoản, giúp giảm các câu trả lời gây hiểu lầm do những đoạn trích riêng lẻ.
- Hệ thống bảo trì trực quan: Máy móc được phát hiện, loại lỗi và vị trí cơ sở giúp bổ sung ngữ cảnh cho hình ảnh trước khi hệ thống truy xuất sổ tay sửa chữa hoặc hồ sơ kiểm tra.
- Giáo dục cá nhân hóa: Các agent học tập có thể kết hợp hội thoại của học viên với nhật ký hoạt động để truy xuất hướng dẫn phù hợp với tác vụ hiện tại của người học.
Các Kỹ thuật Liên quan và Thực hành Tốt nhất#
Truy xuất theo ngữ cảnh khác với kỹ thuật ngữ cảnh, vốn quản lý toàn bộ thông tin được cung cấp cho model trong thời gian chạy. Kỹ thuật này cũng khác với nghiên cứu về late chunking, trong đó toàn bộ tài liệu được chuyển thành embedding trước khi gộp các biểu diễn token thành các phân đoạn. Một đánh giá so sánh năm 2025 cho thấy truy xuất theo ngữ cảnh hiệu quả trong việc duy trì tính mạch lạc ngữ nghĩa nhưng đòi hỏi nhiều tính toán hơn. (arxiv.org)
Các thực hành tốt nhất hiện nay bao gồm thử nghiệm nhiều kích thước phân đoạn, giữ lại metadata nguồn, kết hợp truy xuất dense và truy xuất từ khóa, đồng thời đo lường recall, precision, groundedness và tính đầy đủ của phản hồi bằng hướng dẫn đánh giá RAG của Microsoft. Các nghiên cứu mới hơn như SAGE precise retrieval ưu tiên phân đoạn ngữ nghĩa và lựa chọn phân đoạn động, trong khi một benchmark truy xuất năm 2026 ủng hộ truy xuất kết hợp và xếp hạng lại bằng neural network cho các tài liệu văn bản và bảng phức tạp. Các nhóm xây dựng hệ thống tri thức trực quan có thể sử dụng Ultralytics Platform để gắn nhãn dataset, huấn luyện vision model, triển khai endpoint và giám sát các thành phần cung cấp ngữ cảnh trực quan có cấu trúc.






