Hybrid Search
Tìm kiếm lai kết hợp đối sánh từ khóa với tìm kiếm vector, sử dụng biểu diễn thưa và dày để xếp hạng kết quả. Trình bày các ứng dụng và metadata của YOLO26.
Kết hợp độ chính xác của phương pháp khớp từ khóa truyền thống với khả năng hiểu ngữ cảnh của AI hiện đại, phương pháp tìm kiếm này truy xuất và xếp hạng thông tin bằng cách tận dụng cả biểu diễn dữ liệu thưa và dày. Trong khi công cụ tìm kiếm tiêu chuẩn hoàn toàn dựa vào việc khớp chính xác từ khóa (gọi là tìm kiếm từ vựng) và các công cụ tìm kiếm vector chỉ dựa vào độ tương đồng ngữ nghĩa, công cụ tìm kiếm lai kết hợp hai phương pháp này để cung cấp kết quả có độ chính xác cao và nhận biết ngữ cảnh.
Cách thức hoạt động#
Một pipeline tìm kiếm lai điển hình thực thi đồng thời hai phương pháp truy xuất riêng biệt, rồi hợp nhất kết quả thành một thứ hạng duy nhất được tối ưu hóa:
- Tìm kiếm từ vựng (thưa): Sử dụng các thuật toán như BM25 để chấm điểm những kết quả khớp chính xác từ khóa dựa trên tần suất từ. Phương pháp này rất quan trọng khi truy xuất các thực thể cụ thể, từ viết tắt, SKU sản phẩm hoặc thuật ngữ chuyên ngành mà model thuần ngữ nghĩa có thể khó nhận diện.
- Tìm kiếm ngữ nghĩa (dày): Sử dụng model AI để tạo các mảng số có số chiều cao nhằm hiểu ý nghĩa sâu hơn và ngữ cảnh của truy vấn. Nhờ đó, hệ thống có thể tìm thấy kết quả phù hợp ngay cả khi truy vấn tìm kiếm không chứa các từ chính xác.
Sau khi cả hai phương pháp truy xuất các kết quả ứng viên, thuật toán hợp nhất—thường là hợp nhất thứ hạng nghịch đảo (RRF)—kết hợp các danh sách. RRF tính điểm mới dựa trên thứ hạng của từng mục trong các tập kết quả thưa và dày tương ứng. Nhờ đó, tài liệu xếp hạng cao trong một hoặc cả hai lượt tìm kiếm sẽ được đưa lên đầu, cân bằng giữa khả năng khớp ngữ cảnh rộng và độ chính xác khi khớp từ khóa.
Ứng dụng AI và ML trong thực tế#
Các kiến trúc AI hiện đại phụ thuộc nhiều vào kỹ thuật này để khắc phục hạn chế của việc chỉ sử dụng một phương pháp truy xuất trong môi trường production.
- RAG lai (tạo sinh tăng cường truy xuất): Trong các hệ thống tri thức doanh nghiệp, việc cung cấp cho mô hình ngôn ngữ lớn (LLM) ngữ cảnh phù hợp nhất là yếu tố then chốt để ngăn chặn ảo giác. Cấu hình RAG lai đảm bảo model truy xuất các tài liệu đáp ứng chính xác những ràng buộc kỹ thuật, đồng thời lấy thêm các đoạn văn có liên quan về mặt ngữ nghĩa.
- Thương mại điện tử và khám phá sản phẩm bằng hình ảnh: Nhà bán lẻ dùng tìm kiếm lai để cung cấp năng lực cho danh mục sản phẩm. Người dùng có thể tìm "giày chạy bộ màu đỏ". Công cụ tìm kiếm từ vựng khớp chính xác từ khóa thương hiệu hoặc danh mục, trong khi model AI thị giác dùng embedding hình ảnh để đưa ra các mặt hàng có hình ảnh tương tự.
Ngày nay, gần như mọi cơ sở dữ liệu vector lớn—bao gồm Pinecone, Qdrant và OpenSearch—đều hỗ trợ tìm kiếm lai theo cách gốc, còn PostgreSQL có thể kết hợp pgvector với tính năng tìm kiếm toàn văn tích hợp. Điều này cho phép nhà phát triển lập chỉ mục hiệu quả cả từ khóa thưa lẫn vector dày đặc trong một hạ tầng duy nhất.
Tạo siêu dữ liệu cho tìm kiếm lai#
Trong pipeline thị giác máy tính, bạn có thể trích xuất các từ khóa có ý nghĩa từ hình ảnh để xây dựng thành phần thưa của chỉ mục lai. Với Ultralytics YOLO26, bạn có thể tự động thực hiện phát hiện đối tượng trên hình ảnh và dùng các tên lớp làm thẻ siêu dữ liệu. Sau đó, có thể kết hợp các thẻ từ khóa này với embedding vector dày của hình ảnh để lập chỉ mục toàn diện.
from ultralytics import YOLO
# Tải model phát hiện đối tượng Ultralytics YOLO26 được đề xuất
model = YOLO("yolo26n.pt")
# Chạy suy luận để phát hiện đối tượng trong hình ảnh
results = model("store_aisle.jpg")
# Trích xuất tên lớp được dự đoán để lập chỉ mục dưới dạng siêu dữ liệu từ khóa (dữ liệu thưa)
keywords = [model.names[int(box.cls)] for box in results[0].boxes]
print("Sparse keywords for lexical search:", keywords)Bằng cách làm giàu embedding hình ảnh dày đặc bằng các từ khóa thưa chính xác do AI tạo, nhà phát triển có thể tận dụng Ultralytics Platform và cơ sở dữ liệu vector tương thích với tìm kiếm lai để xây dựng công cụ tìm kiếm đa phương thức mạnh mẽ, hiểu được cả thẻ văn bản tường minh lẫn ngữ cảnh thị giác hàm ẩn của dữ liệu.










