Semantic Chunking
Tìm hiểu cách semantic chunking bảo toàn ngữ cảnh dữ liệu để nâng cao độ chính xác của AI và RAG. Khám phá cách trích xuất các visual chunk bằng Ultralytics YOLO26.
Phân đoạn ngữ nghĩa là một kỹ thuật tiền xử lý dữ liệu nâng cao được sử dụng trong học máy (ML) và trí tuệ nhân tạo (AI) để chia các tập dữ liệu lớn thành những phân đoạn nhỏ hơn và có ý nghĩa. Nếu bạn đang tự hỏi "phân đoạn là gì" trong bối cảnh AI, thì đó là quá trình chia các chuỗi dài của dữ liệu phi cấu trúc—chẳng hạn như tài liệu, video hoặc âm thanh—thành các mẩu hoặc phân đoạn có thể quản lý. Định nghĩa phân đoạn tiêu chuẩn thường bao gồm việc chia dữ liệu theo số lượng ký tự hoặc khoảng thời gian cố định. Tuy nhiên, "phân đoạn theo ý nghĩa" hay phân đoạn ngữ nghĩa đi xa hơn bằng cách phân tích ngữ cảnh và nhóm các thông tin liên quan lại với nhau. Điều này đảm bảo thông điệp cốt lõi vẫn được bảo toàn, ngăn chặn việc mất ngữ cảnh thường xảy ra với các phương pháp chia tách tùy ý.
Phân đoạn ngữ nghĩa hoạt động như thế nào?#
Để hiểu cách thực hiện phân đoạn ngữ nghĩa, việc xem xét vai trò của nó trong các pipeline sinh hiện đại sẽ rất hữu ích. Vậy phân đoạn ngữ nghĩa trong RAG là gì? Khi chuẩn bị dữ liệu cho một cơ sở dữ liệu vector, một model embedding sẽ phân tích các câu liền kề hoặc các thành phần trực quan và tính toán mối quan hệ giữa chúng. Sử dụng các chỉ số thống kê như độ tương đồng cosine, hệ thống xác định các điểm mà chủ đề thay đổi—thường được gọi là các điểm ngắt—và chia dữ liệu tại đó. Điều này đảm bảo rằng các phần dữ liệu được Mô hình ngôn ngữ lớn (LLM) truy xuất trong một truy vấn chứa các ý hoàn chỉnh, mạch lạc, qua đó cải thiện đáng kể độ chính xác của phản hồi được tạo ra. Các nghiên cứu gần đây về RAPTOR và phân cụm đồ thị thích ứng cho thấy chiến lược nhận biết ngữ cảnh này vượt trội hơn phương pháp chia tách theo kích thước cố định.
Phân đoạn ngữ nghĩa trong Thị giác máy tính#
Mặc dù thường gắn liền với Xử lý ngôn ngữ tự nhiên (NLP), phân đoạn ngữ nghĩa cũng rất phù hợp với thị giác máy tính và AI đa phương thức. Chẳng hạn, trong phân tích tài liệu, một phân đoạn ngữ nghĩa trực quan có thể giữ biểu đồ cùng chú thích giải thích tương ứng thay vì tách chúng dựa trên ranh giới trang nghiêm ngặt. Các nhà cung cấp cloud và công cụ API tiên tiến cung cấp các cấu hình phân đoạn ngữ nghĩa chuyên biệt để quản lý những loại dữ liệu phức tạp này.
Các developer có thể tận dụng model Ultralytics YOLO26 để tự động hóa việc trích xuất các phân đoạn trực quan này. Bằng cách phát hiện các đối tượng trong ảnh hoặc video, bạn có thể tạo ra các phân đoạn ý nghĩa cục bộ đại diện cho nội dung cốt lõi của cảnh.
from ultralytics import YOLO
# Load an Ultralytics YOLO26 model to extract visual semantics
model = YOLO("yolo26n.pt")
# Run inference to detect objects within a visual scene
results = model("scene.jpg")
# Group detected object classes to form a semantic visual chunk
visual_chunk = [model.names[int(cls)] for cls in results[0].boxes.cls]
print(f"Semantic visual chunk elements: {visual_chunk}")Các ứng dụng trong thực tế#
Phân đoạn ngữ nghĩa giải quyết những thách thức quan trọng trong nhiều workflow AI khác nhau. Dưới đây là hai ví dụ cụ thể:
- RAG đa phương thức cho AI tài liệu: Khi phân tích các tệp PDF phức tạp, chẳng hạn như báo cáo tài chính, phân đoạn trực quan đảm bảo rằng các bounding box bao quanh bảng được nhóm cùng với phần tóm tắt văn bản tương ứng. Điều này cho phép các trợ lý AI trả lời chính xác những câu hỏi rất cụ thể mà không làm mất ngữ cảnh số liệu.
- Tóm tắt video tự động: Trong lĩnh vực an ninh và giám sát, các luồng video liên tục được phân đoạn theo ngữ nghĩa dựa trên những sự kiện được phát hiện—chẳng hạn như một người đi vào khu vực hạn chế. Sử dụng theo dõi đối tượng, hệ thống nhóm các frame liên quan thành một đoạn video có thể hành động thay vì trả về một đoạn cắt ngẫu nhiên dài 10 giây. Các team quản lý những tập dữ liệu khổng lồ này thường dựa vào Ultralytics Platform để liền mạch gán nhãn, train và triển khai các pipeline phức tạp dựa trên sự kiện như vậy.
Các khái niệm liên quan#
Điều quan trọng là phân biệt kỹ thuật này với các thuật ngữ AI tương tự:
- Phân đoạn hành động: Trong khi phân đoạn ngữ nghĩa nhóm dữ liệu theo ý nghĩa để truy xuất tối ưu, phân đoạn hành động nhóm các chuỗi chuyển động vật lý (chẳng hạn như quỹ đạo của cánh tay robot) thành các hành động đơn lẻ có thể thực thi trong lĩnh vực robotics.
- Tìm kiếm ngữ nghĩa: Phân đoạn ngữ nghĩa là giai đoạn chuẩn bị dữ liệu thiết yếu giúp việc truy xuất thông tin chính xác trở nên khả thi, trong khi tìm kiếm ngữ nghĩa là quá trình truy vấn thực tế để lấy các phân đoạn đã được chuẩn bị dựa trên ý định của người dùng.









