Hallucination (in LLMs)
Khám phá nguyên nhân và rủi ro của hiện tượng AI hallucination trong LLM. Tìm hiểu cách giảm thiểu lỗi thực tế bằng RAG, RLHF và grounding với Ultralytics YOLO26.
Trong lĩnh vực Trí tuệ nhân tạo (AI), ảo giác là hiện tượng trong đó một Mô hình ngôn ngữ lớn (LLM) tạo ra nội dung có vẻ tự tin và đúng cú pháp nhưng không chính xác về mặt thực tế, vô nghĩa hoặc không trung thành với dữ liệu đầu vào nguồn. Khác với các lỗi phần mềm thông thường có thể gây crash hoặc lỗi hiển thị rõ ràng, model bị ảo giác hoạt động như một kẻ bịa đặt đầy thuyết phục, trình bày thông tin sai lệch với mức độ chắc chắn tương đương các sự thật hợp lệ. Điều này đặt ra những thách thức đáng kể cho các tổ chức triển khai AI tạo sinh trong các lĩnh vực nhạy cảm như y tế, pháp luật và tài chính, nơi tính toàn vẹn của dữ liệu là yếu tố tối quan trọng.
Tại sao ảo giác xảy ra?#
Để hiểu tại sao các model tạo ra ảo giác, việc xem xét cách chúng được xây dựng sẽ rất hữu ích. LLM thường dựa trên kiến trúc Transformer, hoạt động như một engine dự đoán tinh vi. Thay vì truy vấn một cơ sở dữ liệu có cấu trúc chứa các sự thật đã được xác minh, model dự đoán token tiếp theo trong một chuỗi dựa trên các xác suất thống kê được suy ra từ dữ liệu huấn luyện của nó.
Một số yếu tố thúc đẩy hành vi này:
- Phỏng đoán xác suất: Model ưu tiên độ trôi chảy và mạch lạc hơn sự thật về mặt thực tế. Nếu một chuỗi từ cụ thể có xác suất xảy ra cao về mặt thống kê—ngay cả khi sai sự thật—model vẫn có thể tạo ra chuỗi đó. Khái niệm này thường được thảo luận trong các nghiên cứu về vẹt ngẫu nhiên, trong đó các model bắt chước các mẫu ngôn ngữ mà không hiểu ý nghĩa.
- Vấn đề về chất lượng dữ liệu: Nếu kho văn bản khổng lồ được sử dụng để huấn luyện chứa các mâu thuẫn, thông tin lỗi thời hoặc nội dung hư cấu, model có thể tái tạo những điểm không chính xác này.
- Mất dấu nguồn: LLM nén lượng thông tin khổng lồ vào trọng số model. Trong quá trình này, chúng thường mất liên kết với các nguồn cụ thể, dẫn đến hiện tượng "bịa hợp" trong đó các khái niệm hoặc sự kiện riêng biệt bị kết hợp sai.
Các ví dụ thực tế về ảo giác#
Ảo giác có thể biểu hiện theo nhiều cách khác nhau, từ những điểm tô sáng tạo vô hại đến các lỗi nghiêm trọng về mặt thực tế:
- Bịa đặt pháp lý: Đã có những trường hợp được ghi nhận trong đó các chuyên gia pháp lý sử dụng AI để soạn bản bào chữa, nhưng phát hiện model đã bịa ra các vụ án không tồn tại và trích dẫn để hỗ trợ lập luận.
- Tạo mã: Các developer sử dụng trợ lý AI có thể gặp phải hiện tượng "ảo giác package", trong đó model đề xuất import một thư viện phần mềm hoặc gọi một function thực sự không tồn tại, đơn giản vì tên đó tuân theo các quy ước đặt tên tiêu chuẩn.
- Lỗi tiểu sử: Khi được hỏi về những cá nhân ít nổi tiếng hơn, các model có thể tự tin gán cho họ những thành tựu, nơi sinh hoặc quá trình sự nghiệp không chính xác, trên thực tế là trộn lẫn thông tin chi tiết từ nhiều người.
Chiến lược giảm thiểu#
Giảm tần suất ảo giác là một trọng tâm lớn của An toàn AI. Các kỹ sư và nhà nghiên cứu sử dụng một số kỹ thuật để neo các model vào thực tế:
- Tạo sinh tăng cường truy xuất (RAG): Phương pháp này kết nối LLM với một cơ sở tri thức bên ngoài đáng tin cậy, thường được lập chỉ mục trong một cơ sở dữ liệu vector. Bằng cách truy xuất các tài liệu liên quan trước khi tạo câu trả lời, model bị ràng buộc bởi dữ liệu thực tế.
- Prompting theo chuỗi suy nghĩ: Kỹ thuật prompt engineering này khuyến khích model "trình bày cách giải" bằng cách phân tách quá trình suy luận phức tạp thành các bước trung gian, qua đó thường làm giảm các lỗi logic.
- Học tăng cường từ phản hồi của con người (RLHF): Trong giai đoạn fine-tuning, các chuyên gia đánh giá do con người thực hiện sẽ xếp hạng các câu trả lời của model. Bằng cách phạt ảo giác và khen thưởng tính trung thực, model học cách đáp ứng tốt hơn các kỳ vọng của con người.
Neo LLM bằng Thị giác máy tính#
Trong các hệ thống AI đa phương thức, việc tạo văn bản có thể được neo bằng dữ liệu hình ảnh. Nếu được yêu cầu mô tả một cảnh, LLM có thể tạo ảo giác về những object không tồn tại trong đó. Bằng cách tích hợp một bộ phát hiện object có độ chính xác cao như YOLO26, developer có thể cung cấp cho LLM danh sách thực tế về các object hiện diện, qua đó giới hạn chặt chẽ đầu ra của nó ở những detection đã được xác minh.
Ví dụ Python sau đây cho thấy cách sử dụng package ultralytics để trích xuất danh sách object đã được xác minh, sau đó có thể dùng danh sách này làm ràng buộc thực tế cho prompt của language model.
from ultralytics import YOLO
# Load the YOLO26n model (latest generation, efficient and accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to get ground-truth detections
results = model("https://ultralytics.com/images/bus.jpg")
# Extract the class names of actually detected objects
detected_objects = [model.names[int(c)] for c in results[0].boxes.cls]
# This factual list prevents the LLM from hallucinating items
print(f"Verified Objects for Prompt Context: {detected_objects}")
# Output example: ['bus', 'person', 'person', 'person', 'person']Phân biệt các khái niệm liên quan#
Điều quan trọng là phải phân biệt ảo giác với các lỗi AI phổ biến khác:
- So với Thiên kiến trong AI: Thiên kiến đề cập đến sự định kiến có hệ thống trong đầu ra (ví dụ: ưu ái nhóm nhân khẩu học này hơn nhóm khác), trong khi ảo giác là sự thất bại về độ chính xác thực tế. Một câu trả lời có thể không thiên kiến nhưng vẫn bị ảo giác (ví dụ: "Mặt trăng được làm bằng pho mát").
- So với Overfitting: Overfitting xảy ra khi model ghi nhớ dữ liệu huấn luyện quá sát và không thể khái quát hóa cho các đầu vào mới. Ảo giác thường xảy ra khi model cố gắng khái quát hóa quá mức sang những lĩnh vực mà nó thiếu dữ liệu.
- So với phân loại sai: Trong phát hiện object, gán nhãn một chiếc xe hơi thành xe tải là lỗi phân loại (vấn đề về độ chính xác), không phải ảo giác. Ảo giác chỉ liên quan đến việc tạo sinh nội dung sai lệch.
Đối với những người muốn quản lý dataset và huấn luyện model với tính toàn vẹn dữ liệu cao nhằm ngăn ngừa các lỗi phát sinh ở các bước sau, Ultralytics Platform cung cấp các công cụ toàn diện để annotation và quản lý dataset. Ngoài ra, hướng dẫn từ Khung quản lý rủi ro AI của NIST cung cấp các tiêu chuẩn để đánh giá và giảm thiểu những rủi ro này trong môi trường production.









