Prompt Enrichment
Tìm hiểu cách làm giàu prompt (prompt enrichment) tự động hóa việc tăng cường đầu vào để cải thiện độ chính xác của AI. Khám phá cách sử dụng kỹ thuật này với Ultralytics YOLO26 cho các tác vụ thị giác thông minh hơn.
Prompt enrichment là quá trình tự động bổ sung ngữ cảnh phù hợp, các hướng dẫn cụ thể hoặc dữ liệu phụ trợ cho đầu vào ban đầu của người dùng trước khi gửi nó đến mô hình Artificial Intelligence (AI). Kỹ thuật này đóng vai trò như một lớp trung gian thông minh giúp tối ưu hóa tương tác giữa con người và máy móc, đảm bảo rằng các Large Language Models (LLMs) và hệ thống computer vision nhận được các truy vấn toàn diện. Bằng cách chèn các chi tiết mà người dùng có thể bỏ sót—chẳng hạn như tùy chọn lịch sử, dữ liệu vị trí hoặc các ràng buộc kỹ thuật—prompt enrichment cải thiện đáng kể accuracy và tính cá nhân hóa của đầu ra từ mô hình mà không yêu cầu người dùng phải là chuyên gia trong việc soạn thảo các hướng dẫn chi tiết.
Cơ chế của việc làm giàu dữ liệu#
Chức năng cốt lõi của prompt enrichment là thu hẹp khoảng cách giữa ý định mơ hồ của con người và đầu vào chính xác, giàu dữ liệu mà các mô hình yêu cầu để đạt hiệu suất tối ưu. Khi một truy vấn được nhận, hệ thống sẽ phân tích nó và truy xuất thông tin nền tảng cần thiết từ knowledge graph hoặc cơ sở dữ liệu có cấu trúc. Dữ liệu được truy xuất này sẽ được định dạng bằng chương trình và đính kèm vào prompt ban đầu.
Ví dụ, trong các quy trình Natural Language Processing (NLP), một câu hỏi đơn giản như "Trạng thái thế nào?" là chưa đủ về mặt ngữ cảnh. Hệ thống enrichment sẽ xác định phiên hoạt động đang chạy, truy xuất số đơn hàng mới nhất từ transactional database, và viết lại prompt thành: "Người dùng đang hỏi về Đơn hàng #998, hiện đang trên đường vận chuyển. Hãy cung cấp cập nhật vận chuyển dựa trên trạng thái này." Quá trình này thường tận dụng vector databases để nhanh chóng tìm kiếm ngữ cảnh có liên quan về mặt ngữ nghĩa để chèn vào.
Các ứng dụng trong thực tế#
Prompt enrichment đóng vai trò thiết yếu cho việc triển khai các ứng dụng generative AI mạnh mẽ trên nhiều ngành công nghiệp khác nhau, nâng cao cả hệ thống dựa trên văn bản và thị giác:
-
Hỗ trợ khách hàng nhận biết ngữ cảnh: Trong các tổng đài tự động, một chatbot sử dụng enrichment để truy cập lịch sử mua hàng và môi trường kỹ thuật của khách hàng. Thay vì yêu cầu người dùng cung cấp phiên bản thiết bị của họ, hệ thống sẽ truy xuất thông tin này từ metadata của tài khoản và chèn nó vào prompt. Điều này cho phép AI agent cung cấp các bước khắc phục sự cố tức thì, dành riêng cho thiết bị, giúp cải thiện đáng kể customer experience.
-
Cấu hình computer vision động: Trong các hoạt động bảo mật, người dùng có thể chỉ cần bật cài đặt "Chế độ ban đêm". Phía sau hậu trường, prompt enrichment chuyển đổi ý định cấp cao này thành các lớp đối tượng cụ thể cho một bộ dò tìm từ vựng mở như YOLO-World. Hệ thống làm phong phú prompt để quét cụ thể các đối tượng "đèn pin", "chuyển động đáng ngờ" hoặc "người trái phép", cho phép mô hình điều chỉnh trọng tâm object detection một cách linh hoạt.
Ví dụ: Làm giàu lớp đối tượng động#
Ví dụ Python sau đây minh họa khái niệm prompt enrichment bằng cách sử dụng gói ultralytics. Tại đây, ý định cấp cao của người dùng được làm phong phú theo chương trình thành danh sách các lớp mô tả cụ thể mà mô hình quét qua.
from ultralytics import YOLO
def run_enriched_inference(user_mode):
"""Enriches a simple user mode into specific detection prompts."""
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLO("yolov8s-world.pt")
# Enrichment Logic: Map simple user intent to detailed class prompts
context_map = {
"site_safety": ["hard hat", "safety vest", "gloves"],
"traffic": ["car", "bus", "traffic light", "pedestrian"],
}
# Inject the enriched context into the model
enriched_classes = context_map.get(user_mode, ["object"])
model.set_classes(enriched_classes)
# The model now looks for the specific enriched terms
print(f"Mode: {user_mode} -> Enriched Prompt: {enriched_classes}")
run_enriched_inference("site_safety")Làm giàu Prompt so với các khái niệm liên quan#
Để triển khai Machine Learning Operations (MLOps) hiệu quả, việc phân biệt prompt enrichment với các thuật ngữ tương tự là rất hữu ích:
- Retrieval-Augmented Generation (RAG): RAG là một phương pháp enrichment cụ thể. Nó đề cập nghiêm ngặt đến cơ chế tìm nạp các tài liệu có liên quan từ một tập hợp ngữ liệu bên ngoài để làm cơ sở cho phản hồi của mô hình. Enrichment là khái niệm rộng hơn bao gồm RAG nhưng cũng bao gồm việc chèn dữ liệu phiên tĩnh, metadata của người dùng hoặc thời gian hệ thống mà không nhất thiết phải thực hiện semantic search phức tạp.
- Prompt Engineering: Đây là thủ công thiết kế các prompt hiệu quả. Enrichment là một quá trình tự động áp dụng các nguyên tắc prompt engineering một cách linh hoạt tại thời điểm chạy (runtime).
- Prompt Tuning: Đây là kỹ thuật parameter-efficient fine-tuning (PEFT) trong đó các "soft prompt" (các tensor có thể học) được tối ưu hóa trong quá trình huấn luyện. Prompt enrichment diễn ra hoàn toàn trong real-time inference và không làm thay đổi model weights.
- Few-Shot Learning: Điều này liên quan đến việc cung cấp các ví dụ bên trong prompt để dạy mô hình một tác vụ. Các hệ thống enrichment thường chèn các ví dụ few-shot này một cách linh hoạt dựa trên loại tác vụ, kết hợp hiệu quả cả hai khái niệm.
Sự phù hợp trong các hệ thống AI hiện đại#
Khi các mô hình như Ultralytics YOLO26 và GPT-4 trở nên có năng lực hơn, điểm nghẽn thường chuyển sang chất lượng của đầu vào. Prompt enrichment giảm thiểu tình trạng hallucinations in LLMs bằng cách neo giữ mô hình vào dữ liệu thực tế được cung cấp. Trong computer vision (CV), nó cho phép các hệ thống phát hiện zero-shot learning linh hoạt, có thể thích ứng với môi trường mới ngay lập tức mà không cần huấn luyện lại, chỉ bằng cách sửa đổi các prompt văn bản được đưa vào hệ thống. Tính linh hoạt này đóng vai trò quan trọng trong việc xây dựng các giải pháp multi-modal AI có khả năng suy luận trên cả văn bản và hình ảnh. Người dùng muốn quản lý các tập dữ liệu được sử dụng để làm cơ sở cho các hệ thống này thường dựa vào các công cụ như Ultralytics Platform để tổ chức và chú thích thông tin của họ một cách hiệu quả.






