Prompt Chaining
Tìm hiểu cách prompt chaining chia các tác vụ AI phức tạp thành những workflow đáng tin cậy. Khám phá cách tích hợp Ultralytics YOLO26 với LLM để xây dựng các AI agent nâng cao.
Xâu chuỗi prompt là một mẫu kiến trúc nâng cao trong quá trình phát triển Trí tuệ nhân tạo (AI), trong đó một tác vụ phức tạp được phân rã thành một chuỗi các tác vụ con nhỏ hơn, dễ quản lý hơn. Trong quy trình này, đầu ra của một bước—thường được tạo bởi Mô hình ngôn ngữ lớn (LLM) hoặc một hệ thống thị giác máy tính—đóng vai trò là đầu vào cho bước tiếp theo. Không giống một prompt nguyên khối duy nhất cố gắng giải quyết cùng lúc một vấn đề đa diện, việc xâu chuỗi cho phép developer xây dựng các ứng dụng đáng tin cậy hơn, dễ kiểm thử hơn và mạnh mẽ hơn. Cách tiếp cận module hóa này rất cần thiết để tạo ra các AI Agents tinh vi, có khả năng suy luận, duyệt web hoặc tương tác với môi trường vật lý.
Cơ chế xâu chuỗi#
Về cốt lõi, xâu chuỗi prompt giải quyết các hạn chế về cửa sổ ngữ cảnh và khả năng suy luận trong Mô hình nền tảng. Khi một model được yêu cầu thực hiện quá nhiều thao tác riêng biệt trong một request duy nhất (ví dụ: "Phân tích hình ảnh này, trích xuất văn bản, dịch sang tiếng Tây Ban Nha và định dạng thành một hóa đơn JSON"), xác suất xảy ra lỗi sẽ tăng lên. Bằng cách tách quy trình này thành một pipeline, developer có thể xác minh độ chính xác của từng giai đoạn.
Các chuỗi hiệu quả thường sử dụng "glue code" được viết bằng Python hoặc được quản lý bởi các thư viện điều phối như LangChain để xử lý việc chuyển đổi dữ liệu giữa các bước. Điều này cho phép tích hợp các công nghệ khác biệt, chẳng hạn như kết hợp khả năng quan sát trực quan của Phát hiện đối tượng với khả năng diễn đạt ngôn ngữ tự nhiên của các model sinh văn bản.
Các ứng dụng trong thực tế#
Xâu chuỗi prompt đặc biệt mạnh mẽ khi kết nối các modality dữ liệu khác nhau, cho phép Model đa phương thức hoạt động trong các môi trường công nghiệp và thương mại năng động.
-
Báo cáo trực quan tự động: Trong Sản xuất thông minh, một hệ thống kiểm soát chất lượng có thể xâu chuỗi một model thị giác với một LLM. Đầu tiên, một model tốc độ cao như Ultralytics YOLO26 quét các linh kiện trên dây chuyền lắp ráp. Đầu ra có cấu trúc (ví dụ: "Class: Dented_Can, Confidence: 0.92") được chuyển đổi thành một chuỗi văn bản. Sau đó, văn bản này được truyền cho một model ngôn ngữ cùng prompt như "Soạn yêu cầu bảo trì dựa trên lỗi này", từ đó tạo ra một email dễ đọc cho quản lý khu vực sản xuất.
-
Hỗ trợ khách hàng nhận biết ngữ cảnh: Các chatbot thông minh thường sử dụng kỹ thuật xâu chuỗi để xử lý những truy vấn phức tạp của người dùng. Mắt xích đầu tiên trong chuỗi có thể sử dụng Xử lý ngôn ngữ tự nhiên (NLP) để phân loại ý định của người dùng. Nếu ý định mang tính kỹ thuật, hệ thống sẽ kích hoạt quy trình Tạo sinh tăng cường truy xuất (RAG): tạo embeddings cho truy vấn, tìm kiếm tài liệu trong cơ sở dữ liệu vector và cuối cùng yêu cầu một LLM tổng hợp các đoạn nội dung đã truy xuất thành một câu trả lời hữu ích.
Ví dụ mã từ thị giác sang ngôn ngữ#
Ví dụ sau minh họa "mắt xích" đầu tiên trong một chuỗi: sử dụng Thị giác máy tính (CV) để tạo dữ liệu có cấu trúc, đóng vai trò là ngữ cảnh cho prompt ở bước tiếp theo.
from ultralytics import YOLO
# Load the YOLO26 model (natively end-to-end and highly efficient)
model = YOLO("yolo26n.pt")
# Step 1: Run inference to 'see' the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Step 2: Format visual detections into a natural language string
det_names = [model.names[int(c)] for c in results[0].boxes.cls]
prompt_context = f"The scene contains: {', '.join(det_names)}. Please describe the likely activity."
# The 'prompt_context' variable is now ready to be sent to an LLM API
print(prompt_context)Phân biệt các khái niệm liên quan#
Để triển khai các kiến trúc Học máy (ML) hiệu quả, việc phân biệt xâu chuỗi prompt với các thuật ngữ tương tự trong lĩnh vực AI là rất hữu ích:
- So với Prompt Chain-of-Thought: Chain-of-Thought (CoT) là một kỹ thuật được sử dụng bên trong một prompt duy nhất để khuyến khích model "trình bày cách thực hiện" (ví dụ: "Suy nghĩ từng bước"). Xâu chuỗi prompt bao gồm nhiều lệnh gọi API riêng biệt, trong đó đầu vào của bước B phụ thuộc vào đầu ra của bước A.
- So với Prompt Engineering: Prompt engineering là lĩnh vực rộng hơn, tập trung vào việc tối ưu hóa đầu vào dạng văn bản để đạt hiệu suất tốt hơn từ model. Xâu chuỗi là một mẫu kỹ thuật cụ thể, tập trung vào luồng tuần tự của các thao tác và việc kiểm soát logic.
- So với Prompt Tuning: Prompt tuning là một phương pháp Tối ưu hóa model, trong đó các tham số có thể học (soft prompt) được cập nhật trong giai đoạn training. Xâu chuỗi prompt diễn ra hoàn toàn trong Suy luận thời gian thực và không làm thay đổi Trọng số model.
Bằng cách tận dụng xâu chuỗi prompt, các team có thể xây dựng những ứng dụng mạnh mẽ, tích hợp logic, truy xuất dữ liệu và Nhận dạng hành động. Để quản lý các dataset và training các model thị giác làm nền tảng cho những chuỗi này, Nền tảng Ultralytics cung cấp một giải pháp tập trung cho việc gán nhãn, training và triển khai.









