ReAct Prompting
Khám phá kỹ thuật prompting ReAct để xây dựng AI agent tự hành. Tìm hiểu cách suy luận và hành động phối hợp với LLM cùng các công cụ thị giác như Ultralytics YOLO26.
Gợi ý ReAct (Lập luận và Hành động) là một mô hình kỹ thuật prompt tiên tiến, cho phép model ngôn ngữ lớn (LLM) đan xen linh hoạt các chuỗi suy luận từng bước với những hành động dành riêng cho tác vụ. Được giới thiệu trong bài báo học thuật có ảnh hưởng năm 2022 "ReAct: Kết hợp sức mạnh của lập luận và hành động trong mô hình ngôn ngữ", kỹ thuật này biến model ngôn ngữ tĩnh thành một AI agent tương tác. Bằng cách tạo suy nghĩ rõ ràng về một vấn đề và thực thi hành động để truy xuất thông tin bên ngoài, framework ReAct cải thiện đáng kể độ chính xác thực tế và năng lực ra quyết định trong các workflow trí tuệ nhân tạo phức tạp.
Cơ chế lập luận và hành động#
Trong các tương tác truyền thống, model tạo câu trả lời hoàn toàn dựa trên kiến thức nội bộ, điều này thường dẫn đến hiện tượng ảo giác trong LLM. Kiến trúc ReAct khắc phục vấn đề này bằng cách neo AI vào các môi trường bên ngoài thông qua một vòng lặp liên tục gồm Suy nghĩ, Hành động và Quan sát.
Khi nhận một truy vấn, trước tiên model tạo "Suy nghĩ" để phác thảo chiến lược. Sau đó, model kích hoạt một "Hành động", chẳng hạn như truy vấn công cụ tìm kiếm, tương tác với cơ sở dữ liệu hoặc gọi API thị giác thông qua một khái niệm gọi là gọi hàm. Môi trường trả về một "Quan sát" cung cấp dữ liệu thực tế. Model đánh giá thông tin mới này, cập nhật suy luận và lặp lại chu kỳ cho đến khi đưa ra câu trả lời cuối cùng. Phương pháp này, được trình bày chi tiết hơn trong Hướng dẫn Kỹ thuật Prompt về ReAct, mô phỏng quá trình giải quyết vấn đề của con người và tạo ra hành vi agent có tính minh bạch, kiểm soát cao.
Ứng dụng thực tế#
Gợi ý ReAct phát huy hiệu quả trong các tình huống cần giải quyết vấn đề lặp đi lặp lại và sử dụng công cụ qua nhiều bước, khiến kỹ thuật này trở thành nền tảng của các hệ thống AI agentic hiện đại.
- Agent hỗ trợ khách hàng tự động: Trong môi trường doanh nghiệp, agent hỗ trợ CNTT sử dụng ReAct để giải quyết vấn đề của người dùng. Nếu người dùng báo mất kết nối mạng, agent suy luận rằng cần kiểm tra trạng thái máy chủ. Agent hành động bằng cách ping một API chẩn đoán, quan sát kết quả, rồi chuyển tiếp phiếu hỗ trợ hoặc cung cấp hướng dẫn khắc phục sự cố dựa trên thông tin truy xuất được, qua đó tinh giản các pipeline Tạo sinh tăng cường bằng truy xuất (RAG) truyền thống.
- Phân tích hình ảnh động: Các hệ thống thị giác máy tính tận dụng ReAct để trả lời các câu hỏi phức tạp về hình ảnh. Một agent robot được giao nhiệm vụ quản lý hàng tồn kho có thể quan sát kệ hàng, suy luận rằng cần đếm một số mặt hàng cụ thể, hành động bằng cách gọi model phát hiện đối tượng, rồi sử dụng dữ liệu bounding box trả về để hoàn tất việc đếm. Sự kết hợp này thu hẹp khoảng cách giữa suy luận dựa trên văn bản và khả năng hiểu không gian.
Triển khai ReAct với thị giác máy tính#
Đối với nhà phát triển sử dụng Python, các agent ReAct thường điều phối model nhận thức để tương tác với thế giới vật lý. Đoạn mã khái niệm sau minh họa cách vòng lặp suy luận ReAct có thể triển khai liền mạch một model Ultralytics YOLO26 làm công cụ bên ngoài để quan sát và báo cáo về môi trường.
from ultralytics import YOLO
def vision_tool(image_path: str) -> str:
"""Action tool for a ReAct agent to detect objects in an image."""
model = YOLO("yolo26n.pt") # Load highly efficient YOLO26 nano model
results = model(image_path)
# Format the observation for the LLM's reasoning loop
detected_classes = [model.names[int(c)] for c in results[0].boxes.cls]
return f"Observation: Found {len(detected_classes)} objects: {', '.join(detected_classes)}"
# Simulated ReAct agent executing an action
agent_observation = vision_tool("https://ultralytics.com/images/bus.jpg")
print(agent_observation)Có thể tinh giản hoàn toàn việc quản lý dataset và theo dõi thí nghiệm cho các công cụ thị giác này bằng Ultralytics Platform, nền tảng cung cấp các giải pháp toàn diện cho việc triển khai AI hiện đại. Những ai muốn tự xây dựng các agent này từ đầu cũng có thể nghiên cứu logic nền tảng trong repository ReAct chính thức.
Phân biệt các khái niệm liên quan#
Để thiết kế kiến trúc đa phương thức mạnh mẽ như được khảo sát trong nghiên cứu học thuật gần đây về căn chỉnh, điều cốt yếu là phân biệt ReAct với các mẫu kỹ thuật liên quan:
- So với Gợi ý Chuỗi suy nghĩ: Chuỗi suy nghĩ (CoT) khuyến khích model suy nghĩ từng bước nhưng hoàn toàn dựa vào kiến thức nội bộ tĩnh. ReAct mở rộng CoT bằng cách đưa vào các "hành động" linh động, thu thập những quan sát bên ngoài mới trong quá trình suy luận.
- So với Chuỗi prompt: Chuỗi prompt gồm một chuỗi lệnh gọi LLM riêng biệt được mã hóa cứng, trong đó đầu ra của bước này tự động được chuyển sang bước kế tiếp. ReAct là mô hình tự chủ hơn, trong đó một agent tự quyết định linh hoạt cần sử dụng công cụ nào hoặc thực hiện hành động tuần tự nào dựa trên các quan sát liên tục, thay vì tuân theo một script được xâu chuỗi cứng nhắc.
Bằng cách hợp nhất suy luận logic với việc thực thi các công cụ bên ngoài chuyên biệt như Model Đa phương thức, gợi ý ReAct cho phép phát triển các hệ thống AI tổng quát có năng lực cao.









