Chain-of-Thought Prompting
Khám phá prompting Chain-of-Thought (CoT) để nâng cao khả năng suy luận của AI. Tìm hiểu cách phân tách tác vụ thành các bước logic cải thiện việc sinh code cho Ultralytics YOLO26.
Prompting theo chuỗi suy luận (CoT) là một kỹ thuật nâng cao trong lĩnh vực prompt engineering, cho phép các mô hình ngôn ngữ lớn (LLM) giải quyết những tác vụ suy luận phức tạp bằng cách phân rã chúng thành các bước logic trung gian. Thay vì yêu cầu model cung cấp ngay câu trả lời cuối cùng, CoT khuyến khích hệ thống tạo ra một "chuỗi suy nghĩ" mô phỏng cách con người giải quyết vấn đề. Cách suy luận từng bước này cải thiện đáng kể hiệu suất trong các tác vụ liên quan đến số học, logic ký hiệu và suy luận theo lẽ thường, qua đó thay đổi cách chúng ta tương tác với các hệ thống Trí tuệ nhân tạo (AI).
Cơ chế suy luận#
Các model ngôn ngữ tiêu chuẩn thường gặp khó khăn với những bài toán nhiều bước vì chúng cố gắng ánh xạ trực tiếp đầu vào sang đầu ra chỉ trong một lượt xử lý. Cách tiếp cận "hộp đen" này có thể dẫn đến lỗi, đặc biệt khi bước nhảy logic quá lớn. Prompting theo chuỗi suy luận giải quyết vấn đề này bằng cách chèn các bước suy luận giữa câu hỏi đầu vào và đầu ra cuối cùng.
Quy trình này thường hoạt động theo hai cách:
- CoT zero-shot: Người dùng thêm một cụm từ kích hoạt đơn giản như "Hãy suy nghĩ từng bước" vào prompt. Điều này kích hoạt các khả năng suy luận tiềm ẩn của model mà không cần các ví dụ cụ thể.
- CoT few-shot: Prompt bao gồm một vài ví dụ (mẫu) về các câu hỏi đi kèm lời giải từng bước. Cách này tận dụng học few-shot để chỉ cho model chính xác cách cấu trúc logic trước khi xử lý một bài toán mới.
Bằng cách tạo ra các bước suy luận trung gian một cách tường minh, model có thêm cơ hội tự sửa lỗi và cung cấp khả năng minh bạch về cách nó đi đến kết luận. Điều này rất quan trọng để giảm hiện tượng hallucination trong LLM, khi các model có thể tự tin nêu ra những thông tin không chính xác.
Các ứng dụng trong thực tế#
Mặc dù ban đầu được phát triển cho logic dựa trên văn bản, prompting theo chuỗi suy luận có những ứng dụng mạnh mẽ khi kết hợp với các lĩnh vực AI khác, chẳng hạn như thị giác máy tính và sinh code.
1. Nâng cao khả năng sinh code cho thị giác máy tính#
Các developer sử dụng CoT để hướng dẫn LLM viết các script phần mềm phức tạp cho những tác vụ như phát hiện đối tượng. Thay vì một yêu cầu mơ hồ như "viết code để tìm ô tô", prompt CoT có thể cấu trúc yêu cầu như sau: "Đầu tiên, import các thư viện cần thiết. Thứ hai, load model đã được pre-trained. Thứ ba, xác định nguồn ảnh. Cuối cùng, chạy vòng lặp prediction." Cách tiếp cận có cấu trúc này đảm bảo code được sinh cho các model như YOLO26 có cú pháp chính xác và logic hợp lý.
2. Ra quyết định tự động#
Trong lĩnh vực phương tiện tự hành, các hệ thống phải xử lý dữ liệu hình ảnh và đưa ra những quyết định quan trọng đối với an toàn. Cách tiếp cận theo chuỗi suy luận cho phép hệ thống diễn đạt logic của mình: "Tôi phát hiện một người đi bộ gần vạch sang đường. Người đi bộ đang hướng mặt về phía đường. Đèn giao thông đang xanh đối với tôi, nhưng người đi bộ có thể bước xuống đường. Vì vậy, tôi sẽ giảm tốc độ và chuẩn bị dừng lại." Điều này giúp các quyết định của AI có thể diễn giải được và phù hợp với các nguyên tắc của AI có khả năng giải thích (XAI).
Chuỗi suy luận trong thực tế#
Mặc dù CoT chủ yếu là một kỹ thuật xử lý ngôn ngữ tự nhiên, kỹ thuật này có thể được triển khai bằng code để đảm bảo tương tác nhất quán với các vision model. Ví dụ Python sau đây minh họa cách developer có thể cấu trúc một prompt nhằm hướng dẫn một LLM (được mô phỏng trong ví dụ này) sinh code inference hợp lệ cho Nền tảng Ultralytics.
# Example of structuring a Chain-of-Thought prompt for an LLM
# This prompt guides the model to write a valid YOLO26 inference script
cot_prompt = """
Task: Write a Python script to detect objects using YOLO26.
Chain of Thought:
1. Import the YOLO class from the 'ultralytics' library.
2. Load the 'yolo26n.pt' model weights (the latest nano model).
3. Load a sample image using a URL or local path.
4. Run the predict() function and save the results.
Based on these steps, generate the Python code below:
"""
# In a real application, you would send 'cot_prompt' to an LLM API
print(f"Structured Prompt for LLM:\n{cot_prompt}")Phân biệt các khái niệm liên quan#
Điều quan trọng là phải phân biệt prompting theo chuỗi suy luận với các thuật ngữ tương tự trong lĩnh vực học máy (ML):
- Nối chuỗi prompt: Đây là việc kết nối nhiều lần gọi model riêng biệt, trong đó đầu ra của một bước trở thành đầu vào của bước tiếp theo. CoT diễn ra trong một prompt duy nhất để khơi gợi suy luận nội tại, trong khi nối chuỗi prompt điều phối một workflow qua nhiều lượt tương tác.
- Sinh tăng cường truy xuất (RAG): RAG tập trung vào việc truy xuất dữ liệu bên ngoài (chẳng hạn như tài liệu hoặc database) để làm cơ sở cho kiến thức của model. CoT tập trung vào chính quy trình suy luận. Hai phương pháp này thường được kết hợp—sử dụng RAG để lấy dữ kiện và CoT để suy luận về chúng.
- Tinh chỉnh prompt: Đây là một phương pháp fine-tuning hiệu quả về tham số, tối ưu các soft prompt liên tục (vector) trong quá trình huấn luyện. CoT là một chiến lược ngôn ngữ tự nhiên rời rạc được áp dụng trong inference thời gian thực mà không thay đổi trọng số model.
Triển vọng tương lai#
Khi các model nền tảng tiếp tục phát triển, prompting theo chuỗi suy luận đang trở thành một best practice tiêu chuẩn để khai thác tối đa tiềm năng của chúng. Nghiên cứu từ các nhóm như Google DeepMind cho thấy khi model tăng quy mô, khả năng thực hiện suy luận CoT của chúng được cải thiện đáng kể. Sự phát triển này đang mở đường cho các agent tự động đáng tin cậy hơn, có khả năng xử lý những workflow phức tạp trong các ngành từ chăm sóc sức khỏe đến sản xuất thông minh.









