Constitutional AI
Khám phá cách Constitutional AI điều chỉnh các mô hình theo giá trị con người bằng cách sử dụng các nguyên tắc đạo đức. Tìm hiểu cách triển khai các kiểm tra an toàn trong Computer Vision với Ultralytics YOLO26.
Constitutional AI là phương pháp huấn luyện các hệ thống trí tuệ nhân tạo sao cho phù hợp với các giá trị của con người bằng cách cung cấp cho chúng một tập hợp các nguyên tắc cấp cao—một "hiến pháp"—thay vì chỉ dựa hoàn toàn vào phản hồi chi tiết từ con người trên từng đầu ra riêng lẻ. Cách tiếp cận này về cơ bản dạy cho mô hình AI cách tự phê bình và sửa đổi hành vi của chính nó dựa trên tập hợp các quy tắc được xác định trước, chẳng hạn như "hãy hữu ích", "hãy vô hại" và "tránh phân biệt đối xử". Bằng cách tích hợp trực tiếp các nguyên tắc đạo đức này vào quy trình huấn luyện, các nhà phát triển có thể tạo ra các hệ thống an toàn hơn, minh bạch hơn và dễ mở rộng hơn so với các hệ thống phụ thuộc vào phương pháp thủ công Reinforcement Learning from Human Feedback (RLHF).
Cơ chế của Constitutional AI#
Đổi mới cốt lõi của Constitutional AI nằm ở quy trình huấn luyện hai giai đoạn, giúp tự động hóa quá trình căn chỉnh các mô hình. Khác với supervised learning truyền thống, nơi con người phải gán nhãn cho mọi phản hồi chính xác, Constitutional AI sử dụng chính mô hình đó để tạo ra dữ liệu huấn luyện.
-
Giai đoạn Supervised Learning: Mô hình tạo ra các phản hồi cho các câu lệnh, sau đó phê bình đầu ra của chính nó dựa trên các nguyên tắc hiến pháp. Nó sửa đổi phản hồi để căn chỉnh tốt hơn với các quy tắc. Tập dữ liệu tinh chỉnh này sau đó được sử dụng để tối ưu hóa (fine-tune) mô hình, dạy cho nó cách tuân thủ các hướng dẫn một cách tự nhiên.
-
Giai đoạn học tăng cường: Giai đoạn này, thường được gọi là Reinforcement Learning from AI Feedback (RLAIF), thay thế người gán nhãn là con người. AI tạo ra các cặp phản hồi và chọn ra phản hồi tuân thủ tốt nhất hiến pháp. Dữ liệu ưu tiên này huấn luyện một reward model, sau đó mô hình này sẽ củng cố các hành vi mong muốn thông qua các kỹ thuật reinforcement learning tiêu chuẩn.
Sự liên quan đến Thị giác máy tính (Computer Vision)#
Mặc dù Constitutional AI bắt nguồn từ bối cảnh Large Language Models (LLM) được phát triển bởi các tổ chức như Anthropic, các nguyên tắc của nó ngày càng trở nên quan trọng đối với các tác vụ machine learning rộng hơn, bao gồm cả Computer Vision (CV).
- Tạo ảnh có đạo đức: Các công cụ Generative AI dùng để tạo ảnh có thể được huấn luyện theo "hiến pháp" để từ chối các lời nhắc (prompt) tạo ra hình ảnh bạo lực, thù địch hoặc có bản quyền. Điều này đảm bảo rằng bản thân các model weights mã hóa các ràng buộc an toàn, ngăn chặn việc tạo ra nội dung hình ảnh có hại.
- Hệ thống thị giác an toàn tối quan trọng: Trong các autonomous vehicles, một cách tiếp cận mang tính "hiến pháp" có thể xác định các quy tắc phân cấp để ra quyết định. Ví dụ, một quy tắc nêu rằng "sự an toàn của con người được đặt lên trên hiệu quả giao thông" có thể hướng dẫn mô hình khi phân tích các khung cảnh đường phố phức tạp, đảm bảo rằng các kết quả object detection được diễn giải với ưu tiên hàng đầu là sự an toàn.
Triển khai kiểm tra chính sách trong Vision AI#
Trong khi quá trình đào tạo Constitutional AI hoàn chỉnh liên quan đến các vòng lặp phản hồi phức tạp, các nhà phát triển có thể áp dụng khái niệm "kiểm tra theo hiến pháp" trong quá trình inference để lọc đầu ra dựa trên các chính sách an toàn. Ví dụ sau đây minh họa việc sử dụng Ultralytics YOLO26 để phát hiện đối tượng và áp dụng quy tắc an toàn nhằm lọc các phát hiện có độ tin cậy thấp, mô phỏng một hiến pháp về độ tin cậy.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'Constitutional AI so với RLHF truyền thống#
Điều quan trọng là phải phân biệt Constitutional AI với Reinforcement Learning from Human Feedback (RLHF) tiêu chuẩn.
- Khả năng mở rộng: RLHF đòi hỏi lượng lớn sức lao động của con người để đánh giá kết quả đầu ra của mô hình, điều này tốn kém và chậm chạp. Constitutional AI tự động hóa việc này bằng AI agents, giúp nó có khả năng mở rộng cao.
- Tính minh bạch: Trong RLHF, mô hình học hỏi từ một "tín hiệu phần thưởng" không minh bạch (một điểm số), khiến cho việc biết lý do tại sao một hành vi được ưu tiên trở nên khó khăn. Trong Constitutional AI, phương pháp chain of thought prompting được sử dụng trong giai đoạn phê bình giúp cho lý luận trở nên rõ ràng và có thể truy xuất nguồn gốc đến các nguyên tắc bằng văn bản cụ thể.
- Tính nhất quán: Những người đánh giá là con người có thể không nhất quán hoặc mang thành kiến. Một bản hiến pháp bằng văn bản cung cấp một đường cơ sở ổn định cho AI ethics, làm giảm tính chủ quan trong quá trình căn chỉnh.
Tương lai của việc căn chỉnh#
Khi các mô hình tiến hóa hướng tới Artificial General Intelligence (AGI), tầm quan trọng của các chiến lược căn chỉnh mạnh mẽ như Constitutional AI ngày càng tăng. Các phương pháp này là cần thiết để tuân thủ các tiêu chuẩn mới nổi từ các cơ quan như NIST AI Safety Institute.
Ultralytics Platform cung cấp các công cụ để quản lý quản trị dữ liệu và model monitoring, tạo điều kiện thuận lợi cho việc xây dựng các hệ thống AI có trách nhiệm. Bằng cách tích hợp các cân nhắc về đạo đức này vào vòng đời phát triển AI—từ data collection đến model deployment—các tổ chức có thể giảm thiểu rủi ro và đảm bảo công nghệ của họ đóng góp tích cực cho xã hội.






