Constitutional AI
Khám phá cách Constitutional AI điều chỉnh model theo các giá trị của con người bằng các nguyên tắc đạo đức. Tìm hiểu cách triển khai các bước kiểm tra an toàn trong Thị giác Máy tính với Ultralytics YOLO26.
AI theo hiến pháp là một phương pháp huấn luyện các hệ thống trí tuệ nhân tạo để phù hợp với các giá trị của con người bằng cách cung cấp cho chúng một tập hợp các nguyên tắc cấp cao—một "hiến pháp"—thay vì chỉ dựa vào phản hồi phong phú của con người về từng đầu ra riêng lẻ. Cách tiếp cận này về cơ bản dạy model AI tự phê bình và điều chỉnh hành vi của chính nó dựa trên một tập hợp quy tắc được xác định trước, chẳng hạn như "hữu ích," "không gây hại," và "tránh phân biệt đối xử." Bằng cách tích hợp trực tiếp các hướng dẫn đạo đức này vào quy trình huấn luyện, các nhà phát triển có thể tạo ra những hệ thống an toàn hơn, minh bạch hơn và dễ mở rộng hơn so với các hệ thống phụ thuộc vào Học tăng cường từ phản hồi của con người (RLHF) thủ công.
Cơ chế của AI theo hiến pháp#
Đổi mới cốt lõi của AI theo hiến pháp nằm ở quy trình huấn luyện hai giai đoạn, giúp tự động hóa việc căn chỉnh model. Không giống học có giám sát truyền thống, trong đó con người phải gán nhãn cho mọi phản hồi đúng, AI theo hiến pháp sử dụng chính model để tạo dữ liệu huấn luyện.
-
Giai đoạn học có giám sát: Model tạo phản hồi cho các prompt, sau đó tự phê bình đầu ra dựa trên các nguyên tắc hiến pháp. Model điều chỉnh phản hồi để phù hợp hơn với các quy tắc. Tập dữ liệu đã được tinh chỉnh này sau đó được sử dụng để fine-tune model, giúp model tự nhiên tuân thủ các hướng dẫn.
-
Giai đoạn học tăng cường: Giai đoạn này, thường được gọi là Học tăng cường từ phản hồi của AI (RLAIF), thay thế người gán nhãn. AI tạo các cặp phản hồi và chọn phản hồi tuân thủ hiến pháp tốt nhất. Dữ liệu về mức độ ưu tiên này dùng để huấn luyện một reward model, sau đó củng cố các hành vi mong muốn thông qua các kỹ thuật học tăng cường tiêu chuẩn.
Mức độ liên quan đến Computer Vision#
Mặc dù AI theo hiến pháp bắt nguồn từ lĩnh vực Các mô hình ngôn ngữ lớn (LLM) do các tổ chức như Anthropic phát triển, các nguyên tắc của nó ngày càng phù hợp với những tác vụ machine learning rộng hơn, bao gồm cả Thị giác máy tính (CV).
- Tạo ảnh có đạo đức: Các công cụ AI tạo sinh để tạo ảnh có thể được huấn luyện "theo hiến pháp" nhằm từ chối các prompt có thể tạo ra hình ảnh bạo lực, thù ghét hoặc có bản quyền. Điều này đảm bảo rằng chính trọng số model mã hóa các ràng buộc an toàn, ngăn việc tạo ra nội dung hình ảnh gây hại.
- Hệ thống thị giác quan trọng đối với an toàn: Trong phương tiện tự hành, cách tiếp cận "theo hiến pháp" có thể xác định các quy tắc phân cấp cho việc ra quyết định. Ví dụ, một quy tắc nêu rằng "an toàn của con người được ưu tiên hơn hiệu quả giao thông" có thể hướng dẫn model khi phân tích các cảnh đường phức tạp, đảm bảo rằng kết quả phát hiện đối tượng được diễn giải với an toàn là ưu tiên hàng đầu.
Triển khai các bước kiểm tra chính sách trong AI thị giác#
Mặc dù việc huấn luyện AI theo hiến pháp đầy đủ bao gồm các vòng lặp phản hồi phức tạp, các nhà phát triển có thể áp dụng khái niệm "kiểm tra theo hiến pháp" trong quá trình suy luận để lọc đầu ra dựa trên các chính sách an toàn. Ví dụ sau minh họa cách sử dụng Ultralytics YOLO26 để phát hiện đối tượng và áp dụng một quy tắc an toàn nhằm lọc các kết quả phát hiện có độ tin cậy thấp, mô phỏng một hiến pháp về độ tin cậy.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'AI theo hiến pháp và RLHF thông thường#
Điều quan trọng là phải phân biệt AI theo hiến pháp với Học tăng cường từ phản hồi của con người (RLHF) tiêu chuẩn.
- Khả năng mở rộng: RLHF yêu cầu lượng lớn nhân lực để đánh giá đầu ra của model, vừa tốn kém vừa chậm. AI theo hiến pháp tự động hóa quy trình này bằng tác nhân AI, nhờ đó có khả năng mở rộng cao.
- Tính minh bạch: Trong RLHF, model học từ một "tín hiệu phần thưởng" không minh bạch (một điểm số), khiến việc biết vì sao một hành vi được ưu tiên trở nên khó khăn. Trong AI theo hiến pháp, prompting chuỗi suy nghĩ được sử dụng trong giai đoạn phê bình giúp quá trình suy luận trở nên rõ ràng và có thể truy nguyên đến các nguyên tắc cụ thể được viết ra.
- Tính nhất quán: Những người đánh giá có thể không nhất quán hoặc thiên vị. Một hiến pháp được viết ra cung cấp nền tảng ổn định cho đạo đức AI, giảm tính chủ quan trong quy trình căn chỉnh.
Tương lai của việc căn chỉnh#
Khi các model tiến hóa theo hướng Trí tuệ nhân tạo tổng quát (AGI), tầm quan trọng của các chiến lược căn chỉnh mạnh mẽ như AI theo hiến pháp ngày càng tăng. Những phương pháp này rất cần thiết để tuân thủ các tiêu chuẩn mới nổi từ những cơ quan như Viện An toàn AI NIST.
Nền tảng Ultralytics cung cấp các công cụ để quản trị dữ liệu và giám sát model, hỗ trợ tạo ra các hệ thống AI có trách nhiệm. Bằng cách tích hợp những cân nhắc về đạo đức này vào vòng đời phát triển AI—từ thu thập dữ liệu đến triển khai model—các tổ chức có thể giảm thiểu rủi ro và đảm bảo công nghệ của mình đóng góp tích cực cho xã hội.









