Constitutional AI
探索宪法式 AI 如何利用伦理原则使模型与人类价值观保持一致。了解如何使用 Ultralytics YOLO26 在计算机视觉中实现安全检查。
宪法式 AI 是一种通过向人工智能系统提供一组高层级原则——即“宪法”——来使其与人类价值观保持一致的训练方法,而不是仅仅依赖人类对每个输出提供的大量反馈。这种方法本质上是根据预先定义的一组规则(例如“提供帮助”“避免伤害”和“避免歧视”)教会 AI 模型批评和修正自身行为。通过将这些伦理准则直接嵌入训练过程,开发者可以创建比依赖人工 基于人类反馈的强化学习 (RLHF) 的系统更安全、更透明且更易于扩展的系统。
宪法式 AI 的运作机制#
宪法式 AI 的核心创新在于其两阶段训练过程,该过程能够自动完成模型对齐。不同于传统的监督学习(在传统监督学习中,人类必须为每个正确响应进行标注),宪法式 AI 使用模型自身生成训练数据。
-
监督学习阶段:模型针对提示生成响应,然后根据宪法原则批评自身输出。它会修订响应,使其更符合这些规则。随后使用这个经过优化的数据集对模型进行微调,教会模型从根本上遵循这些准则。
-
强化学习阶段:这一阶段通常称为基于 AI 反馈的强化学习 (RLAIF),用 AI 取代人工标注者。AI 生成成对的响应,并选择最符合宪法的一项。这些偏好数据用于训练奖励模型,随后通过标准的强化学习技术强化所需行为。
与计算机视觉的相关性#
尽管宪法式 AI 最初源于大型语言模型 (LLM)的研究背景,这些模型由Anthropic等组织开发,但其原则正日益适用于更广泛的机器学习任务,包括计算机视觉 (CV)。
- 符合伦理的图像生成:生成式 AI 图像创建工具可以通过“宪法式”训练,拒绝生成暴力、仇恨或受版权保护图像的提示。这样可以确保模型权重自身编码了安全约束,从而防止生成有害的视觉内容。
- 安全关键型视觉系统:在自动驾驶车辆中,“宪法式”方法可以为决策制定定义分层规则。例如,“人身安全优先于交通效率”这一规则可以在模型分析复杂道路场景时提供指导,确保以安全为首要考虑来解读目标检测结果。
在视觉 AI 中实施策略检查#
虽然完整的宪法式 AI 训练涉及复杂的反馈循环,但开发者可以在推理期间应用“宪法式检查”这一概念,根据安全策略过滤输出。以下示例演示了如何使用 Ultralytics YOLO26 检测对象,并应用安全规则过滤低置信度检测结果,以模拟可靠性宪法。
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'宪法式 AI 与传统 RLHF 的比较#
区分宪法式 AI 与标准的基于人类反馈的强化学习 (RLHF)非常重要。
- 可扩展性:RLHF 需要大量人工来评估模型输出,成本高且速度慢。宪法式 AI 借助AI 代理实现自动化,因此具有很高的可扩展性。
- 透明度:在 RLHF 中,模型从不透明的“奖励信号”(一个分数)中学习,因此很难了解某种行为为何更受偏好。在宪法式 AI 中,批评阶段使用的思维链提示会使推理过程变得明确,并且可以追溯到具体的书面原则。
- 一致性:人工评估者可能不一致或存在偏见。书面宪法为AI 伦理提供了稳定基线,减少了对齐过程中的主观性。
对齐的未来#
随着模型向通用人工智能 (AGI)演进,宪法式 AI 等稳健对齐策略的重要性也在不断提升。这些方法对于遵守美国国家标准与技术研究院 AI 安全研究所 (NIST AI Safety Institute)等机构制定的新兴标准至关重要。
Ultralytics Platform 提供了用于管理数据治理和模型监控的工具,助力创建负责任的 AI 系统。通过将这些伦理考量整合到 AI 开发生命周期中——从数据收集到模型部署——组织可以降低风险,并确保其技术为社会带来积极影响。









