AI Safety
学习 AI 安全的核心支柱,包括对齐和鲁棒性。了解如何使用 Ultralytics YOLO26 部署可靠的模型并确保 AI 的稳定性。
AI 安全是一个多学科领域,专注于确保 Artificial Intelligence (AI) 系统能够可靠、可预测且有益地运行。与保护系统免受外部攻击的网络安全不同,AI 安全致力于解决系统设计和运行本身固有的风险。这包括防止因目标不对齐、在复杂环境中缺乏稳健性或 Deep Learning (DL) 泛化失败而产生的意外后果。随着模型变得越来越自主,像 Center for Human-Compatible AI 这样的机构的研究人员正在努力确保这些技术符合人类意图和安全标准。
安全AI的核心支柱#
构建一个安全的系统需要应对超越简单准确率指标的多项技术挑战。这些支柱可确保 Machine Learning (ML) 模型即使在复杂的现实场景中部署时也能保持受控。
- 稳健性: 安全的模型在面对受损的输入或环境变化时必须保持性能。这包括防御对抗性攻击,在这些攻击中,对输入数据的微小操纵可能会诱使模型产生高置信度的错误。
- 对齐: 这一原则确保 AI 的目标与设计者的真实意图相匹配。当系统学会“钻”其奖励函数的空子时,Reinforcement Learning 中经常会出现不对齐现象——例如清洁机器人为了更快清理乱局而打破花瓶。人类反馈强化学习 (RLHF) 等技术被用于缓解这种情况。
- 可解释性: 也称为可解释 AI (XAI),这涉及为“黑盒”模型带来透明度。可视化特征图可以让工程师理解决策过程,确保模型没有依赖虚假相关性。
- 监控: 持续的模型监控对于检测数据漂移至关重要。如果真实世界的数据开始显着偏离训练数据,安全协议必须触发警报或回退机制。
实际应用#
在算法失败可能导致物理伤害或重大经济损失的高风险领域,AI安全至关重要。
-
自动驾驶汽车: 在汽车领域的 AI 领域,安全框架定义了汽车如何对不确定性做出反应。如果目标检测模型无法以高置信度识别障碍物,系统必须默认进入安全状态(例如制动)而不是进行猜测。NHTSA 自动驾驶汽车指南强调了这些故障安全机制。
-
医疗诊断: 在应用医疗健康领域的 AI 时,安全性包括最大限度地减少关键诊断中的假阴性。系统通常会针对高召回率进行调整,以确保不会漏掉任何潜在病情,从而有效地充当医生的“第二意见”。诸如 FDA Digital Health Center 之类的监管机构为作为医疗器械的软件 (SaMD) 设定了严格的标准。
实施安全阈值#
计算机视觉中最基础的安全机制之一是使用置信度阈值。通过在推理过程中过滤掉低概率预测,开发人员可以防止系统根据薄弱的信息采取行动。
以下示例演示了如何使用 Ultralytics YOLO26 应用安全过滤器,从而确保只处理可靠的检测结果。
from ultralytics import YOLO
# Load the YOLO26 model (latest standard for efficiency)
model = YOLO("yolo26n.pt")
# Run inference with a strict confidence threshold of 0.7 (70%)
# This acts as a safety gate to ignore uncertain predictions
results = model.predict("https://ultralytics.com/images/bus.jpg", conf=0.7)
# Verify detections meet safety criteria
print(f"Safety Check: {len(results[0].boxes)} objects detected with >70% confidence.")AI安全与AI伦理#
虽然这些术语经常互换使用,但它们涉及负责任AI的不同方面。
- AI 安全是一门技术工程学科。它提出了这样的问题:“这个系统能否在不引发事故的情况下正常运行?”它处理诸如模型幻觉以及强化学习中的安全探索等问题。
- **AI 伦理**是一个社会技术框架。它提出了这样的问题:“我们应该构建这个系统吗,它是否公平?”它侧重于诸如算法偏见、隐私权和利益的公平分配等问题,正如 EU AI Act 中所概述的那样。
未来展望#
随着行业向通用人工智能 (AGI) 迈进,安全研究变得愈发关键。组织可以利用 Ultralytics Platform 来管理其数据集并监督模型部署,确保其 AI 解决方案在整个生命周期中保持稳健、透明并符合安全标准。






