AI Safety
了解 AI 安全的核心支柱,包括对齐和鲁棒性。探索如何使用 Ultralytics YOLO26 部署可靠模型并确保 AI 可靠性。
人工智能安全是一个多学科领域,致力于确保人工智能(AI)系统可靠、可预测并有益地运行。与保护系统免受外部攻击的网络安全不同,人工智能安全关注系统自身设计和运行中固有的风险。这包括防止因目标错位、在新环境中缺乏稳健性或深度学习(DL)泛化失败而产生的意外后果。随着模型变得更加自主,人类兼容人工智能中心等组织的研究人员致力于确保这些技术符合人类意图和安全标准。
安全人工智能的核心支柱#
构建安全系统需要应对多个超越简单准确率指标的技术挑战。这些支柱可确保机器学习(ML)模型即使部署在复杂的现实场景中,也能保持在可控范围内。
- **稳健性:**安全模型在面对损坏的输入或环境变化时,必须保持性能。这包括防御对抗性攻击,因为对输入数据进行细微操纵可能会诱使模型产生高置信度错误。
- **对齐:**这一原则确保人工智能的目标与设计者的真实意图一致。在强化学习中,当系统学会“钻奖励函数的空子”时,通常会发生目标错位——例如,清洁机器人为了更快地清理碎片而打碎花瓶。人们会使用基于人类反馈的强化学习(RLHF)等技术来缓解这一问题。
- **可解释性:**这也称为可解释人工智能(XAI),指的是提高“黑盒”模型的透明度。可视化特征图能够帮助工程师理解决策过程,确保模型没有依赖虚假相关性。
- **监控:**持续进行模型监控对于检测数据漂移至关重要。如果现实世界的数据开始与训练数据显著偏离,安全协议必须触发警报或备用机制。
实际应用#
在算法故障可能导致人身伤害或重大经济损失的高风险领域,人工智能安全至关重要。
-
**自动驾驶汽车:**在汽车领域的人工智能中,安全框架规定了汽车如何应对不确定性。如果目标检测模型无法以较高置信度识别障碍物,系统必须默认进入安全状态(例如刹车),而不是进行猜测。NHTSA 自动驾驶汽车指南强调了这些故障安全机制。
-
**医学诊断:**在医疗领域的人工智能应用中,安全性包括尽量减少关键诊断中的假阴性。系统通常会针对较高的召回率进行调优,以确保不遗漏任何潜在病症,从而有效地充当医生的“第二意见”。FDA 数字健康中心等监管机构会为医疗器械软件(SaMD)制定严格的标准。
实施安全阈值#
计算机视觉中最基本的安全机制之一是使用置信度阈值。通过在推理期间过滤掉低概率预测,开发者可以防止系统依据不可靠的信息采取行动。
以下示例演示了如何使用Ultralytics YOLO26应用安全过滤器,确保仅处理可靠的检测结果。
from ultralytics import YOLO
# Load the YOLO26 model (latest standard for efficiency)
model = YOLO("yolo26n.pt")
# Run inference with a strict confidence threshold of 0.7 (70%)
# This acts as a safety gate to ignore uncertain predictions
results = model.predict("https://ultralytics.com/images/bus.jpg", conf=0.7)
# Verify detections meet safety criteria
print(f"Safety Check: {len(results[0].boxes)} objects detected with >70% confidence.")人工智能安全与人工智能伦理的区别#
虽然这两个术语经常互换使用,但它们关注的是负责任人工智能的不同方面。
- 人工智能安全是一门技术工程学科。它要回答的是:“这个系统能否在不造成事故的情况下正常运行?”它涉及模型幻觉以及强化学习中的安全探索等问题。
- **人工智能伦理**是一个社会技术框架。它要回答的是:“我们是否应该构建这个系统?它是否公平?”它关注算法偏见、隐私权以及利益公平分配等问题,正如《欧盟人工智能法案》所阐述的那样。
未来展望#
随着行业迈向通用人工智能(AGI),安全研究正变得越来越重要。组织可以利用Ultralytics Platform管理其数据集并监督模型部署,确保其人工智能解决方案在整个生命周期内始终稳健、透明,并符合安全标准。









