YOLO Vision 2026:
返回 Ultralytics 词汇表

AI Guardrails

了解 AI 护栏如何通过针对安全性、隐私、安保、监控和人工监督的分层控制来保护系统,并查看一个 YOLO26 视觉 AI 示例。

AI 护栏是用于将人工智能系统保持在定义的安全、隐私和运营边界内的技术和组织控制措施。它们减少了有害输出、prompt injection、未授权操作以及敏感数据泄露等风险。与更广泛的 AI safety 相比,护栏是在模型推理之前、期间和之后应用的特定安全保障措施。NIST Generative AI Profile 建议在整个完整的 AI 生命周期中管理这些控制措施。(nist.gov)

AI 护栏的工作原理#

护栏使用多个互补层,因为没有任何单一的过滤器可以解决所有的故障模式:

近期研究强调可衡量的评估。GuardBench 引入了一个涵盖众多安全数据集的大规模基准测试,而 ACL 2025 guardrails tutorial 则突出了分层防御、安全评估和自动化 AI red teaming。(aclanthology.org)

实际应用#

视觉 AI 示例#

此示例使用 Ultralytics YOLO26 来防止低置信度检测结果自动到达下游逻辑:

from ultralytics import YOLO

model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg", conf=0.25)[0]
approved = [box for box in result.boxes if float(box.conf) >= 0.70]
if len(approved) != len(result.boxes):
    print("Guardrail: send frame for human review")

此阈值只是其中一层;生产系统应将其与验证数据集、日志记录、访问控制以及人类参与的机器学习结合起来。

当前最佳实践#

使用纵深防御,测试错误批准和不必要的拒绝,并保持安全的降级状态。护栏也应不断适应:AGrail research 探讨了针对代理的演进控制,而 LS-Guard 提出了针对特定模型的保护措施。多语言测试也很重要,正如 MrGuard 所证明的那样。更强的限制可能会降低可用性,因此团队应持续衡量安全性、延迟和任务完成情况,而不是将护栏视为一次性配置。(aclanthology.org)

Explore solutions

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅