Data Poisoning
了解数据投毒及其对 AI 的影响。探索如何使用 Ultralytics Platform 保护 Ultralytics YOLO26 模型和训练数据。
数据投毒是一种网络安全威胁,恶意攻击者会故意篡改用于构建机器学习(ML)模型的训练数据。攻击者在模型训练前污染数据集,从而植入隐藏后门、引入偏见或降低模型整体性能。与针对系统代码的其他安全漏洞利用不同,数据投毒攻击的目标是学习过程本身,因此模型部署到生产环境后,这类攻击极难检测。根据 IBM 的威胁情报概述,这些攻击会严重威胁人工智能系统的完整性和可靠性。
AI 投毒的运作机制#
随着各组织越来越依赖深度学习(DL)和大型语言模型(LLM),它们经常从互联网上抓取大量未经验证的数据。这种做法为数据注入创造了机会,攻击者可以将伪造或恶意的数据点插入公共存储库。2025 年最新的AI 投毒研究揭示了一个令人担忧的现实:即使对于拥有数十亿参数的大型模型,攻击者也只需篡改数量近乎恒定且极少的样本,就能攻破系统。
当特定触发短语被注入模型训练时使用的文本中,就会发生 LLM 投毒。模型部署后,可能会正常运行,直到用户输入触发短语,导致系统绕过安全协议或生成有害内容。Anthropic 关于 LLM 投毒的 2025 年研究表明,只需 250 份投毒文档,就能在一个拥有 130 亿参数的模型中植入后门。
实际应用与示例#
数据投毒不仅影响文本生成,也会严重影响计算机视觉(CV)模型。以下是这种威胁在实际应用中出现的两个具体示例:
- 破坏生成式艺术模型:Nightshade 项目等工具可以让数字艺术家在网上上传作品前,巧妙地修改作品像素。当生成式 AI模型抓取这些图像进行训练时,被修改的像素就会成为投毒数据,导致模型完全误解提示词,例如用户要求生成汽车图像时,模型却生成猫的图像。
- 危害自动驾驶汽车:在目标检测系统中,攻击者可能会悄悄修改开源训练数据集中的停车标志图像。通过添加特定视觉噪声,投毒后的训练数据会让模型将停车标志误识别为限速标志,造成灾难性的安全风险。
与对抗攻击的区别#
虽然两者关系密切,但区分数据投毒和对抗攻击十分重要。对抗攻击发生在推理期间,攻击者会操纵输入数据(例如在现实中的停车标志上贴一张贴纸),以欺骗已经训练好的模型。相反,数据投毒发生在训练期间,从根本上改变模型的内部逻辑。应对这两类风险都需要完善的 AI 安全协议。
降低模型开发中的风险#
防御这些威胁需要严格的模型监控,并使用纯净、可信的验证数据来验证模型完整性。使用经过验证的数据集评估模型,有助于团队发现可能表明数据遭到篡改的意外性能下降。OpenAI 的安全研究和 OWASP GenAI 安全项目提出的最佳实践强调严格的数据来源追踪,并建议使用经过整理的数据集,而不是直接抓取原始网络数据。
构建和测试模型时,团队应结合使用 PyTorch 或 TensorFlow 等成熟框架与全面的验证流程。你可以使用干净可信的数据集轻松验证Ultralytics YOLO26模型,确保模型精度未受损。
from ultralytics import YOLO
# Load a custom-trained Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Validate the model on a trusted dataset to detect performance drops
# Sudden decreases in precision/recall may indicate data poisoning
metrics = model.val(data="clean_validation_data.yaml")
print(f"mAP50-95: {metrics.box.map}") # Review core metrics对于大型计算机视觉项目,跨多次训练运行跟踪这些指标至关重要。开发者可以查看模型评估洞察以了解基准性能,并使用 Ultralytics Platform安全地标注、训练和管理数据,而无需依赖未经验证的外部来源。将安全的数据整理与受控的数据增强技术结合起来,有助于确保模型保持准确,并能抵御外部操纵。









