AI Safety
Изучи основные принципы безопасности ИИ, включая согласованность и устойчивость. Узнай, как развёртывать надёжные модели с помощью Ultralytics YOLO26 и обеспечивать надёжность ИИ.
Безопасность ИИ — это междисциплинарная область, сосредоточенная на обеспечении надежной, предсказуемой и полезной работы систем искусственного интеллекта (AI). В отличие от кибербезопасности, которая защищает системы от внешних атак, безопасность ИИ рассматривает риски, заложенные в самой конструкции и эксплуатации системы. Сюда входит предотвращение непреднамеренных последствий, возникающих из-за несоответствия целей, недостаточной устойчивости в новых средах или сбоев обобщения в глубоком обучении (DL). По мере того как модели становятся более автономными, исследователи из таких организаций, как Центр совместимого с человеком ИИ, работают над тем, чтобы эти технологии соответствовали намерениям человека и стандартам безопасности.
Основные принципы безопасного ИИ#
Создание безопасной системы требует решения нескольких технических задач, выходящих за рамки простых показателей точности. Эти принципы обеспечивают сохранение контроля над моделями машинного обучения (ML) даже при их развертывании в сложных сценариях реального мира.
- Устойчивость: безопасная модель должна сохранять работоспособность при искаженных входных данных или изменениях среды. Это включает защиту от атак злоумышленников, при которых незначительные изменения входных данных могут заставить модель выдавать высокоуверенные ошибочные результаты.
- Согласованность целей: этот принцип обеспечивает соответствие целей ИИ истинным намерениям разработчика. Несоответствие часто возникает в обучении с подкреплением, когда система учится «обходить» свою функцию вознаграждения — например, робот-уборщик разбивает вазу, чтобы быстрее убрать осколки. Для снижения этого риска используются такие методы, как обучение с подкреплением на основе обратной связи от человека (RLHF).
- Интерпретируемость: также известная как объяснимый ИИ (XAI), она предполагает обеспечение прозрачности моделей типа «черного ящика». Визуализация карт признаков позволяет инженерам понять процесс принятия решений и убедиться, что модель не опирается на ложные корреляции.
- Мониторинг: непрерывный мониторинг модели необходим для обнаружения дрейфа данных. Протоколы безопасности должны запускать оповещения или резервные механизмы, если данные из реального мира начинают значительно отличаться от обучающих данных.
Практические применения#
Безопасность ИИ имеет первостепенное значение в критически важных областях, где отказ алгоритма может привести к физическому ущербу или значительным экономическим потерям.
-
Автономные транспортные средства: в области ИИ в автомобильной отрасли системы безопасности определяют реакцию автомобиля на неопределенность. Если модель обнаружения объектов не может с высокой уверенностью идентифицировать препятствие, система должна перейти в безопасное состояние — например, затормозить, — а не делать предположения. В рекомендациях NHTSA по автоматизированным транспортным средствам особое внимание уделяется этим отказоустойчивым механизмам.
-
Медицинская диагностика: при применении ИИ в здравоохранении безопасность предполагает минимизацию ложноотрицательных результатов при критически важных диагнозах. Системы часто настраивают на высокий показатель полноты, чтобы не пропустить потенциальное заболевание, фактически используя их как «второе мнение» для врачей. Регулирующие органы, такие как Центр цифрового здравоохранения FDA, устанавливают строгие стандарты для программного обеспечения как медицинского изделия (SaMD).
Реализация порогов безопасности#
Один из самых базовых механизмов безопасности в компьютерном зрении — использование порогов уверенности. Отфильтровывая маловероятные предсказания на этапе инференса, разработчики не позволяют системам действовать на основе ненадежной информации.
В следующем примере показано, как применить фильтр безопасности с использованием Ultralytics YOLO26, чтобы обрабатывать только надежные обнаружения.
from ultralytics import YOLO
# Load the YOLO26 model (latest standard for efficiency)
model = YOLO("yolo26n.pt")
# Run inference with a strict confidence threshold of 0.7 (70%)
# This acts as a safety gate to ignore uncertain predictions
results = model.predict("https://ultralytics.com/images/bus.jpg", conf=0.7)
# Verify detections meet safety criteria
print(f"Safety Check: {len(results[0].boxes)} objects detected with >70% confidence.")Безопасность ИИ и этика ИИ#
Хотя эти термины часто используются как взаимозаменяемые, они относятся к разным аспектам ответственного ИИ.
- Безопасность ИИ — это техническая инженерная дисциплина. Она задается вопросом: «Будет ли эта система работать корректно, не вызывая аварий?» Она рассматривает такие проблемы, как галлюцинации модели и безопасное исследование в обучении с подкреплением.
- Этика ИИ — это социотехническая концепция. Она задается вопросом: «Следует ли нам создавать эту систему и справедлива ли она?» Она сосредоточена на таких вопросах, как алгоритмическая предвзятость, права на неприкосновенность частной жизни и справедливое распределение преимуществ, как указано в Законе ЕС об ИИ.
Перспективы на будущее#
По мере того как отрасль движется в сторону искусственного общего интеллекта (AGI), исследования безопасности приобретают все большее значение. Организации могут использовать платформу Ultralytics для управления своими наборами данных и контроля развертывания моделей, обеспечивая устойчивость, прозрачность и соответствие стандартам безопасности своих решений на основе ИИ на протяжении всего жизненного цикла.









