Constitutional AI
Познакомься с Constitutional AI, согласующим модели с человеческими ценностями с помощью этических принципов. Научись реализовывать проверки безопасности в компьютерном зрении с Ultralytics YOLO26.
Конституционный ИИ — это метод обучения систем искусственного интеллекта согласованию с человеческими ценностями путем предоставления им набора принципов высокого уровня — «конституции», — вместо того чтобы полагаться исключительно на масштабную обратную связь от людей по отдельным результатам. Этот подход фактически учит модель ИИ критиковать и пересматривать собственное поведение на основе заранее заданного набора правил, таких как «быть полезной», «не причинять вреда» и «избегать дискриминации». Встраивая эти этические принципы непосредственно в процесс обучения, разработчики могут создавать системы, которые безопаснее, прозрачнее и проще масштабируются, чем системы, зависящие от ручного обучения с подкреплением на основе обратной связи от человека (RLHF).
Механизм конституционного ИИ#
Ключевая инновация конституционного ИИ заключается в двухэтапном процессе обучения, который автоматизирует согласование моделей. В отличие от традиционного обучения с учителем, при котором люди должны помечать каждый правильный ответ, конституционный ИИ использует саму модель для создания обучающих данных.
-
Этап обучения с учителем: модель генерирует ответы на запросы, а затем критикует собственный результат на основе конституционных принципов. Она пересматривает ответ, чтобы лучше согласовать его с правилами. Затем этот уточненный набор данных используется для дообучения модели, благодаря чему она учится самостоятельно следовать этим принципам.
-
Этап обучения с подкреплением: этот этап, часто называемый обучением с подкреплением на основе обратной связи от ИИ (RLAIF), заменяет человека-разметчика. ИИ генерирует пары ответов и выбирает тот, который лучше всего соответствует конституции. Эти данные о предпочтениях используются для обучения модели вознаграждения, которая затем закрепляет желательное поведение с помощью стандартных методов обучения с подкреплением.
Значение для компьютерного зрения#
Хотя конституционный ИИ возник в контексте больших языковых моделей (LLM), разработанных такими организациями, как Anthropic, его принципы становятся все более актуальными для более широкого круга задач машинного обучения, включая компьютерное зрение (CV).
- Этичная генерация изображений: инструменты генеративного ИИ для создания изображений можно обучить «конституционно» отказывать в выполнении запросов, которые привели бы к созданию изображений с насилием, разжиганием ненависти или нарушением авторских прав. Это гарантирует, что сами веса модели кодируют ограничения безопасности и предотвращают создание вредоносного визуального контента.
- Системы компьютерного зрения, критичные для безопасности: в автономных транспортных средствах «конституционный» подход может задавать иерархию правил принятия решений. Например, правило «безопасность людей важнее эффективности дорожного движения» может направлять модель при анализе сложных дорожных сцен, гарантируя, что результаты обнаружения объектов интерпретируются с приоритетом безопасности.
Реализация проверок политик в ИИ для компьютерного зрения#
Хотя полноценное обучение конституционного ИИ включает сложные циклы обратной связи, разработчики могут применять концепцию «конституционных проверок» во время вывода, чтобы фильтровать результаты на основе политик безопасности. В следующем примере показано, как использовать Ultralytics YOLO26 для обнаружения объектов и применять правило безопасности для фильтрации обнаружений с низкой уверенностью, имитируя конституцию надежности.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'Конституционный ИИ и традиционный RLHF#
Важно отличать конституционный ИИ от стандартного обучения с подкреплением на основе обратной связи от человека (RLHF).
- Масштабируемость: RLHF требует огромных объемов человеческого труда для оценки результатов модели, что дорого и медленно. Конституционный ИИ автоматизирует этот процесс с помощью агентов ИИ, благодаря чему он легко масштабируется.
- Прозрачность: при RLHF модель обучается на непрозрачном «сигнале вознаграждения» — оценке, — поэтому сложно понять, почему определенное поведение было предпочтительным. В конституционном ИИ побуждение к рассуждениям по цепочке мыслей, используемое на этапе критики, делает рассуждения явными и позволяет связать их с конкретными письменно сформулированными принципами.
- Согласованность: люди-оценщики могут быть непоследовательными или предвзятыми. Письменная конституция обеспечивает стабильную основу для этики ИИ, снижая субъективность в процессе согласования.
Будущее согласования#
По мере развития моделей в направлении искусственного общего интеллекта (AGI) важность надежных стратегий согласования, таких как конституционный ИИ, возрастает. Эти методы необходимы для соблюдения новых стандартов, разрабатываемых такими организациями, как Институт безопасности ИИ NIST.
Платформа Ultralytics предлагает инструменты для управления данными и мониторинга моделей, способствуя созданию ответственных систем ИИ. Интегрируя эти этические аспекты в жизненный цикл разработки ИИ — от сбора данных до развертывания моделей, — организации могут снижать риски и обеспечивать положительное влияние своих технологий на общество.









