Constitutional AI
Исследуй, как конституционный ИИ (Constitutional AI) согласовывает модели с человеческими ценностями, используя этические принципы. Научись внедрять проверки безопасности в компьютерное зрение с помощью Ultralytics YOLO26.
Конституционный ИИ — это метод обучения систем искусственного интеллекта согласованию с человеческими ценностями путем предоставления им набора принципов высокого уровня — «конституции», — вместо того чтобы полагаться исключительно на обширные отзывы людей об отдельных результатах. Этот подход по сути учит модель ИИ критиковать и корректировать свое собственное поведение на основе предопределенного набора правил, таких как «будь полезным», «не причиняй вреда» и «избегай дискриминации». Внедряя эти этические рекомендации непосредственно в процесс обучения, ты можешь создавать системы, которые безопаснее, прозрачнее и легче масштабируются по сравнению с теми, которые зависят от ручного обучения на основе обратной связи от человека Reinforcement Learning from Human Feedback (RLHF).
Механизм Constitutional AI#
Основная инновация Конституционного ИИ заключается в его двухэтапном процессе обучения, который автоматизирует согласование моделей. В отличие от традиционного обучения с учителем, где люди должны размечать каждый правильный ответ, Конституционный ИИ использует саму модель для генерации обучающих данных.
-
Этап обучения с учителем: Модель генерирует ответы на промпты, а затем критикует свой собственный результат на основе конституционных принципов. Она пересматривает ответ, чтобы лучше соответствовать правилам. Этот уточненный набор данных затем используется для дообучения модели, приучая ее внутренне следовать заданным принципам.
-
Фаза обучения с подкреплением: Эта фаза, часто называемая обучением с подкреплением на основе отзывов ИИ Reinforcement Learning from AI Feedback (RLAIF), заменяет разметчика-человека. ИИ генерирует пары ответов и выбирает тот, который лучше всего соответствует конституции. Эти данные о предпочтениях обучают модель вознаграждения, которая затем подкрепляет желаемое поведение с помощью стандартных методов обучения с подкреплением.
Значение для компьютерного зрения#
Хотя Конституционный ИИ зародился в контексте больших языковых моделей (LLM), разработанных такими организациями, как Anthropic, его принципы становятся все более актуальными для более широких задач машинного обучения, включая компьютерное зрение (CV).
- Этическая генерация изображений: Инструменты генеративного ИИ для создания изображений могут быть обучены «конституционно» отказывать в запросах, которые привели бы к созданию насильственного, ненавистнического контента или контента, защищенного авторским правом. Это гарантирует, что сами веса модели кодируют ограничения безопасности, предотвращая создание вредного визуального контента.
- Системы технического зрения, критически важные для безопасности: В автономных транспортных средствах «конституционный» подход может определять иерархические правила для принятия решений. Например, правило «безопасность человека превыше эффективности дорожного движения» может направлять модель при анализе сложных дорожных сцен, гарантируя, что результаты обнаружения объектов интерпретируются с приоритетом безопасности.
Внедрение проверок политики в Vision AI#
Хотя полное обучение Constitutional AI включает сложные циклы обратной связи, ты можешь применять концепцию «конституционных проверок» во время inference для фильтрации результатов на основе политик безопасности. В следующем примере демонстрируется использование Ultralytics YOLO26 для обнаружения объектов и применение правила безопасности для фильтрации результатов с низкой степенью уверенности, имитируя конституцию надежности.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'Constitutional AI против обычного RLHF#
Важно отличать Конституционный ИИ от стандартного метода обучения на основе обратной связи от человека Reinforcement Learning from Human Feedback (RLHF).
- Масштабируемость: RLHF требует огромного объема человеческого труда для оценки результатов работы модели, что дорого и медленно. Конституционный ИИ автоматизирует это с помощью агентов ИИ, делая процесс легко масштабируемым.
- Прозрачность: В RLHF модель учится на основе непрозрачного «сигнала вознаграждения» (оценки), из-за чего сложно понять, почему то или иное поведение было предпочтительным. В Конституционном ИИ промптинг цепочки мыслей, используемый на этапе критического анализа, делает обоснование явным и прослеживаемым до конкретных письменных принципов.
- Консистентность: Оценщики-люди могут быть непоследовательными или предвзятыми. Письменная конституция обеспечивает стабильную основу для этики ИИ, снижая субъективность в процессе согласования.
Будущее согласования#
По мере того как модели развиваются в направлении общего искусственного интеллекта (AGI), важность надежных стратегий согласования, таких как Конституционный ИИ, возрастает. Эти методы необходимы для соблюдения новых стандартов таких организаций, как Институт безопасности ИИ при NIST.
Платформа Ultralytics предлагает инструменты для управления качеством данных и мониторинга моделей, облегчая создание ответственных систем ИИ. Интегрируя эти этические соображения в жизненный цикл разработки ИИ — от сбора данных до развертывания модели — ты сможешь снизить риски и гарантировать, что твои технологии вносят позитивный вклад в развитие общества.






