Конституциональный AI стремится согласовать модели AI с человеческими ценностями
Узнай, как конституциональный AI помогает моделям соблюдать этические правила, принимать более безопасные решения и поддерживать справедливость в языковых системах и системах компьютерного зрения.

Искусственный интеллект (AI) быстро становится важной частью нашей повседневной жизни. Его интегрируют в инструменты, используемые в таких областях, как здравоохранение, подбор персонала, финансы и общественная безопасность. По мере расширения этих систем всё чаще звучат опасения по поводу их этичности и надёжности.
Например, иногда системы ИИ, созданные без учёта принципов справедливости и безопасности, могут выдавать предвзятые или ненадёжные результаты. Это происходит потому, что многие модели по-прежнему не имеют чёткого способа отражать человеческие ценности и согласовываться с ними.
Чтобы решить эти проблемы, исследователи изучают подход, известный как конституционный ИИ. Проще говоря, он добавляет в процесс обучения модели письменный набор принципов. Эти принципы помогают модели оценивать собственное поведение, меньше зависеть от обратной связи от людей и делать ответы более безопасными и понятными.
До сих пор этот подход в основном применялся к большим языковым моделям (LLMs). Однако та же структура может помочь направлять системы компьютерного зрения при принятии этичных решений во время анализа визуальных данных.
В этой статье мы рассмотрим, как работает конституционный ИИ, изучим реальные примеры и обсудим его потенциальное применение в системах компьютерного зрения.

Рис. 1. Характеристики конституционного ИИ. Изображение автора.
Что такое конституционный ИИ?#
Конституционный ИИ — это метод обучения моделей, который задаёт поведение моделей ИИ с помощью чёткого набора этических правил. Эти правила служат кодексом поведения. Вместо того чтобы полагаться на способность модели самостоятельно определять допустимое, он использует письменный набор принципов, формирующих её ответы во время обучения.
Эту концепцию представила Anthropic — исследовательская компания, специализирующаяся на безопасности ИИ, которая разработала семейство LLM Claude как способ сделать системы ИИ более самостоятельными в принятии решений.
Вместо того чтобы полностью полагаться на обратную связь от людей, модель учится критиковать и улучшать собственные ответы на основе заранее определённого набора принципов. Этот подход похож на правовую систему, в которой судья обращается к конституции перед вынесением решения.
В этом случае модель становится одновременно и судьёй, и учеником, используя один и тот же набор правил для проверки и улучшения собственного поведения. Этот процесс повышает согласованность моделей ИИ с заданными целями и способствует разработке безопасных, ответственных систем ИИ.
Как работает конституционный ИИ?#
Цель конституционного ИИ — научить модель ИИ принимать безопасные и справедливые решения, следуя чёткому набору письменных правил. Ниже приведено простое описание этого процесса:
- Определение конституции: Создаётся письменный список этических принципов, которым должна следовать модель. Конституция определяет, чего ИИ следует избегать и какие ценности он должен отражать.
- Обучение на размеченных примерах: Модели показывают примеры ответов, соответствующих конституции. Эти примеры помогают ИИ понять, как выглядит допустимое поведение.
- Распознавание и применение закономерностей: Со временем модель начинает выявлять эти закономерности. Она учится применять те же ценности при ответах на новые вопросы или работе в новых ситуациях.
- Критика и улучшение результатов: Модель проверяет собственные ответы и корректирует их на основе конституции. Этот этап самопроверки помогает ей совершенствоваться, не полагаясь только на обратную связь от людей.
- Формирование согласованных и более безопасных ответов: Модель учится на последовательных правилах, что помогает уменьшить предвзятость и повысить надёжность при использовании в реальных условиях. Благодаря этому подходу она лучше согласуется с человеческими ценностями и ею проще управлять.

Рис. 2. Обзор использования конституционного ИИ для обучения моделей.
Основные принципы этичного проектирования ИИ#
Чтобы модель ИИ соблюдала этические правила, эти правила сначала нужно чётко определить. В случае конституционного ИИ они основываются на наборе ключевых принципов.
Например, вот четыре принципа, составляющие основу эффективной конституции ИИ:
- Прозрачность: Должно быть легко понять, как модель пришла к ответу. Если ответ основан на фактах, оценках или закономерностях, это должно быть прозрачно для пользователя. Это укрепляет доверие и помогает людям оценить, можно ли полагаться на результат работы модели.
- Равенство: Ответы должны оставаться последовательными для разных пользователей. Модель не должна менять результат в зависимости от имени, происхождения или местоположения человека. Равенство помогает предотвращать предвзятость и способствует равному обращению.
- Подотчётность: Должен существовать способ отследить, как обучалась модель и что повлияло на её поведение. Если что-то пошло не так, команды должны иметь возможность определить причину и устранить проблему. Это поддерживает прозрачность и долгосрочную подотчётность.
- Безопасность: Модели должны избегать создания контента, способного причинить вред. Если запрос приводит к рискованным или небезопасным результатам, система должна распознать это и остановиться. Это защищает и пользователя, и целостность системы.
Примеры конституционного ИИ в больших языковых моделях#
Конституционный ИИ перешёл от теории к практике и теперь постепенно используется в больших моделях, взаимодействующих с миллионами пользователей. Два наиболее распространённых примера — LLM от OpenAI и Anthropic.
Хотя обе организации используют разные подходы к созданию более этичных систем ИИ, их объединяет общая идея: научить модель следовать набору письменных руководящих принципов. Рассмотрим эти примеры подробнее.
Подход OpenAI к конституционному ИИ#
OpenAI представила документ под названием Model Spec как часть процесса обучения своих моделей ChatGPT. Этот документ выполняет роль конституции. В нём описано, к чему должна стремиться модель в своих ответах, включая такие ценности, как полезность, честность и безопасность. В документе также определено, какие результаты считаются вредными или вводящими в заблуждение.
Эта система использовалась для дообучения моделей OpenAI: ответы оценивались по степени соответствия правилам. Со временем это помогло настроить ChatGPT так, чтобы он выдавал меньше вредных результатов и лучше соответствовал реальным потребностям пользователей.

Рис. 3. Пример использования ChatGPT документа Model Spec от OpenAI для формирования ответа.
Этичные модели ИИ Anthropic#
Конституция, которой следует модель Anthropic Claude, основана на этических принципах из таких источников, как Всеобщая декларация прав человека, правила платформ, например условия использования Apple, и исследования других лабораторий ИИ. Эти принципы помогают обеспечить безопасность, справедливость и соответствие ответов Claude важным человеческим ценностям.
Claude также использует обучение с подкреплением на основе обратной связи от ИИ (RLAIF): модель проверяет и корректирует собственные ответы на основе этих этических рекомендаций, а не полагается на обратную связь от людей. Этот процесс позволяет Claude со временем совершенствоваться, повышает масштабируемость и помогает лучше предоставлять полезные, этичные и неопасные ответы даже в сложных ситуациях.

Рис. 4. Понимание подхода Anthropic к конституционному ИИ.
Применение конституционного ИИ к компьютерному зрению#
Поскольку конституционный ИИ положительно влияет на поведение языковых моделей, закономерно возникает вопрос: может ли подобный подход помочь системам на основе зрения отвечать более справедливо и безопасно?
Хотя модели компьютерного зрения работают с изображениями, а не с текстом, потребность в этических рекомендациях не менее важна. Например, справедливость и предвзятость — ключевые факторы, которые необходимо учитывать, поскольку такие системы нужно обучать относиться ко всем одинаково и избегать вредных или несправедливых результатов при анализе визуальных данных.

Рис. 5. Этические проблемы, связанные с компьютерным зрением. Изображение автора.
В настоящее время применение методов конституционного ИИ в компьютерном зрении всё ещё изучается и находится на ранней стадии; исследования в этой области продолжаются.
Например, недавно Meta представила CLUE — фреймворк, применяющий рассуждения по принципам, аналогичным конституционным, к задачам обеспечения безопасности изображений. Он преобразует общие правила безопасности в точные шаги, которым могут следовать мультимодальные системы ИИ (системы ИИ, обрабатывающие и понимающие несколько типов данных). Это помогает системе рассуждать более чётко и уменьшать количество вредных результатов.
Кроме того, CLUE делает оценку безопасности изображений более эффективной за счёт упрощения сложных правил, позволяя моделям ИИ действовать быстро и точно без значительного участия людей. Используя набор руководящих принципов, CLUE повышает масштабируемость систем модерации изображений и одновременно обеспечивает высокое качество результатов.
Основные выводы#
По мере того как системы ИИ берут на себя больше ответственности, внимание смещается с того, что они могут делать, на то, что им следует делать. Этот сдвиг важен, поскольку такие системы используются в областях, напрямую влияющих на жизнь людей, включая здравоохранение, правоохранительную деятельность и образование.
Чтобы системы ИИ действовали надлежащим образом и этично, им нужна прочная и последовательная основа. Эта основа должна ставить во главу угла справедливость, безопасность и доверие.
Письменная конституция может обеспечить такую основу во время обучения, направляя процесс принятия решений системой. Она также может предоставить разработчикам структуру для проверки и корректировки поведения системы после развёртывания, гарантируя, что она продолжит соответствовать ценностям, которые должна поддерживать, и упростив её адаптацию к новым возникающим проблемам.
Присоединяйся к нашему растущему сообществу уже сегодня! Погружайся глубже в мир ИИ, изучая наш репозиторий на GitHub. Хочешь создавать собственные проекты в области компьютерного зрения? Ознакомься с нашими вариантами лицензирования. Узнай, как компьютерное зрение в здравоохранении повышает эффективность, и изучи влияние ИИ в производстве на страницах наших решений!









