Constitutional AI

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

Конституционный искусственный интеллект (Constitutional AI, CAI) — это метод обучения больших языковых моделей (LLM), основанный на использовании явного набора правил и принципов (так называемой «конституции») для формирования безопасного, этичного и предсказуемого поведения ИИ. Подход разработан исследовательской компанией Anthropic в 2022 году как альтернатива обучению с подкреплением от обратной связи с человеком (RLHF).

CAI позволяет модели самостоятельно оценивать и корректировать своё поведение в соответствии с заданной системой ценностей, обеспечивая баланс между полезностью, честностью и безвредностью.

История и мотивация

Метод был предложен исследователями Anthropic в ответ на ограничения подхода RLHF, включая:

  • необходимость масштабной ручной разметки;
  • непрозрачность усвоенных моделью ценностей;
  • склонность моделей к отказам на потенциально безопасные запросы;
  • трудности с переносимостью ценностей в другие культурные и нормативные контексты.

CAI был разработан с целью повышения прозрачности и масштабируемости обучения этичного ИИ, обеспечивая при этом соблюдение фундаментальных прав и норм.

Теоретическая основа

CAI основан на идее явного задания модели набора правил (конституции), отражающих универсальные человеческие ценности. Примеры таких принципов:

  • уважение к правам человека (основано на всеобщей декларации прав человека[1]);
  • запрет на дискриминацию, агрессию, токсичность;
  • защита конфиденциальной информации;
  • приоритет честности и фактической точности;
  • поощрение сотрудничества и ненасильственного взаимодействия.

В отличие от RLHF[2], где поведенческие установки модели задаются косвенно через предпочтения аннотаторов, CAI использует явно сформулированный список нормативных положений, доступный для проверки и редактирования.

Архитектура и обучение

CAI реализуется в два этапа:

  1. Обучение с самокритикой (Self-Critique Phase): Модель генерирует ответ на запрос и затем, используя принципы конституции, самостоятельно анализирует и исправляет собственный ответ, если он нарушает заданные нормы. Такие пары (оригинальный ответ и исправленный) используются для дообучения модели в стиле supervised fine-tuning.
  2. Обучение с подкреплением от обратной связи ИИ (RLAIF): Для множества пар ответов модель-судья (обычно та же модель) сравнивает варианты с точки зрения соблюдения конституции. Затем тренируется модель вознаграждений, и основная модель дообучается с использованием RL (например, PPO) по этой обратной связи. Методика полностью избегает ручной разметки токсичного контента и основана на машинном контроле соблюдения ценностей.

Преимущества и особенности

  • Прозрачность: конституция может быть опубликована, рецензирована, проверена.
  • Масштабируемость: нет необходимости в дорогостоящем ручном аннотировании.
  • Безопасность: снижение рисков вредного или дискриминационного поведения модели.
  • Полезность: модель не склонна к чрезмерным отказам, как при RLHF.
  • Контролируемость: ценности можно адаптировать под юридические или культурные контексты

Народная конституция ИИ: эксперимент 2023 года

В 2023 году компания Anthropic совместно с исследовательской инициативой Collective Intelligence Project[3] провела первый в своём роде эксперимент по разработке «народной конституции» для ИИ[4]. Целью проекта было выяснить, как можно интегрировать общественное мнение и демократические принципы в формирование нормативных ограничений поведения языковых моделей.

В исследовании участвовало более 1000 человек, представляющих демографически сбалансированную выборку граждан США. Участникам предлагалось оценить и выбрать ценности, которыми должен руководствоваться ИИ, а также формулировать конкретные поведенческие принципы для чат-ассистентов. В процессе использовались методы коллективного голосования, ранжирования и аргументированного выбора — включая модифицированные версии таких механизмов, как Deliberative Polling и Quadratic Voting. Ключевые особенности эксперимента:

  • Масштаб — более 1000 респондентов, охватывающих широкий спектр политических взглядов, социальных статусов и образовательных уровней;
  • Процедура — итеративное обсуждение и уточнение норм, голосование за принципы, верификация формулировок;
  • Результат — формирование альтернативной конституции ИИ, ориентированной на демократически выраженные предпочтения.

Сравнительный анализ «народной» и исходной (разработанной экспертами Anthropic) конституции показал существенное совпадение в базовых принципах:

  • запрет дискриминации,
  • поощрение честности,
  • уважение к приватности.

Однако «народная» версия оказалась более акцентированной на:

  • равенстве доступа к информации;
  • объективности и беспристрастности ответов;
  • праве пользователя на объяснение модели.

Эксперимент показал, что внедрение демократических механизмов в процесс создания нормативных рамок ИИ может способствовать:

  • легитимности поведения ИИ в глазах пользователей;
  • снижению рисков культурной или политической предвзятости;
  • более широкому принятию систем ИИ в обществе.

См. также

Литература

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Huang, S. et al. (2024). Collective Constitutional AI: Aligning a Language Model with Public Input. arXiv:2406.07814.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Sun, Z. et al. (2023). Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision. arXiv:2305.03047.
  • Wang, Y. et al. (2023). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
  • Petridis, S. et al. (2024). ConstitutionalExperts: Training a Mixture of Principle-based Prompts. arXiv:2403.04894.
  • Huang, S. & Siddarth, D. (2024). ConstitutionMaker: Interactively Critiquing Large Language Models with Public Principles. ACM CHI 2024. DOI:10.1145/3640543.3645144.
  • Bai, Y. et al. (2023). Training a Helpful and Harmless Assistant with RLHF and RLAIF. Anthropic Technical Report. RL repository.
  • Glaese, A. et al. (2024). ConstitutionalExperts: Towards Automated Principle Refinement for Aligned Language Models. NeurIPS 2024 Workshop. arXiv:2403.04894.
  • Lovitt, L. et al. (2024). Redefining Superalignment: From Weak- to Strong-Alignment. arXiv:2504.17404.

Примечания

  1. «Декларации, конвенции, соглашения и другие правовые материалы».[1]
  2. «Reinforcement Learning from Human Feedback». В Wikipedia [2]
  3. «The Collective Intelligence Project». https://www.cip.org.[3]
  4. «Collective Constitutional AI: Aligning a Language Model with Public Input». [4]