Constitutional AI
Конституционный искусственный интеллект (Constitutional AI, CAI) — это метод обучения больших языковых моделей (LLM), основанный на использовании явного набора правил и принципов (так называемой «конституции») для формирования безопасного, этичного и предсказуемого поведения ИИ. Подход разработан исследовательской компанией Anthropic в 2022 году как альтернатива обучению с подкреплением от обратной связи с человеком (RLHF).
CAI позволяет модели самостоятельно оценивать и корректировать своё поведение в соответствии с заданной системой ценностей, обеспечивая баланс между полезностью, честностью и безвредностью.
История и мотивация
Метод был предложен исследователями Anthropic в ответ на ограничения подхода RLHF, включая:
- необходимость масштабной ручной разметки;
- непрозрачность усвоенных моделью ценностей;
- склонность моделей к отказам на потенциально безопасные запросы;
- трудности с переносимостью ценностей в другие культурные и нормативные контексты.
CAI был разработан с целью повышения прозрачности и масштабируемости обучения этичного ИИ, обеспечивая при этом соблюдение фундаментальных прав и норм.
Теоретическая основа
CAI основан на идее явного задания модели набора правил (конституции), отражающих универсальные человеческие ценности. Примеры таких принципов:
- уважение к правам человека (основано на всеобщей декларации прав человека[1]);
- запрет на дискриминацию, агрессию, токсичность;
- защита конфиденциальной информации;
- приоритет честности и фактической точности;
- поощрение сотрудничества и ненасильственного взаимодействия.
В отличие от RLHF[2], где поведенческие установки модели задаются косвенно через предпочтения аннотаторов, CAI использует явно сформулированный список нормативных положений, доступный для проверки и редактирования.
Архитектура и обучение
CAI реализуется в два этапа:
- Обучение с самокритикой (Self-Critique Phase): Модель генерирует ответ на запрос и затем, используя принципы конституции, самостоятельно анализирует и исправляет собственный ответ, если он нарушает заданные нормы. Такие пары (оригинальный ответ и исправленный) используются для дообучения модели в стиле supervised fine-tuning.
- Обучение с подкреплением от обратной связи ИИ (RLAIF): Для множества пар ответов модель-судья (обычно та же модель) сравнивает варианты с точки зрения соблюдения конституции. Затем тренируется модель вознаграждений, и основная модель дообучается с использованием RL (например, PPO) по этой обратной связи. Методика полностью избегает ручной разметки токсичного контента и основана на машинном контроле соблюдения ценностей.
Преимущества и особенности
- Прозрачность: конституция может быть опубликована, рецензирована, проверена.
- Масштабируемость: нет необходимости в дорогостоящем ручном аннотировании.
- Безопасность: снижение рисков вредного или дискриминационного поведения модели.
- Полезность: модель не склонна к чрезмерным отказам, как при RLHF.
- Контролируемость: ценности можно адаптировать под юридические или культурные контексты
Народная конституция ИИ: эксперимент 2023 года
В 2023 году компания Anthropic совместно с исследовательской инициативой Collective Intelligence Project[3] провела первый в своём роде эксперимент по разработке «народной конституции» для ИИ[4]. Целью проекта было выяснить, как можно интегрировать общественное мнение и демократические принципы в формирование нормативных ограничений поведения языковых моделей.
В исследовании участвовало более 1000 человек, представляющих демографически сбалансированную выборку граждан США. Участникам предлагалось оценить и выбрать ценности, которыми должен руководствоваться ИИ, а также формулировать конкретные поведенческие принципы для чат-ассистентов. В процессе использовались методы коллективного голосования, ранжирования и аргументированного выбора — включая модифицированные версии таких механизмов, как Deliberative Polling и Quadratic Voting. Ключевые особенности эксперимента:
- Масштаб — более 1000 респондентов, охватывающих широкий спектр политических взглядов, социальных статусов и образовательных уровней;
- Процедура — итеративное обсуждение и уточнение норм, голосование за принципы, верификация формулировок;
- Результат — формирование альтернативной конституции ИИ, ориентированной на демократически выраженные предпочтения.
Сравнительный анализ «народной» и исходной (разработанной экспертами Anthropic) конституции показал существенное совпадение в базовых принципах:
- запрет дискриминации,
- поощрение честности,
- уважение к приватности.
Однако «народная» версия оказалась более акцентированной на:
- равенстве доступа к информации;
- объективности и беспристрастности ответов;
- праве пользователя на объяснение модели.
Эксперимент показал, что внедрение демократических механизмов в процесс создания нормативных рамок ИИ может способствовать:
- легитимности поведения ИИ в глазах пользователей;
- снижению рисков культурной или политической предвзятости;
- более широкому принятию систем ИИ в обществе.
См. также
Литература
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Huang, S. et al. (2024). Collective Constitutional AI: Aligning a Language Model with Public Input. arXiv:2406.07814.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Sun, Z. et al. (2023). Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision. arXiv:2305.03047.
- Wang, Y. et al. (2023). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
- Petridis, S. et al. (2024). ConstitutionalExperts: Training a Mixture of Principle-based Prompts. arXiv:2403.04894.
- Huang, S. & Siddarth, D. (2024). ConstitutionMaker: Interactively Critiquing Large Language Models with Public Principles. ACM CHI 2024. DOI:10.1145/3640543.3645144.
- Bai, Y. et al. (2023). Training a Helpful and Harmless Assistant with RLHF and RLAIF. Anthropic Technical Report. RL repository.
- Glaese, A. et al. (2024). ConstitutionalExperts: Towards Automated Principle Refinement for Aligned Language Models. NeurIPS 2024 Workshop. arXiv:2403.04894.
- Lovitt, L. et al. (2024). Redefining Superalignment: From Weak- to Strong-Alignment. arXiv:2504.17404.