---
title: "Constitutional AI"
source: "https://systems-analysis.info/wiki/Constitutional_AI"
wiki: "systems-analysis.info/wiki"
article: "Constitutional_AI"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 82
wiki_created_at: 2026-09-06T21:54:44Z
wiki_modified_at: 2026-09-06T21:54:44Z
downloaded_at: 2026-09-07T22:17:18Z
---

# Constitutional AI

**Конституционный искусственный интеллект** (*Constitutional AI*, **CAI**) — это метод [обучения больших языковых моделей](https://systems-analysis.info/wiki/%D0%9E%D0%B1%D1%83%D1%87%D0%B5%D0%BD%D0%B8%D0%B5_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D1%85_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9 "Обучение больших языковых моделей") (LLM), основанный на использовании явного набора правил и принципов (так называемой «конституции») для формирования безопасного, этичного и предсказуемого поведения ИИ. Подход разработан исследовательской компанией Anthropic в 2022 году как альтернатива обучению с подкреплением от обратной связи с человеком ([RLHF](https://systems-analysis.info/wiki/RLHF "RLHF")).

CAI позволяет модели самостоятельно оценивать и корректировать своё поведение в соответствии с заданной системой ценностей, обеспечивая баланс между полезностью, честностью и безвредностью.

## История и мотивация

Метод был предложен исследователями Anthropic в ответ на ограничения подхода RLHF, включая:

- необходимость масштабной ручной разметки;
- непрозрачность усвоенных моделью ценностей;
- склонность моделей к отказам на потенциально безопасные запросы;
- трудности с переносимостью ценностей в другие культурные и нормативные контексты.

CAI был разработан с целью повышения прозрачности и масштабируемости обучения этичного ИИ, обеспечивая при этом соблюдение фундаментальных прав и норм.

## Теоретическая основа

CAI основан на идее явного задания модели набора правил (конституции), отражающих универсальные человеческие ценности. Примеры таких принципов:

- уважение к правам человека (основано на всеобщей декларации прав человека<sup>[\[1\]](https://systems-analysis.info/wiki/Constitutional_AI#cite_note-1)</sup>);
- запрет на дискриминацию, агрессию, токсичность;
- защита конфиденциальной информации;
- приоритет честности и фактической точности;
- поощрение сотрудничества и ненасильственного взаимодействия.

В отличие от RLHF<sup>[\[2\]](https://systems-analysis.info/wiki/Constitutional_AI#cite_note-2)</sup>, где поведенческие установки модели задаются косвенно через предпочтения аннотаторов, CAI использует явно сформулированный список нормативных положений, доступный для проверки и редактирования.

## Архитектура и обучение

CAI реализуется в два этапа:

1.  Обучение с самокритикой (Self-Critique Phase): Модель генерирует ответ на запрос и затем, используя принципы конституции, самостоятельно анализирует и исправляет собственный ответ, если он нарушает заданные нормы. Такие пары (оригинальный ответ и исправленный) используются для дообучения модели в стиле supervised [fine-tuning](https://systems-analysis.info/wiki/Fine-tuning "Fine-tuning").
2.  Обучение с подкреплением от обратной связи ИИ (RLAIF): Для множества пар ответов модель-судья (обычно та же модель) сравнивает варианты с точки зрения соблюдения конституции. Затем тренируется модель вознаграждений, и основная модель дообучается с использованием RL (например, PPO) по этой обратной связи. Методика полностью избегает ручной разметки токсичного контента и основана на машинном контроле соблюдения ценностей.

## Преимущества и особенности

- Прозрачность: конституция может быть опубликована, рецензирована, проверена.
- Масштабируемость: нет необходимости в дорогостоящем ручном аннотировании.
- Безопасность: снижение рисков вредного или дискриминационного поведения модели.
- Полезность: модель не склонна к чрезмерным отказам, как при RLHF.
- Контролируемость: ценности можно адаптировать под юридические или культурные контексты

## Народная конституция ИИ: эксперимент 2023 года

В 2023 году компания Anthropic совместно с исследовательской инициативой *Collective Intelligence Project*<sup>[\[3\]](https://systems-analysis.info/wiki/Constitutional_AI#cite_note-3)</sup> провела первый в своём роде эксперимент по разработке «народной конституции» для ИИ<sup>[\[4\]](https://systems-analysis.info/wiki/Constitutional_AI#cite_note-4)</sup>. Целью проекта было выяснить, как можно интегрировать общественное мнение и демократические принципы в формирование нормативных ограничений поведения языковых моделей.

В исследовании участвовало более 1000 человек, представляющих демографически сбалансированную выборку граждан США. Участникам предлагалось оценить и выбрать ценности, которыми должен руководствоваться ИИ, а также формулировать конкретные поведенческие принципы для чат-ассистентов. В процессе использовались методы коллективного голосования, ранжирования и аргументированного выбора — включая модифицированные версии таких механизмов, как Deliberative Polling и Quadratic Voting. Ключевые особенности эксперимента:

- Масштаб — более 1000 респондентов, охватывающих широкий спектр политических взглядов, социальных статусов и образовательных уровней;
- Процедура — итеративное обсуждение и уточнение норм, голосование за принципы, верификация формулировок;
- Результат — формирование альтернативной конституции ИИ, ориентированной на демократически выраженные предпочтения.

Сравнительный анализ «народной» и исходной (разработанной экспертами Anthropic) конституции показал существенное совпадение в базовых принципах:

- запрет дискриминации,
- поощрение честности,
- уважение к приватности.

Однако «народная» версия оказалась более акцентированной на:

- равенстве доступа к информации;
- объективности и беспристрастности ответов;
- праве пользователя на объяснение модели.

Эксперимент показал, что внедрение демократических механизмов в процесс создания нормативных рамок ИИ может способствовать:

- легитимности поведения ИИ в глазах пользователей;
- снижению рисков культурной или политической предвзятости;
- более широкому принятию систем ИИ в обществе.

## См. также

- [Jailbreaks](https://systems-analysis.info/wiki/Jailbreaks "Jailbreaks")
- [Мультимодальные LLM](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM "Мультимодальные LLM")
- [AI-агент](https://systems-analysis.info/wiki/AI-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82 "AI-агент")
- [Explainable AI](https://systems-analysis.info/wiki/Explainable_AI "Explainable AI")
- [GLM (Zhipu AI)](https://systems-analysis.info/wiki/GLM_(Zhipu_AI) "GLM (Zhipu AI)")

## Литература

- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. <a href="https://arxiv.org/abs/2212.08073" class="external text" rel="nofollow">arXiv:2212.08073</a>.
- Huang, S. et al. (2024). *Collective Constitutional AI: Aligning a Language Model with Public Input*. <a href="https://arxiv.org/abs/2406.07814" class="external text" rel="nofollow">arXiv:2406.07814</a>.
- Lee, H. et al. (2023). *RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback*. <a href="https://arxiv.org/abs/2309.00267" class="external text" rel="nofollow">arXiv:2309.00267</a>.
- Sun, Z. et al. (2023). *Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision*. <a href="https://arxiv.org/abs/2305.03047" class="external text" rel="nofollow">arXiv:2305.03047</a>.
- Wang, Y. et al. (2023). *Self-Instruct: Aligning Language Models with Self-Generated Instructions*. <a href="https://arxiv.org/abs/2212.10560" class="external text" rel="nofollow">arXiv:2212.10560</a>.
- Petridis, S. et al. (2024). *ConstitutionalExperts: Training a Mixture of Principle-based Prompts*. <a href="https://arxiv.org/abs/2403.04894" class="external text" rel="nofollow">arXiv:2403.04894</a>.
- Huang, S. & Siddarth, D. (2024). *ConstitutionMaker: Interactively Critiquing Large Language Models with Public Principles*. *ACM CHI 2024*. <a href="https://dl.acm.org/doi/10.1145/3640543.3645144" class="external text" rel="nofollow">DOI:10.1145/3640543.3645144</a>.
- Bai, Y. et al. (2023). *Training a Helpful and Harmless Assistant with RLHF and RLAIF*. *Anthropic Technical Report*. <a href="https://www.anthropic.com/research/helpful-harmless-assistant" class="external text" rel="nofollow">RL repository</a>.
- Glaese, A. et al. (2024). *ConstitutionalExperts: Towards Automated Principle Refinement for Aligned Language Models*. *NeurIPS 2024 Workshop*. <a href="https://arxiv.org/abs/2403.04894" class="external text" rel="nofollow">arXiv:2403.04894</a>.
- Lovitt, L. et al. (2024). *Redefining Superalignment: From Weak- to Strong-Alignment*. <a href="https://arxiv.org/abs/2504.17404" class="external text" rel="nofollow">arXiv:2504.17404</a>.

## Примечания

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/wiki/Constitutional_AI#cite_ref-1) «Декларации, конвенции, соглашения и другие правовые материалы».<a href="https://www.un.org/ru/documents/decl_conv/declarations/declhr.shtml" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/wiki/Constitutional_AI#cite_ref-2) «Reinforcement Learning from Human Feedback». В *Wikipedia* <a href="https://en.wikipedia.org/wiki/Reinforcement_learning_from_human_feedback" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/wiki/Constitutional_AI#cite_ref-3) «The Collective Intelligence Project». https://www.cip.org.<a href="https://www.cip.org" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/wiki/Constitutional_AI#cite_ref-4) «Collective Constitutional AI: Aligning a Language Model with Public Input». <a href="https://www.anthropic.com/research/collective-constitutional-ai-aligning-a-language-model-with-public-input?utm_source=chatgpt.com" class="external autonumber" rel="nofollow">[4]</a></span>
