Constitutional AI
Constitutional AI (CAI, zu Deutsch etwa „konstitutionelle künstliche Intelligenz“) ist eine Methode zum Training großer Sprachmodelle (LLM), die auf einem expliziten Satz von Regeln und Prinzipien (einer sogenannten „Verfassung“) basiert, um ein sicheres, ethisches und vorhersagbares Verhalten der KI zu formen. Der Ansatz wurde 2022 vom Forschungsunternehmen Anthropic als Alternative zum bestärkenden Lernen durch menschliches Feedback (Reinforcement Learning from Human Feedback, RLHF) entwickelt.
CAI ermöglicht es dem Modell, sein eigenes Verhalten gemäß einem vorgegebenen Wertesystem selbstständig zu bewerten und zu korrigieren, wodurch ein Gleichgewicht zwischen Nützlichkeit, Ehrlichkeit und Harmlosigkeit gewährleistet wird.
Geschichte und Motivation
Die Methode wurde von Forschern bei Anthropic als Reaktion auf die Einschränkungen des RLHF-Ansatzes vorgeschlagen, darunter:
- die Notwendigkeit einer umfangreichen manuellen Annotation;
- die Intransparenz der vom Modell erlernten Werte;
- die Tendenz der Modelle, potenziell harmlose Anfragen abzulehnen;
- Schwierigkeiten bei der Übertragung von Werten in andere kulturelle und normative Kontexte.
CAI wurde mit dem Ziel entwickelt, die Transparenz und Skalierbarkeit des Trainings ethischer KI zu erhöhen und dabei die Einhaltung grundlegender Rechte und Normen zu gewährleisten.
Theoretische Grundlage
CAI basiert auf der Idee, dem Modell ein explizites Regelwerk (eine Verfassung) vorzugeben, das universelle menschliche Werte widerspiegelt. Beispiele für solche Prinzipien sind:
- Achtung der Menschenrechte (basierend auf der Allgemeinen Erklärung der Menschenrechte[1]);
- das Verbot von Diskriminierung, Aggression und Toxizität;
- der Schutz vertraulicher Informationen;
- die Priorisierung von Ehrlichkeit und faktischer Genauigkeit;
- die Förderung von Zusammenarbeit und gewaltfreier Interaktion.
Im Gegensatz zu RLHF[2], bei dem die Verhaltenseinstellungen des Modells indirekt durch die Präferenzen von Annotatoren festgelegt werden, verwendet CAI eine explizit formulierte Liste normativer Bestimmungen, die zur Überprüfung und Bearbeitung verfügbar ist.
Architektur und Training
CAI wird in zwei Phasen umgesetzt:
- Training mit Selbstkritik (Self-Critique Phase): Das Modell generiert eine Antwort auf eine Anfrage und analysiert und korrigiert diese anschließend selbstständig anhand der Verfassungsprinzipien, falls die Antwort gegen die festgelegten Normen verstößt. Solche Paare (Originalantwort und korrigierte Antwort) werden für das anschließende Training des Modells im Stil des Supervised Fine-Tuning verwendet.
- Bestärkendes Lernen durch KI-Feedback (Reinforcement Learning from AI Feedback, RLAIF): Für eine Vielzahl von Antwortpaaren vergleicht ein Bewertungsmodell (in der Regel dasselbe Modell) die Varianten hinsichtlich der Einhaltung der Verfassung. Anschließend wird ein Belohnungsmodell trainiert, und das Hauptmodell wird mittels RL (z. B. PPO) auf Basis dieses Feedbacks weiter trainiert. Diese Methode vermeidet die manuelle Annotation toxischer Inhalte vollständig und basiert auf einer maschinellen Überwachung der Einhaltung von Werten.
Vorteile und Merkmale
- Transparenz: Die Verfassung kann veröffentlicht, begutachtet und überprüft werden.
- Skalierbarkeit: Es ist keine kostspielige manuelle Annotation erforderlich.
- Sicherheit: Reduzierung der Risiken von schädlichem oder diskriminierendem Verhalten des Modells.
- Nützlichkeit: Das Modell neigt nicht zu übermäßigen Verweigerungen wie bei RLHF.
- Kontrollierbarkeit: Die Werte können an rechtliche oder kulturelle Kontexte angepasst werden.
Die öffentliche KI-Verfassung: Ein Experiment aus dem Jahr 2023
Im Jahr 2023 führte das Unternehmen Anthropic in Zusammenarbeit mit der Forschungsinitiative Collective Intelligence Project[3] ein erstmaliges Experiment zur Entwicklung einer „öffentlichen Verfassung“ für KI durch[4]. Ziel des Projekts war es, zu untersuchen, wie die öffentliche Meinung und demokratische Prinzipien in die Gestaltung normativer Einschränkungen für das Verhalten von Sprachmodellen integriert werden können.
An der Studie nahmen über 1000 Personen teil, die eine demografisch repräsentative Stichprobe von US-Bürgern darstellten. Die Teilnehmer wurden gebeten, Werte zu bewerten und auszuwählen, an denen sich eine KI orientieren sollte, sowie konkrete Verhaltensprinzipien für Chat-Assistenten zu formulieren. Dabei kamen Methoden der kollektiven Abstimmung, Rangordnung und begründeten Auswahl zum Einsatz – einschließlich modifizierter Versionen von Mechanismen wie Deliberative Polling und Quadratic Voting. Die wichtigsten Merkmale des Experiments:
- Umfang – über 1000 Befragte, die ein breites Spektrum an politischen Ansichten, sozialem Status und Bildungsniveaus abdeckten;
- Verfahren – iterative Diskussion und Präzisierung von Normen, Abstimmung über Prinzipien und Überprüfung der Formulierungen;
- Ergebnis – die Entwicklung einer alternativen KI-Verfassung, die auf demokratisch geäußerten Präferenzen basiert.
Eine vergleichende Analyse der „öffentlichen“ und der ursprünglichen (von Anthropic-Experten entwickelten) Verfassung zeigte eine erhebliche Übereinstimmung bei den Grundprinzipien:
- Verbot von Diskriminierung,
- Förderung von Ehrlichkeit,
- Achtung der Privatsphäre.
Allerdings legte die „öffentliche“ Version einen stärkeren Schwerpunkt auf:
- die Gleichheit des Zugangs zu Informationen;
- die Objektivität und Unparteilichkeit der Antworten;
- das Recht des Nutzers auf eine Erklärung durch das Modell.
Das Experiment zeigte, dass die Einbeziehung demokratischer Mechanismen in den Prozess der Schaffung normativer Rahmenbedingungen für KI zu Folgendem beitragen kann:
- der Legitimität des KI-Verhaltens in den Augen der Nutzer;
- der Verringerung von Risiken kultureller oder politischer Voreingenommenheit;
- einer breiteren Akzeptanz von KI-Systemen in der Gesellschaft.
Literatur
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Huang, S. et al. (2024). Collective Constitutional AI: Aligning a Language Model with Public Input. arXiv:2406.07814.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Sun, Z. et al. (2023). Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision. arXiv:2305.03047.
- Wang, Y. et al. (2023). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
- Petridis, S. et al. (2024). ConstitutionalExperts: Training a Mixture of Principle-based Prompts. arXiv:2403.04894.
- Huang, S. & Siddarth, D. (2024). ConstitutionMaker: Interactively Critiquing Large Language Models with Public Principles. ACM CHI 2024. DOI:10.1145/3640543.3645144.
- Bai, Y. et al. (2023). Training a Helpful and Harmless Assistant with RLHF and RLAIF. Anthropic Technical Report. RL repository.
- Glaese, A. et al. (2024). ConstitutionalExperts: Towards Automated Principle Refinement for Aligned Language Models. NeurIPS 2024 Workshop. arXiv:2403.04894.
- Lovitt, L. et al. (2024). Redefining Superalignment: From Weak- to Strong-Alignment. arXiv:2504.17404.