IA Constitutionnelle

From Systems analysis Wiki
Jump to navigation Jump to search

L'intelligence artificielle constitutionnelle (de l'anglais Constitutional AI, CAI) est une méthode d'entraînement des grands modèles de langage (LLM) basée sur l'utilisation d'un ensemble explicite de règles et de principes (appelé « constitution ») pour façonner un comportement de l'IA sûr, éthique et prévisible. Cette approche a été développée par la société de recherche Anthropic en 2022 comme une alternative à l'apprentissage par renforcement à partir de la rétroaction humaine (RLHF).

La CAI permet au modèle d'évaluer et de corriger de manière autonome son propre comportement conformément à un système de valeurs prédéfini, assurant ainsi un équilibre entre utilité, honnêteté et innocuité.

Histoire et motivation

La méthode a été proposée par les chercheurs d'Anthropic en réponse aux limites de l'approche RLHF, notamment :

  • la nécessité d'une annotation manuelle à grande échelle ;
  • le manque de transparence des valeurs apprises par le modèle ;
  • la tendance des modèles à refuser de répondre à des requêtes potentiellement inoffensives ;
  • les difficultés à transposer les valeurs dans d'autres contextes culturels et normatifs.

La CAI a été conçue pour améliorer la transparence et la scalabilité de l'entraînement d'une IA éthique, tout en garantissant le respect des droits et des normes fondamentaux.

Fondements théoriques

La CAI repose sur l'idée de fournir explicitement au modèle un ensemble de règles (une constitution) qui reflètent des valeurs humaines universelles. Exemples de ces principes :

  • le respect des droits de l'homme (basé sur la Déclaration universelle des droits de l'homme[1]) ;
  • l'interdiction de la discrimination, de l'agression et de la toxicité ;
  • la protection des informations confidentielles ;
  • la priorité à l'honnêteté et à l'exactitude factuelle ;
  • l'encouragement à la coopération et à l'interaction non-violente.

Contrairement au RLHF[2], où les orientations comportementales du modèle sont définies indirectement par les préférences des annotateurs, la CAI utilise une liste de dispositions normatives explicitement formulées, qui peut être vérifiée et modifiée.

Architecture et entraînement

La CAI est mise en œuvre en deux étapes :

  1. Apprentissage avec auto-critique (Self-Critique Phase) : Le modèle génère une réponse à une requête, puis, en utilisant les principes de la constitution, il analyse et corrige de manière autonome sa propre réponse si elle enfreint les normes établies. Ces paires (réponse originale et réponse corrigée) sont utilisées pour le fine-tuning supervisé du modèle.
  2. Apprentissage par renforcement à partir de la rétroaction de l'IA (RLAIF) : Pour de nombreuses paires de réponses, un modèle-juge (généralement le même modèle) compare les variantes du point de vue du respect de la constitution. Ensuite, un modèle de récompense est entraîné, et le modèle principal est affiné en utilisant l'apprentissage par renforcement (par exemple, PPO) sur la base de cette rétroaction. Cette méthode évite complètement l'annotation manuelle de contenu toxique et repose sur un contrôle automatisé du respect des valeurs.

Avantages et caractéristiques

  • Transparence : la constitution peut être publiée, examinée par des pairs et vérifiée.
  • Scalabilité : pas besoin d'une annotation manuelle coûteuse.
  • Sécurité : réduction des risques de comportement nuisible ou discriminatoire du modèle.
  • Utilité : le modèle n'est pas enclin aux refus excessifs, contrairement au RLHF.
  • Contrôlabilité : les valeurs peuvent être adaptées à des contextes juridiques ou culturels spécifiques.

La constitution populaire de l'IA : une expérience de 2023

En 2023, la société Anthropic, en collaboration avec l'initiative de recherche Collective Intelligence Project[3], a mené une expérience inédite pour développer une « constitution populaire » pour l'IA[4]. L'objectif du projet était de déterminer comment l'opinion publique et les principes démocratiques pouvaient être intégrés dans la formulation des contraintes normatives régissant le comportement des modèles de langage.

Plus de 1 000 personnes, représentant un échantillon démographiquement équilibré de citoyens américains, ont participé à l'étude. Il leur a été demandé d'évaluer et de choisir les valeurs qui devraient guider l'IA, ainsi que de formuler des principes comportementaux spécifiques pour les assistants conversationnels. Le processus a fait appel à des méthodes de vote collectif, de classement et de choix argumenté, y compris des versions modifiées de mécanismes tels que le sondage délibératif (Deliberative Polling) et le vote quadratique (Quadratic Voting). Caractéristiques clés de l'expérience :

  • Ampleur — plus de 1 000 participants couvrant un large éventail d'opinions politiques, de statuts sociaux et de niveaux d'éducation ;
  • Procédure — discussion itérative et affinement des normes, vote sur les principes, vérification des formulations ;
  • Résultat — création d'une constitution alternative pour l'IA, axée sur les préférences exprimées démocratiquement.

L'analyse comparative entre la constitution « populaire » et la version originale (développée par les experts d'Anthropic) a révélé une convergence significative sur les principes de base :

  • l'interdiction de la discrimination,
  • l'encouragement à l'honnêteté,
  • le respect de la vie privée.

Cependant, la version « populaire » mettait davantage l'accent sur :

  • l'égalité d'accès à l'information ;
  • l'objectivité et l'impartialité des réponses ;
  • le droit de l'utilisateur à obtenir des explications du modèle.

L'expérience a démontré que l'intégration de mécanismes démocratiques dans le processus de création des cadres normatifs de l'IA peut favoriser :

  • la légitimité du comportement de l'IA aux yeux des utilisateurs ;
  • la réduction des risques de biais culturels ou politiques ;
  • une acceptation plus large des systèmes d'IA par la société.

Bibliographie

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Huang, S. et al. (2024). Collective Constitutional AI: Aligning a Language Model with Public Input. arXiv:2406.07814.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Sun, Z. et al. (2023). Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision. arXiv:2305.03047.
  • Wang, Y. et al. (2023). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
  • Petridis, S. et al. (2024). ConstitutionalExperts: Training a Mixture of Principle-based Prompts. arXiv:2403.04894.
  • Huang, S. & Siddarth, D. (2024). ConstitutionMaker: Interactively Critiquing Large Language Models with Public Principles. ACM CHI 2024. DOI:10.1145/3640543.3645144.
  • Bai, Y. et al. (2023). Training a Helpful and Harmless Assistant with RLHF and RLAIF. Anthropic Technical Report. RL repository.
  • Glaese, A. et al. (2024). ConstitutionalExperts: Towards Automated Principle Refinement for Aligned Language Models. NeurIPS 2024 Workshop. arXiv:2403.04894.
  • Lovitt, L. et al. (2024). Redefining Superalignment: From Weak- to Strong-Alignment. arXiv:2504.17404.

Références

  1. « Déclaration universelle des droits de l'homme », Nations Unies. [1]
  2. « Reinforcement Learning from Human Feedback ». Dans Wikipedia [2]
  3. « The Collective Intelligence Project ». https://www.cip.org.[3]
  4. « Collective Constitutional AI: Aligning a Language Model with Public Input ». [4]