Automatic Prompt Engineer (APE) (FR)
Automatic Prompt Engineer (APE) est une méthode de génération et d'optimisation automatisées d'instructions textuelles (prompts) pour contrôler le comportement des grands modèles de langage (LLM). Cette approche a été proposée en 2022 par un groupe de chercheurs dirigé par Yongchao Zhou[1].
Au lieu de créer et d'améliorer manuellement les prompts de manière itérative, APE formalise l'ingénierie des prompts comme un problème d'optimisation. Dans ce cadre, un prompt est considéré comme un « programme » en langage naturel qui doit être synthétisé pour maximiser une certaine fonction de qualité (par exemple, la précision ou la fiabilité des réponses du modèle)[2].
Concept principal et méthode
La méthode APE utilise deux modèles de langage en tandem : un modèle générateur et un modèle cible. Le processus consiste en un cycle itératif de recherche et de sélection (search-and-select) :
- Génération de candidats. Le modèle générateur reçoit en entrée quelques exemples de paires « entrée-sortie » pour la tâche cible et, sur cette base, crée un ensemble de prompts candidats possibles qui auraient pu produire de tels résultats.
- Évaluation. Chaque prompt candidat généré est transmis au LLM cible. Le modèle cible exécute l'instruction sur un nouvel ensemble de données de test, et ses réponses sont évaluées selon une métrique prédéfinie (par exemple, la précision, l'exhaustivité, le score F1).
- Sélection. Le prompt ayant obtenu le meilleur résultat lors de l'évaluation est sélectionné.
- Itération (optionnel). Le cycle peut être répété. Le modèle générateur est invité à affiner le meilleur prompt trouvé en créant des variations, après quoi le processus d'évaluation et de sélection est réitéré pour atteindre une efficacité maximale[1].
Cette approche permet de reproduire automatiquement le processus de création manuelle de prompts en utilisant un LLM pour générer des hypothèses (prompts) et les évaluer ensuite.
Méthodologies clés
L'automatisation de l'ingénierie des prompts est mise en œuvre à l'aide de diverses approches algorithmiques.
Automatisation basée sur les LLM
Il s'agit de la méthode APE classique décrite ci-dessus, où un LLM est utilisé pour générer et évaluer des prompts pour un autre LLM (ou pour lui-même). Cette approche s'est avérée très efficace pour les prompts textuels discrets[1].
Méthodes évolutives
Des algorithmes génétiques ou la recherche en faisceau (beam search) sont utilisés pour créer et sélectionner des prompts, en particulier ceux qui sont longs et complexes. Par exemple, le framework APEX (Automatic Engineering of Long Prompts) applique des algorithmes évolutifs pour « faire croître » et améliorer progressivement des instructions complexes[3].
Méthodes basées sur le gradient (Soft Prompts)
Cette approche travaille avec des prompts continus ou souples (soft prompts), qui sont des vecteurs entraînables (embeddings) plutôt que des instructions textuelles. Ces vecteurs sont optimisés par descente de gradient directement sur la tâche cible. Cela inclut des techniques telles que le Prompt Tuning et le Prefix-Tuning.
Apprentissage par renforcement
Dans ce paradigme, le LLM agit comme un agent qui génère un prompt (action), tandis que l'environnement renvoie une évaluation de la qualité de la réponse (récompense). L'objectif est de maximiser la récompense cumulative en trouvant une stratégie optimale de génération de prompts grâce aux méthodes d'apprentissage par renforcement (RL)[2].
Résultats et découvertes
Les expériences menées dans le cadre de l'étude originale sur APE ont montré que les instructions générées automatiquement surpassent dans la plupart des cas la qualité des prompts rédigés par des humains.
- Lors de tests sur 24 tâches de traitement du langage naturel (NLP), APE a généré des prompts qui se sont avérés plus efficaces que ceux des humains dans 19 cas sur 24[1].
- APE a réussi à « découvrir » automatiquement une formulation plus efficace pour le prompting de type Chain-of-Thought. Au lieu de la phrase standard « Let's think step by step » (Réfléchissons étape par étape), APE a généré une instruction plus détaillée et efficace : « Let's work this out in a step by step way to be sure we have the right answer » (Travaillons sur ce problème étape par étape pour être sûrs d'avoir la bonne réponse). Cette formulation a amélioré la précision de la résolution de problèmes mathématiques sur des datasets tels que MultiArith et GSM8K[1].
Applications et avantages
Applications
- Amélioration du few-shot learning: Sélection automatique d'exemples et d'instructions optimaux.
- Augmentation de la fiabilité des modèles: APE peut être configuré pour trouver des prompts qui minimisent les « hallucinations » et maximisent la véracité des réponses sur des benchmarks tels que TruthfulQA.
- Automatisation du développement: Accélération de la création de chatbots, de systèmes d'extraction d'informations et d'autres applications basées sur les LLM[4].
Avantages
- Scalabilité: Capacité à générer et évaluer automatiquement des centaines, voire des milliers de prompts sans intervention humaine.
- Adaptabilité: Ajustement facile des LLM à de nouveaux domaines hautement spécialisés.
- Économie de ressources: Réduction significative du temps et des efforts consacrés à la création manuelle de prompts.
Développement et approches connexes
Le concept d'APE continue d'évoluer. Des systèmes entièrement autonomes sont apparus, tels que APET (Automatic Prompt Engineering Toolbox), qui permettent à un LLM (par exemple, GPT-4) d'appliquer de manière autonome des stratégies de prompting complexes (Expert Prompting, Chain of Thought, Tree of Thoughts) et d'améliorer dynamiquement les instructions sans intervention externe[5].
APE s'inscrit dans une tendance plus large d'automatisation de l'interaction avec les LLM, qui inclut également :
- AutoPrompt: Une méthode précoce qui utilisait une recherche basée sur le gradient pour trouver des jetons « déclencheurs » spécifiques.
- OPRO (Optimization by PROmpting): Une approche de DeepMind similaire à APE, utilisant également un LLM pour optimiser les prompts.
Liens externes
- Site officiel du projet Automatic Prompt Engineer (APE)
- Article scientifique « Large Language Models Are Human-Level Prompt Engineers »
- AutoPrompt (2020). AutoPrompt – Official GitHub Repository. GitHub.
Bibliographie
- Zhou, Y. et al. (2022). Large Language Models Are Human-Level Prompt Engineers. arXiv:2211.01910.
- Li, W. et al. (2025). A Survey of Automatic Prompt Engineering: An Optimization Perspective. arXiv:2502.11560.
- Hsieh, C.-J. et al. (2024). Automatic Engineering of Long Prompts. Findings of ACL 2024. 2024.findings-acl.634.
- Hsieh, C.-J. et al. (2023). Automatic Long Prompt Engineering. arXiv:2311.10117.
- Shin, T. et al. (2020). AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts. arXiv:2010.15980.
- Yang, C. et al. (2023). Large Language Models as Optimizers (OPRO). arXiv:2309.03409.
- Liu, Y. et al. (2024). Revisiting OPRO: The Limitations of Small-Scale LLMs as Optimizers. arXiv:2405.10276.
- Kepel, D.; Valogianni, K. (2024). Autonomous Prompt Engineering in Large Language Models (APET). arXiv:2407.11000.
- Yang, C. et al. (2024). Optimizing Instructions and Demonstrations for Multi-Stage LM Programs. arXiv:2406.11695.
- Hsieh, C.-J. et al. (2024). APEX (code repository and results). PDF.
Références
- ↑ 1.0 1.1 1.2 1.3 1.4 Zhou, Y. et al. «Large Language Models Are Human-Level Prompt Engineers». arXiv:2211.01910, 2022. [1]
- ↑ 2.0 2.1 Li, W. et al. «A Survey of Automatic Prompt Engineering: An Optimization Perspective». arXiv:2502.11560, 2025. [2]
- ↑ Hsieh, C.-J. et al. «Automatic Engineering of Long Prompts». Findings of the Association for Computational Linguistics: ACL 2024. [3]
- ↑ Fernandez-garcia, A. et al. «Automatic Prompt Engineering for Foundation Models: A Survey». MDPI Electronics, 2025. [4]
- ↑ Kepel, D. & Valogianni, K. «Autonomous Prompt Engineering in Large Language Models». arXiv:2407.11000, 2024. [5]