Automatic Prompt Engineer (APE) (ES)
Automatic Prompt Engineer (APE) es una metodología para la generación y optimización automatizada de instrucciones de texto (prompts) para controlar el comportamiento de los modelos de lenguaje grandes (LLM). El enfoque fue propuesto en 2022 por un grupo de investigadores liderado por Yongchao Zhou[1].
En lugar de la selección manual y la mejora iterativa de los prompts, APE formaliza la ingeniería de prompts como un problema de optimización. Dentro de este marco, un prompt se considera un «programa» en lenguaje natural que debe ser sintetizado para maximizar una determinada función de calidad (por ejemplo, la precisión o la fiabilidad de las respuestas del modelo)[2].
Concepto y método principal
El método APE utiliza dos modelos de lenguaje en conjunto: un modelo generador y un modelo objetivo. El proceso consiste en un ciclo iterativo de búsqueda y selección (search-and-select):
- Generación de candidatos. El modelo generador recibe como entrada varios ejemplos de pares «entrada-salida» para la tarea objetivo y, basándose en ellos, crea un conjunto de posibles prompts candidatos que podrían haber llevado a tales resultados.
- Evaluación. Cada prompt candidato generado se pasa al LLM objetivo. El modelo objetivo ejecuta la instrucción en un nuevo conjunto de datos de prueba, y sus respuestas se evalúan según una métrica predefinida (por ejemplo, precisión, exhaustividad, puntuación F1).
- Selección. Se elige el prompt que mostró el mejor resultado tras la evaluación.
- Iteración (opcional). El ciclo puede repetirse. El modelo generador recibe la orden de refinar el mejor prompt encontrado, creando variaciones del mismo, tras lo cual el proceso de evaluación y selección se repite para lograr la máxima eficiencia[1].
Este enfoque permite replicar automáticamente el proceso de ajuste manual de prompts, utilizando un LLM para generar hipótesis (prompts) y evaluarlas posteriormente.
Metodologías clave
La automatización de la ingeniería de prompts se implementa mediante diversos enfoques algorítmicos.
Automatización basada en LLM
Este es el método clásico de APE, descrito anteriormente, donde un LLM se utiliza para generar y evaluar prompts para otro LLM (o para el mismo). Este enfoque ha demostrado ser muy eficaz para los prompts de texto discretos[1].
Métodos evolutivos
Se utilizan algoritmos genéticos o búsqueda por haz (beam search) para crear y seleccionar prompts, especialmente los largos y complejos. Por ejemplo, el framework APEX (Automatic Engineering of Long Prompts) aplica algoritmos evolutivos para «cultivar» y mejorar gradualmente instrucciones complejas[3].
Métodos basados en gradientes (Soft Prompts)
Este enfoque trabaja con prompts continuos o suaves (soft prompts), que son vectores entrenables (embeddings) en lugar de instrucciones textuales. Estos vectores se optimizan mediante descenso de gradiente directamente en la tarea objetivo. Aquí se incluyen técnicas como Prompt Tuning y Prefix-Tuning.
Aprendizaje por refuerzo
En este paradigma, el LLM actúa como un agente que genera un prompt (acción), y el entorno devuelve una evaluación de la calidad de la respuesta (recompensa). El objetivo es maximizar la recompensa acumulada, encontrando la estrategia óptima para la generación de prompts a través de métodos de aprendizaje por refuerzo (RL)[2].
Resultados y descubrimientos
Los experimentos realizados en la investigación original de APE demostraron que las instrucciones generadas automáticamente superan en calidad, en la mayoría de los casos, a los prompts escritos por humanos.
- Durante las pruebas en 24 tareas de procesamiento del lenguaje natural (NLP), APE generó prompts que resultaron ser más eficaces que los humanos en 19 de los 24 casos[1].
- APE logró «descubrir» automáticamente una formulación más eficaz para el prompting de tipo Chain-of-Thought. En lugar de la frase estándar «Let's think step by step» (Pensemos paso a paso), APE generó una instrucción más detallada y efectiva: «Let's work this out in a step by step way to be sure we have the right answer» (Vamos a resolver esto paso a paso para asegurarnos de tener la respuesta correcta). Esta formulación mejoró la precisión en la resolución de problemas matemáticos en conjuntos de datos como MultiArith y GSM8K[1].
Aplicaciones y ventajas
Aplicaciones
- Mejora del aprendizaje de pocos ejemplos (few-shot learning): Selección automática de ejemplos e instrucciones óptimas.
- Aumento de la fiabilidad de los modelos: APE puede configurarse para buscar prompts que minimicen las «alucinaciones» y maximicen la veracidad de las respuestas en benchmarks como TruthfulQA.
- Automatización del desarrollo: Aceleración de la creación de chatbots, sistemas de extracción de información y otras aplicaciones basadas en LLM[4].
Ventajas
- Escalabilidad: Capacidad para generar y evaluar automáticamente cientos o miles de prompts sin intervención humana.
- Adaptabilidad: Fácil ajuste de los LLM a dominios nuevos y altamente especializados.
- Ahorro de recursos: Reducción significativa del tiempo y el esfuerzo dedicados a la selección manual de prompts.
Desarrollo y enfoques relacionados
El concepto de APE continúa evolucionando. Han surgido sistemas completamente autónomos, como APET (Automatic Prompt Engineering Toolbox), que permiten a los LLM (por ejemplo, GPT-4) aplicar de forma independiente estrategias de prompting complejas (Expert Prompting, Chain of Thought, Tree of Thoughts) y mejorar dinámicamente las instrucciones sin intervención externa[5].
APE forma parte de una tendencia más amplia hacia la automatización de la interacción con los LLM, que también incluye:
- AutoPrompt: Un método temprano que utilizaba la búsqueda basada en gradientes para encontrar tokens «desencadenantes» individuales.
- OPRO (Optimization by PROmpting): Un enfoque similar a APE de DeepMind, que también utiliza un LLM para optimizar los prompts.
Enlaces externos
- Sitio web oficial del proyecto Automatic Prompt Engineer (APE)
- Artículo científico «Large Language Models Are Human-Level Prompt Engineers»
- AutoPrompt (2020). AutoPrompt – Official GitHub Repository. GitHub.
Bibliografía
- Zhou, Y. et al. (2022). Large Language Models Are Human-Level Prompt Engineers. arXiv:2211.01910.
- Li, W. et al. (2025). A Survey of Automatic Prompt Engineering: An Optimization Perspective. arXiv:2502.11560.
- Hsieh, C.-J. et al. (2024). Automatic Engineering of Long Prompts. Findings of ACL 2024. 2024.findings-acl.634.
- Hsieh, C.-J. et al. (2023). Automatic Long Prompt Engineering. arXiv:2311.10117.
- Shin, T. et al. (2020). AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts. arXiv:2010.15980.
- Yang, C. et al. (2023). Large Language Models as Optimizers (OPRO). arXiv:2309.03409.
- Liu, Y. et al. (2024). Revisiting OPRO: The Limitations of Small-Scale LLMs as Optimizers. arXiv:2405.10276.
- Kepel, D.; Valogianni, K. (2024). Autonomous Prompt Engineering in Large Language Models (APET). arXiv:2407.11000.
- Yang, C. et al. (2024). Optimizing Instructions and Demonstrations for Multi-Stage LM Programs. arXiv:2406.11695.
- Hsieh, C.-J. et al. (2024). APEX (code repository and results). PDF.
Referencias
- ↑ 1.0 1.1 1.2 1.3 1.4 Zhou, Y. et al. «Large Language Models Are Human-Level Prompt Engineers». arXiv:2211.01910, 2022. [1]
- ↑ 2.0 2.1 Li, W. et al. «A Survey of Automatic Prompt Engineering: An Optimization Perspective». arXiv:2502.11560, 2025. [2]
- ↑ Hsieh, C.-J. et al. «Automatic Engineering of Long Prompts». Findings of the Association for Computational Linguistics: ACL 2024. [3]
- ↑ Fernandez-garcia, A. et al. «Automatic Prompt Engineering for Foundation Models: A Survey». MDPI Electronics, 2025. [4]
- ↑ Kepel, D. & Valogianni, K. «Autonomous Prompt Engineering in Large Language Models». arXiv:2407.11000, 2024. [5]