Automatic Prompt Engineer (APE) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

مهندس خودکار Prompt (APE) — روشی برای تولید و بهینه‌سازی خودکار دستورالعمل‌های متنی (prompt) به منظور کنترل رفتار مدل‌های زبانی بزرگ (LLM) است. این رویکرد در سال ۲۰۲۲ توسط گروهی از پژوهشگران به سرپرستی یونگچائو ژو (Yongchao Zhou) معرفی شد[1].

به جای انتخاب دستی و بهبود تکراری prompt‌ها، APE مهندسی prompt را به صورت یک مسئله بهینه‌سازی رسمی می‌کند. در چارچوب این مسئله، prompt به عنوان یک «برنامه» به زبان طبیعی در نظر گرفته می‌شود که باید برای بیشینه‌سازی یک تابع کیفیت مشخص (مثلاً دقت یا صحت پاسخ‌های مدل) سنتز شود[2].

مفهوم اصلی و روش

روش APE از دو مدل زبانی به صورت زنجیر استفاده می‌کند: مدل مولد و مدل هدف. فرآیند شامل یک چرخه تکراری جستجو و انتخاب (search-and-select) است:

  1. تولید کاندیداها. مدل مولد چند نمونه از جفت‌های «ورودی-خروجی» مربوط به وظیفه هدف را دریافت کرده و بر اساس آن‌ها مجموعه‌ای از prompt‌های کاندیدا تولید می‌کند که می‌توانستند به چنین نتایجی منجر شوند.
  2. ارزیابی. هر prompt کاندیدای تولیدشده به LLM هدف ارسال می‌شود. مدل هدف دستورالعمل را روی مجموعه داده آزمایشی جدید اجرا می‌کند و پاسخ‌های آن بر اساس یک معیار از پیش تعریف‌شده (مثلاً دقت، فراخوانی، F1) سنجیده می‌شود.
  3. انتخاب. prompt‌ای که بهترین نتیجه را در ارزیابی کسب کرده انتخاب می‌شود.
  4. تکرار (اختیاری). چرخه می‌تواند تکرار شود. مدل مولد دستور می‌گیرد بهترین prompt یافت‌شده را بهبود دهد و تغییرات آن را بسازد، سپس فرآیند ارزیابی و انتخاب برای رسیدن به حداکثر کارایی تکرار می‌شود[1].

این رویکرد امکان بازتولید خودکار فرآیند انتخاب دستی prompt را فراهم می‌کند و از LLM برای تولید فرضیه‌ها (prompt‌ها) و ارزیابی بعدی آن‌ها استفاده می‌کند.

روش‌شناسی‌های کلیدی

خودکارسازی مهندسی prompt با رویکردهای الگوریتمی مختلفی پیاده‌سازی می‌شود.

خودکارسازی مبتنی بر LLM

این روش کلاسیک APE است که در بالا توضیح داده شد، که در آن یک LLM برای تولید و ارزیابی prompt برای LLM دیگری (یا همان مدل) استفاده می‌شود. این رویکرد برای prompt‌های متنی گسسته بسیار مؤثر بوده است[1].

روش‌های تکاملی

الگوریتم‌های ژنتیک یا جستجوی پرتویی (beam search) برای تولید و گزینش prompt‌ها، به ویژه prompt‌های طولانی و پیچیده، به کار می‌روند. برای نمونه، فریمورک APEX (Automatic Engineering of Long Prompts) از الگوریتم‌های تکاملی برای «رشد» تدریجی و بهبود دستورالعمل‌های پیچیده استفاده می‌کند[3].

روش‌های مبتنی بر گرادیان (Soft Prompts)

این رویکرد با prompt‌های پیوسته یا نرم (soft prompts) کار می‌کند که بردارهای قابل آموزش (embedding) هستند، نه دستورالعمل‌های متنی. این بردارها از طریق گرادیان کاهشی مستقیماً روی وظیفه هدف بهینه می‌شوند. تکنیک‌هایی مانند Prompt Tuning و Prefix-Tuning در این دسته قرار می‌گیرند.

Reinforcement Learning

در این پارادایم، LLM نقش یک عامل را بازی می‌کند که prompt (عمل) تولید می‌کند و محیط کیفیت پاسخ (پاداش) را بازمی‌گرداند. هدف بیشینه‌سازی پاداش تجمعی از طریق یافتن استراتژی بهینه تولید prompt با روش‌های Reinforcement Learning (RL) است[2].

نتایج و یافته‌ها

آزمایش‌های پژوهش اصلی APE نشان داد که دستورالعمل‌های تولیدشده به صورت خودکار در اکثر موارد از کیفیت prompt‌های نوشته‌شده توسط انسان فراتر می‌روند.

  • در طول آزمایش روی ۲۴ وظیفه پردازش زبان طبیعی (NLP)، APE prompt‌هایی تولید کرد که در ۱۹ مورد از ۲۴ مورد مؤثرتر از prompt‌های انسانی بودند[1].
  • APE توانست به صورت خودکار یک فرمول‌بندی مؤثرتر برای prompting در سبک Chain-of-Thought «کشف» کند. به جای عبارت استاندارد «Let's think step by step» (بیایید گام به گام فکر کنیم)، APE دستورالعمل گسترده‌تر و مؤثرتری تولید کرد: «Let's work this out in a step by step way to be sure we have the right answer» (بیایید این را گام به گام بررسی کنیم تا مطمئن شویم پاسخ درستی داریم). این فرمول‌بندی دقت حل مسائل ریاضی را در مجموعه داده‌هایی مانند MultiArith و GSM8K افزایش داد[1].

کاربردها و مزایا

کاربردها

  • بهبود few-shot learning: انتخاب خودکار بهترین نمونه‌ها و دستورالعمل‌ها.
  • افزایش اعتبار مدل‌ها: APE می‌تواند برای جستجوی prompt‌هایی که «توهم‌زایی» را به حداقل می‌رسانند و صداقت پاسخ‌ها را در benchmark‌هایی مانند TruthfulQA به حداکثر می‌رسانند تنظیم شود.
  • خودکارسازی توسعه: تسریع ساخت chatbot‌ها، سیستم‌های استخراج اطلاعات و سایر برنامه‌های کاربردی LLM[4].

مزایا

  • مقیاس‌پذیری: امکان تولید و ارزیابی خودکار صدها و هزاران prompt بدون دخالت انسان.
  • انعطاف‌پذیری: تنظیم آسان LLM برای حوزه‌های جدید و تخصصی.
  • صرفه‌جویی در منابع: کاهش چشمگیر زمان و تلاش صرف‌شده برای انتخاب دستی prompt.

توسعه و رویکردهای مرتبط

مفهوم APE به توسعه خود ادامه می‌دهد. سیستم‌های کاملاً مستقلی مانند APET (Automatic Prompt Engineering Toolbox) ظهور کرده‌اند که به LLM (مانند GPT-4) اجازه می‌دهند به طور مستقل استراتژی‌های پیچیده prompting (Expert Prompting، Chain of Thought، Tree of Thoughts) را اعمال کرده و دستورالعمل‌ها را بدون دخالت خارجی به صورت پویا بهبود دهند[5].

APE بخشی از روند گسترده‌تر خودکارسازی تعامل با LLM است که شامل موارد زیر نیز می‌شود:

  • AutoPrompt: روشی اولیه که از جستجوی مبتنی بر گرادیان برای یافتن token‌های منفرد «محرک» استفاده می‌کرد.
  • OPRO (Optimization by PROmpting): رویکردی مشابه APE از DeepMind که از LLM برای بهینه‌سازی prompt استفاده می‌کند.

پیوندها

  • وب‌سایت رسمی پروژه Automatic Prompt Engineer (APE)
  • مقاله علمی «Large Language Models Are Human-Level Prompt Engineers»
  • AutoPrompt (2020). AutoPrompt – Official GitHub Repository. GitHub.

منابع

  • Zhou, Y. et al. (2022). Large Language Models Are Human-Level Prompt Engineers. arXiv:2211.01910.
  • Li, W. et al. (2025). A Survey of Automatic Prompt Engineering: An Optimization Perspective. arXiv:2502.11560.
  • Hsieh, C.-J. et al. (2024). Automatic Engineering of Long Prompts. Findings of ACL 2024. 2024.findings-acl.634.
  • Hsieh, C.-J. et al. (2023). Automatic Long Prompt Engineering. arXiv:2311.10117.
  • Shin, T. et al. (2020). AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts. arXiv:2010.15980.
  • Yang, C. et al. (2023). Large Language Models as Optimizers (OPRO). arXiv:2309.03409.
  • Liu, Y. et al. (2024). Revisiting OPRO: The Limitations of Small-Scale LLMs as Optimizers. arXiv:2405.10276.
  • Kepel, D.; Valogianni, K. (2024). Autonomous Prompt Engineering in Large Language Models (APET). arXiv:2407.11000.
  • Yang, C. et al. (2024). Optimizing Instructions and Demonstrations for Multi-Stage LM Programs. arXiv:2406.11695.
  • Hsieh, C.-J. et al. (2024). APEX (code repository and results). PDF.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 1.4 Zhou, Y. et al. «Large Language Models Are Human-Level Prompt Engineers». arXiv:2211.01910, 2022. [۱]
  2. 2.0 2.1 Li, W. et al. «A Survey of Automatic Prompt Engineering: An Optimization Perspective». arXiv:2502.11560, 2025. [۲]
  3. Hsieh, C.-J. et al. «Automatic Engineering of Long Prompts». Findings of the Association for Computational Linguistics: ACL 2024. [۳]
  4. Fernandez-garcia, A. et al. «Automatic Prompt Engineering for Foundation Models: A Survey». MDPI Electronics, 2025. [۴]
  5. Kepel, D. & Valogianni, K. «Autonomous Prompt Engineering in Large Language Models». arXiv:2407.11000, 2024. [۵]