Automatic Prompt Engineer (APE) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

מהנדס הנחיות אוטומטי (APE) — הוא שיטה לייצור אוטומטי ולאופטימיזציה של הוראות טקסטואליות (prompts) לשליטה בהתנהגות של מודלי שפה גדולים (LLM). הגישה הוצעה בשנת 2022 על ידי קבוצת חוקרים בהנהגת יונגצ'או ג'ו (Yongchao Zhou)[1].

במקום בחירה ידנית ושיפור איטרטיבי של הנחיות, APE מגדיר את הנדסת ה-prompt כבעיית אופטימיזציה. במסגרת בעיה זו, ההנחיה נתפסת כ"תוכנית" בשפה טבעית שיש לסנתז אותה כדי למקסם פונקציית איכות מסוימת (לדוגמה, דיוק או אמינות תשובות המודל)[2].

הרעיון המרכזי והשיטה

שיטת APE משתמשת בשתי מודלי שפה בשילוב: מודל-מחולל ומודל יעד. התהליך הוא מחזור איטרטיבי של חיפוש ובחירה (search-and-select):

  1. ייצור מועמדים. מודל-המחולל מקבל כקלט מספר דוגמאות של זוגות «קלט-פלט» למשימת היעד, ועל בסיסן יוצר קבוצה של prompts-מועמדים אפשריים שיכלו להוביל לתוצאות כאלה.
  2. הערכה. כל prompt-מועמד שנוצר מועבר ל-LLM היעד. מודל היעד מבצע את ההוראה על קבוצת נתוני בדיקה חדשה, ותשובותיו מוערכות לפי מדד שנקבע מראש (לדוגמה, דיוק, היקף, מדד F1).
  3. בחירה. נבחר ה-prompt שהשיג את התוצאה הטובה ביותר לאחר ההערכה.
  4. איטרציה (אופציונלי). המחזור יכול לחזור על עצמו. מודל-המחולל מקבל פקודה לשכלל את ה-prompt הטוב ביותר שנמצא, ליצור וריאציות שלו, ולאחר מכן תהליך ההערכה והבחירה חוזר על עצמו להשגת יעילות מרבית[1].

גישה זו מאפשרת לשחזר אוטומטית את תהליך הבחירה הידנית של prompts, תוך שימוש ב-LLM לייצור השערות (prompts) והערכתן לאחר מכן.

מתודולוגיות מרכזיות

אוטומציה של הנדסת prompts מיושמת באמצעות גישות אלגוריתמיות שונות.

אוטומציה מבוססת LLM

זוהי שיטת ה-APE הקלאסית המתוארת לעיל, שבה LLM אחד משמש לייצור ולהערכת prompts עבור LLM אחר (או אותו אחד). גישה זו הוכיחה את עצמה כיעילה מאוד עבור prompts טקסטואליים דיסקרטיים[1].

שיטות אבולוציוניות

משתמשים באלגוריתמים גנטיים או beam search ליצירה וסלקציה של prompts, בעיקר ארוכים ומורכבים. לדוגמה, המסגרת APEX (Automatic Engineering of Long Prompts) מיישמת אלגוריתמים אבולוציוניים ל"גידול" הדרגתי ושיפור של הוראות מורכבות[3].

שיטות גרדיאנטיות (Soft Prompts)

גישה זו עובדת עם prompts רציפים או רכים (soft prompts), שהם וקטורים (embeddings) הניתנים לאימון, ולא הוראות טקסטואליות. וקטורים אלה מאופטמזים באמצעות ירידת גרדיאנט ישירות על משימת היעד. כאן נכללות טכניקות כגון Prompt Tuning ו-Prefix-Tuning.

Reinforcement Learning

בפרדיגמה זו ה-LLM משמש כסוכן המייצר prompt (פעולה), והסביבה מחזירה הערכת איכות של התשובה (תגמול). המטרה היא למקסם את התגמול המצטבר על ידי מציאת אסטרטגיית ייצור prompts אופטימלית באמצעות שיטות Reinforcement Learning (RL)[2].

תוצאות וממצאים

ניסויים במסגרת המחקר המקורי של APE הראו כי הוראות שנוצרו אוטומטית עולות ברוב המקרים באיכותן על prompts שכתב אדם.

  • במהלך בדיקה על 24 משימות עיבוד שפה טבעית (NLP), APE ייצר prompts שהיו יעילים יותר מאלה שנכתבו על ידי בני אדם ב-19 מתוך 24 מקרים[1].
  • APE הצליח ל"גלות" אוטומטית ניסוח יעיל יותר עבור prompting בסגנון Chain-of-Thought. במקום הביטוי הסטנדרטי «Let's think step by step» (בואו נחשוב שלב אחר שלב), APE ייצר הוראה מפורטת ויעילה יותר: «Let's work this out in a step by step way to be sure we have the right answer» (בואו נעבד זאת שלב אחר שלב כדי לוודא שנקבל את התשובה הנכונה). ניסוח זה שיפר את דיוק פתרון בעיות מתמטיות על datasets כגון MultiArith ו-GSM8K[1].

יישומים ויתרונות

יישומים

  • שיפור few-shot learning: בחירה אוטומטית של דוגמאות והוראות אופטימליות.
  • הגברת אמינות המודלים: APE ניתן לכיוון לחיפוש prompts הממזערים "הזיות" ומקסימיזים אמיתיות התשובות על benchmarks כגון TruthfulQA.
  • אוטומציה של פיתוח: האצת יצירת chatbots, מערכות חילוץ מידע ויישומי LLM אחרים[4].

יתרונות

  • מדרגיות: אפשרות לייצר ולהעריך אוטומטית מאות ואלפי prompts ללא מעורבות אנושית.
  • הסתגלות: כיוון קל של LLM לתחומים חדשים ומיוחדים.
  • חיסכון במשאבים: צמצום משמעותי של הזמן והמאמץ המושקעים בבחירה ידנית של prompts.

התפתחות וגישות קשורות

המושג APE ממשיך להתפתח. הופיעו מערכות אוטונומיות לחלוטין, כגון APET (Automatic Prompt Engineering Toolbox), המאפשרות ל-LLM (לדוגמה, GPT-4) ליישם באופן עצמאי אסטרטגיות prompting מורכבות (Expert Prompting, Chain of Thought, Tree of Thoughts) ולשפר הוראות באופן דינמי ללא התערבות חיצונית[5].

APE הוא חלק ממגמה רחבה יותר של אוטומציה של האינטראקציה עם LLM, הכוללת גם:

  • AutoPrompt: שיטה מוקדמת שהשתמשה בחיפוש גרדיאנטי למציאת tokens בודדים מסוג "טריגר".
  • OPRO (Optimization by PROmpting): גישה הדומה ל-APE מבית DeepMind, גם היא משתמשת ב-LLM לאופטימיזציה של prompts.

קישורים

  • האתר הרשמי של פרויקט Automatic Prompt Engineer (APE)
  • המאמר המדעי «Large Language Models Are Human-Level Prompt Engineers»
  • AutoPrompt (2020). AutoPrompt – Official GitHub Repository. GitHub.

ספרות

  • Zhou, Y. et al. (2022). Large Language Models Are Human-Level Prompt Engineers. arXiv:2211.01910.
  • Li, W. et al. (2025). A Survey of Automatic Prompt Engineering: An Optimization Perspective. arXiv:2502.11560.
  • Hsieh, C.-J. et al. (2024). Automatic Engineering of Long Prompts. Findings of ACL 2024. 2024.findings-acl.634.
  • Hsieh, C.-J. et al. (2023). Automatic Long Prompt Engineering. arXiv:2311.10117.
  • Shin, T. et al. (2020). AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts. arXiv:2010.15980.
  • Yang, C. et al. (2023). Large Language Models as Optimizers (OPRO). arXiv:2309.03409.
  • Liu, Y. et al. (2024). Revisiting OPRO: The Limitations of Small-Scale LLMs as Optimizers. arXiv:2405.10276.
  • Kepel, D.; Valogianni, K. (2024). Autonomous Prompt Engineering in Large Language Models (APET). arXiv:2407.11000.
  • Yang, C. et al. (2024). Optimizing Instructions and Demonstrations for Multi-Stage LM Programs. arXiv:2406.11695.
  • Hsieh, C.-J. et al. (2024). APEX (code repository and results). PDF.

הערות

  1. 1.0 1.1 1.2 1.3 1.4 Zhou, Y. et al. «Large Language Models Are Human-Level Prompt Engineers». arXiv:2211.01910, 2022. [1]
  2. 2.0 2.1 Li, W. et al. «A Survey of Automatic Prompt Engineering: An Optimization Perspective». arXiv:2502.11560, 2025. [2]
  3. Hsieh, C.-J. et al. «Automatic Engineering of Long Prompts». Findings of the Association for Computational Linguistics: ACL 2024. [3]
  4. Fernandez-garcia, A. et al. «Automatic Prompt Engineering for Foundation Models: A Survey». MDPI Electronics, 2025. [4]
  5. Kepel, D. & Valogianni, K. «Autonomous Prompt Engineering in Large Language Models». arXiv:2407.11000, 2024. [5]