Automatic Prompt Engineer (APE) (TH)
Automatic Prompt Engineer (APE) — คือวิธีการสร้างและปรับปรุงคำสั่งข้อความ (prompt) โดยอัตโนมัติ เพื่อควบคุมพฤติกรรมของโมเดลภาษาขนาดใหญ่ (LLM) แนวทางนี้ถูกเสนอขึ้นในปี 2022 โดยกลุ่มนักวิจัยภายใต้การนำของ Yongchao Zhou[1]
แทนที่จะคัดเลือกและปรับปรุง prompt ด้วยมืออย่างวนซ้ำ APE ได้กำหนดรูปแบบวิศวกรรม prompt ให้เป็นปัญหาการปรับให้เหมาะสม (optimization) ในกรอบงานนี้ prompt ถูกมองว่าเป็น "โปรแกรม" ในภาษาธรรมชาติ ซึ่งจำเป็นต้องสังเคราะห์ขึ้นเพื่อเพิ่มค่าสูงสุดของฟังก์ชันคุณภาพที่กำหนด (เช่น ความแม่นยำหรือความน่าเชื่อถือของคำตอบจากโมเดล)[2]
แนวคิดหลักและวิธีการ
วิธี APE ใช้โมเดลภาษาสองตัวทำงานร่วมกัน ได้แก่ โมเดลผู้สร้าง และ โมเดลเป้าหมาย กระบวนการดำเนินการเป็นวงจรวนซ้ำของการค้นหาและคัดเลือก (search-and-select):
- การสร้างตัวเลือกผู้สมัคร โมเดลผู้สร้างรับอินพุตเป็นตัวอย่างคู่ "อินพุต-เอาต์พุต" หลายชุดสำหรับงานเป้าหมาย แล้วสร้าง prompt ผู้สมัครที่เป็นไปได้หลายตัวซึ่งอาจนำไปสู่ผลลัพธ์ดังกล่าว
- การประเมิน prompt ผู้สมัครแต่ละตัวที่สร้างขึ้นจะถูกส่งไปยัง LLM เป้าหมาย โมเดลเป้าหมายจะดำเนินการตามคำสั่งบนชุดข้อมูลทดสอบใหม่ และคำตอบของโมเดลจะถูกประเมินตามเมตริกที่กำหนดไว้ล่วงหน้า (เช่น ความแม่นยำ ความครอบคลุม F1-measure)
- การคัดเลือก เลือก prompt ที่ได้รับผลลัพธ์ดีที่สุดจากการประเมิน
- การวนซ้ำ (ทางเลือก) วงจรอาจทำซ้ำได้ โมเดลผู้สร้างได้รับคำสั่งให้ปรับปรุง prompt ที่ดีที่สุดที่พบ โดยสร้างรูปแบบแปรผัน จากนั้นกระบวนการประเมินและคัดเลือกจะทำซ้ำอีกครั้งเพื่อให้ได้ประสิทธิภาพสูงสุด[1]
แนวทางนี้ช่วยให้สามารถจำลองกระบวนการคัดเลือก prompt ด้วยมือโดยอัตโนมัติ โดยใช้ LLM ในการสร้างสมมติฐาน (prompt) และประเมินผลลัพธ์ในภายหลัง
วิธีการหลัก
การทำให้วิศวกรรม prompt เป็นอัตโนมัติสามารถทำได้ด้วยแนวทางอัลกอริทึมที่หลากหลาย
การทำให้เป็นอัตโนมัติโดยอาศัย LLM
นี่คือวิธีคลาสสิกของ APE ที่อธิบายข้างต้น ซึ่ง LLM หนึ่งตัวถูกใช้เพื่อสร้างและประเมิน prompt สำหรับ LLM อีกตัวหนึ่ง (หรือตัวเดียวกัน) แนวทางนี้พิสูจน์แล้วว่ามีประสิทธิภาพสูงสำหรับ prompt ข้อความแบบดิสครีต[1]
วิธีการเชิงวิวัฒนาการ
ใช้อัลกอริทึมทางพันธุกรรมหรือ beam search ในการสร้างและคัดเลือก prompt โดยเฉพาะอย่างยิ่ง prompt ที่ยาวและซับซ้อน ตัวอย่างเช่น framework APEX (Automatic Engineering of Long Prompts) ใช้อัลกอริทึมเชิงวิวัฒนาการเพื่อ "เพาะปลูก" และปรับปรุงคำสั่งที่ซับซ้อนอย่างค่อยเป็นค่อยไป[3]
วิธีการแบบ Gradient (Soft Prompts)
แนวทางนี้ทำงานกับ prompt แบบต่อเนื่อง หรือ soft prompts ซึ่งเป็นเวกเตอร์ที่เรียนรู้ได้ (embedding) ไม่ใช่คำสั่งข้อความ เวกเตอร์เหล่านี้จะถูกปรับให้เหมาะสมด้วย gradient descent โดยตรงบนงานเป้าหมาย เทคนิคที่อยู่ในกลุ่มนี้ได้แก่ Prompt Tuning และ Prefix-Tuning
Reinforcement Learning
ในกรอบทฤษฎีนี้ LLM ทำหน้าที่เป็น agent ที่สร้าง prompt (action) และสภาพแวดล้อมจะส่งคืนคะแนนคุณภาพของคำตอบ (reward) เป้าหมายคือการเพิ่ม reward สะสมสูงสุด โดยค้นหากลยุทธ์การสร้าง prompt ที่เหมาะสมที่สุดผ่านวิธีการ Reinforcement Learning (RL)[2]
ผลลัพธ์และการค้นพบ
การทดลองในงานวิจัย APE ต้นฉบับแสดงให้เห็นว่าคำสั่งที่สร้างขึ้นโดยอัตโนมัติส่วนใหญ่มีคุณภาพเหนือกว่า prompt ที่เขียนโดยมนุษย์
- ในระหว่างการทดสอบบน 24 งานด้านการประมวลผลภาษาธรรมชาติ (NLP) APE สร้าง prompt ที่ มีประสิทธิภาพดีกว่าของมนุษย์ใน 19 จาก 24 กรณี[1]
- APE สามารถ "ค้นพบ" สูตรที่มีประสิทธิภาพมากกว่าสำหรับการทำ prompt แบบ Chain-of-Thought โดยอัตโนมัติ แทนที่จะใช้วลีมาตรฐาน «Let's think step by step» APE สร้างคำสั่งที่ละเอียดและมีประสิทธิภาพมากกว่า: «Let's work this out in a step by step way to be sure we have the right answer» สูตรนี้ช่วยเพิ่มความแม่นยำในการแก้ปัญหาคณิตศาสตร์บน dataset เช่น MultiArith และ GSM8K[1]
การประยุกต์ใช้และข้อดี
การประยุกต์ใช้
- การปรับปรุง few-shot learning: การคัดเลือกตัวอย่างและคำสั่งที่เหมาะสมที่สุดโดยอัตโนมัติ
- การเพิ่มความน่าเชื่อถือของโมเดล: APE สามารถปรับแต่งเพื่อค้นหา prompt ที่ลด "hallucination" และเพิ่มความถูกต้องของคำตอบบน benchmark เช่น TruthfulQA
- การทำให้การพัฒนาเป็นอัตโนมัติ: เร่งการสร้าง chatbot ระบบดึงข้อมูล และแอปพลิเคชัน LLM อื่น ๆ[4]
ข้อดี
- ความสามารถในการขยาย (Scalability): ความสามารถในการสร้างและประเมิน prompt ได้หลายร้อยหลายพันตัวโดยไม่ต้องมีมนุษย์เข้ามาเกี่ยวข้อง
- ความสามารถในการปรับตัว (Adaptability): การปรับ LLM ให้เข้ากับโดเมนใหม่ที่เฉพาะทางได้อย่างง่ายดาย
- การประหยัดทรัพยากร: ลดเวลาและความพยายามในการคัดเลือก prompt ด้วยมือได้อย่างมีนัยสำคัญ
การพัฒนาและแนวทางที่เกี่ยวข้อง
แนวคิด APE ยังคงพัฒนาต่อไปอย่างต่อเนื่อง ระบบอัตโนมัติเต็มรูปแบบได้ปรากฏขึ้น เช่น APET (Automatic Prompt Engineering Toolbox) ซึ่งช่วยให้ LLM (เช่น GPT-4) สามารถนำกลยุทธ์การทำ prompt ที่ซับซ้อนมาใช้ได้อย่างอิสระ (Expert Prompting, Chain of Thought, Tree of Thoughts) และปรับปรุงคำสั่งแบบไดนามิกโดยไม่ต้องมีการแทรกแซงจากภายนอก[5]
APE เป็นส่วนหนึ่งของแนวโน้มที่กว้างขึ้นในการทำให้การโต้ตอบกับ LLM เป็นอัตโนมัติ ซึ่งยังรวมถึง:
- AutoPrompt: วิธีการยุคแรกที่ใช้การค้นหาแบบ gradient เพื่อค้นหา token "ตัวกระตุ้น" แต่ละตัว
- OPRO (Optimization by PROmpting): แนวทางที่คล้ายคลึงกับ APE จาก DeepMind ซึ่งใช้ LLM ในการปรับ prompt ให้เหมาะสมเช่นกัน
ลิงก์
- เว็บไซต์อย่างเป็นทางการของโครงการ Automatic Prompt Engineer (APE)
- บทความวิทยาศาสตร์ «Large Language Models Are Human-Level Prompt Engineers»
- AutoPrompt (2020). AutoPrompt – Official GitHub Repository. GitHub.
วรรณกรรม
- Zhou, Y. et al. (2022). Large Language Models Are Human-Level Prompt Engineers. arXiv:2211.01910.
- Li, W. et al. (2025). A Survey of Automatic Prompt Engineering: An Optimization Perspective. arXiv:2502.11560.
- Hsieh, C.-J. et al. (2024). Automatic Engineering of Long Prompts. Findings of ACL 2024. 2024.findings-acl.634.
- Hsieh, C.-J. et al. (2023). Automatic Long Prompt Engineering. arXiv:2311.10117.
- Shin, T. et al. (2020). AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts. arXiv:2010.15980.
- Yang, C. et al. (2023). Large Language Models as Optimizers (OPRO). arXiv:2309.03409.
- Liu, Y. et al. (2024). Revisiting OPRO: The Limitations of Small-Scale LLMs as Optimizers. arXiv:2405.10276.
- Kepel, D.; Valogianni, K. (2024). Autonomous Prompt Engineering in Large Language Models (APET). arXiv:2407.11000.
- Yang, C. et al. (2024). Optimizing Instructions and Demonstrations for Multi-Stage LM Programs. arXiv:2406.11695.
- Hsieh, C.-J. et al. (2024). APEX (code repository and results). PDF.
หมายเหตุ
- ↑ 1.0 1.1 1.2 1.3 1.4 Zhou, Y. et al. «Large Language Models Are Human-Level Prompt Engineers». arXiv:2211.01910, 2022. [1]
- ↑ 2.0 2.1 Li, W. et al. «A Survey of Automatic Prompt Engineering: An Optimization Perspective». arXiv:2502.11560, 2025. [2]
- ↑ Hsieh, C.-J. et al. «Automatic Engineering of Long Prompts». Findings of the Association for Computational Linguistics: ACL 2024. [3]
- ↑ Fernandez-garcia, A. et al. «Automatic Prompt Engineering for Foundation Models: A Survey». MDPI Electronics, 2025. [4]
- ↑ Kepel, D. & Valogianni, K. «Autonomous Prompt Engineering in Large Language Models». arXiv:2407.11000, 2024. [5]