Phi (Microsoft) (TH)
Phi — คือกลุ่มโมเดลภาษาขนาดเล็ก (Small Language Models, SLM) ที่พัฒนาโดย Microsoft Research โมเดลเหล่านี้แสดงถึงการเปลี่ยนแปลงเชิงกระบวนทัศน์ในการพัฒนา AI และแสดงให้เห็นว่าโมเดลที่มีขนาดกะทัดรัดและประหยัดการคำนวณสามารถบรรลุประสิทธิภาพที่เทียบเท่ากับระบบที่ใหญ่กว่ามากได้ แตกต่างจากแนวทางดั้งเดิมที่เน้นการขยายจำนวนพารามิเตอร์ ปรัชญาของ Phi มุ่งเน้นไปที่คุณภาพของข้อมูลการฝึกและวิธีการฝึกที่สร้างสรรค์[1]
โมเดล Phi ได้รับการปรับให้เหมาะสมสำหรับงานที่ต้องการการอนุมานเชิงตรรกะเชิงลึก เช่น การเขียนโปรแกรม คณิตศาสตร์ และการวิเคราะห์ข้อความ ด้วยขนาดที่เล็ก โมเดลเหล่านี้จึงเหมาะอย่างยิ่งสำหรับการนำไปใช้งานบนอุปกรณ์ท้องถิ่น (on-device AI) รวมถึงสมาร์ทโฟนและแล็ปท็อป ซึ่งเปิดโอกาสใหม่ในการทำให้ AI เข้าถึงได้อย่างกว้างขวางยิ่งขึ้น[2]
ปรัชญา: «Textbooks Are All You Need - ตำราเรียนคือทุกสิ่งที่คุณต้องการ»
สมมติฐานหลักที่เป็นรากฐานของโครงการ Phi คือ สำหรับการฝึกโมเดลที่มีประสิทธิภาพสูง คุณภาพของข้อมูลมีความสำคัญมากกว่าปริมาณ แนวคิดนี้ถูกกำหนดขึ้นครั้งแรกในงานวิจัย «Textbooks Are All You Need»[3] แทนที่จะฝึกบน token นับล้านล้านจากเว็บที่ไม่ผ่านการกรอง โมเดล Phi ฝึกบน dataset ที่คัดเลือกอย่างละเอียดและสร้างขึ้นโดยสังเคราะห์ ซึ่งมีคุณภาพคล้ายกับตำราเรียน
หลักการสำคัญของแนวทางนี้:
- ข้อมูล «คุณภาพตำราเรียน»: คลังข้อมูลการฝึกประกอบด้วยเนื้อหาที่สะอาด มีความสอดคล้องเชิงตรรกะ และมีลักษณะอธิบาย ได้รับแรงบันดาลใจจากหนังสือเด็ก
- ข้อมูลสังเคราะห์: ส่วนสำคัญของข้อมูลถูกสร้างขึ้นโดยใช้โมเดลขนาดใหญ่ (เช่น GPT-4) ตัวอย่างเช่น สำหรับการฝึก Phi-4 มีการสร้าง token คุณภาพสูงที่สังเคราะห์จำนวน 400 พันล้าน token ผ่านมากกว่า 50 pipeline แบบกำหนดเอง[4][5]
- การฝึกแบบวนซ้ำ: กระบวนการสร้างข้อมูลและการฝึกโมเดลดำเนินการแบบวนซ้ำ ซึ่งช่วยให้ปรับปรุงคุณภาพทั้งข้อมูลและโมเดลเองได้อย่างต่อเนื่อง
แนวทางนี้ช่วยให้โมเดล Phi พัฒนาความสามารถในการอนุมานเชิงลึก แทนที่จะเพียงแค่จดจำรูปแบบทางสถิติ
วิวัฒนาการของโมเดล Phi
- Phi-1 (1.3 พันล้านพารามิเตอร์): โมเดลแรกที่เปิดตัวในเดือนมิถุนายน 2023 มุ่งเน้นการเขียนโปรแกรมด้วยภาษา Python โมเดลนี้แสดงประสิทธิภาพที่เหนือกว่าบน benchmark HumanEval และ MBPP พิสูจน์ให้เห็นถึงประสิทธิภาพของแนวทางที่อิงกับข้อมูลคุณภาพสูง[6]
- Phi-2 (2.7 พันล้านพารามิเตอร์): เปิดตัวในเดือนธันวาคม 2023 Phi-2 ขยายความสามารถไปสู่การทำความเข้าใจภาษาทั่วไป ขณะที่ยังคงสถาปัตยกรรมที่กะทัดรัด โมเดลนี้แสดงให้เห็นว่า SLM สามารถบรรลุประสิทธิภาพที่เทียบเคียงได้กับโมเดลที่ใหญ่กว่าหลายสิบเท่า[7]
- Phi-3 (3.8 - 14 พันล้านพารามิเตอร์): กลุ่มโมเดลที่เปิดตัวในเดือนเมษายน 2024 กลายเป็นความก้าวหน้าในด้าน AI สำหรับอุปกรณ์พกพา Phi-3-mini (3.8 พันล้าน) สามารถทำงานบนสมาร์ทโฟน โดยบรรลุประสิทธิภาพที่เทียบได้กับ Mixtral 8x7B และ GPT-3.5[8] กลุ่มโมเดลนี้ยังรวมถึงเวอร์ชัน Phi-3-small (7 พันล้าน) และ Phi-3-medium (14 พันล้าน)
- Phi-3.5 (3.8 - 6.6 พันล้านพารามิเตอร์ที่ใช้งาน): ประกาศในปี 2024 กลุ่มโมเดลนี้รวมถึงโมเดลหลักสามรายการ:
- Phi-3.5-mini-instruct: เวอร์ชันที่ปรับให้เหมาะสมพร้อมการรองรับหลายภาษาที่ดีขึ้น
- Phi-3.5-MoE-instruct: โมเดลที่อิงสถาปัตยกรรม Mixture-of-Experts ที่มีผู้เชี่ยวชาญ 16 ราย และพารามิเตอร์ที่ใช้งาน 6.6 พันล้าน
- Phi-3.5-Vision-instruct: โมเดลมัลติโมดัลสำหรับประมวลผลข้อความและภาพ[9]
- Phi-4 (14 พันล้านพารามิเตอร์): โมเดลที่เชี่ยวชาญด้านการอนุมานทางคณิตศาสตร์ที่ซับซ้อน โมเดลนี้แสดงประสิทธิภาพที่เทียบเคียงได้กับ Gemini-1.5-Flash และ GPT-4o-mini แม้จะมีขนาดที่เล็กกว่ามาก Phi-4-reasoning แสดงประสิทธิภาพที่เหนือกว่า DeepSeek-R1-Distill-Llama-70B[10]
- Phi-4-Multimodal (5.6 พันล้านพารามิเตอร์): โมเดลมัลติโมดัลอย่างเต็มรูปแบบตัวแรกในกลุ่ม ที่สามารถประมวลผลข้อความ ภาพ และเสียงพร้อมกัน โมเดลนี้ใช้แนวทาง Mixture-of-LoRAs ที่สร้างสรรค์สำหรับการประมวลผล modality ต่าง ๆ อย่างมีประสิทธิภาพโดยไม่มีการรบกวนซึ่งกันและกัน[11]
สถาปัตยกรรมและลักษณะเฉพาะทางเทคนิค
- สถาปัตยกรรม: โมเดล Phi ใช้สถาปัตยกรรม transformer แบบมาตรฐานชนิด decoder-only พร้อมการปรับให้เหมาะสมที่สำคัญ เช่น Grouped Query Attention และ Flash Attention เพื่อเพิ่มประสิทธิภาพ[12]
- การใช้งานบนอุปกรณ์ท้องถิ่น: โมเดลได้รับการปรับให้เหมาะสมสำหรับการทำงานบนอุปกรณ์ที่มีทรัพยากรจำกัด ตัวอย่างเช่น Phi-3-mini ต้องการหน่วยความจำเพียง 1.8 GB ด้วยการควอนไทซ์ 4 บิต และสามารถทำงานบน iPhone 14 ได้[13]
- การรองรับ framework: โมเดล Phi มีให้บริการผ่าน Microsoft Azure AI Model Catalog, Hugging Face, Ollama และ NVIDIA NIM microservices ซึ่งทำให้มีการผสานรวมที่กว้างขวางและเข้าถึงได้สำหรับนักพัฒนา[14]
ประสิทธิภาพและ benchmark
| โมเดล | พารามิเตอร์ | MMLU | MT-Bench | HumanEval |
|---|---|---|---|---|
| Phi-3-mini | 3.8B | 69% | 8.38 | - |
| Phi-3-small | 7B | 75% | 8.7 | - |
| Phi-3-medium | 14B | 78% | 8.9 | - |
| Phi-4 | 14B | - | - | เหนือกว่า GPT-4 |
Phi-4 แสดงผลลัพธ์ที่โดดเด่นในงานคณิตศาสตร์ รวมถึง American Mathematics Competitions (AMC) โดยแสดงประสิทธิภาพที่เทียบเคียงได้กับ Gemini-1.5-Flash[15] โมเดลมัลติโมดัล Phi-3.5-Vision เหนือกว่าคู่แข่งที่มีขนาดใกล้เคียงกัน โดยบรรลุ 57.0% บน benchmark BLINK[16]
การประยุกต์ใช้เฉพาะทาง
โมเดล Phi แสดงประสิทธิภาพสูงในด้านเฉพาะทาง:
- การแพทย์: งานวิจัยแสดงให้เห็นความสัมพันธ์ในระดับปานกลางระหว่างคำตอบของ Phi-3 กับการประเมินของผู้เชี่ยวชาญในข้อความทางการแพทย์และการกีฬา[17]
- การตรวจจับคำพูดแสดงความเกลียดชัง: โมเดล HateTinyLLM ที่อิงบน Phi-2 บรรลุความแม่นยำมากกว่า 80% ในงานนี้โดยใช้ LoRA fine-tuning[18]
- กลยุทธ์ในเกม: โมเดล SC-Phi2 แสดงความสามารถในการทำนายกลยุทธ์ในเกม StarCraft II[19]
AI ที่รับผิดชอบและความปลอดภัย
กลุ่มโมเดล Phi ได้รับการพัฒนาตามมาตรฐาน Microsoft Responsible AI ซึ่งรวมถึงหลักการของความรับผิดชอบ ความโปร่งใส ความเป็นธรรม และความปลอดภัย โมเดลผ่านการประเมินความปลอดภัยหลายมิติ รวมถึง Supervised Fine-Tuning (SFT) และ Direct Preference Optimization (DPO) รวมถึงการทดสอบในหลายภาษาและในหมวดหมู่ความเสี่ยงต่าง ๆ[20]
ข้อจำกัด
แม้จะมีผลลัพธ์ที่น่าประทับใจ โมเดล Phi อาจยังด้อยกว่าโมเดลขนาดใหญ่ที่เชี่ยวชาญเฉพาะทางในบางงานที่ซับซ้อน ตัวอย่างเช่น Phi-4 แสดงผลลัพธ์ที่ดีในการอนุมานแบบ chain-of-thought แต่มีข้อจำกัดจากการขาดความสามารถในการเรียกใช้ฟังก์ชัน (function calling)[21] นอกจากนี้ แม้ว่า Phi-3.5 จะรองรับมากกว่า 20 ภาษา ประสิทธิภาพอาจแตกต่างกันไป และงานวิจัยแสดงให้เห็นความไม่แม่นยำในคำตอบภาษาอื่นที่ไม่ใช่ภาษาอังกฤษ[22]
วรรณกรรม
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
- Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
- Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
- Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
- Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
- Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
- Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.
หมายเหตุ
- ↑ «The Phi-3 small language models with big potential». Microsoft Source Features. [1]
- ↑ «Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models». Landing.Jobs Blog. [2]
- ↑ «Textbooks Are All You Need». Microsoft Research. [3]
- ↑ «Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning». Microsoft Tech Community. [4]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [5]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [6]
- ↑ «Новая ИИ-модель Phi-2 от Microsoft училась по учебникам». TechInsider. [7]
- ↑ «Phi-3 Technical Report». arXiv. [8]
- ↑ «Discover the new multi-lingual, high-quality Phi-3.5 SLMs». Microsoft Tech Community. [9]
- ↑ «Phi-4 Technical Report». arXiv. [10]
- ↑ «Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models». arXiv. [11]
- ↑ «Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs)». DataCamp. [12]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [13]
- ↑ «Microsoft Phi». Microsoft Azure. [14]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [15]
- ↑ «Phi-3.5-vision-instruct». Hugging Face. [16]
- ↑ «Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications». arXiv. [17]
- ↑ «HateTinyLLMs: A Small Language Model for Hate Speech Detection». arXiv. [18]
- ↑ «SC-Phi2: A Specialized Small Language Model for StarCraft II». MDPI. [19]
- ↑ «Microsoft’s Phi-3.5: a responsible, small language model». Skymod. [20]
- ↑ «Phi-4: A New Era of Small Language Models». Meta-quantum.today. [21]
- ↑ «A Multi-faceted Analysis of Language-specific Bias in Large Language Models». U.S. Securities and Exchange Commission. [22]