Phi (Microsoft) (FA)
Phi — خانوادهای از مدلهای زبانی کوچک (Small Language Models, SLM) است که توسط Microsoft Research توسعه یافته است. این مدلها نمایانگر یک تحول پارادایمی در توسعه هوش مصنوعی هستند و نشان میدهند که مدلهای فشرده و از نظر محاسباتی کارآمد میتوانند به عملکردی قابل مقایسه با سیستمهای بسیار بزرگتر دست یابند. برخلاف رویکرد سنتی مبتنی بر افزایش تعداد پارامترها، فلسفه Phi بر کیفیت دادههای آموزشی و روشهای نوآورانه آموزش تمرکز دارد[1].
مدلهای Phi برای وظایفی که نیازمند استدلال عمیق هستند، مانند برنامهنویسی، ریاضیات و تحلیل متن، بهینهسازی شدهاند. به لطف اندازه کوچک خود، برای استقرار روی دستگاههای محلی (on-device AI)، از جمله گوشیهای هوشمند و لپتاپها، ایدهآل هستند و این امر افقهای جدیدی را برای دموکراتیزهکردن هوش مصنوعی میگشاید[2].
فلسفه: «کتابهای درسی تمام چیزی هستند که نیاز دارید»
فرضیه مرکزی که زیربنای پروژه Phi است، این است که برای آموزش یک مدل پُرکارایی، کیفیت دادهها مهمتر از حجم آنهاست. این ایده برای اولین بار در مقاله پژوهشی «Textbooks Are All You Need» مطرح شد[3]. به جای آموزش روی تریلیونها token از وب فیلترنشده، مدلهای Phi روی یک dataset بهدقت گزینششده و بهصورت مصنوعی تولیدشده آموزش میبینند که از نظر کیفیت به یک کتاب درسی شباهت دارد.
اصول کلیدی این رویکرد:
- دادههای «با کیفیت کتاب درسی»: پیکره آموزشی از مواد پاک، منطقیپیوسته و توضیحی تشکیل شده که از کتابهای کودکان الهام گرفته است.
- دادههای مصنوعی: بخش قابل توجهی از دادهها با استفاده از مدلهای بزرگ (مانند GPT-4) تولید میشود. برای مثال، برای آموزش Phi-4 بیش از ۴۰۰ میلیارد token محتوای مصنوعی باکیفیت از طریق بیش از ۵۰ خط لوله سفارشی ایجاد شد[4][5].
- آموزش تکراری: فرآیند تولید داده و آموزش مدل بهصورت تکراری انجام میشود که امکان بهبود مستمر کیفیت هم دادهها و هم خود مدل را فراهم میآورد.
این رویکرد به مدلهای Phi اجازه میدهد تا قابلیتهای عمیق استدلال را پرورش دهند، نه اینکه صرفاً الگوهای آماری را حفظ کنند.
تکامل مدلهای Phi
- Phi-1 (۱.۳ میلیارد پارامتر): اولین مدل که در ژوئن ۲۰۲۳ معرفی شد، بر برنامهنویسی به زبان Python متمرکز بود. این مدل عملکرد برتری را در benchmark های HumanEval و MBPP به نمایش گذاشت و اثربخشی رویکرد مبتنی بر دادههای باکیفیت را اثبات کرد[6].
- Phi-2 (۲.۷ میلیارد پارامتر): که در دسامبر ۲۰۲۳ منتشر شد، Phi-2 قابلیتهای خود را به درک عمومی زبان گسترش داد و در عین حال معماری فشرده را حفظ کرد. این مدل نشان داد که SLM ها میتوانند به عملکردی مقایسهپذیر با مدلهایی که دهها برابر بزرگتر هستند دست یابند[7].
- Phi-3 (۳.۸ تا ۱۴ میلیارد پارامتر): خانوادهای که در آوریل ۲۰۲۴ معرفی شد، نقطه عطفی در حوزه هوش مصنوعی موبایل بود. Phi-3-mini (۳.۸ میلیارد) قادر است روی گوشیهای هوشمند اجرا شود و به عملکردی مقایسهپذیر با Mixtral 8x7B و GPT-3.5 دست یابد[8]. این خانواده همچنین شامل نسخههای Phi-3-small (۷ میلیارد) و Phi-3-medium (۱۴ میلیارد) میشود.
- Phi-3.5 (۳.۸ تا ۶.۶ میلیارد پارامتر فعال): که در سال ۲۰۲۴ معرفی شد، این خانواده شامل سه مدل کلیدی است:
- Phi-3.5-mini-instruct: نسخه بهینهشده با پشتیبانی چندزبانه بهبودیافته.
- Phi-3.5-MoE-instruct: مدلی مبتنی بر معماری Mixture-of-Experts با ۱۶ کارشناس و ۶.۶ میلیارد پارامتر فعال.
- Phi-3.5-Vision-instruct: مدلی چندوجهی برای پردازش متن و تصویر[9].
- Phi-4 (۱۴ میلیارد پارامتر): مدلی تخصصی در استدلال ریاضی پیچیده. این مدل عملکردی مقایسهپذیر با Gemini-1.5-Flash و GPT-4o-mini را با اندازهای به مراتب کوچکتر نشان میدهد. Phi-4-reasoning از DeepSeek-R1-Distill-Llama-70B پیشی میگیرد[10].
- Phi-4-Multimodal (۵.۶ میلیارد پارامتر): اولین مدل کاملاً چندوجهی این خانواده که قادر است بهطور همزمان متن، تصویر و صدا را پردازش کند. این مدل از رویکرد نوآورانه Mixture-of-LoRAs برای پردازش کارآمد وجههای مختلف بدون تداخل متقابل استفاده میکند[11].
معماری و ویژگیهای فنی
- معماری: مدلهای Phi از معماری استاندارد transformer نوع «فقط رمزگشا» (decoder-only) با بهینهسازیهای کلیدی مانند Grouped Query Attention و Flash Attention برای افزایش کارایی استفاده میکنند[12].
- استقرار محلی: مدلها برای کار روی دستگاههای با منابع محدود بهینهسازی شدهاند. برای مثال، Phi-3-mini تنها به ۱.۸ گیگابایت حافظه در کوانتیزاسیون ۴ بیتی نیاز دارد و میتواند روی iPhone 14 اجرا شود[13].
- پشتیبانی از framework ها: مدلهای Phi از طریق Microsoft Azure AI Model Catalog، Hugging Face، Ollama و NVIDIA NIM microservices در دسترس هستند که یکپارچگی گسترده و دسترسپذیری آنها را برای توسعهدهندگان تضمین میکند[14].
عملکرد و benchmark ها
| مدل | پارامترها | MMLU | MT-Bench | HumanEval |
|---|---|---|---|---|
| Phi-3-mini | 3.8B | 69% | 8.38 | - |
| Phi-3-small | 7B | 75% | 8.7 | - |
| Phi-3-medium | 14B | 78% | 8.9 | - |
| Phi-4 | 14B | - | - | از GPT-4 پیشی میگیرد |
Phi-4 نتایج استثنایی در مسائل ریاضی، از جمله American Mathematics Competitions (AMC)، نشان میدهد و عملکردی مقایسهپذیر با Gemini-1.5-Flash دارد[15]. مدل چندوجهی Phi-3.5-Vision از رقبای هماندازه خود پیشی میگیرد و به ۵۷.۰٪ در benchmark BLINK دست مییابد[16].
کاربردهای تخصصی
مدلهای Phi کارایی بالایی در حوزههای تخصصی نشان میدهند:
- پزشکی: پژوهشها همبستگی متوسطی بین پاسخهای Phi-3 و ارزیابیهای متخصصان در متون پزشکی و ورزشی نشان میدهند[17].
- تشخیص گفتار نفرتانگیز: مدل HateTinyLLM مبتنی بر Phi-2 با استفاده از LoRA fine-tuning به دقتی بیش از ۸۰٪ در این وظیفه دست مییابد[18].
- استراتژیهای بازی: مدل SC-Phi2 تواناییهایی را در پیشبینی استراتژیها در بازی StarCraft II نشان داد[19].
هوش مصنوعی مسئولانه و ایمنی
خانواده Phi بر اساس استانداردهای Microsoft Responsible AI توسعه یافته که شامل اصول پاسخگویی، شفافیت، انصاف و ایمنی است. مدلها ارزیابی ایمنی چندوجهی را طی میکنند، از جمله Supervised Fine-Tuning (SFT) و Direct Preference Optimization (DPO)، و همچنین آزمون در زبانهای مختلف و در دستهبندیهای ریسک[20].
محدودیتها
علیرغم نتایج چشمگیر، مدلهای Phi ممکن است در برخی وظایف پیچیده نسبت به مدلهای بزرگ تخصصی عملکرد ضعیفتری داشته باشند. برای مثال، Phi-4 نتایج خوبی در استدلال از نوع chain-of-thought نشان میدهد، اما به دلیل فقدان قابلیت فراخوانی تابع (function calling) محدود است[21]. علاوه بر این، اگرچه Phi-3.5 از بیش از ۲۰ زبان پشتیبانی میکند، عملکرد آن میتواند متفاوت باشد و پژوهشها نشان میدهند که در پاسخ به زبانهایی غیر از انگلیسی ممکن است نادقیق باشد[22].
منابع
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
- Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
- Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
- Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
- Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
- Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
- Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.
یادداشتها
- ↑ «The Phi-3 small language models with big potential». Microsoft Source Features. [۱]
- ↑ «Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models». Landing.Jobs Blog. [۲]
- ↑ «Textbooks Are All You Need». Microsoft Research. [۳]
- ↑ «Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning». Microsoft Tech Community. [۴]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [۵]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [۶]
- ↑ «Новая ИИ-модель Phi-2 от Microsoft училась по учебникам». TechInsider. [۷]
- ↑ «Phi-3 Technical Report». arXiv. [۸]
- ↑ «Discover the new multi-lingual, high-quality Phi-3.5 SLMs». Microsoft Tech Community. [۹]
- ↑ «Phi-4 Technical Report». arXiv. [۱۰]
- ↑ «Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models». arXiv. [۱۱]
- ↑ «Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs)». DataCamp. [۱۲]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [۱۳]
- ↑ «Microsoft Phi». Microsoft Azure. [۱۴]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [۱۵]
- ↑ «Phi-3.5-vision-instruct». Hugging Face. [۱۶]
- ↑ «Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications». arXiv. [۱۷]
- ↑ «HateTinyLLMs: A Small Language Model for Hate Speech Detection». arXiv. [۱۸]
- ↑ «SC-Phi2: A Specialized Small Language Model for StarCraft II». MDPI. [۱۹]
- ↑ «Microsoft’s Phi-3.5: a responsible, small language model». Skymod. [۲۰]
- ↑ «Phi-4: A New Era of Small Language Models». Meta-quantum.today. [۲۱]
- ↑ «A Multi-faceted Analysis of Language-specific Bias in Large Language Models». U.S. Securities and Exchange Commission. [۲۲]