Phi (Microsoft) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Phi — خانواده‌ای از مدل‌های زبانی کوچک (Small Language Models, SLM) است که توسط Microsoft Research توسعه یافته است. این مدل‌ها نمایانگر یک تحول پارادایمی در توسعه هوش مصنوعی هستند و نشان می‌دهند که مدل‌های فشرده و از نظر محاسباتی کارآمد می‌توانند به عملکردی قابل مقایسه با سیستم‌های بسیار بزرگ‌تر دست یابند. برخلاف رویکرد سنتی مبتنی بر افزایش تعداد پارامترها، فلسفه Phi بر کیفیت داده‌های آموزشی و روش‌های نوآورانه آموزش تمرکز دارد[1].

مدل‌های Phi برای وظایفی که نیازمند استدلال عمیق هستند، مانند برنامه‌نویسی، ریاضیات و تحلیل متن، بهینه‌سازی شده‌اند. به لطف اندازه کوچک خود، برای استقرار روی دستگاه‌های محلی (on-device AI)، از جمله گوشی‌های هوشمند و لپ‌تاپ‌ها، ایده‌آل هستند و این امر افق‌های جدیدی را برای دموکراتیزه‌کردن هوش مصنوعی می‌گشاید[2].

فلسفه: «کتاب‌های درسی تمام چیزی هستند که نیاز دارید»

فرضیه مرکزی که زیربنای پروژه Phi است، این است که برای آموزش یک مدل پُرکارایی، کیفیت داده‌ها مهم‌تر از حجم آن‌هاست. این ایده برای اولین بار در مقاله پژوهشی «Textbooks Are All You Need» مطرح شد[3]. به جای آموزش روی تریلیون‌ها token از وب فیلترنشده، مدل‌های Phi روی یک dataset به‌دقت گزینش‌شده و به‌صورت مصنوعی تولیدشده آموزش می‌بینند که از نظر کیفیت به یک کتاب درسی شباهت دارد.

اصول کلیدی این رویکرد:

  • داده‌های «با کیفیت کتاب درسی»: پیکره آموزشی از مواد پاک، منطقی‌پیوسته و توضیحی تشکیل شده که از کتاب‌های کودکان الهام گرفته است.
  • داده‌های مصنوعی: بخش قابل توجهی از داده‌ها با استفاده از مدل‌های بزرگ (مانند GPT-4) تولید می‌شود. برای مثال، برای آموزش Phi-4 بیش از ۴۰۰ میلیارد token محتوای مصنوعی باکیفیت از طریق بیش از ۵۰ خط لوله سفارشی ایجاد شد[4][5].
  • آموزش تکراری: فرآیند تولید داده و آموزش مدل به‌صورت تکراری انجام می‌شود که امکان بهبود مستمر کیفیت هم داده‌ها و هم خود مدل را فراهم می‌آورد.

این رویکرد به مدل‌های Phi اجازه می‌دهد تا قابلیت‌های عمیق استدلال را پرورش دهند، نه اینکه صرفاً الگوهای آماری را حفظ کنند.

تکامل مدل‌های Phi

  • Phi-1 (۱.۳ میلیارد پارامتر): اولین مدل که در ژوئن ۲۰۲۳ معرفی شد، بر برنامه‌نویسی به زبان Python متمرکز بود. این مدل عملکرد برتری را در benchmark های HumanEval و MBPP به نمایش گذاشت و اثربخشی رویکرد مبتنی بر داده‌های باکیفیت را اثبات کرد[6].
  • Phi-2 (۲.۷ میلیارد پارامتر): که در دسامبر ۲۰۲۳ منتشر شد، Phi-2 قابلیت‌های خود را به درک عمومی زبان گسترش داد و در عین حال معماری فشرده را حفظ کرد. این مدل نشان داد که SLM ها می‌توانند به عملکردی مقایسه‌پذیر با مدل‌هایی که ده‌ها برابر بزرگ‌تر هستند دست یابند[7].
  • Phi-3 (۳.۸ تا ۱۴ میلیارد پارامتر): خانواده‌ای که در آوریل ۲۰۲۴ معرفی شد، نقطه عطفی در حوزه هوش مصنوعی موبایل بود. Phi-3-mini (۳.۸ میلیارد) قادر است روی گوشی‌های هوشمند اجرا شود و به عملکردی مقایسه‌پذیر با Mixtral 8x7B و GPT-3.5 دست یابد[8]. این خانواده همچنین شامل نسخه‌های Phi-3-small (۷ میلیارد) و Phi-3-medium (۱۴ میلیارد) می‌شود.
  • Phi-3.5 (۳.۸ تا ۶.۶ میلیارد پارامتر فعال): که در سال ۲۰۲۴ معرفی شد، این خانواده شامل سه مدل کلیدی است:
    • Phi-3.5-mini-instruct: نسخه بهینه‌شده با پشتیبانی چندزبانه بهبودیافته.
    • Phi-3.5-MoE-instruct: مدلی مبتنی بر معماری Mixture-of-Experts با ۱۶ کارشناس و ۶.۶ میلیارد پارامتر فعال.
    • Phi-3.5-Vision-instruct: مدلی چندوجهی برای پردازش متن و تصویر[9].
  • Phi-4 (۱۴ میلیارد پارامتر): مدلی تخصصی در استدلال ریاضی پیچیده. این مدل عملکردی مقایسه‌پذیر با Gemini-1.5-Flash و GPT-4o-mini را با اندازه‌ای به مراتب کوچک‌تر نشان می‌دهد. Phi-4-reasoning از DeepSeek-R1-Distill-Llama-70B پیشی می‌گیرد[10].
  • Phi-4-Multimodal (۵.۶ میلیارد پارامتر): اولین مدل کاملاً چندوجهی این خانواده که قادر است به‌طور همزمان متن، تصویر و صدا را پردازش کند. این مدل از رویکرد نوآورانه Mixture-of-LoRAs برای پردازش کارآمد وجه‌های مختلف بدون تداخل متقابل استفاده می‌کند[11].

معماری و ویژگی‌های فنی

  • معماری: مدل‌های Phi از معماری استاندارد transformer نوع «فقط رمزگشا» (decoder-only) با بهینه‌سازی‌های کلیدی مانند Grouped Query Attention و Flash Attention برای افزایش کارایی استفاده می‌کنند[12].
  • استقرار محلی: مدل‌ها برای کار روی دستگاه‌های با منابع محدود بهینه‌سازی شده‌اند. برای مثال، Phi-3-mini تنها به ۱.۸ گیگابایت حافظه در کوانتیزاسیون ۴ بیتی نیاز دارد و می‌تواند روی iPhone 14 اجرا شود[13].
  • پشتیبانی از framework ها: مدل‌های Phi از طریق Microsoft Azure AI Model Catalog، Hugging Face، Ollama و NVIDIA NIM microservices در دسترس هستند که یکپارچگی گسترده و دسترس‌پذیری آن‌ها را برای توسعه‌دهندگان تضمین می‌کند[14].

عملکرد و benchmark ها

مقایسه عملکرد مدل‌های Phi در benchmark های کلیدی
مدل پارامترها MMLU MT-Bench HumanEval
Phi-3-mini 3.8B 69% 8.38 -
Phi-3-small 7B 75% 8.7 -
Phi-3-medium 14B 78% 8.9 -
Phi-4 14B - - از GPT-4 پیشی می‌گیرد

Phi-4 نتایج استثنایی در مسائل ریاضی، از جمله American Mathematics Competitions (AMC)، نشان می‌دهد و عملکردی مقایسه‌پذیر با Gemini-1.5-Flash دارد[15]. مدل چندوجهی Phi-3.5-Vision از رقبای هم‌اندازه خود پیشی می‌گیرد و به ۵۷.۰٪ در benchmark BLINK دست می‌یابد[16].

کاربردهای تخصصی

مدل‌های Phi کارایی بالایی در حوزه‌های تخصصی نشان می‌دهند:

  • پزشکی: پژوهش‌ها همبستگی متوسطی بین پاسخ‌های Phi-3 و ارزیابی‌های متخصصان در متون پزشکی و ورزشی نشان می‌دهند[17].
  • تشخیص گفتار نفرت‌انگیز: مدل HateTinyLLM مبتنی بر Phi-2 با استفاده از LoRA fine-tuning به دقتی بیش از ۸۰٪ در این وظیفه دست می‌یابد[18].
  • استراتژی‌های بازی: مدل SC-Phi2 توانایی‌هایی را در پیش‌بینی استراتژی‌ها در بازی StarCraft II نشان داد[19].

هوش مصنوعی مسئولانه و ایمنی

خانواده Phi بر اساس استانداردهای Microsoft Responsible AI توسعه یافته که شامل اصول پاسخگویی، شفافیت، انصاف و ایمنی است. مدل‌ها ارزیابی ایمنی چندوجهی را طی می‌کنند، از جمله Supervised Fine-Tuning (SFT) و Direct Preference Optimization (DPO)، و همچنین آزمون در زبان‌های مختلف و در دسته‌بندی‌های ریسک[20].

محدودیت‌ها

علی‌رغم نتایج چشمگیر، مدل‌های Phi ممکن است در برخی وظایف پیچیده نسبت به مدل‌های بزرگ تخصصی عملکرد ضعیف‌تری داشته باشند. برای مثال، Phi-4 نتایج خوبی در استدلال از نوع chain-of-thought نشان می‌دهد، اما به دلیل فقدان قابلیت فراخوانی تابع (function calling) محدود است[21]. علاوه بر این، اگرچه Phi-3.5 از بیش از ۲۰ زبان پشتیبانی می‌کند، عملکرد آن می‌تواند متفاوت باشد و پژوهش‌ها نشان می‌دهند که در پاسخ به زبان‌هایی غیر از انگلیسی ممکن است نادقیق باشد[22].

منابع

  • Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
  • Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
  • Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
  • Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
  • Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
  • Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
  • Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
  • Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.

یادداشت‌ها

  1. «The Phi-3 small language models with big potential». Microsoft Source Features. [۱]
  2. «Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models». Landing.Jobs Blog. [۲]
  3. «Textbooks Are All You Need». Microsoft Research. [۳]
  4. «Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning». Microsoft Tech Community. [۴]
  5. «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [۵]
  6. «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [۶]
  7. «Новая ИИ-модель Phi-2 от Microsoft училась по учебникам». TechInsider. [۷]
  8. «Phi-3 Technical Report». arXiv. [۸]
  9. «Discover the new multi-lingual, high-quality Phi-3.5 SLMs». Microsoft Tech Community. [۹]
  10. «Phi-4 Technical Report». arXiv. [۱۰]
  11. «Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models». arXiv. [۱۱]
  12. «Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs)». DataCamp. [۱۲]
  13. «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [۱۳]
  14. «Microsoft Phi». Microsoft Azure. [۱۴]
  15. «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [۱۵]
  16. «Phi-3.5-vision-instruct». Hugging Face. [۱۶]
  17. «Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications». arXiv. [۱۷]
  18. «HateTinyLLMs: A Small Language Model for Hate Speech Detection». arXiv. [۱۸]
  19. «SC-Phi2: A Specialized Small Language Model for StarCraft II». MDPI. [۱۹]
  20. «Microsoft’s Phi-3.5: a responsible, small language model». Skymod. [۲۰]
  21. «Phi-4: A New Era of Small Language Models». Meta-quantum.today. [۲۱]
  22. «A Multi-faceted Analysis of Language-specific Bias in Large Language Models». U.S. Securities and Exchange Commission. [۲۲]