Phi (Microsoft) (HI)
Phi — यह Microsoft Research द्वारा विकसित Small Language Models (SLM) का एक परिवार है। ये मॉडल AI विकास में एक प्रतिमान बदलाव का प्रतिनिधित्व करते हैं और दर्शाते हैं कि कॉम्पैक्ट एवं कम्प्यूटेशनल रूप से कुशल मॉडल भी बहुत बड़े सिस्टम के बराबर प्रदर्शन प्राप्त कर सकते हैं। परंपरागत दृष्टिकोण के विपरीत, जो पैरामीटर की संख्या बढ़ाने पर आधारित है, Phi का दर्शन प्रशिक्षण डेटा की गुणवत्ता और नवोन्मेषी प्रशिक्षण विधियों पर केंद्रित है[1]।
Phi मॉडल उन कार्यों के लिए अनुकूलित हैं जिनमें गहन तार्किक अनुमान की आवश्यकता होती है, जैसे प्रोग्रामिंग, गणित और पाठ विश्लेषण। अपने छोटे आकार के कारण, ये स्थानीय उपकरणों (on-device AI) पर तैनाती के लिए आदर्श हैं, जिनमें स्मार्टफोन और लैपटॉप शामिल हैं, जिससे AI के लोकतंत्रीकरण के नए अवसर खुलते हैं[2]।
दर्शन: «पाठ्यपुस्तकें ही सब कुछ हैं»
Phi परियोजना की मूल परिकल्पना यह है कि उच्च-प्रदर्शन वाले मॉडल को प्रशिक्षित करने के लिए डेटा की मात्रा से अधिक उसकी गुणवत्ता महत्वपूर्ण है। यह विचार सबसे पहले शोध पत्र «Textbooks Are All You Need» में प्रस्तुत किया गया था[3]। अनफ़िल्टर्ड वेब के खरबों token पर प्रशिक्षित होने के बजाय, Phi मॉडल को सावधानीपूर्वक चयनित और सिंथेटिक रूप से उत्पन्न dataset पर प्रशिक्षित किया जाता है, जो गुणवत्ता में पाठ्यपुस्तक जैसा होता है।
इस दृष्टिकोण के प्रमुख सिद्धांत:
- «पाठ्यपुस्तक गुणवत्ता» का डेटा: प्रशिक्षण कॉर्पस में स्वच्छ, तार्किक रूप से सुसंगत और व्याख्यात्मक सामग्री होती है, जो बच्चों की पुस्तकों से प्रेरित है।
- सिंथेटिक डेटा: डेटा का एक महत्वपूर्ण हिस्सा बड़े मॉडलों (जैसे GPT-4) की सहायता से उत्पन्न किया जाता है। उदाहरण के लिए, Phi-4 के प्रशिक्षण के लिए 50 से अधिक उपयोगकर्ता पाइपलाइनों के माध्यम से 400 अरब token का उच्च-गुणवत्ता वाला सिंथेटिक कंटेंट बनाया गया[4][5]।
- पुनरावृत्त प्रशिक्षण: डेटा निर्माण और मॉडल प्रशिक्षण की प्रक्रिया पुनरावृत्त रूप से होती है, जिससे डेटा और मॉडल दोनों की गुणवत्ता में निरंतर सुधार संभव होता है।
यह दृष्टिकोण Phi मॉडल को केवल सांख्यिकीय पैटर्न याद करने के बजाय गहन अनुमान क्षमताएं विकसित करने में सक्षम बनाता है।
Phi मॉडलों का विकास
- Phi-1 (1.3 अरब पैरामीटर): जून 2023 में प्रस्तुत पहला मॉडल Python प्रोग्रामिंग पर केंद्रित था। इसने HumanEval और MBPP benchmark पर बेहतरीन प्रदर्शन दिखाया और गुणवत्तापूर्ण डेटा पर आधारित दृष्टिकोण की प्रभावशीलता सिद्ध की[6]।
- Phi-2 (2.7 अरब पैरामीटर): दिसंबर 2023 में जारी Phi-2 ने अपनी क्षमताओं को सामान्य भाषा समझ तक विस्तारित किया, साथ ही कॉम्पैक्ट आर्किटेक्चर बनाए रखा। इस मॉडल ने दर्शाया कि SLM उन मॉडलों के समान प्रदर्शन प्राप्त कर सकते हैं जो दसियों गुना बड़े हैं[7]।
- Phi-3 (3.8 - 14 अरब पैरामीटर): अप्रैल 2024 में प्रस्तुत यह परिवार मोबाइल AI के क्षेत्र में एक सफलता थी। Phi-3-mini (3.8 अरब) स्मार्टफोन पर कार्य करने में सक्षम है और Mixtral 8x7B तथा GPT-3.5 के समान प्रदर्शन प्राप्त करता है[8]। इस परिवार में Phi-3-small (7 अरब) और Phi-3-medium (14 अरब) संस्करण भी शामिल हैं।
- Phi-3.5 (3.8 - 6.6 अरब सक्रिय पैरामीटर): 2024 में घोषित इस परिवार में तीन प्रमुख मॉडल शामिल हैं:
- Phi-3.5-mini-instruct: बेहतर बहुभाषी समर्थन के साथ अनुकूलित संस्करण।
- Phi-3.5-MoE-instruct: 16 विशेषज्ञों और 6.6 अरब सक्रिय पैरामीटर के साथ Mixture-of-Experts आर्किटेक्चर पर आधारित मॉडल।
- Phi-3.5-Vision-instruct: पाठ और छवियों को संसाधित करने के लिए मल्टीमॉडल मॉडल[9]।
- Phi-4 (14 अरब पैरामीटर): जटिल गणितीय अनुमान में विशेषज्ञ यह मॉडल काफी छोटे आकार पर Gemini-1.5-Flash और GPT-4o-mini के समान प्रदर्शन दर्शाता है। Phi-4-reasoning DeepSeek-R1-Distill-Llama-70B से बेहतर प्रदर्शन करता है[10]।
- Phi-4-Multimodal (5.6 अरब पैरामीटर): परिवार का पहला पूरी तरह मल्टीमॉडल मॉडल, जो एक साथ पाठ, छवि और ऑडियो को संसाधित करने में सक्षम है। यह बिना परस्पर हस्तक्षेप के विभिन्न modalities की कुशल प्रोसेसिंग के लिए नवोन्मेषी Mixture-of-LoRAs दृष्टिकोण का उपयोग करता है[11]।
आर्किटेक्चर और तकनीकी विशेषताएं
- आर्किटेक्चर: Phi मॉडल मानक decoder-only transformer आर्किटेक्चर का उपयोग करते हैं, जिसमें दक्षता बढ़ाने के लिए Grouped Query Attention और Flash Attention जैसे प्रमुख अनुकूलन शामिल हैं[12]।
- स्थानीय तैनाती: मॉडल सीमित संसाधनों वाले उपकरणों पर कार्य के लिए अनुकूलित हैं। उदाहरण के लिए, Phi-3-mini को 4-बिट quantization पर केवल 1.8 GB मेमोरी की आवश्यकता होती है और यह iPhone 14 पर चल सकता है[13]।
- फ्रेमवर्क समर्थन: Phi मॉडल Microsoft Azure AI Model Catalog, Hugging Face, Ollama और NVIDIA NIM microservices के माध्यम से उपलब्ध हैं, जिससे डेवलपर्स के लिए उनका व्यापक एकीकरण और पहुंच सुनिश्चित होती है[14]।
प्रदर्शन और benchmark
| मॉडल | पैरामीटर | MMLU | MT-Bench | HumanEval |
|---|---|---|---|---|
| Phi-3-mini | 3.8B | 69% | 8.38 | - |
| Phi-3-small | 7B | 75% | 8.7 | - |
| Phi-3-medium | 14B | 78% | 8.9 | - |
| Phi-4 | 14B | - | - | GPT-4 से बेहतर |
Phi-4 गणितीय कार्यों में असाधारण परिणाम दर्शाता है, जिसमें American Mathematics Competitions (AMC) शामिल हैं, और Gemini-1.5-Flash के समान प्रदर्शन दिखाता है[15]। मल्टीमॉडल Phi-3.5-Vision समान आकार के प्रतिस्पर्धियों से बेहतर है और BLINK benchmark पर 57.0% प्राप्त करता है[16]।
विशेष अनुप्रयोग
Phi मॉडल विशिष्ट क्षेत्रों में उच्च दक्षता प्रदर्शित करते हैं:
- चिकित्सा: शोध दर्शाते हैं कि चिकित्सा और खेल संबंधी पाठों में Phi-3 के उत्तरों और विशेषज्ञ मूल्यांकनों के बीच मध्यम सहसंबंध है[17]।
- घृणास्पद भाषण की पहचान: Phi-2 पर आधारित HateTinyLLM मॉडल, LoRA fine-tuning के उपयोग से इस कार्य में 80% से अधिक सटीकता प्राप्त करता है[18]।
- गेम रणनीतियां: SC-Phi2 मॉडल ने StarCraft II खेल में रणनीतियों की भविष्यवाणी में क्षमता दिखाई है[19]।
जिम्मेदार AI और सुरक्षा
Phi परिवार को Microsoft Responsible AI के मानकों के अनुसार विकसित किया गया है, जिसमें जवाबदेही, पारदर्शिता, निष्पक्षता और सुरक्षा के सिद्धांत शामिल हैं। मॉडल बहुआयामी सुरक्षा मूल्यांकन से गुजरते हैं, जिसमें Supervised Fine-Tuning (SFT) और Direct Preference Optimization (DPO), तथा विभिन्न भाषाओं और जोखिम श्रेणियों में परीक्षण शामिल हैं[20]।
सीमाएं
प्रभावशाली परिणामों के बावजूद, Phi मॉडल कुछ जटिल कार्यों में विशेषज्ञ बड़े मॉडलों से पीछे रह सकते हैं। उदाहरण के लिए, Phi-4 chain-of-thought अनुमान में अच्छे परिणाम दिखाता है, लेकिन function calling की अनुपस्थिति में सीमित है[21]। इसके अतिरिक्त, हालांकि Phi-3.5 20 से अधिक भाषाओं का समर्थन करता है, इसका प्रदर्शन भिन्न हो सकता है, और शोध अंग्रेजी के अलावा अन्य भाषाओं में उत्तरों में अशुद्धियां दर्शाते हैं[22]।
साहित्य
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
- Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
- Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
- Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
- Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
- Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
- Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.
टिप्पणियां
- ↑ «The Phi-3 small language models with big potential». Microsoft Source Features. [१]
- ↑ «Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models». Landing.Jobs Blog. [२]
- ↑ «Textbooks Are All You Need». Microsoft Research. [३]
- ↑ «Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning». Microsoft Tech Community. [४]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [५]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [६]
- ↑ «Новая ИИ-модель Phi-2 от Microsoft училась по учебникам». TechInsider. [७]
- ↑ «Phi-3 Technical Report». arXiv. [८]
- ↑ «Discover the new multi-lingual, high-quality Phi-3.5 SLMs». Microsoft Tech Community. [९]
- ↑ «Phi-4 Technical Report». arXiv. [१०]
- ↑ «Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models». arXiv. [११]
- ↑ «Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs)». DataCamp. [१२]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [१३]
- ↑ «Microsoft Phi». Microsoft Azure. [१४]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [१५]
- ↑ «Phi-3.5-vision-instruct». Hugging Face. [१६]
- ↑ «Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications». arXiv. [१७]
- ↑ «HateTinyLLMs: A Small Language Model for Hate Speech Detection». arXiv. [१८]
- ↑ «SC-Phi2: A Specialized Small Language Model for StarCraft II». MDPI. [१९]
- ↑ «Microsoft’s Phi-3.5: a responsible, small language model». Skymod. [२०]
- ↑ «Phi-4: A New Era of Small Language Models». Meta-quantum.today. [२१]
- ↑ «A Multi-faceted Analysis of Language-specific Bias in Large Language Models». U.S. Securities and Exchange Commission. [२२]