Phi (Microsoft) (NL)
Phi — dit is een familie van kleine taalmodellen (Small Language Models, SLM), ontwikkeld door Microsoft Research. Deze modellen vertegenwoordigen een paradigmaverschuiving in de ontwikkeling van AI en tonen aan dat compacte en rekenkundig efficiënte modellen prestaties kunnen bereiken die vergelijkbaar zijn met veel grotere systemen. In tegenstelling tot de traditionele aanpak die gebaseerd is op het opschalen van het aantal parameters, richt de filosofie van Phi zich op de kwaliteit van trainingsdata en innovatieve trainingsmethoden[1].
De Phi-modellen zijn geoptimaliseerd voor taken die diepgaand logisch redeneren vereisen, zoals programmeren, wiskunde en tekstanalyse. Dankzij hun geringe omvang zijn ze ideaal geschikt voor implementatie op lokale apparaten (on-device AI), waaronder smartphones en laptops, wat nieuwe mogelijkheden opent voor de democratisering van AI[2].
Filosofie: «Textbooks Are All You Need» - «Leerboeken zijn alles wat je nodig hebt»
De centrale hypothese die aan het Phi-project ten grondslag ligt, is dat voor het trainen van een hoogpresterend model de kwaliteit van de data belangrijker is dan de hoeveelheid ervan. Dit idee werd voor het eerst geformuleerd in het onderzoeksartikel «Textbooks Are All You Need»[3]. In plaats van te trainen op biljoenen tokens uit ongefilterd webmateriaal, worden de Phi-modellen getraind op een zorgvuldig geselecteerde en synthetisch gegenereerde dataset die qua kwaliteit op een leerboek lijkt.
De kernprincipes van deze aanpak zijn:
- Data van «leerboekskwaliteit»: Het trainingskorpus bestaat uit helder, logisch samenhangend en verklarend materiaal, geïnspireerd op kinderboeken.
- Synthetische data: Een aanzienlijk deel van de data wordt gegenereerd met behulp van grote modellen (zoals GPT-4). Voor de training van Phi-4 werden bijvoorbeeld 400 miljard tokens aan hoogwaardige synthetische inhoud aangemaakt via meer dan 50 aangepaste pipelines[4][5].
- Iteratief trainen: Het proces van dataverzameling en modeltraining verloopt iteratief, waardoor zowel de kwaliteit van de data als die van het model voortdurend verbeterd kan worden.
Deze aanpak stelt de Phi-modellen in staat om diepgaande redeneervaardigheden te ontwikkelen in plaats van louter statistische patronen te memoriseren.
Evolutie van de Phi-modellen
- Phi-1 (1,3 miljard parameters): Het eerste model, gepresenteerd in juni 2023, was gericht op programmeren in Python. Het toonde uitstekende prestaties op de benchmarks HumanEval en MBPP en bewees daarmee de effectiviteit van de op kwalitatieve data gebaseerde aanpak[6].
- Phi-2 (2,7 miljard parameters): Uitgebracht in december 2023 breidde Phi-2 zijn mogelijkheden uit naar algemeen taalbegrip, met behoud van de compacte architectuur. Dit model toonde aan dat SLM prestaties kunnen bereiken die vergelijkbaar zijn met modellen die tientallen keren groter zijn[7].
- Phi-3 (3,8 - 14 miljard parameters): De familie die in april 2024 werd gepresenteerd, vormde een doorbraak op het gebied van mobiele AI. Phi-3-mini (3,8 miljard) kan op smartphones draaien en bereikt prestaties die vergelijkbaar zijn met Mixtral 8x7B en GPT-3.5[8]. De familie omvat ook de varianten Phi-3-small (7 miljard) en Phi-3-medium (14 miljard).
- Phi-3.5 (3,8 - 6,6 miljard actieve parameters): Aangekondigd in 2024 omvat deze familie drie belangrijke modellen:
- Phi-3.5-mini-instruct: Een geoptimaliseerde versie met verbeterde meertalige ondersteuning.
- Phi-3.5-MoE-instruct: Een model gebaseerd op de Mixture-of-Experts-architectuur met 16 experts en 6,6 miljard actieve parameters.
- Phi-3.5-Vision-instruct: Een multimodaal model voor de verwerking van tekst en afbeeldingen[9].
- Phi-4 (14 miljard parameters): Een model dat gespecialiseerd is in complexe wiskundige redeneringen. Het toont prestaties die vergelijkbaar zijn met Gemini-1.5-Flash en GPT-4o-mini, bij een aanzienlijk kleinere omvang. Phi-4-reasoning overtreft DeepSeek-R1-Distill-Llama-70B[10].
- Phi-4-Multimodal (5,6 miljard parameters): Het eerste volledig multimodale model van de familie, dat tekst, afbeeldingen en audio tegelijkertijd kan verwerken. Het maakt gebruik van de innovatieve Mixture-of-LoRAs-aanpak voor een efficiënte verwerking van verschillende modaliteiten zonder onderlinge interferentie[11].
Architectuur en technische kenmerken
- Architectuur: De Phi-modellen maken gebruik van een standaard decoder-only transformer-architectuur met belangrijke optimalisaties zoals Grouped Query Attention en Flash Attention voor een verhoogde efficiëntie[12].
- Lokale implementatie: De modellen zijn geoptimaliseerd voor gebruik op apparaten met beperkte middelen. Phi-3-mini vereist bijvoorbeeld slechts 1,8 GB geheugen bij 4-bit kwantisatie en kan op een iPhone 14 draaien[13].
- Ondersteuning van frameworks: De Phi-modellen zijn beschikbaar via de Microsoft Azure AI Model Catalog, Hugging Face, Ollama en NVIDIA NIM microservices, wat zorgt voor een brede integratie en toegankelijkheid voor ontwikkelaars[14].
Prestaties en benchmarks
| Model | Parameters | MMLU | MT-Bench | HumanEval |
|---|---|---|---|---|
| Phi-3-mini | 3.8B | 69% | 8.38 | - |
| Phi-3-small | 7B | 75% | 8.7 | - |
| Phi-3-medium | 14B | 78% | 8.9 | - |
| Phi-4 | 14B | - | - | Overtreft GPT-4 |
Phi-4 toont uitzonderlijke resultaten bij wiskundige taken, waaronder de American Mathematics Competitions (AMC), met prestaties die vergelijkbaar zijn met Gemini-1.5-Flash[15]. Het multimodale Phi-3.5-Vision overtreft concurrenten van vergelijkbare omvang en bereikt 57,0% op de BLINK-benchmark[16].
Gespecialiseerde toepassingen
De Phi-modellen tonen een hoge effectiviteit in niche-gebieden:
- Geneeskunde: Onderzoek toont een matige correlatie aan tussen de antwoorden van Phi-3 en de beoordelingen van deskundigen in medische en sportteksten[17].
- Detectie van haatzaaiende uitlatingen: Het model HateTinyLLM, gebaseerd op Phi-2, bereikt meer dan 80% nauwkeurigheid bij deze taak met behulp van LoRA fine-tuning[18].
- Spelstrategieën: Het model SC-Phi2 toonde mogelijkheden bij het voorspellen van strategieën in het spel StarCraft II[19].
Verantwoordelijke AI en veiligheid
De Phi-familie is ontwikkeld in overeenstemming met de normen van Microsoft Responsible AI, die principes omvatten van verantwoordingsplicht, transparantie, eerlijkheid en veiligheid. De modellen ondergaan een meervoudige veiligheidsbeoordeling, waaronder Supervised Fine-Tuning (SFT) en Direct Preference Optimization (DPO), evenals tests in verschillende talen en risicocategorieën[20].
Beperkingen
Ondanks de indrukwekkende resultaten kunnen de Phi-modellen achterblijven bij gespecialiseerde grote modellen voor bepaalde complexe taken. Phi-4 toont bijvoorbeeld goede resultaten bij chain-of-thought-redeneren, maar is beperkt door het ontbreken van de mogelijkheid tot het aanroepen van functies (function calling)[21]. Bovendien, hoewel Phi-3.5 meer dan 20 talen ondersteunt, kunnen de prestaties variëren en toont onderzoek onnauwkeurigheden in antwoorden in andere talen dan het Engels[22].
Literatuur
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
- Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
- Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
- Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
- Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
- Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
- Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.
Noten
- ↑ «The Phi-3 small language models with big potential». Microsoft Source Features. [1]
- ↑ «Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models». Landing.Jobs Blog. [2]
- ↑ «Textbooks Are All You Need». Microsoft Research. [3]
- ↑ «Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning». Microsoft Tech Community. [4]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [5]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [6]
- ↑ «Новая ИИ-модель Phi-2 от Microsoft училась по учебникам». TechInsider. [7]
- ↑ «Phi-3 Technical Report». arXiv. [8]
- ↑ «Discover the new multi-lingual, high-quality Phi-3.5 SLMs». Microsoft Tech Community. [9]
- ↑ «Phi-4 Technical Report». arXiv. [10]
- ↑ «Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models». arXiv. [11]
- ↑ «Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs)». DataCamp. [12]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [13]
- ↑ «Microsoft Phi». Microsoft Azure. [14]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [15]
- ↑ «Phi-3.5-vision-instruct». Hugging Face. [16]
- ↑ «Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications». arXiv. [17]
- ↑ «HateTinyLLMs: A Small Language Model for Hate Speech Detection». arXiv. [18]
- ↑ «SC-Phi2: A Specialized Small Language Model for StarCraft II». MDPI. [19]
- ↑ «Microsoft’s Phi-3.5: a responsible, small language model». Skymod. [20]
- ↑ «Phi-4: A New Era of Small Language Models». Meta-quantum.today. [21]
- ↑ «A Multi-faceted Analysis of Language-specific Bias in Large Language Models». U.S. Securities and Exchange Commission. [22]