Phi (Microsoft) (CS)
Phi — je rodina malých jazykových modelů (Small Language Models, SLM) vyvinutá společností Microsoft Research. Tyto modely představují paradigmatický posun ve vývoji AI a ukazují, že kompaktní a výpočetně efektivní modely mohou dosahovat výkonu srovnatelného s mnohem většími systémy. Na rozdíl od tradičního přístupu založeného na škálování počtu parametrů se filozofie Phi zaměřuje na kvalitu trénovacích dat a inovativní metody trénování[1].
Modely Phi jsou optimalizovány pro úlohy vyžadující hluboké logické uvažování, jako je programování, matematika a analýza textu. Díky své malé velikosti jsou ideální pro nasazení na lokálních zařízeních (on-device AI), včetně chytrých telefonů a notebooků, což otevírá nové možnosti pro demokratizaci AI[2].
Filozofie: „Učebnice jsou vše, co potřebujete"
Ústřední hypotéza, která stojí v základu projektu Phi, spočívá v tom, že pro trénování vysoce výkonného modelu je důležitější kvalita dat než jejich objem. Tato myšlenka byla poprvé formulována ve výzkumné práci „Textbooks Are All You Need"[3]. Místo trénování na trilionech tokenů z nefiltrovaného webu jsou modely Phi trénovány na pečlivě vybraném a synteticky vygenerovaném datasetu, který svou kvalitou připomíná učebnici.
Klíčové principy tohoto přístupu:
- Data „kvality učebnice": Trénovací korpus se skládá z čistého, logicky konzistentního a vysvětlujícího materiálu inspirovaného dětskými knihami.
- Syntetická data: Značná část dat je generována pomocí velkých modelů (například GPT-4). Například pro trénování Phi-4 bylo vytvořeno 400 miliard tokenů vysoce kvalitního syntetického obsahu prostřednictvím více než 50 vlastních pipeline[4][5].
- Iterativní trénování: Proces tvorby dat a trénování modelu probíhá iterativně, což umožňuje neustálé zlepšování kvality jak dat, tak samotného modelu.
Tento přístup umožňuje modelům Phi rozvíjet hluboké schopnosti uvažování, místo aby si pouze pamatovaly statistické vzory.
Evoluce modelů Phi
- Phi-1 (1,3 mld. parametrů): První model, představený v červnu 2023, byl zaměřen na programování v jazyce Python. Prokázal vynikající výkon na benchmarcích HumanEval a MBPP, čímž doložil účinnost přístupu založeného na kvalitních datech[6].
- Phi-2 (2,7 mld. parametrů): Vydaný v prosinci 2023, Phi-2 rozšířil své možnosti na obecné porozumění jazyku při zachování kompaktní architektury. Tento model ukázal, že SLM mohou dosahovat výkonu srovnatelného s modely, které jsou desetinásobně větší[7].
- Phi-3 (3,8 – 14 mld. parametrů): Rodina představená v dubnu 2024 se stala průlomem v oblasti mobilního AI. Phi-3-mini (3,8 mld.) je schopna fungovat na chytrých telefonech a dosahuje výkonu srovnatelného s Mixtral 8x7B a GPT-3.5[8]. Rodina zahrnuje také verze Phi-3-small (7 mld.) a Phi-3-medium (14 mld.).
- Phi-3.5 (3,8 – 6,6 mld. aktivních parametrů): Oznámená v roce 2024, tato rodina zahrnuje tři klíčové modely:
- Phi-3.5-mini-instruct: Optimalizovaná verze s vylepšenou vícejazykovou podporou.
- Phi-3.5-MoE-instruct: Model založený na architektuře Mixture-of-Experts se 16 experty a 6,6 mld. aktivními parametry.
- Phi-3.5-Vision-instruct: Multimodální model pro zpracování textu a obrázků[9].
- Phi-4 (14 mld. parametrů): Model specializovaný na složité matematické uvažování. Vykazuje výkon srovnatelný s Gemini-1.5-Flash a GPT-4o-mini při výrazně menší velikosti. Phi-4-reasoning překonává DeepSeek-R1-Distill-Llama-70B[10].
- Phi-4-Multimodal (5,6 mld. parametrů): První plně multimodální model rodiny, schopný současně zpracovávat text, obrázky a zvuk. Využívá inovativní přístup Mixture-of-LoRAs pro efektivní zpracování různých modalit bez vzájemného rušení[11].
Architektura a technické vlastnosti
- Architektura: Modely Phi využívají standardní architekturu transformeru typu „pouze dekodér" (decoder-only) s klíčovými optimalizacemi, jako jsou Grouped Query Attention a Flash Attention pro zvýšení efektivity[12].
- Lokální nasazení: Modely jsou optimalizovány pro provoz na zařízeních s omezenými prostředky. Například Phi-3-mini vyžaduje pouhých 1,8 GB paměti při 4-bitové kvantizaci a může fungovat na iPhone 14[13].
- Podpora frameworků: Modely Phi jsou dostupné prostřednictvím Microsoft Azure AI Model Catalog, Hugging Face, Ollama a NVIDIA NIM microservices, což zajišťuje jejich širokou integraci a dostupnost pro vývojáře[14].
Výkon a benchmarky
| Model | Parametry | MMLU | MT-Bench | HumanEval |
|---|---|---|---|---|
| Phi-3-mini | 3.8B | 69% | 8.38 | - |
| Phi-3-small | 7B | 75% | 8.7 | - |
| Phi-3-medium | 14B | 78% | 8.9 | - |
| Phi-4 | 14B | - | - | Překonává GPT-4 |
Phi-4 vykazuje výjimečné výsledky v matematických úlohách, včetně American Mathematics Competitions (AMC), a dosahuje výkonu srovnatelného s Gemini-1.5-Flash[15]. Multimodální Phi-3.5-Vision překonává konkurenty podobné velikosti a dosahuje 57,0 % na benchmarku BLINK[16].
Specializovaná využití
Modely Phi vykazují vysokou účinnost v nišových oblastech:
- Medicína: Výzkumy ukazují mírnou korelaci odpovědí Phi-3 s hodnoceními odborníků v lékařských a sportovních textech[17].
- Detekce nenávistných projevů: Model HateTinyLLM založený na Phi-2 dosahuje více než 80% přesnosti v této úloze s využitím LoRA fine-tuning[18].
- Herní strategie: Model SC-Phi2 prokázal schopnosti v předpovídání strategií ve hře StarCraft II[19].
Zodpovědné AI a bezpečnost
Rodina Phi je vyvíjena v souladu se standardy Microsoft Responsible AI, které zahrnují principy odpovědnosti, transparentnosti, spravedlnosti a bezpečnosti. Modely procházejí mnohostranným hodnocením bezpečnosti, včetně Supervised Fine-Tuning (SFT) a Direct Preference Optimization (DPO), jakož i testováním v různých jazycích a kategoriích rizik[20].
Omezení
Přes působivé výsledky mohou modely Phi zaostávat za specializovanými velkými modely v některých složitých úlohách. Například Phi-4 vykazuje dobré výsledky v uvažování typu chain-of-thought, ale je omezen absencí možnosti volání funkcí (function calling)[21]. Kromě toho, ačkoli Phi-3.5 podporuje více než 20 jazyků, jeho výkon se může lišit a výzkumy poukazují na nepřesnosti v odpovědích v jiných jazycích než angličtině[22].
Literatura
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
- Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
- Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
- Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
- Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
- Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
- Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.
Poznámky
- ↑ «The Phi-3 small language models with big potential». Microsoft Source Features. [1]
- ↑ «Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models». Landing.Jobs Blog. [2]
- ↑ «Textbooks Are All You Need». Microsoft Research. [3]
- ↑ «Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning». Microsoft Tech Community. [4]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [5]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [6]
- ↑ «Новая ИИ-модель Phi-2 от Microsoft училась по учебникам». TechInsider. [7]
- ↑ «Phi-3 Technical Report». arXiv. [8]
- ↑ «Discover the new multi-lingual, high-quality Phi-3.5 SLMs». Microsoft Tech Community. [9]
- ↑ «Phi-4 Technical Report». arXiv. [10]
- ↑ «Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models». arXiv. [11]
- ↑ «Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs)». DataCamp. [12]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [13]
- ↑ «Microsoft Phi». Microsoft Azure. [14]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [15]
- ↑ «Phi-3.5-vision-instruct». Hugging Face. [16]
- ↑ «Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications». arXiv. [17]
- ↑ «HateTinyLLMs: A Small Language Model for Hate Speech Detection». arXiv. [18]
- ↑ «SC-Phi2: A Specialized Small Language Model for StarCraft II». MDPI. [19]
- ↑ «Microsoft’s Phi-3.5: a responsible, small language model». Skymod. [20]
- ↑ «Phi-4: A New Era of Small Language Models». Meta-quantum.today. [21]
- ↑ «A Multi-faceted Analysis of Language-specific Bias in Large Language Models». U.S. Securities and Exchange Commission. [22]