Phi (Microsoft) (PL)
Phi — to rodzina małych modeli językowych (Small Language Models, SLM), opracowana przez Microsoft Research. Modele te stanowią paradygmatyczną zmianę w dziedzinie tworzenia AI i pokazują, że kompaktowe oraz obliczeniowo wydajne modele mogą osiągać wydajność porównywalną z znacznie większymi systemami. W odróżnieniu od tradycyjnego podejścia opartego na skalowaniu liczby parametrów, filozofia Phi koncentruje się na jakości danych treningowych i innowacyjnych metodach trenowania[1].
Modele Phi są zoptymalizowane pod kątem zadań wymagających głębokiego rozumowania logicznego, takich jak programowanie, matematyka i analiza tekstu. Dzięki swojemu niewielkiemu rozmiarowi idealnie nadają się do wdrażania na lokalnych urządzeniach (on-device AI), w tym smartfonach i laptopach, co otwiera nowe możliwości demokratyzacji AI[2].
Filozofia: „Podręczniki to wszystko, czego potrzebujesz"
Centralna hipoteza leżąca u podstaw projektu Phi głosi, że dla wytrenowania wysokowydajnego modelu ważniejsza jest jakość danych niż ich ilość. Idea ta została po raz pierwszy sformułowana w pracy badawczej „Textbooks Are All You Need»[3]. Zamiast trenować się na bilionach tokenów z niefiltrowanego internetu, modele Phi uczą się na starannie wyselekcjonowanym i syntetycznie wygenerowanym datasecie, który jakością przypomina podręcznik.
Kluczowe zasady tego podejścia:
- Dane „jakości podręcznika": Korpus treningowy składa się z czystego, logicznie spójnego i wyjaśniającego materiału, inspirowanego książkami dla dzieci.
- Dane syntetyczne: Znaczna część danych jest generowana przy użyciu dużych modeli (np. GPT-4). Przykładowo, do trenowania Phi-4 stworzono 400 miliardów tokenów wysokiej jakości treści syntetycznych za pośrednictwem ponad 50 dedykowanych pipeline'ów[4][5].
- Iteracyjne trenowanie: Proces tworzenia danych i trenowania modelu przebiega iteracyjnie, co pozwala na ciągłe doskonalenie zarówno jakości danych, jak i samego modelu.
Podejście to pozwala modelom Phi rozwijać głębokie zdolności rozumowania, a nie jedynie zapamiętywać wzorce statystyczne.
Ewolucja modeli Phi
- Phi-1 (1,3 mld parametrów): Pierwszy model, zaprezentowany w czerwcu 2023 roku, był skoncentrowany na programowaniu w języku Python. Zademonstrował doskonałą wydajność na benchmarkach HumanEval i MBPP, udowadniając skuteczność podejścia opartego na wysokiej jakości danych[6].
- Phi-2 (2,7 mld parametrów): Wydany w grudniu 2023 roku, Phi-2 rozszerzył swoje możliwości na ogólne rozumienie języka, zachowując kompaktową architekturę. Model ten pokazał, że SLM mogą osiągać wydajność porównywalną z modelami kilkadziesiąt razy większymi[7].
- Phi-3 (3,8 – 14 mld parametrów): Rodzina zaprezentowana w kwietniu 2024 roku stała się przełomem w dziedzinie mobilnego AI. Phi-3-mini (3,8 mld) jest w stanie działać na smartfonach, osiągając wydajność porównywalną z Mixtral 8x7B i GPT-3.5[8]. Rodzina obejmuje również wersje Phi-3-small (7 mld) i Phi-3-medium (14 mld).
- Phi-3.5 (3,8 – 6,6 mld aktywnych parametrów): Ogłoszona w 2024 roku, rodzina ta obejmuje trzy kluczowe modele:
- Phi-3.5-mini-instruct: Zoptymalizowana wersja z ulepszoną obsługą wielu języków.
- Phi-3.5-MoE-instruct: Model oparty na architekturze Mixture-of-Experts z 16 ekspertami i 6,6 mld aktywnych parametrów.
- Phi-3.5-Vision-instruct: Multimodalny model do przetwarzania tekstu i obrazów[9].
- Phi-4 (14 mld parametrów): Model wyspecjalizowany w złożonym rozumowaniu matematycznym. Demonstruje wydajność porównywalną z Gemini-1.5-Flash i GPT-4o-mini przy znacznie mniejszym rozmiarze. Phi-4-reasoning przewyższa DeepSeek-R1-Distill-Llama-70B[10].
- Phi-4-Multimodal (5,6 mld parametrów): Pierwszy w pełni multimodalny model rodziny, zdolny do jednoczesnego przetwarzania tekstu, obrazów i dźwięku. Wykorzystuje innowacyjne podejście Mixture-of-LoRAs do wydajnego przetwarzania różnych modalności bez wzajemnych zakłóceń[11].
Architektura i cechy techniczne
- Architektura: Modele Phi używają standardowej architektury transformera typu „tylko dekoder" (decoder-only) z kluczowymi optymalizacjami, takimi jak Grouped Query Attention i Flash Attention, zwiększającymi wydajność[12].
- Lokalne wdrożenie: Modele są zoptymalizowane do działania na urządzeniach o ograniczonych zasobach. Przykładowo, Phi-3-mini wymaga zaledwie 1,8 GB pamięci przy 4-bitowej kwantyzacji i może działać na iPhone 14[13].
- Wsparcie dla frameworków: Modele Phi są dostępne przez Microsoft Azure AI Model Catalog, Hugging Face, Ollama i NVIDIA NIM microservices, co zapewnia ich szeroką integrację i dostępność dla programistów[14].
Wydajność i benchmarki
| Model | Parametry | MMLU | MT-Bench | HumanEval |
|---|---|---|---|---|
| Phi-3-mini | 3.8B | 69% | 8.38 | - |
| Phi-3-small | 7B | 75% | 8.7 | - |
| Phi-3-medium | 14B | 78% | 8.9 | - |
| Phi-4 | 14B | - | - | Przewyższa GPT-4 |
Phi-4 demonstruje wyjątkowe wyniki w zadaniach matematycznych, w tym w American Mathematics Competitions (AMC), osiągając wydajność porównywalną z Gemini-1.5-Flash[15]. Multimodalny Phi-3.5-Vision przewyższa konkurentów podobnego rozmiaru, osiągając 57,0% na benchmarku BLINK[16].
Zastosowania specjalistyczne
Modele Phi wykazują wysoką skuteczność w niszowych dziedzinach:
- Medycyna: Badania wykazują umiarkowaną korelację odpowiedzi Phi-3 z ocenami ekspertów w tekstach medycznych i sportowych[17].
- Wykrywanie mowy nienawiści: Model HateTinyLLM oparty na Phi-2 osiąga ponad 80% dokładności w tym zadaniu z zastosowaniem LoRA fine-tuning[18].
- Strategie w grach: Model SC-Phi2 wykazał możliwości w przewidywaniu strategii w grze StarCraft II[19].
Odpowiedzialny AI i bezpieczeństwo
Rodzina Phi została opracowana zgodnie ze standardami Microsoft Responsible AI, które obejmują zasady odpowiedzialności, przejrzystości, sprawiedliwości i bezpieczeństwa. Modele przechodzą wieloaspektową ocenę bezpieczeństwa, w tym Supervised Fine-Tuning (SFT) i Direct Preference Optimization (DPO), a także testy w różnych językach i kategoriach ryzyka[20].
Ograniczenia
Pomimo imponujących wyników, modele Phi mogą ustępować wyspecjalizowanym dużym modelom w niektórych złożonych zadaniach. Przykładowo, Phi-4 osiąga dobre wyniki w rozumowaniu typu chain-of-thought, ale jest ograniczony brakiem możliwości wywoływania funkcji (function calling)[21]. Ponadto, choć Phi-3.5 obsługuje ponad 20 języków, jego wydajność może się różnić, a badania wskazują na nieścisłości w odpowiedziach w językach innych niż angielski[22].
Literatura
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
- Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
- Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
- Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
- Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
- Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
- Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.
Przypisy
- ↑ «The Phi-3 small language models with big potential». Microsoft Source Features. [1]
- ↑ «Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models». Landing.Jobs Blog. [2]
- ↑ «Textbooks Are All You Need». Microsoft Research. [3]
- ↑ «Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning». Microsoft Tech Community. [4]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [5]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [6]
- ↑ «Новая ИИ-модель Phi-2 от Microsoft училась по учебникам». TechInsider. [7]
- ↑ «Phi-3 Technical Report». arXiv. [8]
- ↑ «Discover the new multi-lingual, high-quality Phi-3.5 SLMs». Microsoft Tech Community. [9]
- ↑ «Phi-4 Technical Report». arXiv. [10]
- ↑ «Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models». arXiv. [11]
- ↑ «Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs)». DataCamp. [12]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [13]
- ↑ «Microsoft Phi». Microsoft Azure. [14]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [15]
- ↑ «Phi-3.5-vision-instruct». Hugging Face. [16]
- ↑ «Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications». arXiv. [17]
- ↑ «HateTinyLLMs: A Small Language Model for Hate Speech Detection». arXiv. [18]
- ↑ «SC-Phi2: A Specialized Small Language Model for StarCraft II». MDPI. [19]
- ↑ «Microsoft’s Phi-3.5: a responsible, small language model». Skymod. [20]
- ↑ «Phi-4: A New Era of Small Language Models». Meta-quantum.today. [21]
- ↑ «A Multi-faceted Analysis of Language-specific Bias in Large Language Models». U.S. Securities and Exchange Commission. [22]