Phi (Microsoft) (FR)
Phi est une famille de petits modèles de langage (Small Language Models, SLM) développée par Microsoft Research. Ces modèles représentent un changement de paradigme dans le développement de l'IA et démontrent que des modèles compacts et efficaces sur le plan computationnel peuvent atteindre des performances comparables à celles de systèmes beaucoup plus grands. Contrairement à l'approche traditionnelle basée sur l'augmentation du nombre de paramètres, la philosophie de Phi se concentre sur la qualité des données d'entraînement et sur des méthodes de formation innovantes[1].
Les modèles Phi sont optimisés pour des tâches nécessitant un raisonnement logique approfondi, telles que la programmation, les mathématiques et l'analyse de texte. Grâce à leur petite taille, ils sont idéalement adaptés au déploiement sur des appareils locaux (on-device AI), y compris les smartphones et les ordinateurs portables, ce qui ouvre de nouvelles possibilités pour la démocratisation de l'IA[2].
Philosophie : « Les manuels sont tout ce dont vous avez besoin »
L'hypothèse centrale du projet Phi est que la qualité des données est plus importante que leur volume pour entraîner un modèle performant. Cette idée a été formulée pour la première fois dans le document de recherche « Textbooks Are All You Need »[3]. Au lieu d'être entraînés sur des milliers de milliards de tokens provenant du web non filtré, les modèles Phi sont entraînés sur un dataset soigneusement sélectionné et généré synthétiquement, dont la qualité s'apparente à celle d'un manuel scolaire.
Les principes clés de cette approche sont :
- Données de « qualité manuelle » : Le corpus d'entraînement est composé de matériel propre, logiquement cohérent et explicatif, inspiré des livres pour enfants.
- Données synthétiques : Une part importante des données est générée à l'aide de grands modèles (par exemple, GPT-4). Par exemple, pour l'entraînement de Phi-4, 400 milliards de tokens de contenu synthétique de haute qualité ont été créés via plus de 50 pipelines personnalisés[4][5].
- Entraînement itératif : Le processus de création des données et d'entraînement du modèle est itératif, ce qui permet d'améliorer continuellement la qualité des données et du modèle lui-même.
Cette approche permet aux modèles Phi de développer des capacités de raisonnement profondes, plutôt que de simplement mémoriser des motifs statistiques.
Évolution des modèles Phi
- Phi-1 (1,3 milliard de paramètres) : Le premier modèle, présenté en juin 2023, était axé sur la programmation en Python. Il a démontré des performances supérieures sur les benchmarks HumanEval et MBPP, prouvant l'efficacité de l'approche basée sur des données de qualité[6].
- Phi-2 (2,7 milliards de paramètres) : Lancé en décembre 2023, Phi-2 a étendu ses capacités à la compréhension générale du langage, tout en conservant une architecture compacte. Ce modèle a montré que les SLM peuvent atteindre des performances comparables à celles de modèles des dizaines de fois plus grands[7].
- Phi-3 (3,8 à 14 milliards de paramètres) : Cette famille, introduite en avril 2024, a constitué une percée dans le domaine de l'IA mobile. Phi-3-mini (3,8 milliards) est capable de fonctionner sur des smartphones, atteignant des performances comparables à celles de Mixtral 8x7B et GPT-3.5[8]. La famille comprend également les versions Phi-3-small (7 milliards) et Phi-3-medium (14 milliards).
- Phi-3.5 (3,8 à 6,6 milliards de paramètres actifs) : Annoncée en 2024, cette famille comprend trois modèles clés :
- Phi-3.5-mini-instruct : Une version optimisée avec un support multilingue amélioré.
- Phi-3.5-MoE-instruct : Un modèle basé sur l'architecture Mixture-of-Experts avec 16 experts et 6,6 milliards de paramètres actifs.
- Phi-3.5-Vision-instruct : Un modèle multimodal pour le traitement du texte et des images[9].
- Phi-4 (14 milliards de paramètres) : Un modèle spécialisé dans les raisonnements mathématiques complexes. Il affiche des performances comparables à celles de Gemini-1.5-Flash et GPT-4o-mini, pour une taille nettement inférieure. Phi-4-reasoning surpasse DeepSeek-R1-Distill-Llama-70B[10].
- Phi-4-Multimodal (5,6 milliards de paramètres) : Le premier modèle entièrement multimodal de la famille, capable de traiter simultanément le texte, les images et l'audio. Il utilise une approche innovante, le Mixture-of-LoRAs, pour traiter efficacement différentes modalités sans interférence mutuelle[11].
Architecture et caractéristiques techniques
- Architecture : Les modèles Phi utilisent une architecture de transformeur standard de type « décodeur seul » (decoder-only) avec des optimisations clés telles que Grouped Query Attention et Flash Attention pour une efficacité accrue[12].
- Déploiement local : Les modèles sont optimisés pour fonctionner sur des appareils aux ressources limitées. Par exemple, Phi-3-mini ne nécessite que 1,8 Go de mémoire avec une quantification 4 bits et peut fonctionner sur un iPhone 14[13].
- Prise en charge des frameworks : Les modèles Phi sont disponibles via le Microsoft Azure AI Model Catalog, Hugging Face, Ollama et les microservices NVIDIA NIM, ce qui garantit leur large intégration et leur accessibilité pour les développeurs[14].
Performances et benchmarks
| Modèle | Paramètres | MMLU | MT-Bench | HumanEval |
|---|---|---|---|---|
| Phi-3-mini | 3,8 G | 69 % | 8,38 | - |
| Phi-3-small | 7 G | 75 % | 8,7 | - |
| Phi-3-medium | 14 G | 78 % | 8,9 | - |
| Phi-4 | 14 G | - | - | Supérieur à GPT-4 |
Phi-4 affiche des résultats exceptionnels dans les problèmes mathématiques, y compris les American Mathematics Competitions (AMC), montrant des performances comparables à celles de Gemini-1.5-Flash[15]. Le modèle multimodal Phi-3.5-Vision surpasse ses concurrents de taille similaire, atteignant 57,0 % sur le benchmark BLINK[16].
Applications spécialisées
Les modèles Phi démontrent une grande efficacité dans des domaines de niche :
- Médecine : Des études montrent une corrélation modérée entre les réponses de Phi-3 et les évaluations d'experts dans des textes médicaux et sportifs[17].
- Détection des discours de haine : Le modèle HateTinyLLM, basé sur Phi-2, atteint une précision de plus de 80 % dans cette tâche en utilisant le fine-tuning LoRA[18].
- Stratégies de jeu : Le modèle SC-Phi2 a montré des capacités à prédire des stratégies dans le jeu StarCraft II[19].
IA responsable et sécurité
La famille Phi est développée conformément aux normes de l'AI Responsable de Microsoft (Microsoft Responsible AI), qui incluent les principes de responsabilité, de transparence, d'équité et de sécurité. Les modèles sont soumis à une évaluation de sécurité multidimensionnelle, incluant le Supervised Fine-Tuning (SFT) et la Direct Preference Optimization (DPO), ainsi que des tests dans différentes langues et catégories de risques[20].
Limites
Malgré des résultats impressionnants, les modèles Phi peuvent être inférieurs aux grands modèles spécialisés dans certaines tâches complexes. Par exemple, Phi-4 obtient de bons résultats dans le raisonnement de type chain-of-thought, mais est limité par l'absence de la capacité d'appel de fonctions (function calling)[21]. De plus, bien que Phi-3.5 prenne en charge plus de 20 langues, ses performances peuvent varier, et des recherches ont montré des inexactitudes dans les réponses dans des langues autres que l'anglais[22].
Bibliographie
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
- Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
- Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
- Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
- Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
- Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
- Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.
Références
- ↑ « The Phi-3 small language models with big potential ». Microsoft Source Features. [1]
- ↑ « Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models ». Landing.Jobs Blog. [2]
- ↑ « Textbooks Are All You Need ». Microsoft Research. [3]
- ↑ « Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning ». Microsoft Tech Community. [4]
- ↑ « Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model ». OpenCV Blog. [5]
- ↑ « Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi ». LinkedIn. [6]
- ↑ « Le nouveau modèle d'IA Phi-2 de Microsoft a appris à partir de manuels ». TechInsider. [7]
- ↑ « Phi-3 Technical Report ». arXiv. [8]
- ↑ « Discover the new multi-lingual, high-quality Phi-3.5 SLMs ». Microsoft Tech Community. [9]
- ↑ « Phi-4 Technical Report ». arXiv. [10]
- ↑ « Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models ». arXiv. [11]
- ↑ « Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs) ». DataCamp. [12]
- ↑ « Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi ». LinkedIn. [13]
- ↑ « Microsoft Phi ». Microsoft Azure. [14]
- ↑ « Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model ». OpenCV Blog. [15]
- ↑ « Phi-3.5-vision-instruct ». Hugging Face. [16]
- ↑ « Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications ». arXiv. [17]
- ↑ « HateTinyLLMs: A Small Language Model for Hate Speech Detection ». arXiv. [18]
- ↑ « SC-Phi2: A Specialized Small Language Model for StarCraft II ». MDPI. [19]
- ↑ « Microsoft’s Phi-3.5: a responsible, small language model ». Skymod. [20]
- ↑ « Phi-4: A New Era of Small Language Models ». Meta-quantum.today. [21]
- ↑ « A Multi-faceted Analysis of Language-specific Bias in Large Language Models ». U.S. Securities and Exchange Commission. [22]