Phi (Microsoft) (VI)
Phi — đây là một họ mô hình ngôn ngữ nhỏ (Small Language Models, SLM) do Microsoft Research phát triển. Các mô hình này đại diện cho một sự thay đổi mô hình trong phát triển AI và cho thấy rằng các mô hình nhỏ gọn, hiệu quả về mặt tính toán có thể đạt được hiệu suất tương đương với các hệ thống lớn hơn nhiều. Khác với cách tiếp cận truyền thống dựa trên việc mở rộng số lượng tham số, triết lý của Phi tập trung vào chất lượng dữ liệu huấn luyện và các phương pháp huấn luyện sáng tạo[1].
Các mô hình Phi được tối ưu hóa cho các tác vụ đòi hỏi khả năng suy luận logic sâu, chẳng hạn như lập trình, toán học và phân tích văn bản. Nhờ kích thước nhỏ gọn, chúng lý tưởng để triển khai trên các thiết bị cục bộ (on-device AI), bao gồm điện thoại thông minh và máy tính xách tay, mở ra những cơ hội mới cho việc dân chủ hóa AI[2].
Triết lý: «Sách giáo khoa là tất cả những gì bạn cần»
Giả thuyết trung tâm làm nền tảng cho dự án Phi là: để huấn luyện một mô hình hiệu suất cao, chất lượng dữ liệu quan trọng hơn khối lượng dữ liệu. Ý tưởng này được phát biểu lần đầu trong công trình nghiên cứu «Textbooks Are All You Need»[3]. Thay vì huấn luyện trên hàng nghìn tỷ token từ web chưa được lọc, các mô hình Phi được huấn luyện trên một dataset được tuyển chọn kỹ lưỡng và được tạo ra tổng hợp, có chất lượng gợi nhớ đến sách giáo khoa.
Các nguyên tắc chính của cách tiếp cận này:
- Dữ liệu «chất lượng sách giáo khoa»: Kho ngữ liệu huấn luyện bao gồm tài liệu sạch, mạch lạc về mặt logic và có tính giải thích, được lấy cảm hứng từ sách thiếu nhi.
- Dữ liệu tổng hợp: Một phần đáng kể dữ liệu được tạo ra bằng các mô hình lớn (ví dụ: GPT-4). Chẳng hạn, để huấn luyện Phi-4, 400 tỷ token nội dung tổng hợp chất lượng cao đã được tạo ra thông qua hơn 50 pipeline tùy chỉnh[4][5].
- Huấn luyện lặp lại: Quá trình tạo dữ liệu và huấn luyện mô hình diễn ra theo vòng lặp, cho phép liên tục cải thiện chất lượng cả dữ liệu lẫn bản thân mô hình.
Cách tiếp cận này cho phép các mô hình Phi phát triển khả năng suy luận sâu, thay vì chỉ đơn thuần ghi nhớ các mẫu thống kê.
Quá trình phát triển của các mô hình Phi
- Phi-1 (1,3 tỷ tham số): Mô hình đầu tiên, ra mắt vào tháng 6 năm 2023, tập trung vào lập trình bằng ngôn ngữ Python. Nó thể hiện hiệu suất vượt trội trên các benchmark HumanEval và MBPP, chứng minh hiệu quả của cách tiếp cận dựa trên dữ liệu chất lượng cao[6].
- Phi-2 (2,7 tỷ tham số): Ra mắt vào tháng 12 năm 2023, Phi-2 mở rộng khả năng sang lĩnh vực hiểu ngôn ngữ tổng quát, trong khi vẫn giữ kiến trúc nhỏ gọn. Mô hình này cho thấy rằng SLM có thể đạt hiệu suất tương đương với các mô hình lớn hơn hàng chục lần[7].
- Phi-3 (3,8 - 14 tỷ tham số): Họ mô hình ra mắt vào tháng 4 năm 2024 đã trở thành bước đột phá trong lĩnh vực AI trên thiết bị di động. Phi-3-mini (3,8 tỷ) có thể chạy trên điện thoại thông minh, đạt hiệu suất tương đương với Mixtral 8x7B và GPT-3.5[8]. Họ mô hình còn bao gồm các phiên bản Phi-3-small (7 tỷ) và Phi-3-medium (14 tỷ).
- Phi-3.5 (3,8 - 6,6 tỷ tham số hoạt động): Được công bố vào năm 2024, họ mô hình này bao gồm ba mô hình chính:
- Phi-3.5-mini-instruct: Phiên bản được tối ưu hóa với hỗ trợ đa ngôn ngữ được cải thiện.
- Phi-3.5-MoE-instruct: Mô hình dựa trên kiến trúc Mixture-of-Experts với 16 chuyên gia và 6,6 tỷ tham số hoạt động.
- Phi-3.5-Vision-instruct: Mô hình đa phương thức để xử lý văn bản và hình ảnh[9].
- Phi-4 (14 tỷ tham số): Mô hình chuyên biệt cho suy luận toán học phức tạp. Nó thể hiện hiệu suất tương đương với Gemini-1.5-Flash và GPT-4o-mini, với kích thước nhỏ hơn đáng kể. Phi-4-reasoning vượt trội hơn DeepSeek-R1-Distill-Llama-70B[10].
- Phi-4-Multimodal (5,6 tỷ tham số): Mô hình đa phương thức hoàn toàn đầu tiên trong họ, có khả năng xử lý đồng thời văn bản, hình ảnh và âm thanh. Nó sử dụng cách tiếp cận sáng tạo Mixture-of-LoRAs để xử lý hiệu quả các phương thức khác nhau mà không gây nhiễu lẫn nhau[11].
Kiến trúc và đặc điểm kỹ thuật
- Kiến trúc: Các mô hình Phi sử dụng kiến trúc transformer tiêu chuẩn kiểu «chỉ bộ giải mã» (decoder-only) với các tối ưu hóa chính như Grouped Query Attention và Flash Attention để tăng hiệu quả[12].
- Triển khai cục bộ: Các mô hình được tối ưu hóa để hoạt động trên các thiết bị có tài nguyên hạn chế. Ví dụ, Phi-3-mini chỉ cần 1,8 GB bộ nhớ với lượng tử hóa 4-bit và có thể chạy trên iPhone 14[13].
- Hỗ trợ framework: Các mô hình Phi có thể truy cập qua Microsoft Azure AI Model Catalog, Hugging Face, Ollama và NVIDIA NIM microservices, đảm bảo khả năng tích hợp rộng rãi và tính sẵn có cho các nhà phát triển[14].
Hiệu suất và benchmark
| Mô hình | Tham số | MMLU | MT-Bench | HumanEval |
|---|---|---|---|---|
| Phi-3-mini | 3.8B | 69% | 8.38 | - |
| Phi-3-small | 7B | 75% | 8.7 | - |
| Phi-3-medium | 14B | 78% | 8.9 | - |
| Phi-4 | 14B | - | - | Vượt trội hơn GPT-4 |
Phi-4 thể hiện kết quả xuất sắc trong các bài toán toán học, bao gồm American Mathematics Competitions (AMC), cho thấy hiệu suất tương đương với Gemini-1.5-Flash[15]. Mô hình đa phương thức Phi-3.5-Vision vượt trội hơn các đối thủ cùng kích thước, đạt 57,0% trên benchmark BLINK[16].
Các ứng dụng chuyên biệt
Các mô hình Phi thể hiện hiệu quả cao trong các lĩnh vực chuyên biệt:
- Y tế: Các nghiên cứu cho thấy mức tương quan vừa phải giữa câu trả lời của Phi-3 và đánh giá của các chuyên gia trong các văn bản y tế và thể thao[17].
- Phát hiện phát ngôn thù ghét: Mô hình HateTinyLLM, dựa trên Phi-2, đạt độ chính xác hơn 80% trong tác vụ này khi sử dụng LoRA fine-tuning[18].
- Chiến lược trò chơi: Mô hình SC-Phi2 cho thấy khả năng dự đoán chiến lược trong trò chơi StarCraft II[19].
AI có trách nhiệm và an toàn
Họ mô hình Phi được phát triển theo các tiêu chuẩn Microsoft Responsible AI, bao gồm các nguyên tắc về trách nhiệm giải trình, minh bạch, công bằng và an toàn. Các mô hình trải qua đánh giá an toàn đa chiều, bao gồm Supervised Fine-Tuning (SFT) và Direct Preference Optimization (DPO), cũng như kiểm tra trên nhiều ngôn ngữ và trong các danh mục rủi ro khác nhau[20].
Hạn chế
Mặc dù đạt được những kết quả ấn tượng, các mô hình Phi có thể kém hơn so với các mô hình lớn chuyên biệt trong một số tác vụ phức tạp. Ví dụ, Phi-4 cho kết quả tốt trong suy luận kiểu chain-of-thought, nhưng bị hạn chế bởi việc thiếu khả năng gọi hàm (function calling)[21]. Ngoài ra, mặc dù Phi-3.5 hỗ trợ hơn 20 ngôn ngữ, hiệu suất của nó có thể thay đổi, và các nghiên cứu cho thấy sự thiếu chính xác trong các câu trả lời bằng ngôn ngữ khác ngoài tiếng Anh[22].
Tài liệu tham khảo
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
- Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
- Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
- Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
- Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
- Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
- Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
- Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.
Chú thích
- ↑ «The Phi-3 small language models with big potential». Microsoft Source Features. [1]
- ↑ «Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models». Landing.Jobs Blog. [2]
- ↑ «Textbooks Are All You Need». Microsoft Research. [3]
- ↑ «Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning». Microsoft Tech Community. [4]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [5]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [6]
- ↑ «Новая ИИ-модель Phi-2 от Microsoft училась по учебникам». TechInsider. [7]
- ↑ «Phi-3 Technical Report». arXiv. [8]
- ↑ «Discover the new multi-lingual, high-quality Phi-3.5 SLMs». Microsoft Tech Community. [9]
- ↑ «Phi-4 Technical Report». arXiv. [10]
- ↑ «Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models». arXiv. [11]
- ↑ «Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs)». DataCamp. [12]
- ↑ «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [13]
- ↑ «Microsoft Phi». Microsoft Azure. [14]
- ↑ «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [15]
- ↑ «Phi-3.5-vision-instruct». Hugging Face. [16]
- ↑ «Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications». arXiv. [17]
- ↑ «HateTinyLLMs: A Small Language Model for Hate Speech Detection». arXiv. [18]
- ↑ «SC-Phi2: A Specialized Small Language Model for StarCraft II». MDPI. [19]
- ↑ «Microsoft’s Phi-3.5: a responsible, small language model». Skymod. [20]
- ↑ «Phi-4: A New Era of Small Language Models». Meta-quantum.today. [21]
- ↑ «A Multi-faceted Analysis of Language-specific Bias in Large Language Models». U.S. Securities and Exchange Commission. [22]