Mistral AI (VI)
Mistral AI — công ty Pháp chuyên về trí tuệ nhân tạo, chuyên phát triển các mô hình ngôn ngữ lớn (LLM). Được thành lập vào tháng 4 năm 2023, công ty nhanh chóng trở thành một trong những tên tuổi chủ chốt trên thị trường châu Âu và thế giới, định vị mình là sự thay thế cho các mô hình độc quyền của các tập đoàn công nghệ Mỹ.
Đặc điểm nổi bật trong cách tiếp cận của Mistral AI là tập trung vào việc tạo ra các mô hình hiệu suất cao với trọng số mở (chủ yếu theo giấy phép Apache 2.0), góp phần dân chủ hóa khả năng tiếp cận các công nghệ AI tiên tiến. Công ty nổi tiếng với các đổi mới kiến trúc như Grouped-Query Attention (GQA), Sliding Window Attention (SWA) và Sparse Mixture-of-Experts (MoE), cho phép các mô hình của họ đạt hiệu quả cao với kích thước tương đối nhỏ và chi phí tính toán thấp.
Lịch sử
Công ty Mistral AI được thành lập tại Paris vào tháng 4 năm 2023 bởi ba nhà nghiên cứu người Pháp: Arthur Mensch, Guillaume Lample và Timothée Lacroix. Cả ba nhà sáng lập trước đây đều từng nghiên cứu về các mô hình ngôn ngữ lớn tại các công ty hàng đầu thế giới: Mensch là nhà nghiên cứu tại Google DeepMind, còn Lample và Lacroix làm việc về LLM tại Meta AI.
Sứ mệnh của công ty là làm cho các thành tựu AI tiên tiến trở nên khả dụng với tất cả mọi người, thúc đẩy tính cởi mở, hợp tác và minh bạch. Cách tiếp cận này đã giúp Mistral AI nhanh chóng thu hút nguồn đầu tư đáng kể:
- Tháng 6/2023: €105 triệu trong vòng seed, lập kỷ lục tại châu Âu.
- Tháng 12/2023: €385 triệu trong vòng Series A, sau đó định giá công ty vượt $2 tỷ, đạt danh hiệu "kỳ lân".
- Tháng 2/2024: Công bố quan hệ đối tác chiến lược với Microsoft, bao gồm khoản đầu tư $16 triệu và triển khai các mô hình Mistral trên đám mây Azure.
- Tháng 6/2024: Vòng tài trợ mới trị giá €600 triệu, đưa định giá công ty lên ~€5,8 tỷ, biến nó thành một trong những startup AI đắt giá nhất thế giới.
Đặc điểm kỹ thuật của kiến trúc
Các mô hình Mistral AI dựa trên kiến trúc transformer, nhưng bổ sung một số đổi mới quan trọng nhằm nâng cao hiệu quả và giảm chi phí tính toán.
Transformer với cải tiến (Mistral 7B)
Mô hình đầu tiên của công ty, Mistral 7B, giới thiệu hai cải tiến kiến trúc quan trọng:
- Sliding Window Attention (SWA) (Cơ chế chú ý cửa sổ trượt): Thay vì mỗi token tương tác với tất cả các token trước đó (có độ phức tạp bậc hai), SWA giới hạn sự chú ý trong một cửa sổ cố định (ví dụ: 4096 token). Điều này cho phép xử lý các chuỗi rất dài (lên đến 32.000 token trở lên) với độ phức tạp tính toán tuyến tính, tăng tốc đáng kể quá trình xử lý.
- Grouped-Query Attention (GQA) (Cơ chế chú ý theo nhóm truy vấn): Tối ưu hóa cơ chế multi-head attention tiêu chuẩn. GQA sử dụng ít "đầu" hơn cho các khóa (keys) và giá trị (values) so với các truy vấn (queries) (ví dụ: tỷ lệ 8:1), giúp giảm đáng kể yêu cầu bộ nhớ và tăng tốc quá trình sinh văn bản (inference) mà không làm giảm đáng kể chất lượng.
Sparse Mixture-of-Experts (MoE)
Trong các mô hình thuộc dòng Mixtral (ví dụ: Mixtral 8x7B, Mixtral 8x22B), kiến trúc Sparse Mixture-of-Experts (hỗn hợp chuyên gia thưa) được áp dụng. Thay vì một lớp mạng nơ-ron dày đặc duy nhất, nhiều mạng con "chuyên gia" song song được sử dụng. Với mỗi token đầu vào, một lớp gating đặc biệt (bộ định tuyến) động lựa chọn một tập hợp nhỏ các chuyên gia để kích hoạt (thường là 2 trong số 8).
Điều này cho phép tạo ra các mô hình với tổng số tham số khổng lồ (Mixtral 8x22B có 141 tỷ), nhưng khi xử lý mỗi token chỉ có một phần nhỏ trong số đó được sử dụng (~39 tỷ). Kết quả là mô hình đạt chất lượng tương đương với các mô hình "dày đặc" lớn hơn nhiều, nhưng với tốc độ và chi phí inference như các mô hình nhỏ hơn đáng kể.
Kiến trúc Mamba (SSM)
Năm 2024, Mistral AI giới thiệu mô hình thử nghiệm Codestral Mamba, dựa trên kiến trúc Mamba (Selective State-Space Model). Khác với transformer, Mamba sử dụng cơ chế hồi quy dựa trên các mô hình không gian trạng thái. Các ưu điểm chính:
- Độ phức tạp tuyến tính theo độ dài chuỗi, khiến nó cực kỳ nhanh trên các ngữ cảnh dài.
- Ngữ cảnh lý thuyết "vô hạn", chỉ bị giới hạn bởi bộ nhớ khả dụng.
- Tốc độ inference cao so với các transformer tương đương.
Lịch sử phát hành và các mô hình
| Tháng / Năm | Mô hình | Tham số (tỷ) | Đặc điểm chính | Giấy phép |
|---|---|---|---|---|
| 09 / 2023 | Mistral 7B | 7,3 | Kiến trúc GQA + SWA; ngữ cảnh 32k; vượt trội hơn Llama 2 13B trên tất cả các benchmark. | Apache 2.0 |
| 12 / 2023 | Mixtral 8x7B | 46,7 (12,9 kích hoạt) | Mô hình MoE mã nguồn mở đầu tiên; chất lượng tương đương GPT-3.5. | Apache 2.0 |
| 02 / 2024 | Mistral Small / Large | ? | Mô hình "nhỏ hơn" và flagship, có sẵn qua API. | Small: Apache 2.0, Large: Research |
| 04 / 2024 | Mixtral 8x22B | 141 (39 kích hoạt) | Ngữ cảnh 64k; chất lượng SOTA trong các mô hình open-source tại thời điểm ra mắt. | Apache 2.0 |
| 05 / 2024 | Codestral 22B | 22 | Mô hình chuyên biệt cho việc sinh mã (80+ ngôn ngữ lập trình). | Non-Production |
| 07 / 2024 | Mathstral 7B / Nemo 12B | 7 / 12 | Các mô hình chuyên biệt cho toán học và đa ngôn ngữ. | Apache 2.0 |
| 07 / 2024 | Codestral Mamba 7.3B | 7,3 | Mô hình thử nghiệm cho mã trên kiến trúc Mamba; ngữ cảnh 256k+. | Apache 2.0 |
| 09 / 2024 | Pixtral 12B | 12 | Mô hình đa phương thức mã nguồn mở đầu tiên (văn bản + hình ảnh). | Apache 2.0 |
| 11 / 2024 | Mistral Large 24.11 | ~100+ (ước tính) | Mô hình flagship được cập nhật với khả năng reasoning được cải thiện. | Research |
| 01 / 2025 | Mistral Small 3 | 24 | Được tối ưu hóa cho độ trễ thấp (lên đến 150 token/s); chất lượng tương đương mô hình 70B. | Apache 2.0 |
| 05 / 2025 | Mistral Medium 3 | ? | Mô hình đa phương thức frontier (văn bản, hình ảnh) với ngữ cảnh 128k. | Độc quyền |
| 05 / 2025 | Devstral 24B | 24 | Mô hình "tác nhân" cho phát triển phần mềm tự động; 46,8% trên SWE-Bench. | Apache 2.0 |
So sánh với đối thủ cạnh tranh
- vs. Llama (Meta): Các mô hình Mistral liên tục vượt trội hơn các mô hình Llama có kích thước tương đương hoặc thậm chí lớn hơn. Mistral 7B vượt trội hơn Llama 2 13B, còn Mixtral 8x7B vượt trội hơn Llama 2 70B. Điểm khác biệt chính là giấy phép: Mistral sử dụng Apache 2.0 hoàn toàn cho phép, trong khi giấy phép Llama có các hạn chế.
- vs. GPT (OpenAI): Các mô hình flagship của OpenAI (GPT-4) vẫn là dẫn đầu trong các tác vụ phức tạp nhất, tuy nhiên các mô hình mã nguồn mở của Mistral (ví dụ: Mixtral 8x7B) thể hiện chất lượng tương đương GPT-3.5. Mistral cung cấp giải pháp thay thế mã nguồn mở, cho phép triển khai mô hình cục bộ và kiểm soát hoàn toàn.
- vs. Claude (Anthropic): Các mô hình Claude nổi tiếng với cửa sổ ngữ cảnh lớn và định hướng an toàn. Mistral đề xuất các mô hình mã nguồn mở với ngữ cảnh tương đương hoặc lớn hơn. Về hiệu suất trên các benchmark tiêu chuẩn (LMSys Arena), mô hình Medium 3 đã vượt qua Claude 3 Opus.
Ứng dụng và hệ sinh thái
Sản phẩm
- Le Chat: Trợ lý chat công khai (web, iOS/Android), thể hiện khả năng của các mô hình Mistral, bao gồm tìm kiếm web và sinh hình ảnh.
- La Plateforme: Nền tảng doanh nghiệp với quyền truy cập API vào tất cả các mô hình Mistral, cho phép các công ty tích hợp LLM vào sản phẩm của họ.
Khách hàng doanh nghiệp
Công nghệ Mistral được sử dụng bởi các công ty lớn như BNP Paribas (tài chính), CMA CGM (logistics), Zalando (thương mại điện tử) và cơ quan nhà nước France Travail. Đối với khách hàng châu Âu, khả năng triển khai mô hình cục bộ để tuân thủ GDPR là điều quan trọng.
Cộng đồng Open-Source
Nhờ giấy phép mã nguồn mở, các mô hình Mistral đã trở thành nền tảng cho hàng nghìn dự án trên các nền tảng như Hugging Face. Cộng đồng tích cực fine-tuning các mô hình cho các tác vụ chuyên biệt, tạo ra các phiên bản cho sinh học (BioMistral), luật pháp (SaulLM-7B) và bản địa hóa sang các ngôn ngữ khác nhau (ví dụ: Polish Bielik 7B).
Cấp phép
| Dòng mô hình | Giấy phép | Hạn chế |
|---|---|---|
| Cơ bản, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0 | Sử dụng thương mại tự do. |
| Codestral 22B | Non-Production License | Sử dụng thương mại bị cấm khi không có thỏa thuận riêng. |
| Dòng Large, dòng Medium | Mistral Research / Độc quyền | Chỉ có thể truy cập qua API đám mây. |
Liên kết
- Tài liệu chính thức của Mistral AI
- Hồ sơ Mistral AI trên Hugging Face
Tài liệu tham khảo
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.