Mistral AI (TL)
Mistral AI — isang kumpanyang Pranses sa larangan ng artipisyal na katalinuhan, na espesyalista sa pagbuo ng malalaking modelo ng wika (LLM). Itinatag noong Abril 2023, ang kumpanya ay mabilis na naging isa sa mga pangunahing kalahok sa European at pandaigdigang merkado, na nagpoposisyon sa sarili bilang alternatibo sa mga proprietary na modelo mula sa malalaking teknolohikal na kumpanya ng Amerika.
Ang pangunahing katangian ng diskarte ng Mistral AI ay ang pagtuon sa paglikha ng mga high-performance na modelo na may bukas na mga timbang (open weights) (pangunahin sa ilalim ng lisensiyang Apache 2.0), na nagtataguyod ng demokratisasyon ng access sa mga makabagong teknolohiya ng AI. Ang kumpanya ay kilala sa mga arkitekturang inobasyon nito, tulad ng Grouped-Query Attention (GQA), Sliding Window Attention (SWA) at Sparse Mixture-of-Experts (MoE), na nagbibigay-daan sa kanilang mga modelo na makamit ang mataas na kahusayan sa medyo maliit na sukat at computational na gastos.
Kasaysayan
Ang kumpanyang Mistral AI ay itinatag sa Paris noong Abril 2023 ng tatlong Pranses na mananaliksik: Arthur Mensch, Guillaume Lample at Timothée Lacroix. Ang lahat ng tatlong tagapagtatag ay dati nang nagtrabaho sa malalaking modelo ng wika sa mga nangungunang kumpanya sa mundo: si Mensch ay mananaliksik sa Google DeepMind, habang sina Lample at Lacroix ay nagtrabaho sa LLM sa Meta AI.
Ang misyon ng kumpanya — gawing accessible para sa lahat ang mga pinakabagong tagumpay ng AI, na nagtataguyod ng pagiging bukas, pakikipagtulungan at transparency. Ang diskarteng ito ay nagbigay-daan sa Mistral AI na mabilis na makaakit ng malaking investisyon:
- Hunyo 2023: €105 milyon sa seed round, na naging rekord para sa Europa.
- Disyembre 2023: €385 milyon sa Series A round, matapos na lumagpas sa $2 bilyon ang pagpapahalaga sa kumpanya, at natanggap nito ang katayuang "unicorn".
- Pebrero 2024: Inanunsyo ang strategic na pakikipagsosyo sa Microsoft, na kinasama ang investisyong $16 milyon at paglalagay ng mga modelo ng Mistral sa Azure cloud.
- Hunyo 2024: Bagong round ng pagpopondo na €600 milyon, kung saan ang pagpapahalaga sa kumpanya ay umabot sa ~€5.8 bilyon, na ginawa itong isa sa pinaka-mahahalagang AI startup sa mundo.
Mga Teknikal na Katangian ng Arkitektura
Ang mga modelo ng Mistral AI ay nakabatay sa arkitektura ng transformer, ngunit nagsasama ng ilang pangunahing inobasyon na naglalayong mapataas ang kahusayan at mabawasan ang mga computational na gastos.
Transformer na may mga pagpapabuti (Mistral 7B)
Ang unang modelo ng kumpanya, Mistral 7B, ay nagpresenta ng dalawang mahalagang pagpapabuti ng arkitektura:
- Sliding Window Attention (SWA) (Atensyon na may gumagalaw na bintana): Sa halip na ang bawat token ay makipag-ugnayan sa lahat ng nakaraang token (na may quadratic na kumplikasyon), inililimita ng SWA ang atensyon sa isang nakatakdang bintana (hal., 4096 na token). Nagbibigay-daan ito sa pagproseso ng napakahabang mga pagkakasunod-sunod (hanggang 32,000 token at higit pa) na may linear na computational na kumplikasyon, na lubos na nagpapabilis ng pagpoproseso.
- Grouped-Query Attention (GQA) (Nakapangkat na atensyon sa mga query): Isang optimisasyon ng karaniwang mekanismo ng multi-head attention. Gumagamit ang GQA ng mas kaunting "ulo" para sa mga susi (keys) at halaga (values) kaysa sa mga query (queries) (hal., sa ratio na 8:1), na lubos na nagpapababa ng mga kinakailangan sa memorya at nagpapabilis ng proseso ng paggawa (inference) nang walang malaking pagkawala ng kalidad.
Sparse Mixture-of-Experts (MoE)
Sa mga modelo ng serye ng Mixtral (hal., Mixtral 8x7B, Mixtral 8x22B) ay ginagamit ang arkitekturang Sparse Mixture-of-Experts (manipis na halo ng mga eksperto). Sa halip na isang makapal na layer ng neural network, gumagamit ng ilang parallel na "expert" na subnetwork. Para sa bawat input na token, isang espesyal na gating layer (router) ang dinamikong pumipili ng maliit na subset ng mga eksperto para sa activation (karaniwang 2 mula sa 8).
Nagbibigay-daan ito na lumikha ng mga modelo na may napakalaking kabuuang bilang ng mga parameter (ang Mixtral 8x22B ay may 141 bilyon), ngunit sa pagpoproseso ng bawat token, isang maliit na bahagi lamang ang ginagamit (~39 bilyon). Bilang resulta, ang modelo ay nakakamit ng kalidad na maihahambing sa mas malaking "makapal" na mga modelo, ngunit sa bilis at gastos ng inference na katulad ng mga modelo ng mas maliit na sukat.
Arkitektura ng Mamba (SSM)
Noong 2024, nagpresenta ang Mistral AI ng eksperimental na modelo na Codestral Mamba, na nakabatay sa arkitekturang Mamba (Selective State-Space Model). Hindi tulad ng mga transformer, gumagamit ang Mamba ng recursive na mekanismo na nakabatay sa mga modelo ng espasyo ng estado. Mga pangunahing bentahe:
- Linear na kumplikasyon ayon sa haba ng pagkakasunod-sunod, na ginagawa itong napakabilis sa mahabang mga konteksto.
- Teoryang "walang hanggan" na konteksto, na limitado lamang ng available na memorya.
- Mataas na bilis ng inference kumpara sa mga katumbas na transformer.
Kronolohiya at mga Modelo
| Buwan / Taon | Modelo | Mga Parameter (bilyon) | Mga Pangunahing Katangian | Lisensya |
|---|---|---|---|---|
| 09 / 2023 | Mistral 7B | 7.3 | Arkitektura ng GQA + SWA; konteksto 32k; nangunguna sa Llama 2 13B sa lahat ng benchmark. | Apache 2.0 |
| 12 / 2023 | Mixtral 8x7B | 46.7 (12.9 aktibo) | Unang bukas na MoE modelo; kalidad sa antas ng GPT-3.5. | Apache 2.0 |
| 02 / 2024 | Mistral Small / Large | ? | Modelo na "junior" at flagship, available sa pamamagitan ng API. | Small: Apache 2.0, Large: Research |
| 04 / 2024 | Mixtral 8x22B | 141 (39 aktibo) | Konteksto 64k; kalidad na SOTA sa mga open-source na modelo sa oras ng paglalabas. | Apache 2.0 |
| 05 / 2024 | Codestral 22B | 22 | Espesyalisadong modelo para sa pagbuo ng code (80+ wika). | Non-Production |
| 07 / 2024 | Mathstral 7B / Nemo 12B | 7 / 12 | Espesyalisadong mga modelo para sa matematika at multilingual. | Apache 2.0 |
| 07 / 2024 | Codestral Mamba 7.3B | 7.3 | Eksperimental na modelo para sa code sa arkitektura ng Mamba; konteksto 256k+. | Apache 2.0 |
| 09 / 2024 | Pixtral 12B | 12 | Unang bukas na multimodal na modelo (teksto + mga larawan). | Apache 2.0 |
| 11 / 2024 | Mistral Large 24.11 | ~100+ (tinatayang halaga) | Na-update na flagship na modelo na may pinahusay na reasoning. | Research |
| 01 / 2025 | Mistral Small 3 | 24 | Na-optimize para sa mababang latency (hanggang 150 token/s); kalidad sa antas ng mga 70B na modelo. | Apache 2.0 |
| 05 / 2025 | Mistral Medium 3 | ? | Frontier na multimodal na modelo (teksto, mga larawan) na may konteksto 128k. | Proprietary |
| 05 / 2025 | Devstral 24B | 24 | Modelo na "agentic" para sa autonomous na pagbuo ng software; 46.8% sa SWE-Bench. | Apache 2.0 |
Paghahambing sa mga Kakumpitensya
- vs. Llama (Meta): Ang mga modelo ng Mistral ay patuloy na nangunguna sa mga modelo ng Llama na may katulad o maging mas malaking sukat. Nalampasan ng Mistral 7B ang Llama 2 13B, at ng Mixtral 8x7B ang Llama 2 70B. Ang pangunahing pagkakaiba — ang lisensya: gumagamit ang Mistral ng ganap na permissive na Apache 2.0, habang ang lisensya ng Llama ay may mga paghihigpit.
- vs. GPT (OpenAI): Ang mga flagship na modelo ng OpenAI (GPT-4) ay nananatiling mga lider sa pinakamahirap na mga gawain, ngunit ang mga bukas na modelo ng Mistral (hal., Mixtral 8x7B) ay nagpapakita ng kalidad na maihahambing sa GPT-3.5. Nagbibigay ang Mistral ng bukas na alternatibo, na nagbibigay-daan sa pag-deploy ng mga modelo nang lokal at ganap na kontrolin ang mga ito.
- vs. Claude (Anthropic): Ang mga modelo ng Claude ay kilala sa malaking context window at oryentasyon sa kaligtasan. Nag-alok ang Mistral ng mga bukas na modelo na may maihahambing o mas malaking konteksto. Sa pagganap sa mga karaniwang benchmark (LMSys Arena), nalampasan ng modelo na Medium 3 ang Claude 3 Opus.
Paggamit at Ekosistema
Mga Produkto
- Le Chat: Pampublikong chat assistant (web, iOS/Android), na nagpapakita ng mga kakayahan ng mga modelo ng Mistral, kabilang ang web search at pagbuo ng larawan.
- La Plateforme: Plataporma para sa mga korporasyon na may access sa pamamagitan ng API sa lahat ng modelo ng Mistral, na nagbibigay-daan sa mga kumpanya na isama ang LLM sa kanilang mga produkto.
Mga Korporasyong Kliyente
Ginagamit ang mga teknolohiya ng Mistral ng malalaking kumpanya tulad ng BNP Paribas (pananalapi), CMA CGM (logistika), Zalando (e-commerce) at ng ahensyang pang-gobyerno ng France Travail. Para sa mga European na kliyente, mahalaga ang posibilidad ng lokal na pag-deploy ng mga modelo para sa pagsunod sa GDPR.
Open-Source na Komunidad
Sa pamamagitan ng bukas na lisensya, ang mga modelo ng Mistral ay naging pundasyon para sa libu-libong proyekto sa mga platform tulad ng Hugging Face. Aktibo ang komunidad sa fine-tuning ng mga modelo para sa paglutas ng mga espesyalisadong gawain, na lumilikha ng mga bersyon para sa biolohiya (BioMistral), batas (SaulLM-7B) at lokalisasyon sa iba't ibang wika (hal., Polish Bielik 7B).
Paglilisensya
| Serye ng Modelo | Lisensya | Mga Paghihigpit |
|---|---|---|
| Mga pangunahing modelo, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0 | Libreng komersyal na paggamit. |
| Codestral 22B | Non-Production License | Ang komersyal na paggamit ay ipinagbabawal nang walang hiwalay na kasunduan. |
| Serye ng Large, Serye ng Medium | Mistral Research / Proprietary | Access sa pamamagitan lamang ng cloud API. |
Mga Sanggunian
- Opisyal na dokumentasyon ng Mistral AI
- Profile ng Mistral AI sa Hugging Face
Panitikan
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.