Mistral AI (BG)
Mistral AI — френска компания в областта на изкуствения интелект, специализирана в разработването на големи езикови модели (LLM). Основана през април 2023 г., компанията бързо се превърна в един от ключовите играчи на европейския и световния пазар, позиционирайки се като алтернатива на проприетарните модели на американските технологични гиганти.
Ключова особеност на подхода на Mistral AI е фокусът върху създаването на високопроизводителни модели с отворени тегла (предимно под лиценз Apache 2.0), което допринася за демократизирането на достъпа до съвременните AI технологии. Компанията е известна с архитектурните си иновации, като Grouped-Query Attention (GQA), Sliding Window Attention (SWA) и Sparse Mixture-of-Experts (MoE), които позволяват на моделите им да постигат висока ефективност при сравнително малък размер и изчислителни разходи.
История
Компанията Mistral AI е основана в Париж през април 2023 г. от трима френски изследователи: Артър Менш (Arthur Mensch), Гийом Ламpl (Guillaume Lample) и Тимоте Лакроа (Timothée Lacroix). И тримата основатели са работили преди това върху големи езикови модели във водещи световни компании: Менш е бил изследовател в Google DeepMind, а Лампл и Лакроа са се занимавали с LLM в Meta AI.
Мисията на компанията е да направи съвременните постижения в областта на AI достъпни за всички, като насърчава откритостта, сътрудничеството и прозрачността. Този подход позволи на Mistral AI бързо да привлече значителни инвестиции:
- Юни 2023: €105 млн в seed-рунд, което стана рекорд за Европа.
- Декември 2023: €385 млн в рунд Series A, след което оценката на компанията надхвърли $2 млрд и тя получи статут на „еднорог".
- Февруари 2024: Обявено е стратегическо партньорство с Microsoft, което включваше инвестиции в размер на $16 млн и разполагане на моделите на Mistral в облака Azure.
- Юни 2024: Нов рунд на финансиране от €600 млн, в резултат на което оценката на компанията достигна ~€5,8 млрд, което я превърна в един от най-скъпите AI стартъпи в света.
Технически особености на архитектурата
Моделите на Mistral AI са базирани на архитектурата transformer, но включват редица ключови иновации, насочени към повишаване на ефективността и намаляване на изчислителните разходи.
Transformer с подобрения (Mistral 7B)
Първият модел на компанията, Mistral 7B, представи две важни архитектурни подобрения:
- Sliding Window Attention (SWA) (Внимание с плъзгащ прозорец): Вместо всеки token да взаимодейства с всички предходни токени (което има квадратична сложност), SWA ограничава вниманието до фиксиран прозорец (например 4096 токена). Това позволява обработката на много дълги последователности (до 32 000 токена и повече) с линейна изчислителна сложност, като значително ускорява обработката.
- Grouped-Query Attention (GQA) (Групирано внимание по заявки): Оптимизация на стандартния механизъм multi-head attention. GQA използва по-малък брой „глави" за ключовете (keys) и стойностите (values), отколкото за заявките (queries) (например в съотношение 8:1), което съществено намалява изискванията към паметта и ускорява процеса на генериране (inference) без значителна загуба на качество.
Sparse Mixture-of-Experts (MoE)
В моделите от серията Mixtral (например Mixtral 8x7B, Mixtral 8x22B) се прилага архитектурата Sparse Mixture-of-Experts (разредена смес от експерти). Вместо един плътен слой на невронна мрежа се използват няколко паралелни „експертни" подмрежи. За всеки входен token специален gating-слой (маршрутизатор) динамично избира малко подмножество от експерти за активиране (обикновено 2 от 8).
Това позволява създаването на модели с огромен общ брой параметри (Mixtral 8x22B има 141 млрд), но при обработката на всеки token се използва само малка част от тях (~39 млрд). В резултат моделът постига качество, сравнимо с много по-големи „плътни" модели, но със скоростта и цената на inference на модели от значително по-малък размер.
Архитектура Mamba (SSM)
През 2024 г. Mistral AI представи експерименталния модел Codestral Mamba, базиран на архитектурата Mamba (Selective State-Space Model). За разлика от transformer моделите, Mamba използва рекурентен механизъм, основан на модели на пространството на състоянията. Ключови предимства:
- Линейна сложност по дължина на последователността, което я прави изключително бърза при дълги контексти.
- Теоретически „безкраен" контекст, ограничен само от наличната памет.
- Висока скорост на inference в сравнение с еквивалентни transformer модели.
Хронология и модели
| Месец / Година | Модел | Параметри (млрд) | Ключови особености | Лиценз |
|---|---|---|---|---|
| 09 / 2023 | Mistral 7B | 7,3 | Архитектура GQA + SWA; контекст 32k; превъзхожда Llama 2 13B по всички benchmark показатели. | Apache 2.0 |
| 12 / 2023 | Mixtral 8x7B | 46,7 (12,9 активни) | Първи отворен MoE модел; качество на ниво GPT-3.5. | Apache 2.0 |
| 02 / 2024 | Mistral Small / Large | ? | „Младши" и флагмански модели, достъпни чрез API. | Small: Apache 2.0, Large: Research |
| 04 / 2024 | Mixtral 8x22B | 141 (39 активни) | Контекст 64k; SOTA качество сред open-source моделите към момента на излизане. | Apache 2.0 |
| 05 / 2024 | Codestral 22B | 22 | Специализиран модел за генериране на код (80+ езика). | Non-Production |
| 07 / 2024 | Mathstral 7B / Nemo 12B | 7 / 12 | Специализирани модели за математика и многоезичие. | Apache 2.0 |
| 07 / 2024 | Codestral Mamba 7.3B | 7,3 | Експериментален модел за код на архитектура Mamba; контекст 256k+. | Apache 2.0 |
| 09 / 2024 | Pixtral 12B | 12 | Първи отворен мултимодален модел (текст + изображения). | Apache 2.0 |
| 11 / 2024 | Mistral Large 24.11 | ~100+ (оценка) | Обновен флагмански модел с подобрено reasoning. | Research |
| 01 / 2025 | Mistral Small 3 | 24 | Оптимизиран за ниска латентност (до 150 токена/с); качество на ниво 70B модели. | Apache 2.0 |
| 05 / 2025 | Mistral Medium 3 | ? | Frontier мултимодален модел (текст, изображения) с контекст 128k. | Проприетарна |
| 05 / 2025 | Devstral 24B | 24 | „Агентен" модел за автономна разработка на софтуер; 46,8% на SWE-Bench. | Apache 2.0 |
Сравнение с конкурентите
- vs. Llama (Meta): Моделите на Mistral стабилно превъзхождат моделите на Llama с аналогичен или дори по-голям размер. Mistral 7B надмина Llama 2 13B, а Mixtral 8x7B — Llama 2 70B. Основното разграничение е лицензът: Mistral използва напълно разрешителен Apache 2.0, докато лицензът на Llama има ограничения.
- vs. GPT (OpenAI): Флагманските модели на OpenAI (GPT-4) остават лидери при най-сложните задачи, но отворените модели на Mistral (например Mixtral 8x7B) демонстрират качество, сравнимо с GPT-3.5. Mistral предоставя открита алтернатива, позволявайки разполагането на модели локално и пълния им контрол.
- vs. Claude (Anthropic): Моделите Claude са известни с голям контекстен прозорец и ориентация към безопасност. Mistral предложи отворени модели с сравним или по-голям контекст. По производителност на стандартни benchmark показатели (LMSys Arena) моделът Medium 3 надмина Claude 3 Opus.
Приложение и екосистема
Продукти
- Le Chat: Публичен чат асистент (уеб, iOS/Android), демонстриращ възможностите на моделите на Mistral, включително уеб търсене и генериране на изображения.
- La Plateforme: Корпоративна платформа с достъп чрез API до всички модели на Mistral, позволяваща на компаниите да интегрират LLM в своите продукти.
Корпоративни клиенти
Технологиите на Mistral се използват от големи компании като BNP Paribas (финанси), CMA CGM (логистика), Zalando (e-commerce) и държавната агенция France Travail. За европейските клиенти е важна възможността за локално разполагане на моделите с цел съответствие с GDPR.
Общност Open-Source
Благодарение на отворения лиценз, моделите на Mistral се превърнаха в основа за хиляди проекти на платформи като Hugging Face. Общността активно дообучава модели за решаване на специализирани задачи, създавайки версии за биология (BioMistral), юриспруденция (SaulLM-7B) и локализация на различни езици (например полски Bielik 7B).
Лицензиране
| Серия модели | Лиценз | Ограничения |
|---|---|---|
| Базови, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0 | Свободно търговско използване. |
| Codestral 22B | Non-Production License | Търговското използване е забранено без отделно споразумение. |
| Серия Large, серия Medium | Mistral Research / Проприетарна | Достъп само чрез облачен API. |
Връзки
- Официална документация на Mistral AI
- Профил на Mistral AI в Hugging Face
Литература
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.