---
title: "Mistral AI (BG)"
source: "https://systems-analysis.info/int/Mistral_AI_(BG)"
wiki: "systems-analysis.info/int"
article: "Mistral_AI_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4392
wiki_created_at: 2026-09-06T23:34:32Z
wiki_modified_at: 2026-09-06T23:34:32Z
downloaded_at: 2026-09-07T23:02:25Z
---

# Mistral AI (BG)

**Mistral AI** — френска компания в областта на изкуствения интелект, специализирана в разработването на големи езикови модели (LLM). Основана през април 2023 г., компанията бързо се превърна в един от ключовите играчи на европейския и световния пазар, позиционирайки се като алтернатива на проприетарните модели на американските технологични гиганти.

Ключова особеност на подхода на Mistral AI е фокусът върху създаването на високопроизводителни модели с отворени тегла (предимно под лиценз Apache 2.0), което допринася за демократизирането на достъпа до съвременните AI технологии. Компанията е известна с архитектурните си иновации, като **Grouped-Query Attention (GQA)**, **Sliding Window Attention (SWA)** и **Sparse Mixture-of-Experts (MoE)**, които позволяват на моделите им да постигат висока ефективност при сравнително малък размер и изчислителни разходи.

## История

Компанията Mistral AI е основана в Париж през април 2023 г. от трима френски изследователи: **Артър Менш** (Arthur Mensch), **Гийом Ламpl** (Guillaume Lample) и **Тимоте Лакроа** (Timothée Lacroix). И тримата основатели са работили преди това върху големи езикови модели във водещи световни компании: Менш е бил изследовател в Google DeepMind, а Лампл и Лакроа са се занимавали с LLM в Meta AI.

Мисията на компанията е да направи съвременните постижения в областта на AI достъпни за всички, като насърчава откритостта, сътрудничеството и прозрачността. Този подход позволи на Mistral AI бързо да привлече значителни инвестиции:

- **Юни 2023:** €105 млн в seed-рунд, което стана рекорд за Европа.
- **Декември 2023:** €385 млн в рунд Series A, след което оценката на компанията надхвърли \$2 млрд и тя получи статут на „еднорог".
- **Февруари 2024:** Обявено е стратегическо партньорство с Microsoft, което включваше инвестиции в размер на \$16 млн и разполагане на моделите на Mistral в облака Azure.
- **Юни 2024:** Нов рунд на финансиране от €600 млн, в резултат на което оценката на компанията достигна ~€5,8 млрд, което я превърна в един от най-скъпите AI стартъпи в света.

## Технически особености на архитектурата

Моделите на Mistral AI са базирани на архитектурата transformer, но включват редица ключови иновации, насочени към повишаване на ефективността и намаляване на изчислителните разходи.

### Transformer с подобрения (Mistral 7B)

Първият модел на компанията, **Mistral 7B**, представи две важни архитектурни подобрения:

- **Sliding Window Attention (SWA)** (Внимание с плъзгащ прозорец): Вместо всеки token да взаимодейства с всички предходни токени (което има квадратична сложност), SWA ограничава вниманието до фиксиран прозорец (например 4096 токена). Това позволява обработката на много дълги последователности (до 32 000 токена и повече) с линейна изчислителна сложност, като значително ускорява обработката.
- **Grouped-Query Attention (GQA)** (Групирано внимание по заявки): Оптимизация на стандартния механизъм multi-head attention. GQA използва по-малък брой „глави" за ключовете (keys) и стойностите (values), отколкото за заявките (queries) (например в съотношение 8:1), което съществено намалява изискванията към паметта и ускорява процеса на генериране (inference) без значителна загуба на качество.

### Sparse Mixture-of-Experts (MoE)

В моделите от серията **Mixtral** (например *Mixtral 8x7B*, *Mixtral 8x22B*) се прилага архитектурата **Sparse Mixture-of-Experts** (разредена смес от експерти). Вместо един плътен слой на невронна мрежа се използват няколко паралелни „експертни" подмрежи. За всеки входен token специален *gating*-слой (маршрутизатор) динамично избира малко подмножество от експерти за активиране (обикновено 2 от 8).

Това позволява създаването на модели с огромен общ брой параметри (Mixtral 8x22B има 141 млрд), но при обработката на всеки token се използва само малка част от тях (~39 млрд). В резултат моделът постига качество, сравнимо с много по-големи „плътни" модели, но със скоростта и цената на inference на модели от значително по-малък размер.

### Архитектура Mamba (SSM)

През 2024 г. Mistral AI представи експерименталния модел **Codestral Mamba**, базиран на архитектурата **Mamba (Selective State-Space Model)**. За разлика от transformer моделите, Mamba използва рекурентен механизъм, основан на модели на пространството на състоянията. Ключови предимства:

- **Линейна сложност** по дължина на последователността, което я прави изключително бърза при дълги контексти.
- **Теоретически „безкраен" контекст**, ограничен само от наличната памет.
- **Висока скорост на inference** в сравнение с еквивалентни transformer модели.

## Хронология и модели

<table class="\&quot;wikitable">
<caption>Основни релийзи на модели на Mistral AI</caption>
<colgroup>
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
</colgroup>
<thead>
<tr class="header">
<th>Месец / Година</th>
<th>Модел</th>
<th>Параметри (млрд)</th>
<th>Ключови особености</th>
<th>Лиценз</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>09 / 2023</td>
<td><strong>Mistral 7B</strong></td>
<td>7,3</td>
<td>Архитектура GQA + SWA; контекст 32k; превъзхожда Llama 2 13B по всички benchmark показатели.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>12 / 2023</td>
<td><strong>Mixtral 8x7B</strong></td>
<td>46,7 (12,9 активни)</td>
<td>Първи отворен MoE модел; качество на ниво GPT-3.5.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>02 / 2024</td>
<td><strong>Mistral Small / Large</strong></td>
<td>?</td>
<td>„Младши" и флагмански модели, достъпни чрез API.</td>
<td>Small: Apache 2.0,<br />
Large: Research</td>
</tr>
<tr class="even">
<td>04 / 2024</td>
<td><strong>Mixtral 8x22B</strong></td>
<td>141 (39 активни)</td>
<td>Контекст 64k; SOTA качество сред open-source моделите към момента на излизане.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2024</td>
<td><strong>Codestral 22B</strong></td>
<td>22</td>
<td>Специализиран модел за генериране на код (80+ езика).</td>
<td>Non-Production</td>
</tr>
<tr class="even">
<td>07 / 2024</td>
<td><strong>Mathstral 7B</strong> / <strong>Nemo 12B</strong></td>
<td>7 / 12</td>
<td>Специализирани модели за математика и многоезичие.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>07 / 2024</td>
<td><strong>Codestral Mamba 7.3B</strong></td>
<td>7,3</td>
<td>Експериментален модел за код на архитектура Mamba; контекст 256k+.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>09 / 2024</td>
<td><strong>Pixtral 12B</strong></td>
<td>12</td>
<td>Първи отворен мултимодален модел (текст + изображения).</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>11 / 2024</td>
<td><strong>Mistral Large 24.11</strong></td>
<td>~100+ (оценка)</td>
<td>Обновен флагмански модел с подобрено reasoning.</td>
<td>Research</td>
</tr>
<tr class="even">
<td>01 / 2025</td>
<td><strong>Mistral Small 3</strong></td>
<td>24</td>
<td>Оптимизиран за ниска латентност (до 150 токена/с); качество на ниво 70B модели.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2025</td>
<td><strong>Mistral Medium 3</strong></td>
<td>?</td>
<td>Frontier мултимодален модел (текст, изображения) с контекст 128k.</td>
<td>Проприетарна</td>
</tr>
<tr class="even">
<td>05 / 2025</td>
<td><strong>Devstral 24B</strong></td>
<td>24</td>
<td>„Агентен" модел за автономна разработка на софтуер; 46,8% на SWE-Bench.</td>
<td>Apache 2.0</td>
</tr>
</tbody>
</table>

Основни релийзи на модели на Mistral AI

## Сравнение с конкурентите

- **vs. Llama (Meta):** Моделите на Mistral стабилно превъзхождат моделите на Llama с аналогичен или дори по-голям размер. Mistral 7B надмина Llama 2 13B, а Mixtral 8x7B — Llama 2 70B. Основното разграничение е лицензът: Mistral използва напълно разрешителен Apache 2.0, докато лицензът на Llama има ограничения.
- **vs. GPT (OpenAI):** Флагманските модели на OpenAI (GPT-4) остават лидери при най-сложните задачи, но отворените модели на Mistral (например Mixtral 8x7B) демонстрират качество, сравнимо с GPT-3.5. Mistral предоставя открита алтернатива, позволявайки разполагането на модели локално и пълния им контрол.
- **vs. Claude (Anthropic):** Моделите Claude са известни с голям контекстен прозорец и ориентация към безопасност. Mistral предложи отворени модели с сравним или по-голям контекст. По производителност на стандартни benchmark показатели (LMSys Arena) моделът Medium 3 надмина Claude 3 Opus.

## Приложение и екосистема

### Продукти

- **Le Chat:** Публичен чат асистент (уеб, iOS/Android), демонстриращ възможностите на моделите на Mistral, включително уеб търсене и генериране на изображения.
- **La Plateforme:** Корпоративна платформа с достъп чрез API до всички модели на Mistral, позволяваща на компаниите да интегрират LLM в своите продукти.

### Корпоративни клиенти

Технологиите на Mistral се използват от големи компании като **BNP Paribas** (финанси), **CMA CGM** (логистика), **Zalando** (e-commerce) и държавната агенция **France Travail**. За европейските клиенти е важна възможността за локално разполагане на моделите с цел съответствие с GDPR.

### Общност Open-Source

Благодарение на отворения лиценз, моделите на Mistral се превърнаха в основа за хиляди проекти на платформи като Hugging Face. Общността активно дообучава модели за решаване на специализирани задачи, създавайки версии за биология (BioMistral), юриспруденция (SaulLM-7B) и локализация на различни езици (например полски Bielik 7B).

## Лицензиране

| Серия модели                                               | Лиценз                          | Ограничения                                                  |
|------------------------------------------------------------|---------------------------------|--------------------------------------------------------------|
| Базови, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0                      | Свободно търговско използване.                               |
| Codestral 22B                                              | Non-Production License          | Търговското използване е забранено без отделно споразумение. |
| Серия Large, серия Medium                                  | Mistral Research / Проприетарна | Достъп само чрез облачен API.                                |

## Връзки

- Официална документация на Mistral AI
- Профил на Mistral AI в Hugging Face

## Литература

- Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). *Mistral 7B*. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.
