---
title: "Mistral AI (PT)"
source: "https://systems-analysis.info/int/Mistral_AI_(PT)"
wiki: "systems-analysis.info/int"
article: "Mistral_AI_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 4408
wiki_created_at: 2026-09-06T23:34:45Z
wiki_modified_at: 2026-09-06T23:34:45Z
downloaded_at: 2026-09-07T23:02:30Z
---

# Mistral AI (PT)

**Mistral AI** — é uma empresa francesa de inteligência artificial especializada no desenvolvimento de grandes modelos de linguagem (LLMs). Fundada em abril de 2023, a empresa rapidamente se tornou um dos principais players nos mercados europeu e mundial, posicionando-se como uma alternativa aos modelos proprietários dos gigantes da tecnologia americanos.

A principal característica da abordagem da Mistral AI é o foco na criação de modelos de alto desempenho com pesos abertos (predominantemente sob a licença Apache 2.0), o que promove a democratização do acesso a tecnologias de IA de ponta. A empresa é conhecida por suas inovações arquitetônicas, como **Grouped-Query Attention (GQA)**, **Sliding Window Attention (SWA)** e **Sparse Mixture-of-Experts (MoE)**, que permitem que seus modelos alcancem alta eficiência com um tamanho e custos computacionais relativamente pequenos.

## História

A empresa Mistral AI foi fundada em Paris em abril de 2023 por três pesquisadores franceses: **Arthur Mensch** (<a href="https://en.wikipedia.org/wiki/Arthur_Mensch" class="extiw" title="wikipedia:Arthur Mensch">Arthur Mensch</a>), **Guillaume Lample** e **Timothée Lacroix**. Todos os três fundadores trabalharam anteriormente em grandes modelos de linguagem em empresas líderes mundiais: Mensch foi pesquisador no Google DeepMind, enquanto Lample e Lacroix se dedicaram a LLMs na Meta AI.

A missão da empresa é tornar os avanços de ponta da IA acessíveis a todos, promovendo abertura, colaboração e transparência. Essa abordagem permitiu que a Mistral AI atraísse rapidamente investimentos significativos:

- **Junho de 2023:** €105 milhões em uma rodada de sementes (seed), um recorde para a Europa.
- **Dezembro de 2023:** €385 milhões em uma rodada Série A, após a qual a avaliação da empresa ultrapassou US\$ 2 bilhões, conferindo-lhe o status de "unicórnio".
- **Fevereiro de 2024:** Anunciada uma parceria estratégica com a Microsoft, que incluiu um investimento de US\$ 16 milhões e a disponibilização dos modelos Mistral na nuvem Azure.
- **Junho de 2024:** Uma nova rodada de financiamento de €600 milhões, que elevou a avaliação da empresa para aproximadamente €5,8 bilhões, tornando-a uma das startups de IA mais valiosas do mundo.

## Características técnicas da arquitetura

Os modelos da Mistral AI são baseados na arquitetura Transformer, mas incluem uma série de inovações importantes destinadas a aumentar a eficiência e reduzir os custos computacionais.

### Transformer com melhorias (Mistral 7B)

O primeiro modelo da empresa, **Mistral 7B**, introduziu duas melhorias arquitetônicas significativas:

- **Sliding Window Attention (SWA)** (Atenção de Janela Deslizante): Em vez de cada token interagir com todos os tokens anteriores (o que tem complexidade quadrática), o SWA limita a atenção a uma janela fixa (por exemplo, 4096 tokens). Isso permite processar sequências muito longas (até 32.000 tokens e mais) com complexidade computacional linear, acelerando significativamente o processamento.
- **Grouped-Query Attention (GQA)** (Atenção de Consulta Agrupada): Uma otimização do mecanismo padrão de atenção multi-cabeça (multi-head attention). O GQA usa um número menor de "cabeças" para chaves (keys) e valores (values) do que para consultas (queries) (por exemplo, em uma proporção de 8:1), o que reduz substancialmente os requisitos de memória e acelera o processo de geração (inferência) sem perda significativa de qualidade.

### Sparse Mixture-of-Experts (MoE)

Nos modelos da série **Mixtral** (por exemplo, *Mixtral 8x7B*, *Mixtral 8x22B*), é aplicada a arquitetura **Sparse Mixture-of-Experts** (mistura esparsa de especialistas). Em vez de uma única camada densa de rede neural, são usadas várias sub-redes "especialistas" paralelas. Para cada token de entrada, uma camada especial de *gating* (roteador) seleciona dinamicamente um pequeno subconjunto de especialistas para ativação (geralmente 2 de 8).

Isso permite a criação de modelos com um número total enorme de parâmetros (o Mixtral 8x22B tem 141 bilhões), mas durante o processamento de cada token, apenas uma pequena parte deles é utilizada (~39 bilhões). Como resultado, o modelo alcança uma qualidade comparável a modelos "densos" muito maiores, mas com a velocidade e o custo de inferência de modelos consideravelmente menores.

### Arquitetura Mamba (SSM)

Em 2024, a Mistral AI apresentou um modelo experimental, o **Codestral Mamba**, baseado na arquitetura **Mamba (Selective State-Space Model)**. Diferentemente dos Transformers, o Mamba utiliza um mecanismo recorrente baseado em modelos de espaço de estados. As principais vantagens são:

- **Complexidade linear** em relação ao comprimento da sequência, o que o torna extremamente rápido em contextos longos.
- **Contexto teoricamente "infinito"**, limitado apenas pela memória disponível.
- **Alta velocidade de inferência** em comparação com Transformers equivalentes.

## Cronologia e modelos

<table class="wikitable mw-collapsible">
<caption>Principais lançamentos de modelos da Mistral AI</caption>
<colgroup>
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
</colgroup>
<thead>
<tr class="header">
<th>Mês / Ano</th>
<th>Modelo</th>
<th>Parâmetros (bilhões)</th>
<th>Principais características</th>
<th>Licença</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>09 / 2023</td>
<td><strong>Mistral 7B</strong></td>
<td>7,3</td>
<td>Arquitetura GQA + SWA; contexto de 32k; supera o Llama 2 13B em todos os benchmarks.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>12 / 2023</td>
<td><strong>Mixtral 8x7B</strong></td>
<td>46,7 (12,9 ativos)</td>
<td>Primeiro modelo MoE aberto; qualidade no nível do GPT-3.5.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>02 / 2024</td>
<td><strong>Mistral Small / Large</strong></td>
<td>?</td>
<td>Modelo "júnior" e carro-chefe, disponíveis via API.</td>
<td>Small: Apache 2.0,<br />
Large: Research</td>
</tr>
<tr class="even">
<td>04 / 2024</td>
<td><strong>Mixtral 8x22B</strong></td>
<td>141 (39 ativos)</td>
<td>Contexto de 64k; qualidade SOTA entre os modelos de código aberto no momento do lançamento.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2024</td>
<td><strong>Codestral 22B</strong></td>
<td>22</td>
<td>Modelo especializado para geração de código (mais de 80 idiomas).</td>
<td>Non-Production</td>
</tr>
<tr class="even">
<td>07 / 2024</td>
<td><strong>Mathstral 7B</strong> / <strong>Nemo 12B</strong></td>
<td>7 / 12</td>
<td>Modelos especializados para matemática e multilinguismo.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>07 / 2024</td>
<td><strong>Codestral Mamba 7.3B</strong></td>
<td>7,3</td>
<td>Modelo experimental para código na arquitetura Mamba; contexto de 256k+.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>09 / 2024</td>
<td><strong>Pixtral 12B</strong></td>
<td>12</td>
<td>Primeiro modelo multimodal aberto (texto + imagens).</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>11 / 2024</td>
<td><strong>Mistral Large 24.11</strong></td>
<td>~100+ (estimativa)</td>
<td>Modelo carro-chefe atualizado com raciocínio aprimorado.</td>
<td>Research</td>
</tr>
<tr class="even">
<td>01 / 2025</td>
<td><strong>Mistral Small 3</strong></td>
<td>24</td>
<td>Otimizado para baixa latência (até 150 tokens/s); qualidade no nível de modelos de 70B.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2025</td>
<td><strong>Mistral Medium 3</strong></td>
<td>?</td>
<td>Modelo multimodal de fronteira (texto, imagens) com contexto de 128k.</td>
<td>Proprietária</td>
</tr>
<tr class="even">
<td>05 / 2025</td>
<td><strong>Devstral 24B</strong></td>
<td>24</td>
<td>Modelo "agente" para desenvolvimento autônomo de software; 46,8% no SWE-Bench.</td>
<td>Apache 2.0</td>
</tr>
</tbody>
</table>

Principais lançamentos de modelos da Mistral AI

## Comparação com concorrentes

- **vs. Llama (Meta):** Os modelos da Mistral consistentemente superam os modelos Llama de tamanho semelhante ou até maior. O Mistral 7B superou o Llama 2 13B, e o Mixtral 8x7B superou o Llama 2 70B. A principal diferença é a licença: a Mistral usa a licença totalmente permissiva Apache 2.0, enquanto a licença do Llama possui restrições.
- **vs. GPT (OpenAI):** Os modelos carro-chefe da OpenAI (GPT-4) continuam sendo líderes nas tarefas mais complexas. No entanto, os modelos abertos da Mistral (por exemplo, Mixtral 8x7B) demonstram uma qualidade comparável à do GPT-3.5. A Mistral oferece uma alternativa aberta, permitindo que os modelos sejam implantados localmente e totalmente controlados.
- **vs. Claude (Anthropic):** Os modelos Claude são conhecidos por sua grande janela de contexto e foco em segurança. A Mistral ofereceu modelos abertos com um contexto comparável ou maior. Em termos de desempenho em benchmarks padrão (LMSys Arena), o modelo Medium 3 superou o Claude 3 Opus.

## Aplicação e ecossistema

### Produtos

- **Le Chat:** Um assistente de chat público (web, iOS/Android) que demonstra as capacidades dos modelos Mistral, incluindo busca na web e geração de imagens.
- **La Plateforme:** Uma plataforma corporativa com acesso via API a todos os modelos da Mistral, permitindo que as empresas integrem LLMs em seus produtos.

### Clientes corporativos

As tecnologias da Mistral são utilizadas por grandes empresas como **BNP Paribas** (finanças), **CMA CGM** (logística), **Zalando** (e-commerce) e a agência governamental **France Travail**. Para os clientes europeus, a capacidade de implantar modelos localmente para cumprir o GDPR é crucial.

### Comunidade de Código Aberto

Graças à sua licença aberta, os modelos da Mistral se tornaram a base para milhares de projetos em plataformas como a Hugging Face. A comunidade treina ativamente os modelos para resolver tarefas especializadas, criando versões para biologia (BioMistral), jurisprudência (SaulLM-7B) e localização para diferentes idiomas (por exemplo, Polish Bielik 7B).

## Licenciamento

| Série de modelos                                         | Licença                         | Restrições                                     |
|----------------------------------------------------------|---------------------------------|------------------------------------------------|
| Base, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0                      | Uso comercial livre.                           |
| Codestral 22B                                            | Non-Production License          | Uso comercial proibido sem um acordo separado. |
| Série Large, Série Medium                                | Mistral Research / Proprietária | Acesso apenas através da API na nuvem.         |

## Ligações externas

- <a href="https://docs.mistral.ai/" class="external text" rel="nofollow">Documentação oficial da Mistral AI</a>
- <a href="https://huggingface.co/mistralai" class="external text" rel="nofollow">Perfil da Mistral AI no Hugging Face</a>

## Literatura

- Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external text" rel="nofollow">arXiv:2004.05150</a>.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. <a href="https://arxiv.org/abs/2205.14135" class="external text" rel="nofollow">arXiv:2205.14135</a>.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. <a href="https://arxiv.org/abs/2402.13753" class="external text" rel="nofollow">arXiv:2402.13753</a>.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Gu, A.; Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external text" rel="nofollow">arXiv:2312.00752</a>.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. <a href="https://arxiv.org/abs/2504.12637" class="external text" rel="nofollow">arXiv:2504.12637</a>.
- Jiang, A. Q. et al. (2023). *Mistral 7B*. <a href="https://arxiv.org/abs/2310.06825" class="external text" rel="nofollow">arXiv:2310.06825</a>.
- Jiang, A. Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external text" rel="nofollow">arXiv:2401.04088</a>.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. <a href="https://arxiv.org/abs/2309.00071" class="external text" rel="nofollow">arXiv:2309.00071</a>.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. <a href="https://arxiv.org/abs/1911.02150" class="external text" rel="nofollow">arXiv:1911.02150</a>.
