---
title: "MAUVE (metric) (PT)"
source: "https://systems-analysis.info/int/MAUVE_(metric)_(PT)"
wiki: "systems-analysis.info/int"
article: "MAUVE_(metric)_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 4002
wiki_created_at: 2026-09-06T23:29:05Z
wiki_modified_at: 2026-09-06T23:29:05Z
downloaded_at: 2026-09-07T23:00:16Z
---

# MAUVE (metric) (PT)

**MAUVE** é uma métrica automática para avaliar a qualidade do texto gerado por grandes modelos de linguagem modernos<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>. Esse indicador mede a "lacuna" entre a distribuição estatística dos textos criados pela rede neural e a distribuição do texto humano<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>. O **MAUVE** é projetado para tarefas de geração de formato aberto (*open-ended*), como a continuação de texto, onde não há uma única resposta correta, e a comparação é feita no nível das distribuições de texto, e não de exemplos individuais<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>. O método foi proposto em 2021 por um grupo de pesquisadores liderado por Krishna Pillutla e apresentado na conferência NeurIPS 2021, onde recebeu o prêmio **Outstanding Paper Award** por sua novidade e potencial impacto<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-IFML-2)[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>.

## Metodologia de avaliação

**MAUVE** utiliza o conceito de **fronteiras de divergência** (em inglês, *divergence frontiers*), da teoria da informação, para avaliar simultaneamente dois tipos de erros do modelo generativo<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>:

- Desvio da plausibilidade (geração de texto "sem sentido").
- Redução da diversidade (texto excessivamente padronizado).

A ideia consiste em comparar as propriedades estatísticas da distribuição das saídas do modelo com a distribuição dos textos de referência (humanos) em um espectro completo de critérios. A implementação da métrica baseia-se na representação dos textos como embeddings de um grande modelo de linguagem pré-treinado e no cálculo das discrepâncias entre as distribuições resultantes nesse espaço de características<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-KrishnaP25GitHub-3)</sup>.

Abaixo estão as principais etapas do cálculo do MAUVE:

### Vetorização das amostras

Ambos os conjuntos de textos — os gerados pelo modelo e os reais — são transformados em embeddings usando um modelo de linguagem pré-treinado (por exemplo, o último estado oculto do GPT-2)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-KrishnaP25GitHub-3)</sup>. Essa representação converte os textos para um espaço de características unificado para posterior comparação.

### Discretização das distribuições

Os embeddings obtidos são clusterizados (por exemplo, pelo método k-médias), o que resulta na quantização do espaço de características contínuo<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-KrishnaP25GitHub-3)</sup>. Como resultado, são formadas distribuições discretas aproximadas **P** (texto humano) e **Q** (texto do modelo) sobre os clusters.

### Construção da fronteira de divergência

As divergências entre as distribuições P e Q são calculadas para diferentes proporções de erros do tipo I e do tipo II<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>. Na prática, isso significa avaliar várias discrepâncias de informação (por exemplo, divergências de Kullback-Leibler) para um conjunto de valores de limiar que caracterizam o trade-off entre a "precisão" e a "abrangência" do modelo. O conjunto desses pontos forma uma "curva de divergência" (*divergence curve*)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>.

### Integração e resultado

A curva resultante é integrada, ou seja, calcula-se a área sob a curva de divergências. Esse indicador integral é o valor **MAUVE** — um escalar que quantifica o grau de proximidade da distribuição do texto do modelo em relação ao texto humano<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>. O **MAUVE score** final é normalizado no intervalo de 0 a 1, onde valores mais próximos de 1 correspondem à menor divergência (o texto do modelo é estatisticamente semelhante ao humano)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-KrishnaP25GitHub-3)</sup>.

## Resultados experimentais e propriedades

Os autores testaram o MAUVE em uma série de tarefas de geração de texto de formato aberto (continuação de textos da web, artigos de notícias, histórias)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>. A métrica demonstrou a capacidade de identificar padrões conhecidos na qualidade da geração. Especificamente, com o aumento do tamanho do modelo de linguagem, o valor do MAUVE cresce, refletindo a melhoria da coerência e da plausibilidade do texto em modelos maiores<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-IFML-2)</sup>. Por outro lado, com o aumento do comprimento do fragmento gerado, observa-se uma diminuição do MAUVE, o que significa que a qualidade de continuações longas é geralmente inferior à de continuações curtas (o modelo começa a se repetir ou a se desviar do contexto)<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-IFML-2)</sup>. O MAUVE também distingue os efeitos da escolha do algoritmo de geração de texto: por exemplo, a alteração da estratégia de amostragem (temperatura, amostragem top-k/nucleus, etc.) influencia a distribuição das saídas e se reflete no valor da métrica<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>.

Uma característica importante do MAUVE é sua alta concordância com a avaliação humana. Estudos mostraram que os valores do MAUVE **possuem forte correlação com as avaliações subjetivas de qualidade**, superando, nesse quesito, as métricas básicas utilizadas para geração de texto de formato aberto<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-KrishnaP25GitHub-3)</sup>. Em outras palavras, modelos com um MAUVE mais alto são geralmente percebidos pelas pessoas como geradores de texto mais coerente e "semelhante ao humano". Além disso, o MAUVE impõe menos restrições do que as métricas de avaliação distribucionais propostas anteriormente: o método é escalável para modelos grandes e textos longos e considera múltiplos aspectos das diferenças simultaneamente, enquanto muitos indicadores padrão capturam apenas um aspecto estatístico (um único ponto na curva de divergência)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>. Essa abordagem abrangente permite uma avaliação mais completa da qualidade do desempenho do modelo generativo.

## Aplicação e pesquisas futuras

Embora o MAUVE tenha sido originalmente desenvolvido para modelos de texto, sua abordagem é universal. O método foi aplicado com sucesso a outros tipos de dados gerados. Por exemplo, na geração de imagens (GANs, modelos de difusão), a métrica MAUVE identifica de forma análoga as diferenças características entre as distribuições de imagens reais e sintéticas, alcançando uma precisão comparável ou superior às melhores métricas existentes<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-IFML-2)</sup>. Potencialmente, o MAUVE pode ser adaptado a outras modalidades (áudio, música, vídeo), desde que embeddings de características semanticamente significativos estejam disponíveis para elas<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-KrishnaP25GitHub-3)</sup>.

A métrica ganhou ampla aceitação na comunidade de pesquisa. Os autores lançaram uma implementação de código aberto do MAUVE em Python (disponível via PyPI e integrada à biblioteca HuggingFace Evaluate) para facilitar seu uso prático<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-KrishnaP25GitHub-3)</sup>. Em 2023, foi publicado um trabalho estendido, «MAUVE Scores for Generative Models: Theory and Practice», que detalha as propriedades teóricas da métrica, diferentes variantes de seu cálculo e fornece recomendações para sua aplicação em texto e imagens<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-IFML-2)</sup>. Além disso, em paralelo ao artigo original, foi publicado um trabalho suplementar que estabelece limites estatísticos e o tamanho de amostra necessário para uma avaliação confiável do MAUVE<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>. O desenvolvimento dessas ideias não apenas ajuda a melhorar a qualidade dos modelos generativos, mas também estabelece as bases para ferramentas de detecção de texto gerado por máquina: à medida que a lacuna entre os textos criados por IA e por humanos diminui, métricas como o MAUVE ajudarão a entender melhor o funcionamento dos modelos e a distinguir seu conteúdo do conteúdo humano<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_note-AllenSchoolNews-1)</sup>.

## Limitações e recomendações

Os desenvolvedores do MAUVE enfatizam que, para um uso prático, é importante observar certas condições para uma avaliação correta. Primeiro, é necessário um **volume de amostragem suficiente**: para uma avaliação estável da métrica, são necessárias alguns milhares de exemplos de cada tipo (nos experimentos originais, foram utilizadas cerca de 5.000 sentenças de cada). Com amostras significativamente menores, o MAUVE pode superestimar a qualidade (viés otimista) e produzir resultados instáveis com alta variância. Segundo, é preferível **interpretar o MAUVE de forma comparativa**. O valor absoluto da métrica depende de alguns hiperparâmetros de cálculo (por exemplo, o número de clusters na quantização), portanto, o valor direto do MAUVE para um único modelo é menos informativo. Recomenda-se comparar os valores de MAUVE de vários modelos ou métodos de geração entre si (com as mesmas configurações da métrica) — nesse caso, um valor mais alto indica inequivocamente uma qualidade de texto mais próxima da humana. Seguindo essas recomendações, o MAUVE serve como uma ferramenta confiável para a avaliação objetiva e a comparação de modelos generativos.

## Ligações externas

- <a href="https://krishnap25.github.io/mauve/" class="external text" rel="nofollow">Página do projeto MAUVE</a>

## Notas

1.  <span id="cite_note-AllenSchoolNews-1">↑ <sup>[1.00](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-AllenSchoolNews_1-12)</sup> «Notícias da Allen School \>\> Pesquisadores da Allen School e do AI2 pintam a conferência NeurIPS de MAUVE e levam para casa um prêmio de Artigo Destaque». *Allen School News*. <a href="https://news.cs.washington.edu/2022/02/28/allen-school-and-ai2-researchers-paint-the-neurips-conference-mauve-and-take-home-an-outstanding-paper-award/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-IFML-2">↑ <sup>[2.0](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-IFML_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-IFML_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-IFML_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-IFML_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-IFML_2-4)</sup> «MAUVE: Statistical Evaluation of LLMs and Generative AI \| Institute for Foundations of Machine Learning». *Institute for Foundations of Machine Learning*. <a href="https://www.ifml.institute/index.php/research/mauve-statistical-evaluation-llms-and-generative-ai" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-KrishnaP25GitHub-3">↑ <sup>[3.0](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-KrishnaP25GitHub_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-KrishnaP25GitHub_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-KrishnaP25GitHub_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-KrishnaP25GitHub_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-KrishnaP25GitHub_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-KrishnaP25GitHub_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/MAUVE_(metric)_(PT)#cite_ref-KrishnaP25GitHub_3-6)</sup> «MAUVE: Measuring the Gap Between Neural Text and Human Text — MAUVE». *MAUVE project page*. <a href="https://krishnap25.github.io/mauve/" class="external autonumber" rel="nofollow">[3]</a></span>
