---
title: "Métricas de Qualidade de LLMs"
source: "https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs"
wiki: "systems-analysis.info/int"
article: "Métricas_de_Qualidade_de_LLMs"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 4818
wiki_created_at: 2026-09-06T23:40:21Z
wiki_modified_at: 2026-09-06T23:40:21Z
downloaded_at: 2026-09-07T23:04:50Z
---

# Métricas de Qualidade de LLMs

**Métricas de qualidade de modelos de linguagem grandes (LLMs)** — são uma abordagem sistemática e um conjunto de ferramentas padronizadas para medir vários aspectos do desempenho de modelos de linguagem, incluindo precisão, segurança, justiça e confiabilidade<sup>[\[1\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-perplexity-overview-1)</sup>. À medida que os LLMs encontram aplicação cada vez mais ampla em áreas críticas como saúde, finanças e educação, surge uma necessidade urgente de sua avaliação abrangente e objetiva<sup>[\[2\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-perplexity-security-2)</sup>.

Métricas e benchmarks servem a várias funções-chave: eles permitem a comparação objetiva de diferentes modelos, o acompanhamento do progresso em seu desenvolvimento, a identificação de pontos fracos e a garantia de transparência dos resultados para pesquisadores e profissionais<sup>[\[1\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-perplexity-overview-1)</sup>.

## Categorias de métricas

As métricas para avaliação de LLMs podem ser divididas em várias categorias principais: métricas automáticas, avaliação com participação humana e métricas especializadas para avaliação de segurança e confiabilidade.

### Métricas automáticas

Essas métricas permitem uma avaliação rápida e escalável sem a participação humana.

#### Métricas baseadas em n-gramas

Métricas tradicionais que medem a sobreposição lexical entre o texto gerado e o texto de referência.

- **BLEU** (Bilingual Evaluation Understudy): Originalmente desenvolvida para avaliar a qualidade da tradução automática. Mede a precisão da correspondência de n-gramas (sequências de n palavras) e aplica uma penalidade para textos gerados muito curtos<sup>[\[3\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-ngram-metrics-3)</sup>.
- **ROUGE** (Recall-Oriented Understudy for Gisting Evaluation): Foca na revocação (recall), medindo quão bem os n-gramas do texto de referência estão representados no texto gerado. É especialmente eficaz para avaliar tarefas de sumarização<sup>[\[3\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-ngram-metrics-3)</sup>.
- **METEOR**: Expande as capacidades do BLEU, considerando sinônimos, palavras com a mesma raiz e variantes morfológicas, o que permite alcançar uma melhor correlação com as avaliações humanas<sup>[\[3\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-ngram-metrics-3)</sup>.

#### Métricas semânticas

Essas métricas usam embeddings contextuais para avaliar a proximidade semântica, em vez de apenas a correspondência lexical.

- **BERTScore**: Calcula a similaridade semântica entre os tokens dos textos gerado e de referência, utilizando embeddings do modelo BERT. Isso permite reconhecer a equivalência semântica mesmo com formulações diferentes<sup>[\[4\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-semantic-metrics-4)</sup>.
- **MAUVE**: Mede a divergência entre as distribuições do texto gerado por máquina e do texto humano no espaço de embeddings. É especialmente eficaz para avaliar a geração de texto em formato aberto, onde não há um texto de referência fixo<sup>[\[5\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-distribution-metrics-5)</sup>.

#### Métricas intrínsecas de modelagem de linguagem

- **Perplexidade** (Perplexity): Uma métrica fundamental que mede quão bem um modelo de linguagem prevê uma sequência de texto. Ela reflete a incerteza do modelo ao prever o próximo token. Valores de perplexidade mais baixos indicam um melhor desempenho<sup>[\[6\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-intrinsic-metrics-6)</sup>.
- **Acurácia e F1-score**: Amplamente utilizadas em tarefas de classificação e sistemas de perguntas e respostas. O F1-score é a média harmônica entre precisão e revocação (recall), fornecendo uma avaliação equilibrada<sup>[\[6\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-intrinsic-metrics-6)</sup>.

### Avaliação com participação humana

A avaliação humana continua sendo o "padrão ouro", pois as métricas automáticas muitas vezes não conseguem capturar aspectos sutis de qualidade, como coerência, criatividade e relevância<sup>[\[7\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-human-eval-7)</sup>.

- **Avaliação direta**: Especialistas ou trabalhadores de crowdsourcing avaliam a qualidade da geração de texto em uma escala predefinida (por exemplo, de 1 a 5) com base em critérios como fluência e coerência.
- **Avaliação comparativa**: Os avaliadores são solicitados a comparar as saídas de dois ou mais modelos e escolher a melhor (comparação pareada) ou classificá-las da melhor para a pior.

As desvantagens da avaliação humana incluem o alto custo, a dificuldade de escalonamento e a subjetividade<sup>[\[7\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-human-eval-7)</sup>.

### Avaliação com o uso de LLM (LLM-as-a-Judge)

Uma nova abordagem na qual um modelo de linguagem (geralmente mais poderoso) é usado para avaliar as respostas de outro. Por exemplo, o GPT-4 pode classificar as saídas de modelos com base em critérios definidos. Este método oferece uma alternativa escalável à avaliação humana, embora tenha seus próprios desafios, como a sensibilidade ao estilo dos prompts e um viés potencial<sup>[\[8\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-llm-as-judge-8)</sup>.

## Métricas e benchmarks especializados

Para avaliar aspectos específicos de desempenho e confiabilidade dos LLMs, são utilizadas métricas e benchmarks especializados.

### Confiabilidade factual

Avalia a capacidade do modelo de gerar informações verdadeiras e evitar alucinações.

- **TruthfulQA**: Um benchmark projetado especificamente para medir a tendência dos modelos de gerar respostas baseadas em mitos e equívocos comuns. Exige-se que o modelo forneça respostas factualmente corretas, em vez de apenas populares<sup>[\[9\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-security-metrics-9)</sup>.

### Segurança e ética

- **Avaliação de toxicidade**: Mede a presença de conteúdo ofensivo ou prejudicial. Para isso, são utilizados classificadores e APIs especializados, como a **Perspective API**<sup>[\[9\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-security-metrics-9)</sup>.
- **Avaliação de viés e justiça**: Avalia se o modelo demonstra comportamento discriminatório em relação a diferentes grupos demográficos. Pesquisas mostram que os LLMs podem preservar e amplificar estereótipos sociais presentes nos dados de treinamento<sup>[\[10\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-bias-metrics-10)</sup>.
- **SafetyBench**: Um benchmark abrangente para avaliação de segurança, que inclui testes de robustez contra ataques adversariais e a capacidade de evitar a geração de conteúdo prejudicial<sup>[\[11\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-safety-bench-11)</sup>.

### Benchmarks abrangentes

- **MMLU** (Massive Multitask Language Understanding): Um dos benchmarks mais amplamente utilizados, incluindo questões de múltipla escolha em 57 áreas, desde matemática elementar até direito internacional. Ele avalia a amplitude e a profundidade do conhecimento do modelo<sup>[\[12\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-comprehensive-benchmarks-12)</sup>.
- **BIG-bench** (Beyond the Imitation Game): Contém mais de 204 tarefas projetadas para avaliar habilidades que vão além das capacidades dos modelos de linguagem padrão, incluindo tarefas que vão desde jogar xadrez até adivinhar emojis<sup>[\[12\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-comprehensive-benchmarks-12)</sup>.

## Desafios e limitações

- **Problema de correlação**: Métricas automáticas tradicionais, como BLEU e ROUGE, frequentemente apresentam baixa correlação com as avaliações humanas, especialmente em tarefas criativas<sup>[\[13\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-challenges-correlation-13)</sup>.
- **Contaminação de dados (Data Contamination)**: Existe o risco de que os dados de teste de um benchmark possam ter sido incluídos no conjunto de treinamento do modelo, o que leva a avaliações inflacionadas e não confiáveis<sup>[\[14\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-challenges-contamination-14)</sup>.
- **Avaliação multilíngue**: A maioria das métricas e benchmarks existentes foca no idioma inglês, o que limita sua aplicabilidade para avaliar as capacidades multilíngues dos LLMs<sup>[\[15\]](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_note-challenges-multilingual-15)</sup>.

## Ligações externas

- <a href="https://www.ibm.com/think/topics/llm-benchmarks" class="external text" rel="nofollow">What Are LLM Benchmarks?</a> — artigo de visão geral da IBM
- <a href="https://www.evidentlyai.com/llm-guide/llm-benchmarks" class="external text" rel="nofollow">20 LLM evaluation benchmarks and how they work</a> — guia de benchmarks da Evidently AI

## Literatura

- Papineni, K. et al. (2002). *Bleu: a Method for Automatic Evaluation of Machine Translation*. <a href="https://aclanthology.org/P02-1040/" class="external text" rel="nofollow">ACL:P02-1040</a>.
- Lin, C.-Y. (2004). *ROUGE: A Package for Automatic Evaluation of Summaries*. <a href="https://aclanthology.org/W04-1013/" class="external text" rel="nofollow">ACL:W04-1013</a>.
- Banerjee, S.; Lavie, A. (2005). *METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments*. <a href="https://aclanthology.org/W05-0909/" class="external text" rel="nofollow">ACL:W05-0909</a>.
- Zhang, T. et al. (2019). *BERTScore: Evaluating Text Generation with BERT*. <a href="https://arxiv.org/abs/1904.09675" class="external text" rel="nofollow">arXiv:1904.09675</a>.
- Pillutla, K. et al. (2021). *MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers*. <a href="https://arxiv.org/abs/2102.01454" class="external text" rel="nofollow">arXiv:2102.01454</a>.
- Lin, S. et al. (2021). *TruthfulQA: Measuring How Models Mimic Human Falsehoods*. <a href="https://arxiv.org/abs/2109.07958" class="external text" rel="nofollow">arXiv:2109.07958</a>.
- Parrish, A. et al. (2021). *BBQ: A Hand-Built Bias Benchmark for Question Answering*. <a href="https://arxiv.org/abs/2110.08193" class="external text" rel="nofollow">arXiv:2110.08193</a>.
- Dhamala, J. et al. (2021). *BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation*. <a href="https://arxiv.org/abs/2101.11718" class="external text" rel="nofollow">arXiv:2101.11718</a>.
- Hendrycks, D. et al. (2020). *Measuring Massive Multitask Language Understanding*. <a href="https://arxiv.org/abs/2009.03300" class="external text" rel="nofollow">arXiv:2009.03300</a>.
- Srivastava, A. et al. (2022). *Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models*. <a href="https://arxiv.org/abs/2206.04615" class="external text" rel="nofollow">arXiv:2206.04615</a>.
- Zhang, Z. et al. (2023). *SafetyBench: Evaluating the Safety of Large Language Models*. <a href="https://arxiv.org/abs/2309.07045" class="external text" rel="nofollow">arXiv:2309.07045</a>.
- Huang, H. et al. (2024). *An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4*. <a href="https://arxiv.org/abs/2403.02839" class="external text" rel="nofollow">arXiv:2403.02839</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Gu, J. et al. (2024). *A Survey on LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2411.15594" class="external text" rel="nofollow">arXiv:2411.15594</a>.
- Li, S. et al. (2025). *LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2506.09443" class="external text" rel="nofollow">arXiv:2506.09443</a>.

## Notas

1.  <span id="cite_note-perplexity-overview-1">↑ <sup>[1.0](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-perplexity-overview_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-perplexity-overview_1-1)</sup> "Métricas de Qualidade de LLMs". *Perplexity AI*.</span>
2.  <span id="cite_note-perplexity-security-2">[↑](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-perplexity-security_2-0) "Métricas de segurança especializadas". *Perplexity AI*.</span>
3.  <span id="cite_note-ngram-metrics-3">↑ <sup>[3.0](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-ngram-metrics_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-ngram-metrics_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-ngram-metrics_3-2)</sup> "Métricas tradicionais de avaliação de texto". *Perplexity AI*.</span>
4.  <span id="cite_note-semantic-metrics-4">[↑](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-semantic-metrics_4-0) "Métricas semânticas". *Perplexity AI*.</span>
5.  <span id="cite_note-distribution-metrics-5">[↑](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-distribution-metrics_5-0) "Métricas baseadas em distribuições". *Perplexity AI*.</span>
6.  <span id="cite_note-intrinsic-metrics-6">↑ <sup>[6.0](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-intrinsic-metrics_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-intrinsic-metrics_6-1)</sup> "Métricas intrínsecas". *Perplexity AI*.</span>
7.  <span id="cite_note-human-eval-7">↑ <sup>[7.0](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-human-eval_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-human-eval_7-1)</sup> "Avaliação com participação humana". *Perplexity AI*.</span>
8.  <span id="cite_note-llm-as-judge-8">[↑](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-llm-as-judge_8-0) "LLM-as-a-Judge". *Perplexity AI*.</span>
9.  <span id="cite_note-security-metrics-9">↑ <sup>[9.0](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-security-metrics_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-security-metrics_9-1)</sup> "Métricas de segurança especializadas". *Perplexity AI*.</span>
10. <span id="cite_note-bias-metrics-10">[↑](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-bias-metrics_10-0) "Viés e justiça". *Perplexity AI*.</span>
11. <span id="cite_note-safety-bench-11">[↑](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-safety-bench_11-0) "Benchmarks de segurança". *Perplexity AI*.</span>
12. <span id="cite_note-comprehensive-benchmarks-12">↑ <sup>[12.0](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-comprehensive-benchmarks_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-comprehensive-benchmarks_12-1)</sup> "Avaliação abrangente". *Perplexity AI*.</span>
13. <span id="cite_note-challenges-correlation-13">[↑](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-challenges-correlation_13-0) "Problemas de correlação". *Perplexity AI*.</span>
14. <span id="cite_note-challenges-contamination-14">[↑](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-challenges-contamination_14-0) "Contaminação de dados". *Perplexity AI*.</span>
15. <span id="cite_note-challenges-multilingual-15">[↑](https://systems-analysis.info/int/M%C3%A9tricas_de_Qualidade_de_LLMs#cite_ref-challenges-multilingual_15-0) "Avaliação multilíngue". *Perplexity AI*.</span>
