---
title: "BERTScore (metric) (PT)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(PT)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 556
wiki_created_at: 2026-09-06T22:35:32Z
wiki_modified_at: 2026-09-06T22:35:32Z
downloaded_at: 2026-09-07T22:40:58Z
---

# BERTScore (metric) (PT)

**BERTScore** é uma métrica automática para avaliar a qualidade de texto gerado, baseada na medição da similaridade semântica por meio de embeddings contextuais de modelos de linguagem pré-treinados, como o BERT. A métrica foi proposta em 2019 por um grupo de pesquisadores liderado por **Tianyi Zhang** em seu trabalho "BERTScore: Evaluating Text Generation with BERT"<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-bertscore_paper-1)</sup>.

Diferentemente das métricas tradicionais, como BLEU e ROUGE, que se baseiam na correspondência exata de n-gramas, o BERTScore permite identificar a equivalência de significado mesmo quando há diferenças nas palavras e formulações, levando em conta sinônimos e paráfrases<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-analytics_vidhya-2)</sup>.

## Metodologia de Cálculo

O método BERTScore consiste em várias etapas:

1.  **Obtenção de embeddings contextuais**: Ambos os textos (o de referência e o gerado) são divididos em tokens e processados por um modelo transformer pré-treinado (por exemplo, BERT ou RoBERTa). Para cada token, é extraída sua representação vetorial contextual (embedding).
2.  **Cálculo da similaridade de cosseno**: A similaridade de cosseno é calculada para todos os pares de tokens dos dois textos, formando uma matriz de similaridade de tokens<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-bertscore_explained-3)</sup>.
3.  **Cálculo da precisão, recall e F1-score**: Com base na matriz de similaridade, para cada token no texto gerado, o token mais semelhante no texto de referência é encontrado, o que permite calcular a **precisão** (*precision*). De forma análoga, para cada token de referência, o token mais próximo no texto gerado é encontrado, resultando no **recall** (*recall*). O valor final do BERTScore é a medida F₁ balanceada, que combina precisão e recall:

<!-- -->

       RBERT=1|x|∑xi∈xmaxyj∈yxiTyj(Recall)
       PBERT=1|y|∑yj∈ymaxxi∈xxiTyj(Precisão)
       FBERT=2PBERT⋅RBERTPBERT+RBERT

A métrica é flexível: é possível escolher diferentes modelos pré-treinados, ponderar tokens por sua importância (usando pesos IDF) e transformar linearmente as pontuações para melhor interpretabilidade<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-bertscore_explained-3)</sup>.

## Aplicação e Eficácia

O BERTScore é aplicado para avaliar a qualidade em diversas tarefas de geração de texto:

- **Tradução automática**: Captura a preservação do significado, mesmo que as construções da tradução difiram das referências.
- **Sumarização automática**: É capaz de determinar que diferentes formulações podem transmitir os mesmos fatos-chave, o que o torna mais flexível que o ROUGE.
- **Sistemas de diálogo**: Ajuda a medir a relevância de uma resposta, comparando-a com uma referência em nível de significado.

Uma avaliação em larga escala realizada pelos autores mostrou que o coeficiente de correlação do BERTScore com as avaliações humanas é **notavelmente maior** do que o de métricas como BLEU e ROUGE. Além disso, a métrica demonstrou maior robustez a casos complexos de paráfrase<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-bertscore_paper-1)</sup>.

## Vantagens

- **Consideração da semântica**: Compara textos em nível de significado, levando em conta sinônimos e paráfrases.
- **Alta correlação com avaliações humanas**: As pontuações do BERTScore concordam melhor com os julgamentos humanos sobre a qualidade do texto do que as métricas tradicionais.
- **Universalidade e portabilidade**: A métrica não está vinculada a um idioma ou tarefa específica; basta escolher o modelo pré-treinado apropriado.
- **Não requer treinamento**: O BERTScore é uma **métrica não treinável**, ao contrário de métricas mais complexas (como o BLEURT), que exigem treinamento prévio em corpus de avaliações.
- **Integração de modelos modernos**: Utiliza o poder dos transformers para extrair características contextuais profundas.

## Limitações e Críticas

- **Alto custo computacional**: O cálculo baseado em embeddings requer significativamente mais recursos do que a contagem de n-gramas e frequentemente exige o uso de GPUs<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-analytics_vidhya-2)</sup>.
- **Dependência do modelo**: A qualidade da avaliação está diretamente ligada à qualidade do modelo pré-treinado. A escolha do modelo e da camada para extração dos embeddings afeta o resultado, o que pode causar problemas de reprodutibilidade<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-theseus_fi-4)</sup>.
- **Falta de consideração de fatos e estrutura**: O BERTScore foca na similaridade semântica local e não garante a compreensão da estrutura do texto ou a precisão factual. Um texto com frases reordenadas ou erros factuais pode receber uma pontuação alta<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-bertscore_explained-3)</sup>.
- **Baixa interpretabilidade**: Diferentemente do BLEU/ROUGE, a pontuação do BERTScore é menos transparente, o que dificulta a análise de erros.
- **Vieses sociais (bias)**: A métrica herda os estereótipos e vieses presentes nos modelos pré-treinados. Um estudo de 2022 mostrou que métricas baseadas em LLMs (incluindo o BERTScore) exibem um viés social significativamente maior do que as métricas tradicionais<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-bertscore_unfair-5)</sup>.

## Significado e Papel na Avaliação

O BERTScore representa um passo importante no desenvolvimento de métodos de avaliação de texto gerado, pois permite considerar a equivalência semântica, e não apenas correspondências lexicais. Embora nenhuma métrica automática seja capaz de medir perfeitamente a qualidade de um texto, o BERTScore se estabeleceu como uma ferramenta confiável que complementa as abordagens clássicas (como BLEU e ROUGE), em vez de substituí-las completamente.

Na prática, o BERTScore é frequentemente usado em conjunto com a avaliação manual e outras métricas para obter uma compreensão mais completa e profunda do sucesso dos modelos na geração de textos coesos e semanticamente relevantes<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_note-analytics_vidhya-2)</sup>.

## Ligações externas

- <a href="https://github.com/Tiiiger/bert_score" class="external text" rel="nofollow">Repositório oficial do BERTScore no GitHub</a>

## Notas

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 de abril de 2019. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(PT)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 de out. de 2022. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
