---
title: "BERTScore (metric) (KO)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(KO)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(KO)"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 553
wiki_created_at: 2026-09-06T22:35:30Z
wiki_modified_at: 2026-09-06T22:35:30Z
downloaded_at: 2026-09-07T22:40:57Z
---

# BERTScore (metric) (KO)

**BERTScore** — 생성된 텍스트의 품질을 자동으로 평가하는 지표로, BERT와 같은 사전 학습된 언어 모델의 문맥적 embedding을 활용하여 의미론적 유사도를 측정하는 방식에 기반합니다. 이 지표는 2019년 **Tianyi Zhang**을 중심으로 한 연구팀이 「BERTScore: Evaluating Text Generation with BERT」라는 논문에서 제안하였습니다<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-bertscore_paper-1)</sup>.

BLEU 및 ROUGE와 같이 n-gram의 정확한 일치에 기반한 전통적인 지표와 달리, BERTScore는 단어나 표현이 다르더라도 동의어와 paraphrase를 고려하여 의미적 동등성을 파악할 수 있습니다<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-analytics_vidhya-2)</sup>.

## 계산 방법

BERTScore의 방법은 여러 단계로 구성됩니다:

1.  **문맥적 embedding 획득**: 두 텍스트(참조 텍스트와 생성된 텍스트) 모두 token으로 분리되어 사전 학습된 transformer 모델(예: BERT 또는 RoBERTa)을 통과합니다. 각 token에 대해 문맥적 벡터 표현(embedding)이 추출됩니다.
2.  **코사인 유사도 계산**: 두 텍스트의 모든 token 쌍에 대해 코사인 유사도가 계산되며, token 유사도 행렬이 형성됩니다<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-bertscore_explained-3)</sup>.
3.  **Precision, Recall 및 F1 점수 계산**: 유사도 행렬을 기반으로 생성된 텍스트의 각 token에 대해 참조 텍스트에서 가장 유사한 token을 찾아 **Precision**을 계산합니다. 마찬가지로, 참조 텍스트의 각 token에 대해 생성된 텍스트에서 가장 가까운 token을 찾아 **Recall**을 구합니다. BERTScore의 최종 값은 Precision과 Recall을 결합한 균형 잡힌 F₁ 점수입니다:

<!-- -->

       RBERT=1|x|∑xi∈xmaxyj∈yxiTyj(Recall)
       PBERT=1|y|∑yj∈ymaxxi∈xxiTyj(Precision)
       FBERT=2PBERT⋅RBERTPBERT+RBERT

이 지표는 유연성을 갖추고 있어, 다양한 사전 학습 모델을 선택하거나, IDF 가중치를 이용해 token의 중요도에 따라 가중치를 부여하거나, 더 나은 해석 가능성을 위해 점수를 선형 변환할 수 있습니다<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-bertscore_explained-3)</sup>.

## 적용 및 효과

BERTScore는 다양한 텍스트 생성 작업의 품질 평가에 활용됩니다:

- **기계 번역**: 번역 구조가 기준 번역과 다르더라도 의미의 보존 여부를 포착합니다.
- **자동 요약**: 서로 다른 표현이 동일한 핵심 사실을 전달할 수 있음을 판단할 수 있어, ROUGE보다 더 유연합니다.
- **대화 시스템**: 응답을 의미 수준에서 기준 응답과 비교하여 응답의 적절성을 측정하는 데 도움을 줍니다.

저자들이 수행한 대규모 평가에 따르면, BERTScore와 인간 평가 간의 상관계수는 BLEU 및 ROUGE 계열 지표보다 **현저히 높은** 것으로 나타났습니다. 또한 이 지표는 복잡한 paraphrase 사례에 대해 향상된 강건성을 보여 주었습니다<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-bertscore_paper-1)</sup>.

## 장점

- **의미론적 고려**: 동의어와 paraphrase를 고려하여 의미 수준에서 텍스트를 비교합니다.
- **인간 평가와의 높은 상관관계**: BERTScore의 점수는 전통적인 지표보다 텍스트 품질에 대한 인간의 판단과 더 잘 일치합니다.
- **범용성 및 이식성**: 특정 언어나 과제에 종속되지 않으며, 적절한 사전 학습 모델을 선택하는 것으로 충분합니다.
- **학습 불필요**: BERTScore는 **비학습형 지표**로, 평가 코퍼스에 대한 사전 학습이 필요한 BLEURT와 같은 복잡한 지표와 다릅니다.
- **최신 모델 통합**: 심층적인 문맥 특징 추출을 위해 transformer의 강력한 성능을 활용합니다.

## 한계 및 비판

- **높은 계산 비용**: Embedding 기반 계산은 n-gram 계산보다 훨씬 많은 자원을 필요로 하며, 종종 GPU 사용을 요구합니다<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-analytics_vidhya-2)</sup>.
- **모델 의존성**: 평가 품질은 사전 학습 모델의 품질과 직결됩니다. Embedding 추출을 위한 모델과 레이어 선택이 결과에 영향을 미쳐 재현성 문제를 야기할 수 있습니다<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-theseus_fi-4)</sup>.
- **사실 및 구조 고려 부재**: BERTScore는 지역적 의미론적 유사성에 집중하며, 텍스트 구조의 이해나 사실적 정확성을 보장하지 않습니다. 문장이 뒤섞이거나 사실적 오류가 있는 텍스트도 높은 점수를 받을 수 있습니다<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-bertscore_explained-3)</sup>.
- **낮은 해석 가능성**: BLEU/ROUGE와 달리 BERTScore 수치는 투명성이 낮아 오류 분석이 어렵습니다.
- **사회적 편향(bias)**: 이 지표는 사전 학습 모델에 내재된 고정관념과 편향을 그대로 계승합니다. 2022년 연구에 따르면 LLM 기반 지표(BERTScore 포함)는 전통적인 지표보다 사회적 bias를 훨씬 크게 나타냅니다<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-bertscore_unfair-5)</sup>.

## 의의와 평가에서의 역할

BERTScore는 단순한 어휘 일치가 아닌 의미적 동등성을 고려할 수 있다는 점에서 생성 텍스트 평가 방법 발전의 중요한 이정표를 나타냅니다. 어떤 자동 지표도 텍스트 품질을 완벽하게 측정할 수는 없지만, BERTScore는 BLEU 및 ROUGE와 같은 고전적 접근법을 완전히 대체하는 것이 아니라 보완하는 신뢰할 수 있는 도구로 자리매김하였습니다.

실제로 BERTScore는 모델이 얼마나 성공적으로 일관성 있고 의미에 부합하는 텍스트를 생성하는지에 대한 보다 완전하고 심층적인 이해를 얻기 위해 수동 전문가 평가 및 다른 지표들과 함께 사용되는 경우가 많습니다<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_note-analytics_vidhya-2)</sup>.

## 링크

- GitHub의 BERTScore 공식 저장소

## 주석

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(KO)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
