BERTScore (metric) (KO)

From Systems analysis Wiki
Jump to navigation Jump to search

BERTScore — 생성된 텍스트의 품질을 자동으로 평가하는 지표로, BERT와 같은 사전 학습된 언어 모델의 문맥적 embedding을 활용하여 의미론적 유사도를 측정하는 방식에 기반합니다. 이 지표는 2019년 Tianyi Zhang을 중심으로 한 연구팀이 「BERTScore: Evaluating Text Generation with BERT」라는 논문에서 제안하였습니다[1].

BLEU 및 ROUGE와 같이 n-gram의 정확한 일치에 기반한 전통적인 지표와 달리, BERTScore는 단어나 표현이 다르더라도 동의어와 paraphrase를 고려하여 의미적 동등성을 파악할 수 있습니다[2].

계산 방법

BERTScore의 방법은 여러 단계로 구성됩니다:

  1. 문맥적 embedding 획득: 두 텍스트(참조 텍스트와 생성된 텍스트) 모두 token으로 분리되어 사전 학습된 transformer 모델(예: BERT 또는 RoBERTa)을 통과합니다. 각 token에 대해 문맥적 벡터 표현(embedding)이 추출됩니다.
  2. 코사인 유사도 계산: 두 텍스트의 모든 token 쌍에 대해 코사인 유사도가 계산되며, token 유사도 행렬이 형성됩니다[3].
  3. Precision, Recall 및 F1 점수 계산: 유사도 행렬을 기반으로 생성된 텍스트의 각 token에 대해 참조 텍스트에서 가장 유사한 token을 찾아 Precision을 계산합니다. 마찬가지로, 참조 텍스트의 각 token에 대해 생성된 텍스트에서 가장 가까운 token을 찾아 Recall을 구합니다. BERTScore의 최종 값은 Precision과 Recall을 결합한 균형 잡힌 F₁ 점수입니다:
   RBERT=1|x|xixmaxyjyxiTyj(Recall)
   PBERT=1|y|yjymaxxixxiTyj(Precision)
   FBERT=2PBERTRBERTPBERT+RBERT

이 지표는 유연성을 갖추고 있어, 다양한 사전 학습 모델을 선택하거나, IDF 가중치를 이용해 token의 중요도에 따라 가중치를 부여하거나, 더 나은 해석 가능성을 위해 점수를 선형 변환할 수 있습니다[3].

적용 및 효과

BERTScore는 다양한 텍스트 생성 작업의 품질 평가에 활용됩니다:

  • 기계 번역: 번역 구조가 기준 번역과 다르더라도 의미의 보존 여부를 포착합니다.
  • 자동 요약: 서로 다른 표현이 동일한 핵심 사실을 전달할 수 있음을 판단할 수 있어, ROUGE보다 더 유연합니다.
  • 대화 시스템: 응답을 의미 수준에서 기준 응답과 비교하여 응답의 적절성을 측정하는 데 도움을 줍니다.

저자들이 수행한 대규모 평가에 따르면, BERTScore와 인간 평가 간의 상관계수는 BLEU 및 ROUGE 계열 지표보다 현저히 높은 것으로 나타났습니다. 또한 이 지표는 복잡한 paraphrase 사례에 대해 향상된 강건성을 보여 주었습니다[1].

장점

  • 의미론적 고려: 동의어와 paraphrase를 고려하여 의미 수준에서 텍스트를 비교합니다.
  • 인간 평가와의 높은 상관관계: BERTScore의 점수는 전통적인 지표보다 텍스트 품질에 대한 인간의 판단과 더 잘 일치합니다.
  • 범용성 및 이식성: 특정 언어나 과제에 종속되지 않으며, 적절한 사전 학습 모델을 선택하는 것으로 충분합니다.
  • 학습 불필요: BERTScore는 비학습형 지표로, 평가 코퍼스에 대한 사전 학습이 필요한 BLEURT와 같은 복잡한 지표와 다릅니다.
  • 최신 모델 통합: 심층적인 문맥 특징 추출을 위해 transformer의 강력한 성능을 활용합니다.

한계 및 비판

  • 높은 계산 비용: Embedding 기반 계산은 n-gram 계산보다 훨씬 많은 자원을 필요로 하며, 종종 GPU 사용을 요구합니다[2].
  • 모델 의존성: 평가 품질은 사전 학습 모델의 품질과 직결됩니다. Embedding 추출을 위한 모델과 레이어 선택이 결과에 영향을 미쳐 재현성 문제를 야기할 수 있습니다[4].
  • 사실 및 구조 고려 부재: BERTScore는 지역적 의미론적 유사성에 집중하며, 텍스트 구조의 이해나 사실적 정확성을 보장하지 않습니다. 문장이 뒤섞이거나 사실적 오류가 있는 텍스트도 높은 점수를 받을 수 있습니다[3].
  • 낮은 해석 가능성: BLEU/ROUGE와 달리 BERTScore 수치는 투명성이 낮아 오류 분석이 어렵습니다.
  • 사회적 편향(bias): 이 지표는 사전 학습 모델에 내재된 고정관념과 편향을 그대로 계승합니다. 2022년 연구에 따르면 LLM 기반 지표(BERTScore 포함)는 전통적인 지표보다 사회적 bias를 훨씬 크게 나타냅니다[5].

의의와 평가에서의 역할

BERTScore는 단순한 어휘 일치가 아닌 의미적 동등성을 고려할 수 있다는 점에서 생성 텍스트 평가 방법 발전의 중요한 이정표를 나타냅니다. 어떤 자동 지표도 텍스트 품질을 완벽하게 측정할 수는 없지만, BERTScore는 BLEU 및 ROUGE와 같은 고전적 접근법을 완전히 대체하는 것이 아니라 보완하는 신뢰할 수 있는 도구로 자리매김하였습니다.

실제로 BERTScore는 모델이 얼마나 성공적으로 일관성 있고 의미에 부합하는 텍스트를 생성하는지에 대한 보다 완전하고 심층적인 이해를 얻기 위해 수동 전문가 평가 및 다른 지표들과 함께 사용되는 경우가 많습니다[2].

링크

  • GitHub의 BERTScore 공식 저장소

주석

  1. 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
  2. 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
  3. 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
  4. Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
  5. Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]