---
title: "GLUE Benchmark (KO)"
source: "https://systems-analysis.info/int/GLUE_Benchmark_(KO)"
wiki: "systems-analysis.info/int"
article: "GLUE_Benchmark_(KO)"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2430
wiki_created_at: 2026-09-06T23:03:54Z
wiki_modified_at: 2026-09-06T23:03:54Z
downloaded_at: 2026-09-07T22:51:09Z
---

# GLUE Benchmark (KO)

**GLUE** (**General Language Understanding Evaluation**의 약어, '일반 언어 이해 평가') — 자연어 처리(NLU) 모델의 품질을 평가하기 위한 멀티태스크 benchmark입니다. 이 benchmark는 2018년 뉴욕대학교, 워싱턴대학교, DeepMind의 연구자 그룹(**Alex Wang**과 **Samuel Bowman** 포함)에 의해 제안되었으며, 연구 커뮤니티에서 널리 사용되고 있습니다<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_note-glue_paper-1)</sup>.

GLUE의 주요 목표는 특정 단일 분야를 넘어 다양한 과제들을 아우르는 NLU 모델의 능력을 비교 평가하기 위한 통합적이고 중립적이며 도전적인 테스트 세트를 제공하는 것입니다. 이 benchmark는 **리더보드**(순위표)가 포함된 온라인 플랫폼을 포함하며, 이를 통해 모델 간 객관적인 비교가 가능하고 테스트 데이터에 대한 과적합을 방지합니다. 일부 테스트의 정답 레이블은 공개되지 않고 평가 서버를 통해서만 접근할 수 있습니다. 높은 성과를 달성하려면 모델이 범용적인 언어 표현을 추출하고 다양한 유형의 과제 간에 지식을 효과적으로 전이할 수 있어야 합니다.

## 벤치마크의 구성 및 과제

GLUE benchmark는 AI에 도전적인 기존 dataset을 기반으로 하는 9가지 다양한 언어 이해 과제를 통합합니다. 모든 과제는 단일 문장 또는 문장 쌍에 대한 분류 또는 회귀 문제로 정의됩니다<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_note-glue_paper-1)</sup>.

- **CoLA** (*Corpus of Linguistic Acceptability*) — 문장의 문법적 수용 가능성을 판별하는 과제입니다. 평가 지표는 Matthews 상관 계수입니다.
- **SST-2** (*Stanford Sentiment Treebank*) — 영화 리뷰의 감성(긍정/부정)을 판별하는 과제입니다. 평가 지표는 정확도(*accuracy*)입니다.
- **MRPC** (*Microsoft Research Paraphrase Corpus*) — 뉴스 출처에서 가져온 문장 쌍의 의역 여부를 판별하는 과제입니다. 평가 지표는 정확도와 F1 점수입니다.
- **QQP** (*Quora Question Pairs*) — Quora 커뮤니티에서 중복 질문을 판별하는 과제입니다. 평가 지표는 정확도와 F1 점수입니다.
- **STS-B** (*Semantic Textual Similarity Benchmark*) — 두 문장 간의 의미적 유사도를 측정하는 과제입니다. 모델은 1에서 5까지의 척도로 의미적 유사성 정도를 예측해야 합니다. 평가 지표는 Pearson 및 Spearman 상관 계수입니다.
- **MNLI** (*Multi-Genre Natural Language Inference*) — 다양한 장르의 출처에서 가져온 문장 쌍을 이용하여 텍스트 함의 관계(함의, 모순, 중립)를 인식하는 과제입니다. 결과는 일치(*matched*) 및 불일치(*mismatched*) 하위 집합에서 각각 별도로 평가됩니다.
- **QNLI** (*Question Natural Language Inference*) — SQuAD dataset을 변환하여 만든 과제입니다. 단락의 특정 문장이 주어진 질문에 대한 답변을 포함하는지 여부를 판별해야 합니다.
- **RTE** (*Recognizing Textual Entailment*) — 여러 소규모 컬렉션을 통합한 텍스트 함의 dataset입니다. 과제는 문장 간의 관계를 이진 분류하는 것입니다.
- **WNLI** (*Winograd NLI*) — NLI 형식에 맞게 조정된 Winograd 도식의 수정 버전입니다. 조응어 해소 과제로, 시스템에는 모호한 대명사가 포함된 문장이 주어지며 해당 대명사가 두 개체 중 어느 것을 가리키는지 판별해야 합니다.

## 평가 방법론

GLUE 평가를 위해 연구자들은 자신의 모델이 예측한 결과를 전용 서버에 제출하면, 각 과제별 지표와 종합 점수가 자동으로 계산됩니다.

- **GLUE score** — 9개 주요 과제 전체 결과의 평균값으로 계산되는 최종 지표입니다.
- **리더보드** — 현재 NLU 과제에서 어떤 모델이 가장 우수한 성능을 보이는지 보여주는 공개 순위표입니다. 숨겨진 테스트 세트를 사용하여 공정한 비교를 보장합니다.
- **진단 세트** — 세밀한 언어학적 분석을 위해 전문가가 수동으로 주석을 달아 만든 1,100개 예시로 구성된 특별 세트입니다. 이 세트는 순위에 영향을 미치지 않으며, 모델이 어떤 언어적 현상(어휘 의미론, 논리, 상식)을 인식할 수 있는지, 어떤 것에 어려움을 겪는지 파악하기 위한 정성적 분석 도구로 활용됩니다<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_note-glue_paper-1)</sup>.

## 결과 및 산업에 미친 영향

2018년 GLUE가 출시될 당시 최고 수준의 모델(예: ELMo를 사용한 BiLSTM)은 종합 점수 약 **70점**(0~100점 척도)을 달성했으며, 이는 인간 수준(약 87점)보다 현저히 낮은 수치였습니다<sup>[\[2\]](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_note-human_vs_muppet-2)</sup>.

GLUE와 공개 리더보드의 등장은 NLP 분야의 전이 학습(transfer learning)에서 급격한 발전을 촉진했습니다.

- 2019년 5월까지, 출시 후 1년도 채 되지 않아 transformer 기반의 새로운 세대 모델(특히 BERT)이 *state-of-the-art* 기준을 **83.9점**으로 끌어올렸습니다.
- 2019년 하반기에는 GLUE benchmark가 사실상 '정복'되었으며, 최고 성능 시스템이 인간 수준에 근접하거나 일부 과제에서는 이를 초월하기도 했습니다<sup>[\[3\]](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_note-w4ngatang_superglue-3)</sup>.

GLUE는 언어 이해 모델 발전에 있어 **단일 기준점**으로서 중요한 역할을 했습니다. 덕분에 연구자들은 복합적인 과제 세트에서 다양한 아키텍처를 직접 비교하고, 각 접근 방식의 강점과 약점을 파악하며, 공개 리더보드를 통해 성과를 신속하게 공유할 수 있었습니다.

## SuperGLUE: 후속 발전

GLUE의 급속한 성공으로 인해 불과 1년 만에 같은 저자 그룹이 Facebook AI 동료들과 함께 **SuperGLUE**라는 새롭고 더 어려운 테스트 세트를 발표했습니다<sup>[\[4\]](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_note-venturebeat_superglue-4)</sup>.

SuperGLUE는 2019년 말에 최신 모델과 인간 사이의 격차를 다시 만들기 위한 '더 까다로운'(*stickier*) 테스트 모음으로 발표되었습니다. 여기에는 더욱 심층적인 언어 이해를 요구하는 8가지 과제가 포함되었으며, 참가자를 위한 도구와 규칙도 개선되었습니다. GLUE는 기본 테스트로 계속 사용되고 있지만, 경쟁적 발전의 주요 초점은 SuperGLUE 및 기타 보다 전문화된 benchmark로 이동했습니다.

## 외부 링크

- GLUE Benchmark 공식 웹사이트
- 모델 결과가 포함된 Papers With Code의 GLUE 페이지

## 참고 문헌

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## 각주

1.  <span id="cite_note-glue_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_ref-glue_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_ref-glue_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_ref-glue_paper_1-2)</sup> Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv:1804.07461*, 2019. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-human_vs_muppet-2">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_ref-human_vs_muppet_2-0) Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». *arXiv:1905.10425*, 2019. <a href="https://arxiv.org/abs/1905.10425" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-w4ngatang_superglue-3">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_ref-w4ngatang_superglue_3-0) Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS 2019*. <a href="https://w4ngatang.github.io/static/papers/superglue.pdf" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-venturebeat_superglue-4">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(KO)#cite_ref-venturebeat_superglue_4-0) «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». *VentureBeat*. <a href="https://venturebeat.com/business/ai-models-from-microsoft-and-google-already-surpass-human-performance-on-the-superglue-language-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
