GLUE Benchmark (KO)
GLUE (General Language Understanding Evaluation의 약어, '일반 언어 이해 평가') — 자연어 처리(NLU) 모델의 품질을 평가하기 위한 멀티태스크 benchmark입니다. 이 benchmark는 2018년 뉴욕대학교, 워싱턴대학교, DeepMind의 연구자 그룹(Alex Wang과 Samuel Bowman 포함)에 의해 제안되었으며, 연구 커뮤니티에서 널리 사용되고 있습니다[1].
GLUE의 주요 목표는 특정 단일 분야를 넘어 다양한 과제들을 아우르는 NLU 모델의 능력을 비교 평가하기 위한 통합적이고 중립적이며 도전적인 테스트 세트를 제공하는 것입니다. 이 benchmark는 리더보드(순위표)가 포함된 온라인 플랫폼을 포함하며, 이를 통해 모델 간 객관적인 비교가 가능하고 테스트 데이터에 대한 과적합을 방지합니다. 일부 테스트의 정답 레이블은 공개되지 않고 평가 서버를 통해서만 접근할 수 있습니다. 높은 성과를 달성하려면 모델이 범용적인 언어 표현을 추출하고 다양한 유형의 과제 간에 지식을 효과적으로 전이할 수 있어야 합니다.
벤치마크의 구성 및 과제
GLUE benchmark는 AI에 도전적인 기존 dataset을 기반으로 하는 9가지 다양한 언어 이해 과제를 통합합니다. 모든 과제는 단일 문장 또는 문장 쌍에 대한 분류 또는 회귀 문제로 정의됩니다[1].
- CoLA (Corpus of Linguistic Acceptability) — 문장의 문법적 수용 가능성을 판별하는 과제입니다. 평가 지표는 Matthews 상관 계수입니다.
- SST-2 (Stanford Sentiment Treebank) — 영화 리뷰의 감성(긍정/부정)을 판별하는 과제입니다. 평가 지표는 정확도(accuracy)입니다.
- MRPC (Microsoft Research Paraphrase Corpus) — 뉴스 출처에서 가져온 문장 쌍의 의역 여부를 판별하는 과제입니다. 평가 지표는 정확도와 F1 점수입니다.
- QQP (Quora Question Pairs) — Quora 커뮤니티에서 중복 질문을 판별하는 과제입니다. 평가 지표는 정확도와 F1 점수입니다.
- STS-B (Semantic Textual Similarity Benchmark) — 두 문장 간의 의미적 유사도를 측정하는 과제입니다. 모델은 1에서 5까지의 척도로 의미적 유사성 정도를 예측해야 합니다. 평가 지표는 Pearson 및 Spearman 상관 계수입니다.
- MNLI (Multi-Genre Natural Language Inference) — 다양한 장르의 출처에서 가져온 문장 쌍을 이용하여 텍스트 함의 관계(함의, 모순, 중립)를 인식하는 과제입니다. 결과는 일치(matched) 및 불일치(mismatched) 하위 집합에서 각각 별도로 평가됩니다.
- QNLI (Question Natural Language Inference) — SQuAD dataset을 변환하여 만든 과제입니다. 단락의 특정 문장이 주어진 질문에 대한 답변을 포함하는지 여부를 판별해야 합니다.
- RTE (Recognizing Textual Entailment) — 여러 소규모 컬렉션을 통합한 텍스트 함의 dataset입니다. 과제는 문장 간의 관계를 이진 분류하는 것입니다.
- WNLI (Winograd NLI) — NLI 형식에 맞게 조정된 Winograd 도식의 수정 버전입니다. 조응어 해소 과제로, 시스템에는 모호한 대명사가 포함된 문장이 주어지며 해당 대명사가 두 개체 중 어느 것을 가리키는지 판별해야 합니다.
평가 방법론
GLUE 평가를 위해 연구자들은 자신의 모델이 예측한 결과를 전용 서버에 제출하면, 각 과제별 지표와 종합 점수가 자동으로 계산됩니다.
- GLUE score — 9개 주요 과제 전체 결과의 평균값으로 계산되는 최종 지표입니다.
- 리더보드 — 현재 NLU 과제에서 어떤 모델이 가장 우수한 성능을 보이는지 보여주는 공개 순위표입니다. 숨겨진 테스트 세트를 사용하여 공정한 비교를 보장합니다.
- 진단 세트 — 세밀한 언어학적 분석을 위해 전문가가 수동으로 주석을 달아 만든 1,100개 예시로 구성된 특별 세트입니다. 이 세트는 순위에 영향을 미치지 않으며, 모델이 어떤 언어적 현상(어휘 의미론, 논리, 상식)을 인식할 수 있는지, 어떤 것에 어려움을 겪는지 파악하기 위한 정성적 분석 도구로 활용됩니다[1].
결과 및 산업에 미친 영향
2018년 GLUE가 출시될 당시 최고 수준의 모델(예: ELMo를 사용한 BiLSTM)은 종합 점수 약 70점(0~100점 척도)을 달성했으며, 이는 인간 수준(약 87점)보다 현저히 낮은 수치였습니다[2].
GLUE와 공개 리더보드의 등장은 NLP 분야의 전이 학습(transfer learning)에서 급격한 발전을 촉진했습니다.
- 2019년 5월까지, 출시 후 1년도 채 되지 않아 transformer 기반의 새로운 세대 모델(특히 BERT)이 state-of-the-art 기준을 83.9점으로 끌어올렸습니다.
- 2019년 하반기에는 GLUE benchmark가 사실상 '정복'되었으며, 최고 성능 시스템이 인간 수준에 근접하거나 일부 과제에서는 이를 초월하기도 했습니다[3].
GLUE는 언어 이해 모델 발전에 있어 단일 기준점으로서 중요한 역할을 했습니다. 덕분에 연구자들은 복합적인 과제 세트에서 다양한 아키텍처를 직접 비교하고, 각 접근 방식의 강점과 약점을 파악하며, 공개 리더보드를 통해 성과를 신속하게 공유할 수 있었습니다.
SuperGLUE: 후속 발전
GLUE의 급속한 성공으로 인해 불과 1년 만에 같은 저자 그룹이 Facebook AI 동료들과 함께 SuperGLUE라는 새롭고 더 어려운 테스트 세트를 발표했습니다[4].
SuperGLUE는 2019년 말에 최신 모델과 인간 사이의 격차를 다시 만들기 위한 '더 까다로운'(stickier) 테스트 모음으로 발표되었습니다. 여기에는 더욱 심층적인 언어 이해를 요구하는 8가지 과제가 포함되었으며, 참가자를 위한 도구와 규칙도 개선되었습니다. GLUE는 기본 테스트로 계속 사용되고 있지만, 경쟁적 발전의 주요 초점은 SuperGLUE 및 기타 보다 전문화된 benchmark로 이동했습니다.
외부 링크
- GLUE Benchmark 공식 웹사이트
- 모델 결과가 포함된 Papers With Code의 GLUE 페이지
참고 문헌
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
각주
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]