---
title: "LLM evaluation — 대형 언어 모델 평가"
source: "https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80"
wiki: "systems-analysis.info/int"
article: "LLM_evaluation_—_대형_언어_모델_평가"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 3627
wiki_created_at: 2026-09-06T23:23:37Z
wiki_modified_at: 2026-09-06T23:23:37Z
downloaded_at: 2026-09-07T22:57:57Z
---

# LLM evaluation — 대형 언어 모델 평가

**대형 언어 모델(LLM) 평가**는 인공지능 분야의 학문으로, 언어 모델의 능력, 한계 및 위험을 측정하기 위한 표준화된 방법을 제공합니다<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-chang2023-1)</sup>. LLM이 의료 및 금융과 같은 핵심 분야에 통합됨에 따라, 안전성·신뢰성·공정성을 보장하기 위한 객관적인 평가가 필수적으로 요구됩니다<sup>[\[2\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-ccl-survey-2)</sup>.

LLM 평가는 다음과 같은 몇 가지 근본적인 기능을 수행합니다:

- 능력 측정: 표준화된 과제에서 다양한 모델의 성능을 객관적으로 비교합니다.
- 진전 추적: 성과를 기록하고 추가 개선이 필요한 영역을 식별합니다.
- 위험 최소화: 편향, 환각, 안전 문제 등 잠재적으로 유해한 결과를 식별합니다.
- 개발자 및 사용자 정보 제공: 특정 응용 프로그램에 가장 적합한 모델을 선택할 수 있도록 투명한 정보를 제공합니다.

## 주요 접근법 및 방법론

현대적인 LLM 평가는 **GLUE**(General Language Understanding Evaluation)와 같은 종합적인 benchmark의 등장과 함께 시작되었으며, 이는 일반적인 언어 이해 평가의 표준을 확립하였습니다<sup>[\[3\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-wang2018-3)</sup>. 모델이 GLUE에서 인간 수준의 성능을 초과하기 시작함에 따라, **SuperGLUE**와 같은 더 복잡한 후속 benchmark가 개발되었습니다<sup>[\[4\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-understanding-benchmarks-4)</sup>.

순수한 언어적 과제를 넘어 광범위한 지식과 추론 능력을 테스트하는 **MMLU**와 **BIG-bench** 같은 다중 과제 benchmark의 도입과 함께 근본적인 전환이 이루어졌습니다<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-chang2023-1)</sup>.

### 핵심 메트릭 및 benchmark

#### 자동화 메트릭

- **퍼플렉서티** (Perplexity): 모델이 텍스트를 얼마나 잘 예측하는지 측정하는 기본 메트릭입니다. 낮은 퍼플렉서티는 모델의 예측에 대한 더 높은 확신을 나타냅니다.
- **BLEU** 및 **ROUGE**: 생성된 텍스트와 참조 텍스트 간의 어휘적 일치를 측정하는 n-gram 기반 메트릭입니다. BLEU는 정밀도에, ROUGE는 재현율에 초점을 맞춥니다<sup>[\[2\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-ccl-survey-2)</sup>.
- **BERTScore**: BERT의 embedding을 사용하여 의미론적 유사성을 계산하는 의미 기반 메트릭입니다. 동의어 및 의역을 포착할 수 있어 n-gram 기반 메트릭보다 더 정확합니다<sup>[\[5\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-zhang2019-bertscore-5)</sup>.

#### 특화 benchmark

특정 능력을 평가하기 위해 목적에 맞는 benchmark가 개발되었습니다:

- **코드 생성**: **HumanEval**은 텍스트 설명으로부터 올바른 프로그램 코드를 생성하는 모델의 능력을 평가하며, 단위 테스트를 통해 기능을 검증합니다<sup>[\[6\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-chen2021-humaneval-6)</sup>.
- **상식 추론**: **HellaSwag**은 일상적인 상황의 가장 그럴듯한 결말을 예측하는 방식을 통해 물리적 세계와 인과관계에 대한 모델의 이해를 테스트합니다<sup>[\[7\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-zellers2019-hellaswag-7)</sup>.
- **학문적 지식**: **MMLU**(Massive Multitask Language Understanding)는 초등 수학부터 법학 및 의학에 이르기까지 57개 과목을 포괄하며 모델의 폭넓은 지식을 검증합니다<sup>[\[8\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-hendrycks2020-mmlu-8)</sup>.
- **능력의 경계**: **BIG-bench**(Beyond the Imitation Game)는 모델이 임계 규모에 도달했을 때 갑자기 나타나는 능력인 창발적 능력을 발견하기 위해 설계된 204개의 과제를 모은 협력적 프로젝트입니다<sup>[\[9\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-srivastava2022-bigbench-9)</sup>.

### 안전성 및 윤리적 측면 평가

- **편향**: 사회적·인구통계학적 편견을 평가하기 위해 **BBQ**(Bias Benchmark for Question Answering) 및 **BOLD**(Bias in Open-ended Language generation Dataset)와 같은 dataset이 사용됩니다.
- **독성**: **RealToxicityPrompts**와 같은 benchmark는 독성 콘텐츠 생성을 유도하는 프롬프트를 제공하여 모델의 견고성을 평가합니다.
- **견고성(Robustness)**: 적대적 공격을 통해 평가됩니다. **PromptRobust** 프레임워크는 문자, 단어, 문장 수준에서 모델의 견고성을 검증하기 위한 포괄적인 프롬프트 세트를 제공합니다.

### 현대적 표준 및 프레임워크

- **HELM**(Holistic Evaluation of Language Models): 스탠퍼드 대학교의 이니셔티브로 '전체론적' 방법론을 제안합니다. HELM은 정확성, 견고성, 공정성, 편향, 독성 및 효율성 등 다양한 차원에서 모델을 평가합니다<sup>[\[10\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-bommasani2022-helm-10)</sup>.
- **ISO/IEC 42001:2023**: AI 관리 시스템을 위한 최초의 국제 표준으로, 전체 생명 주기에 걸친 AI 거버넌스 요건을 수립합니다.
- **EU 규정 2024/1689 (EU AI Act)**: 최초의 포괄적 AI 규제로, 시스템적 위험을 지닌 범용 모델에 대한 표준화된 평가를 요구합니다.
- **NIST AI Risk Management Framework 1.0**: 미국 국립표준기술연구소(NIST)가 개발한, 신뢰할 수 있는 AI의 개발 및 배포를 위한 자발적 프레임워크입니다.

## 기존 방법의 문제점 및 한계

- **Benchmark 포화**: 많은 모델이 인기 있는 benchmark에서 거의 완벽한 점수를 달성함으로써, 모델이 일반적인 능력이 아닌 특정 테스트에 최적화되는 'benchmark 추격' 현상이 발생합니다.
- **데이터 오염**: benchmark의 테스트 데이터가 학습 세트에 우연히 포함되어 평가 결과가 과장되고 불공정해지는 심각한 문제입니다.
- **인간 판단과의 낮은 상관관계**: BLEU 및 ROUGE와 같은 자동화 메트릭은, 특히 창의적이고 개방형 과제에서 인간의 품질 평가와 상관관계가 낮은 경우가 많습니다.

## 최신 연구 및 동향

- **LLM-as-a-Judge 패러다임**: 강력한 LLM(예: GPT-4)을 '심판'으로 활용하여 다른 모델의 응답을 평가하는 방식입니다. 이 접근법은 비용이 많이 드는 인간 평가에 대한 확장 가능한 대안을 제공합니다.
- **동적 및 적응적 평가**: **LMArena**와 같은 플랫폼은 사용자와의 실제 상호작용에서 모델을 실시간으로 평가하기 위한 Elo 등급 기반의 크라우드소싱 시스템을 제공합니다.
- **하이브리드 접근법**: 자동화 메트릭, 인간의 판단, LLM 평가를 결합하여 모델 성능에 대한 더 완전하고 신뢰할 수 있는 그림을 얻습니다.

LLM 평가의 환경은 계속해서 발전하고 있으며, 정확성뿐만 아니라 AI 기술 적용의 사회적·윤리적 측면을 고려하는 다차원적이고 표준화된 재현 가능한 프레임워크를 구축하는 방향으로 나아가고 있습니다<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_note-chang2023-1)</sup>.

## 참고 링크

- Stanford HELM — Holistic Evaluation of Language Models 프로젝트 공식 사이트.
- Chatbot Arena — 인간의 선호도를 기반으로 챗봇을 비교 평가하는 플랫폼.

## 참고 문헌

- Wang, A. et al. (2018). *GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding*. arXiv:1804.07461.
- Zhang, T. et al. (2019). *BERTScore: Evaluating Text Generation with BERT*. arXiv:1904.09675.
- Wang, A. et al. (2019). *SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems*. arXiv:1905.00537.
- Zellers, R. et al. (2019). *HellaSwag: Can a Machine Really Finish Your Sentence?*. arXiv:1905.07830.
- Hendrycks, D. et al. (2020). *Measuring Massive Multitask Language Understanding*. arXiv:2009.03300.
- Gehman, S. et al. (2020). *RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models*. arXiv:2009.11462.
- Chen, M. et al. (2021). *Evaluating Large Language Models Trained on Code*. arXiv:2107.03374.
- Parrish, A. et al. (2021). *BBQ: A Hand-Built Bias Benchmark for Question Answering*. arXiv:2110.08193.
- Dhamala, J. et al. (2021). *BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation*. arXiv:2101.11718.
- Srivastava, A. et al. (2022). *Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models*. arXiv:2206.04615.
- Bommasani, R. et al. (2022). *Holistic Evaluation of Language Models*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Zhuang, Y. et al. (2023). *Through the Lens of Core Competency: Survey on Evaluation of Large Language Models*. ACL Anthology:2023.ccl-2.8.
- Zhu, K. et al. (2023). *PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts*. arXiv:2306.04528.

## 각주

1.  <span id="cite_note-chang2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-chang2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-chang2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-chang2023_1-2)</sup> Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2307.03109" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-ccl-survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-ccl-survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-ccl-survey_2-1)</sup> Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». *ACL Anthology*. <a href="https://aclanthology.org/2023.ccl-2.8/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wang2018-3">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-wang2018_3-0) Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv*.<a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-understanding-benchmarks-4">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-understanding-benchmarks_4-0) Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». *Medium*.</span>
5.  <span id="cite_note-zhang2019-bertscore-5">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-zhang2019-bertscore_5-0) Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». *arXiv*.</span>
6.  <span id="cite_note-chen2021-humaneval-6">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-chen2021-humaneval_6-0) Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». *arXiv*.</span>
7.  <span id="cite_note-zellers2019-hellaswag-7">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-zellers2019-hellaswag_7-0) Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv*.</span>
8.  <span id="cite_note-hendrycks2020-mmlu-8">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-hendrycks2020-mmlu_8-0) Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». *arXiv*.</span>
9.  <span id="cite_note-srivastava2022-bigbench-9">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-srivastava2022-bigbench_9-0) Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». *arXiv*.</span>
10. <span id="cite_note-bommasani2022-helm-10">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_%ED%8F%89%EA%B0%80#cite_ref-bommasani2022-helm_10-0) Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». *arXiv*. <a href="https://arxiv.org/abs/2211.09110" class="external autonumber" rel="nofollow">[4]</a></span>
