---
title: "LLM benchmarks — LLM 벤치마크"
source: "https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC"
wiki: "systems-analysis.info/int"
article: "LLM_benchmarks_—_LLM_벤치마크"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3588
wiki_created_at: 2026-09-06T23:23:02Z
wiki_modified_at: 2026-09-06T23:23:02Z
downloaded_at: 2026-09-07T22:57:44Z
---

# LLM benchmarks — LLM 벤치마크

**대형 언어 모델 벤치마크**란 대형 언어 모델(LLM)의 품질과 성능을 측정·비교·평가하기 위해 설계된 표준화된 테스트 모음이다<sup>[\[1\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-ibm-benchmarks-1)</sup>. 일반적으로 각 벤치마크는 올바른 답변이나 평가 기준이 미리 정해진 고정된 과제 집합(예: 질문, 텍스트 또는 지시문)으로 구성된다. 이러한 접근 방식은 동일한 조건에서 서로 다른 모델을 객관적으로 비교할 수 있게 하며, 분야의 발전을 추적하고 모델의 강점과 약점을 파악하는 데 도움을 준다<sup>[\[2\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-evidently-guide-2)</sup>.

벤치마크의 정기적인 활용은 LLM 발전에 핵심적인 역할을 하며, 개발자들이 모델을 개선하도록 독려하고 학술 커뮤니티 내에서 결과의 투명성과 비교 가능성을 보장한다. 벤치마크의 진화는 LLM 자체의 발전을 반영한다: 단순한 언어 이해 과제에서 다단계 추론, 상식, 윤리 및 안전성을 검증하는 복합적인 테스트에 이르기까지 발전해 왔다<sup>[\[3\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-habr-popular-llm-3)</sup>.

## 주요 카테고리 및 사례

LLM 벤치마크는 다양한 능력과 응용 분야를 포괄한다. 아래에서는 주요 카테고리와 각 카테고리에서 가장 잘 알려진 과제 모음을 살펴본다.

### 일반 언어 이해

이 카테고리는 자연어를 이해하고 해석하는 모델의 기본 능력을 평가한다.

- **GLUE** (General Language Understanding Evaluation, 2019) — 감정 분석부터 텍스트 논리적 일관성 평가에 이르기까지 다양한 과제를 포함한 최초의 종합 벤치마크 중 하나다. 모든 과제의 결과가 단일 점수로 집계되어 초기 모델들을 총합 성능 기준으로 비교할 수 있게 했다<sup>[\[4\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-wang2019glue-4)</sup>.
- **SuperGLUE** (2019) — GLUE의 '강화된' 후속 벤치마크로, 모델들이 빠르게 인간 수준에 근접한 결과를 달성했다는 점에 대응하여 개발되었다. SuperGLUE는 깊은 문맥 이해와 추론 능력을 요구하는 더 어려운 과제를 포함한다<sup>[\[5\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-wang2019superglue-5)</sup>.
- **WinoGrande** (2019) — Winograd Schema 퀴즈의 확장 버전이다. 올바른 해석을 선택하기 위해 상식이 필요한 문장 내 모호한 대명사 해소 과제 4만 4천 개를 포함한다<sup>[\[6\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-sakaguchi2019-6)</sup>.

### 멀티태스크 및 복합 벤치마크

이 모음은 순수한 언어적 과제의 범위를 넘어 광범위한 지식과 능력에 걸쳐 모델을 테스트한다.

- **MMLU** (Massive Multitask Language Understanding, 2020) — 학교 교과목부터 전문 직업 지식(법학, 의학)에 이르기까지 57개 주제 분야를 망라하는 퀴즈 형식의 과제 모음이다. MMLU는 모델의 박식함의 폭을 측정한다<sup>[\[7\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-hendrycks2020mmlu-7)</sup>.
- **BIG-bench** (Beyond the Imitation Game Benchmark, 2022) — 400명 이상의 저자가 참여하여 개발한, 당시 기준 최대 규모의 협업 벤치마크다. 언어학에서 물리학까지 200개 이상의 다양한 주제 과제를 포함하며, 단순한 패턴 매칭을 넘어 비정형적인 상황에서 모델의 한계를 파악하기 위해 설계되었다<sup>[\[8\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-srivastava2022bigbench-8)</sup>.

### 상식 및 진실성

이 벤치마크들은 일상적인 상황에 대해 논리적인 추론을 하고 잘못된 정보의 전파를 피하는 모델의 능력을 평가한다.

- **HellaSwag** (2019) — 상황 설명에 대해 가장 그럴듯한 결말을 선택하는 과제를 통해 상식을 테스트한다. 이 벤치마크의 특징은 '함정'의 존재다: 오답은 자동으로 생성되어 매우 그럴듯하게 보이므로, 모델은 문맥에 대한 깊은 이해를 요구받는다<sup>[\[9\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-zellers2019hellaswag-9)</sup>.
- **TruthfulQA** (2021) — 모델이 널리 퍼진 미신과 오해를 전파하는 경향을 측정한다. 인터넷에서 흔히 볼 수 있는 답변이 틀린 질문들을 포함한다(예: "백신이 자폐증을 유발하는가?"). 모델은 잘못된 고정관념에 굴복하지 않고 사실적으로 정확한 답변을 제공해야 한다<sup>[\[10\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-lin2021truthfulqa-10)</sup>.

### 수학 문제

- **GSM8K** (2021) — 초등학교 수준의 수학 서술형 문제 수천 개를 포함한다. 각 문제는 답을 구하기 위해 2~8단계의 산술 연산 과정을 요구하며, 다단계 추론 능력을 검증한다<sup>[\[11\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-cobbe2021gsm8k-11)</sup>.
- **MATH** (2021) — 수학 올림피아드 및 경시대회 문제로 구성된 더 어려운 과제 모음이다. 대수학, 기하학, 정수론 분야를 포함하며, 비자명한 풀이 방법에 대한 숙달을 요구한다<sup>[\[12\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-hendrycks2021math-12)</sup>.

### 프로그램 코드 생성

- **HumanEval** (2021) — LLM의 코드 작성 능력을 평가하는 표준 테스트다. 주어진 설명을 바탕으로 모델이 올바른 Python 코드를 생성해야 하는 프로그래밍 과제 164개를 포함한다. 정확성은 유닛 테스트로 평가된다<sup>[\[13\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-chen2021humaneval-13)</sup>.
- **SWE-bench** (2023) — GitHub의 실제 문제(*issues*) 설명을 수집한 보다 현실적인 벤치마크다. 모델은 해당 문제를 해결하는 패치(코드 조각)를 생성해야 한다. 이는 방대한 양의 타인 코드를 이해하고 복잡한 단계적 추론을 요구한다<sup>[\[14\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-jimenez2023swebench-14)</sup>.

### 대화 모델 평가

- **Chatbot Arena** (2024) — 두 개의 익명 모델이 사용자와 쌍방향 대화에 참여하는 개방형 온라인 플랫폼이다. 대화 후 사용자는 어느 쪽의 답변이 더 나았는지 투표한다. 수천 번의 이러한 '대결'을 기반으로 실제 대화에서의 모델 품질을 반영하는 사용자 선호도 Elo 등급이 형성된다<sup>[\[15\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-chiang2024chatbot-15)</sup>.
- **MT-Bench** (2023) — 대화 능력의 스트레스 테스트를 위한 자동화 벤치마크다. 다단계 대화를 모방하는 80쌍의 질문을 포함한다. 모델의 답변은 미리 정해진 척도에 따라 더 강력한 다른 LLM('LLM-as-a-judge', 예: GPT-4)에 의해 평가된다<sup>[\[16\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-zheng2023mtbench-16)</sup>.

### 안전성 및 신뢰성

- **AgentHarm** (2024) — LLM 에이전트가 위험한 지시를 수행하려는 경향을 평가하는 벤치마크다. 사기에서 사이버 범죄에 이르기까지 악의적인 과제를 나타내는 110개의 시나리오를 포함한다. 우수한 모델은 이러한 요청의 수행을 거부해야 한다<sup>[\[17\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-andriushchenko2024agentharm-17)</sup>.
- **SafetyBench** (2023) — 모델이 부적절한 콘텐츠와 유해한 조언의 생성을 얼마나 일관되게 회피하는지를 검증하는, 도발적인 요청을 포함한 1만 1천 개 이상의 광범위한 질문 모음이다<sup>[\[18\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-zhang2023safetybench-18)</sup>.

## 한계 및 현안 문제

- **데이터 오염**: 평가 신뢰성에 대한 주요 위협은 테스트 데이터가 학습 데이터셋에 유출되는 것이다. 모델이 답변을 단순히 암기하여 결과가 인위적으로 부풀려질 수 있다<sup>[\[2\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-evidently-guide-2)</sup>.
- **벤치마크 포화**: 모델이 발전함에 따라 기존 벤치마크(GLUE 등)에서의 성능이 한계에 도달하고, 테스트가 새롭고 더 강력한 모델들을 구별하는 데 유용하지 않게 된다. 이는 지속적으로 더 복잡한 기준을 개발할 필요성을 제기한다<sup>[\[2\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-evidently-guide-2)</sup>.
- **현실과의 괴리**: 벤치마크에서의 높은 결과가 실제의 비정형적인 시나리오에서 모델의 안정적인 성능을 항상 보장하지는 않는다. 실제 환경은 어떤 고정된 과제 모음보다 훨씬 풍부하고 예측 불가능한 경우가 많다<sup>[\[1\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_note-ibm-benchmarks-1)</sup>.

## 외부 링크

- Open LLM Leaderboard — Hugging Face 커뮤니티의 개방형 모델 순위
- Chatbot Arena Leaderboard — 인간 선호도 기반 채팅 모델 순위

## 각주

1.  <span id="cite_note-ibm-benchmarks-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-ibm-benchmarks_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-ibm-benchmarks_1-1)</sup> «What Are LLM Benchmarks?». *IBM*. <a href="https://www.ibm.com/think/topics/llm-benchmarks" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-evidently-guide-2">↑ <sup>[2.0](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-evidently-guide_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-evidently-guide_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-evidently-guide_2-2)</sup> «20 LLM evaluation benchmarks and how they work». *Evidently AI*. <a href="https://www.evidentlyai.com/llm-guide/llm-benchmarks" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-habr-popular-llm-3">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-habr-popular-llm_3-0) «Самые популярные LLM бенчмарки». *Хабр*. <a href="https://habr.com/ru/articles/844974/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-wang2019glue-4">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-wang2019glue_4-0) Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv*. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-wang2019superglue-5">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-wang2019superglue_5-0) Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *arXiv*. <a href="https://arxiv.org/abs/1905.00537" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-sakaguchi2019-6">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-sakaguchi2019_6-0) Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-hendrycks2020mmlu-7">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-hendrycks2020mmlu_7-0) Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». *arXiv*. <a href="https://arxiv.org/abs/2009.03300" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-srivastava2022bigbench-8">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-srivastava2022bigbench_8-0) Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». *arXiv*. <a href="https://arxiv.org/abs/2206.04615" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-zellers2019hellaswag-9">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-zellers2019hellaswag_9-0) Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv*. <a href="https://arxiv.org/abs/1905.07830" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-lin2021truthfulqa-10">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-lin2021truthfulqa_10-0) Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». *arXiv*. <a href="https://arxiv.org/abs/2109.07958" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-cobbe2021gsm8k-11">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-cobbe2021gsm8k_11-0) Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». *arXiv*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-hendrycks2021math-12">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-hendrycks2021math_12-0) Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chen2021humaneval-13">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-chen2021humaneval_13-0) Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». *arXiv*. <a href="https://arxiv.org/abs/2107.03374" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-jimenez2023swebench-14">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-jimenez2023swebench_14-0) Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». *arXiv*. <a href="https://arxiv.org/abs/2310.06770" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-chiang2024chatbot-15">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-chiang2024chatbot_15-0) Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». *lmsys.org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[15]</a></span>
16. <span id="cite_note-zheng2023mtbench-16">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-zheng2023mtbench_16-0) Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv*. <a href="https://arxiv.org/abs/2306.05685" class="external autonumber" rel="nofollow">[16]</a></span>
17. <span id="cite_note-andriushchenko2024agentharm-17">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-andriushchenko2024agentharm_17-0) Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». *arXiv*. <a href="https://arxiv.org/abs/2402.12249" class="external autonumber" rel="nofollow">[17]</a></span>
18. <span id="cite_note-zhang2023safetybench-18">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%EB%B2%A4%EC%B9%98%EB%A7%88%ED%81%AC#cite_ref-zhang2023safetybench_18-0) Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[18]</a></span>
