Humanity's Last Exam (benchmark) (KO)

From Systems analysis Wiki
Jump to navigation Jump to search

Humanity's Last Exam (HLE, 한국어: «인류의 마지막 시험») — 최고 수준의 인간 전문가에 버금가는 지식과 추론 능력을 요구하는 과제에서 첨단 인공지능(AI) 시스템의 역량을 평가하기 위해 설계된 종합 테스트 benchmark입니다. 이 benchmark는 2024~2025년에 비영리 단체 Center for AI Safety(CAIS)와 Scale AI가 공동으로 개발하였습니다[1].

HLE 프로젝트는 AI 모델을 위한 «최후의 학술 시험»으로 구상되었으며, 현재의 모델이 전문가 수준에 근접하고 있는지, 그리고 어느 부분에서 능력의 격차가 남아 있는지를 판별하기 위한 극도로 어려운 시험입니다[1]. 이 benchmark는 100개 이상의 다양한 분야를 아우르는 2,500개의 매우 난도 높은 문제를 포함하고 있습니다[2].

개발 역사

2020년대 중반에 이르러 GPT-4, Claude 등의 대규모 언어 모델은 MMLU와 같은 대중적인 테스트 세트에서 매우 높은 성과를 보였고, 많은 benchmark가 발전의 신뢰할 수 있는 척도로서의 기능을 잃게 되었습니다. 학부 수준의 표준 시험은 사실상 모델에 의해 «압도»되어, 이후의 개선을 객관적으로 평가하는 것이 불가능해졌습니다[3].

이러한 상황에서 CAIS의 소장이자 저명한 AI 연구자인 댄 헨드릭스(Dan Hendrycks)는 «인류의 마지막 시험» 개념을 제안하였습니다. 이는 AI의 역량을 진정한 전문가 수준과 구별할 수 있는 최고 난도의 문제 모음입니다. 기존의 테스트가 너무 쉬워졌다는 의견을 표명한 기업가 일론 머스크와의 대화가 계기가 되었습니다[2].

이 아이디어를 실현하기 위해 CAIS는 Scale AI와 협력하였습니다. 2024년 9월 15일, 미래 시험을 위한 가장 어려운 문제를 전 세계적으로 공개 모집한다고 공식 발표하였습니다. 주최 측은 전 세계의 학자와 전문가들에게 가장 발전된 AI 모델조차 막힐 수 있는 문제를 보내달라고 요청하였습니다. 참가자들의 참여를 독려하기 위해 50만 달러의 상금이 마련되었습니다[3].

문제 선별은 여러 단계를 거쳐 이루어졌습니다. 우선 제출된 문제들이 첨단 AI 모델을 통한 필터를 거쳤으며, 알고리즘이 자신 있게 풀어낸 문제는 난도가 충분하지 않은 것으로 걸러졌습니다. AI가 해결하지 못한 문제들은 정확성과 유일한 정답의 존재 여부를 평가하기 위해 전문가 검토를 거쳤습니다. 최종적으로 500개 이상의 학술·교육 기관에서 온 약 1,000명의 전문가가 문제 구성에 참여하였습니다[4].

2,500개 문제로 구성된 benchmark의 최종 버전은 2025년 초에 공개되었습니다. 일부 문제는 통제 테스트를 위한 비공개 예비 문제로 남겨두어 모델이 고정된 세트에 맞게 조정되는 것을 방지하고 있습니다[2].

Benchmark의 구조와 내용

HLE의 문제 세트는 학술 지식의 매우 광범위한 분야를 아우릅니다. 문제는 주제에 따라 다음과 같이 분포되어 있습니다:

  • 수학: ~41%
  • 생물학 및 의학: ~11%
  • 컴퓨터과학 및 AI: ~10%
  • 물리학: ~9%
  • 인문·사회과학: ~9%
  • 화학: ~7%
  • 공학: ~4%
  • 기타 분야: ~9%

전체 문제의 약 14%멀티모달 문제로, 이미지(그림, 도표, 텍스트 등)의 분석이 필요합니다[2]. 대부분(약 3/4)의 문제는 단답형 주관식 문제로, 모델이 정확한 답(숫자, 용어, 이름)을 스스로 생성해야 합니다. 나머지는 객관식 문제입니다.

HLE의 모든 문제는 공통적인 특성을 가지고 있습니다:

  • 극도로 높은 난도: 각 문제는 해당 분야의 숙련된 전문가 수준의 지식과 능력을 요구합니다[5].
  • 검증 가능한 답변: 각 문제에는 명확하고 증명 가능한 정답이 존재합니다.
  • 검색 저항성: 단순한 검색만으로는 답을 찾을 수 없도록 문제가 구성되어 있으며, 성공을 위해서는 깊은 주제 이해와 추론이 필요합니다[1].

모델 평가 결과

Humanity's Last Exam은 즉시 극도로 어려운 시험으로서의 명성을 입증하였습니다. 현재의 어떤 AI 모델도 인간에 근접한 결과를 보여주지 못하였습니다. 2025년 기준 최고 수준의 언어 모델들은 매우 낮은 정확도를 보였습니다.

  • OpenAI의 GPT-4 다양한 버전과 Anthropic의 Claude10% 미만의 결과를 보였습니다[4].
  • 일반 LLM 중 가장 높은 결과는 Google DeepMind의 Gemini 2.5 Pro 모델로, 약 21.6%의 정확도를 기록하였습니다[4].
  • 최고의 모델조차 HLE 문제의 약 4/5를 틀렸으며, 이는 현재 AI의 역량과 인간 전문가 수준 사이의 격차의 규모를 강조합니다[1].

특히 주목할 만한 것은 OpenAI의 실험적 에이전트 ChatGPT Deep Research의 결과입니다. 이 에이전트는 자동으로 검색 쿼리를 수행할 수 있도록 허용되었으며, 연구자의 작업 방식을 모방하여 문제의 26.6%를 정확하게 풀었습니다. 이는 도구 없이 사용한 어떤 모델보다 2배 이상 높은 결과이지만, 여전히 합격 점수에는 크게 미치지 못합니다[6].

의의와 전망

HLE의 등장은 AI 커뮤니티에서 중요한 사건이 되었으며, 이 benchmark는 새롭고 더 어려운 발전 척도에 대한 시급한 수요를 충족시켰습니다.

  • 공통 기준점. HLE는 연구자와 정책 입안자에게 AI 역량을 평가하는 객관적인 도구를 제공하여 개선의 동향을 추적하고 기계가 인간 수준에 얼마나 근접하고 있는지 파악할 수 있게 합니다.
  • 정책 정보 제공 도구. 이러한 기준 시험의 존재는 AI 발전 방향, 잠재적 위험 및 필요한 규제 조치에 관한 보다 실질적인 논의를 촉진합니다.
  • 학술 시험의 최후 관문. «마지막 시험»이라는 명칭 자체가, 이 문제 세트가 AI를 평가하기 위한 마지막 폐쇄형 시험이 될 수 있다는 아이디어를 반영합니다. HLE를 확실하게 통과한다는 것은, 공식적인 지식과 엄격하게 검증 가능한 추론 능력 면에서 기계가 최고의 인간 전문가 수준에 도달하였음을 의미할 것입니다[4].

HLE를 완전히 통과한다 하더라도 범용 인공지능(AGI)의 달성을 의미하지는 않는다는 점을 주목해야 합니다. 이 시험은 창의적 능력, 자발성 또는 새로운 과학적 질문을 제기하는 능력을 검증하지 않기 때문입니다[4].

빠른 발전 속도를 고려할 때, 연구자들은 2025년 말까지 모델이 HLE에서 50%의 정확도를 초과할 수 있을 것으로 예상합니다. 이는 기계가 학술 지식이라는 좁지만 중요한 지표에서 인간 수준에 매우 근접하였음을 의미할 것입니다[4].

참조 링크

  • Humanity's Last Exam 공식 웹사이트
  • Benchmark를 소개하는 학술 논문

참고 문헌

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

주석

  1. 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
  2. 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
  3. 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
  4. 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
  5. «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
  6. «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]