LMArena (Chatbot Arena) (KO)
Arena(2026년 1월 28일까지는 LMArena(Large Model Arena), 그 이전에는 Chatbot Arena)는 대규모 언어 모델(LLM)과 멀티모달 모델(텍스트·이미지·동영상)을 실제 인간의 선호도에 기반하여 크라우드소싱 방식으로 평가·비교하는 개방형 웹 플랫폼이다. 핵심은 모델 간의 익명 쌍대 비교(blind battles)와 Elo 레이팅 시스템이며, 이를 바탕으로 공개적이고 투명한 리더보드를 발표한다. 이 리더보드는 프론티어 AI 모델에 대한 가장 널리 인정받는 독립 벤치마크 중 하나로 평가된다.[1][2]
이 플랫폼은 2023년 캘리포니아 대학교 버클리(Sky Computing Lab)의 연구 조직 LMSYS Org(Large Model Systems Organization)의 학술 연구 프로젝트로 출발했다. 2024년 9월, 프로젝트는 자체 도메인 lmarena.ai로 "졸업(Graduation)"했다[3]. 2025년 4월에는 독립 기업 Arena Intelligence Inc.가 설립되었으며, 2025년 5월 21일에는 기업가치 6억 달러로 1억 달러 규모의 시드 라운드를 유치했다(주요 투자자는 a16z와 UC Investments)[4][5]. 2026년 1월 6일, 회사는 포스트머니 기업가치 17억 달러로 1억 5000만 달러 규모의 시리즈 A 라운드를 마무리했다(Felicis와 UC Investments가 주도)[6][7]. 2026년 1월 28일에는 최종 리브랜딩이 이루어져, 플랫폼은 Arena로 개칭하고 도메인을 arena.ai로 이전했다[8][9].
역사
이 플랫폼은 2023년 4월 Chatbot Arena라는 이름으로, 캘리포니아 대학교 버클리(Sky Computing Lab)의 연구 조직 LMSYS Org(Large Model Systems Organization)의 연구 프로젝트로 공개되었다. 실제 사용자의 선호도에 기반하여 익명 쌍대 비교(blind battles)와 Elo 레이팅 시스템을 통해 대규모 언어 모델을 크라우드소싱 방식으로 평가하는 최초의 도구 중 하나였다.
- 2023년 4월 24일 — Chatbot Arena의 기술적 출시.
- 2023년 5월 3일 — 공식 일반 공개 및 최초 리더보드 발표.
- 2023년 — 최초의 공개 데이터셋 출시: 3만 3000건의 페어 대화(7월)와 LMSYS-Chat-1M(9월, 약 100만 건의 실제 대화).
- 2024년 3월 1일 — 플랫폼 공식 정책 발표 및 개방적이고 커뮤니티 주도적인 평가 시스템으로서의 사명 명문화.
- 2024년 6월 27일 — 이미지 지원 추가 및 멀티모달 작업으로의 확장 시작.
- 2024년 9월 20일 — "Graduation": 독립 도메인 lmarena.ai로 이전.
- 2024년 말 ~ 2025년 봄 — 전문 아레나(Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control 등) 출시.
- 2025년 4월 17일 — 독립 기업 Arena Intelligence Inc.로 공식 법인화 및 LMArena 브랜드로 개편된 플랫폼의 베타 버전 공개.
- 2025년 5월 21일 — 회사 설립 발표 및 1억 달러 규모의 시드 라운드(기업가치 6억 달러).
- 2025년 7월 31일 — Text Arena의 최근 대화 14만 건으로 구성된 공개 데이터셋 출시.
- 2025년 12월 18일 — 랭킹 방법론을 구현한 오픈 소스 패키지 Arena-Rank 출시.
- 2026년 1월 6일 — 포스트머니 기업가치 17억 달러로 1억 5000만 달러 규모의 시리즈 A 라운드 마무리.
- 2026년 1월 — Video Arena(동영상 모달리티 완전 지원) 출시.
- 2026년 1월 28일 — 최종 리브랜딩: 플랫폼을 Arena로 개칭하고 도메인을 arena.ai로 이전.
2026년 3월 기준, Arena(arena.ai)는 150개국 이상에 걸쳐 500만 명이 넘는 월간 활성 사용자에게 서비스를 제공하며, 수천만 건의 투표를 축적했고, 실세계의 인간 선호도에 기반하여 프론티어 AI 모델을 평가하는 가장 널리 인정받는 독립 도구 중 하나로 남아 있다.
평가 방식
사용자는 쿼리(프롬프트)를 입력하고 무작위로 선택된 두 개의 익명 모델("A"와 "B")로부터 응답을 받은 뒤, 더 나은 응답에 투표한다(또는 무승부이거나 어느 쪽도 만족스럽지 않다고 표시한다). 랭킹은 Elo와 개념적으로 유사한 Bradley–Terry 통계 모델(쌍대 선호도에 대한 로지스틱 회귀)에 기반한다[1]. 플랫폼은 Arena Score와 신뢰 구간을 공개하며, 불균일한 샘플링에서도 편향이 생기지 않도록 샘플링 보정(재가중, re-weighting)을 적용한다[10].
투명성과 개방성. 평가 및 랭킹 파이프라인은 오픈 소스이다. 원래 인프라는 FastChat 저장소에 있으며[11], 2025년 12월에는 리더보드 방법론이 독립적인 Python 패키지 Arena-Rank로 공개되었다. 이는 현재 사이트의 모든 리더보드를 구동하며, FastChat 기반 버전보다 약 30배 빠르다[12]. 또한 검증과 연구를 위해 원시 데이터의 일부가 정기적으로 공개된다(예: 2025년 7월의 14만 건 대화 공개)[10][13]. FAQ와 홈페이지의 안내에 따르면, 사용자 쿼리는 모델 제공업체와 공유되고 연구 목적으로 일부 공개될 수 있으므로, 민감한 데이터를 제출해서는 안 된다[14][15].
선정 및 샘플링 규칙. 리더보드에는 일반에 공개된 모델(공개 가중치, 공개 API, 또는 공개 서비스)이 포함된다. 점수를 안정화하려면 일반적으로 1000표 이상이 필요하며, 배틀의 최소 20%는 공개 모델 간에만 진행된다. 샘플링 확률은 레이팅과 불확실성에 따라 높아지며, 재가중 회귀를 통해 최종 점수의 불편성이 보장된다[10].
자동 평가 지표와 스타일 제어. 평가를 가속화하고 "스타일" 선호의 영향을 줄이기 위해 보조 방법론이 사용된다: MT-Bench(LLM-as-a-judge)[16], Arena-Hard(어려운 질문의 자동 생성)[17], 그리고 Style/Sentiment Control(어조·감정이 선호에 미치는 영향의 모델링 및 보정)[18]. Arena-Hard-Auto의 경우, 실시간 인간 투표와의 매우 높은 일치율(통제된 조건에서 최대 약 98.6%)이 보고되었다[19].
아레나 및 평가 영역
플랫폼은 작업 유형에 따른 "아레나"의 집합으로 발전해 왔다:
- Text Arena — 일반 대화 및 작업; 주요 리더보드[20].
- Vision Arena — "텍스트→이미지/동영상/이미지 분석" 멀티모달 모델[21].
- Text-to-Image와 Image Edit — 이미지 생성 및 편집(nano-banana 사례 포함)[22][23].
- Text-/Image-to-Video — 동영상 생성[24].
- WebDev Arena — 설명으로부터 웹 애플리케이션 구축[25].
- RepoChat Arena — 코드 및 저장소와 관련된 AI 엔지니어링 작업[26].
- Search Arena — 웹 검색에 연결된 모델. 2025년 4월 처음(legacy로) 출시된 후 메인 사이트로 이전되었으며, 데이터셋과 논문을 동반한다[27][28][29].
- BiomedArena.AI — 생물의학 작업을 위한 도메인 특화 평가(DataTecnica와 협력)[30].
활용과 영향
- 업계의 쇼케이스. 주요 제공업체(OpenAI, Anthropic, Google 등)는 자사 모델을 정기적으로 이 플랫폼에서 테스트하고 선보인다. 업계 언론은 이 플랫폼을 중요한 벤치마크로 평가한다[5][31]. NAACL-2025 업계 논문에서는 Chatbot Arena의 Elo 점수를 "gold industry-standard(업계의 황금 표준)"로 묘사한다[32].
- 출시 전 테스트. 정책은 "미출시" 모델의 익명 미리보기를 허용하며, 커뮤니티 통지와 출시 후 공개 평가의 사후 발표를 동반한다. 안정화를 위해서는 최소 약 1000표가 필요하다[10].
- 주요 사건. 2025년 봄, 익명 모델 Llama-4 Maverick-03-26-Experimental이 논란이 되었다(공개 버전과의 비교와 관련된 사건). 이는 언론의 큰 주목을 받았고 규칙과 커뮤니케이션의 업데이트로 이어졌다[33][34]. 2025년 8월에는 "nano-banana"가 Gemini 2.5 Flash Image로 밝혀졌으며, 시각 계열 아레나에서 최상위를 차지했다[23][22].
한계와 비판
규모와 인기에도 불구하고, 이 접근법에는 한계가 있다:
- 주관성과 스타일 효과. 투표 선호는 응답의 어조와 형식에 좌우된다. 팀은 "스타일"과 "콘텐츠"를 분리하기 위해 Style/Sentiment Control을 도입하고 있다[18].
- 이용자층의 대표성 부족. 활동의 중심은 기술 애호가와 개발자이며, 도메인 특화 시나리오를 위해 전문 아레나(Search, WebDev, Biomed 등)가 만들어진다[35].
- 조작과 편향에 대한 취약성. 2025년 연구에 따르면, 엄격한 방어가 없으면 수백~수천 표를 동원한 투표 조작(vote rigging)이 가능하다. 다만 연구자들과 LMArena의 협력으로 보호 조치(CAPTCHA, 로그인, 봇 차단, 이상 탐지)가 도입되었고 "공격 비용"이 높아졌다[36][37][38].
- 방법론적 비판. 논문 The Leaderboard Illusion(2025년 4월)은 경쟁 환경을 왜곡할 수 있는 체계적·제도적 요인을 지적한다. LMArena는 상세한 반박을 발표했으며, 방법론의 변경 이력(changelog)을 공개하고 있다[39][40][41].
외부 링크
참고 문헌
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
각주
- ↑ 1.0 1.1 Chiang, W.-L. et al. "Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference." arXiv:2403.04132, 2024. arXiv
- ↑ "Hello from LMArena: The Community Platform for Exploring Frontier AI." LMArena Blog, 2025년 6월 23일. [1]
- ↑ "Announcing a New Site for Chatbot Arena." LMSYS Blog, 2024년 9월 20일. [2]
- ↑ "LMArena Secures $100M in Seed Funding to Bring Scientific Rigor to AI Reliability." PR Newswire, 2025년 5월 21일. [3]
- ↑ 5.0 5.1 Wiggers, K. "LM Arena, the organization behind popular AI leaderboards, lands $100M." TechCrunch, 2025년 5월 21일. [4]
- ↑ "LMArena Raises $150 Million to Build the World's Most Trusted AI Evaluation Platform." PR Newswire, 2026년 1월 6일. [5]
- ↑ "LMArena lands $1.7B valuation four months after launching its product." TechCrunch, 2026년 1월 6일. [6]
- ↑ "LMArena is now Arena." Arena Blog, 2026년 1월 28일. [7]
- ↑ "LMArena is Growing to Support our Community Platform." LMArena Blog, 2025년 4월 17일.
- ↑ 10.0 10.1 10.2 10.3 Arena Leaderboard Policy. Arena Blog, 최종 업데이트: 2026년 4월 30일. [8]
- ↑ lm-sys/FastChat (GitHub). [9]
- ↑ "Arena-Rank: Open Sourcing the Leaderboard Methodology." Arena Blog, 2025년 12월 18일. [10]. 저장소: lmarena/arena-rank.
- ↑ Y. Song. "A Deep Dive into Recent Arena Data." LMArena Blog, 2025년 7월 31일. [11]
- ↑ FAQ. Arena. [12]
- ↑ Arena 홈페이지(데이터 공개 및 제공업체 전달 가능성에 관한 면책 조항). [13]
- ↑ Zheng, L. et al. "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena." arXiv:2306.05685, 2023. [14]
- ↑ Li, T. et al. "From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline." arXiv:2406.11939, 2024. [15]
- ↑ 18.0 18.1 "Does Sentiment Matter Too? Introducing Sentiment Control." LMArena Blog, 2025년 4월 22일. [16]
- ↑ Li, T. et al. "From Crowdsourced Data…" arXiv:2406.11939(일치율 표). [17]
- ↑ Text Arena (English). Arena. [18]
- ↑ Vision Arena. Arena. [19]
- ↑ 22.0 22.1 Text-to-Image Arena. Arena. [20]
- ↑ 23.0 23.1 "Nano-Banana (Gemini 2.5 Flash Image): Try it on LMArena." LMArena Blog, 2025년 8월 27일. [21]
- ↑ Text-to-Video 및 Image-to-Video Leaderboards. Arena. [22] [23]
- ↑ "WebDev Arena: A Live LLM Leaderboard for Web App Development." LMArena Blog, 2025년 3월 10일. [24]
- ↑ "RepoChat Arena: A Live Benchmark for AI Software Engineers." LMArena Blog, 2025년 4월 9일. [25]
- ↑ "Introducing the Search Arena." LMArena Blog, 2025년 4월 14일. [26]
- ↑ "Search Arena & What We're Learning About Human Preference." LMArena Blog, 2025년 7월 23일. [27]
- ↑ Frick, E. et al. "Search Arena: Analyzing Search-Augmented LLMs." arXiv:2506.05334, 2025. [28]
- ↑ "Introducing BiomedArena.AI." LMArena Blog, 2025년 8월 19일. [29]
- ↑ Google. "Gemma 3…," 2025년 3월 12일(LMArena 결과 링크). [30]
- ↑ Spangher, L. et al. "Chatbot Arena Estimate…." NAACL Industry, 2025. [31]
- ↑ "Meta's experimental Llama 4 model briefly topped AI leaderboard…." The Register, 2025년 4월 7일. [32]
- ↑ 해당 사건에 대한 LMArena의 공식 해명 및 X 게시물(2025년 4월). [33]
- ↑ "Search Arena & What We're Learning…." LMArena Blog, 2025년 7월 23일. [34]
- ↑ Min, R. et al. "Improving Your Model Ranking on Chatbot Arena by Vote Rigging." arXiv:2501.17858, 2025. [35]
- ↑ Huang, Y. et al. "Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards." arXiv:2501.07493, 2025. [36]
- ↑ "Hundreds of rigged votes can skew…." Fast Company, 2025년 2월 6일. [37]
- ↑ Singh, S. et al. "The Leaderboard Illusion." arXiv:2504.20879, 2025. [38]
- ↑ "Our Response to 'The Leaderboard Illusion'." LMArena Blog, 2025년 5월 9일. [39]
- ↑ Leaderboard Changelog. Arena Blog. [40]