LMArena (Chatbot Arena) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

Arena (trước ngày 28 tháng 1 năm 2026 — LMArena (Large Model Arena), trước đó — Chatbot Arena) — nền tảng web crowdsourcing mở để đánh giá và xếp hạng so sánh các mô hình ngôn ngữ lớn (LLM) và các mô hình đa phương thức (văn bản, hình ảnh, video) dựa trên sở thích thực tế của con người. Nền tảng được xây dựng dựa trên các so sánh cặp đôi ẩn danh (blind battles) giữa các mô hình và hệ thống xếp hạng Elo; trên cơ sở đó, các bảng xếp hạng công khai minh bạch được công bố, được coi là một trong những benchmark độc lập có uy tín nhất đối với các mô hình AI frontier.[1][2]

Nền tảng ra đời vào năm 2023 như một dự án nghiên cứu học thuật của tổ chức LMSYS Org (Large Model Systems Organization) tại Đại học California, Berkeley (Sky Computing Lab). Vào tháng 9 năm 2024, dự án "tốt nghiệp" lên tên miền độc lập lmarena.ai («Graduation»)[3]. Vào tháng 4 năm 2025, công ty độc lập Arena Intelligence Inc. được thành lập, và ngày 21 tháng 5 năm 2025, vòng gọi vốn hạt giống trị giá $100 triệu được huy động (định giá $600 triệu, các nhà đầu tư chính — a16z và UC Investments)[4][5]. Ngày 6 tháng 1 năm 2026, công ty đóng vòng Series A trị giá $150 triệu với định giá post-money là $1,7 tỷ[6]. Ngày 28 tháng 1 năm 2026, thương hiệu được đổi tên lần cuối — nền tảng có tên Arena và chuyển sang tên miền arena.ai[7][8].

Lịch sử

Nền tảng được ra mắt vào tháng 4 năm 2023 với tên Chatbot Arena như một dự án nghiên cứu của tổ chức LMSYS Org (Large Model Systems Organization) tại Đại học California, Berkeley (Sky Computing Lab). Đây là một trong những công cụ đầu tiên đánh giá crowdsourcing các mô hình ngôn ngữ lớn thông qua các so sánh cặp đôi ẩn danh (blind battles) và hệ thống xếp hạng Elo dựa trên sở thích thực tế của người dùng.

  • 24 tháng 4 năm 2023 — ra mắt kỹ thuật Chatbot Arena.
  • 3 tháng 5 năm 2023 — phát hành công khai chính thức và công bố bảng xếp hạng đầu tiên.
  • 2023 — phát hành các dataset mở đầu tiên: 33 nghìn cuộc hội thoại cặp đôi (tháng 7) và LMSYS‑Chat‑1M (tháng 9, khoảng 1 triệu cuộc hội thoại thực tế).
  • 1 tháng 3 năm 2024 — công bố chính sách chính thức của nền tảng, chính thức hóa sứ mệnh như một hệ thống đánh giá community-driven mở.
  • 27 tháng 6 năm 2024 — bổ sung hỗ trợ hình ảnh và bắt đầu mở rộng sang các tác vụ đa phương thức.
  • 20 tháng 9 năm 2024 — «Graduation»: chuyển sang tên miền độc lập lmarena.ai.
  • Cuối 2024 — đầu xuân 2025 — ra mắt các đấu trường chuyên biệt (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control và nhiều hơn nữa).
  • 17 tháng 4 năm 2025 — chính thức thành lập công ty độc lập Arena Intelligence Inc., ra mắt phiên bản beta của nền tảng cập nhật dưới thương hiệu LMArena.
  • 21 tháng 5 năm 2025 — công bố thành lập công ty và huy động vòng gọi vốn hạt giống trị giá $100 triệu (định giá — $600 triệu).
  • 31 tháng 7 năm 2025 — công bố dataset mở gồm 140 nghìn cuộc hội thoại gần đây từ Text Arena.
  • 6 tháng 1 năm 2026 — huy động vòng Series A trị giá $150 triệu với định giá post-money là $1,7 tỷ.
  • Tháng 1 năm 2026 — ra mắt Video Arena (hỗ trợ đầy đủ phương thức video).
  • 28 tháng 1 năm 2026 — đổi thương hiệu lần cuối: nền tảng được đặt tên Arena và chuyển sang tên miền arena.ai.

Tính đến tháng 3 năm 2026, Arena (arena.ai) phục vụ hơn 5 triệu người dùng hoạt động hàng tháng từ hơn 150 quốc gia, đã tích lũy hàng chục triệu lượt bình chọn và tiếp tục là một trong những công cụ đánh giá độc lập có uy tín nhất về các mô hình AI frontier dựa trên sở thích thực tế của con người.

Cơ chế đánh giá

Người dùng nhập câu truy vấn và nhận được hai câu trả lời từ các mô hình ẩn danh được chọn ngẫu nhiên («A» và «B»), sau đó bình chọn cho câu trả lời tốt hơn (hoặc ghi nhận hòa/không thỏa mãn). Xếp hạng dựa trên mô hình thống kê Bradley–Terry (hồi quy logistic theo sở thích cặp đôi), về mặt trực quan gần với Elo[1]. Nền tảng công bố Arena Score và khoảng tin cậy, đồng thời áp dụng hiệu chỉnh mẫu (re‑weighting) để đảm bảo tính không thiên lệch khi lấy mẫu không đồng đều[9].

Tính minh bạch và cởi mở. Các pipeline đánh giá và xếp hạng nguồn mở được công bố trong kho lưu trữ FastChat[10]; các phần dữ liệu thô được công bố định kỳ để xác minh và nghiên cứu (ví dụ: phát hành 140K cuộc hội thoại vào tháng 7 năm 2025)[9][11]. Theo FAQ và các cảnh báo trên trang chủ, câu truy vấn của người dùng có thể được tiết lộ cho các nhà cung cấp mô hình và được công bố một phần cho mục đích nghiên cứu — không nên gửi dữ liệu nhạy cảm[12][13].

Quy tắc lựa chọn và lấy mẫu. Bảng xếp hạng bao gồm các mô hình có thể truy cập công khai (trọng số mở/API công khai/dịch vụ công khai). Để ổn định đánh giá, thông thường cần ≥1000 lượt bình chọn; ít nhất 20% các trận đấu — chỉ giữa các mô hình công khai; xác suất lấy mẫu tăng theo xếp hạng và độ không chắc chắn, còn hồi quy với tái trọng số đảm bảo tính không thiên lệch của điểm đánh giá cuối cùng[9].

Chỉ số tự động và kiểm soát phong cách. Để đánh giá nhanh hơn và giảm thiểu các hiệu ứng «sở thích về phong cách», các phương pháp bổ trợ được áp dụng: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (tự động tạo câu hỏi khó)[15], cũng như Style/Sentiment Control (mô hình hóa và «chữa trị» hiệu ứng giọng điệu/cảm xúc đối với sở thích)[16]. Đối với Arena‑Hard‑Auto, mức độ đồng thuận rất cao với các lượt bình chọn của con người «trực tiếp» đã được báo cáo (lên đến ≈98,6% trong các điều kiện có kiểm soát)[17].

Các đấu trường và lĩnh vực đánh giá

Nền tảng đã phát triển thành một tập hợp các «đấu trường» theo loại tác vụ:

  • Text Arena — hội thoại/tác vụ chung, bảng xếp hạng chính[18].
  • Vision Arena — các mô hình đa phương thức «văn bản→hình ảnh/video/phân tích hình ảnh»[19].
  • Text‑to‑ImageImage Edit — tạo sinh và chỉnh sửa hình ảnh (bao gồm trường hợp nano‑banana)[20][21].
  • Text‑/Image‑to‑Video — tạo sinh video[22].
  • WebDev Arena — xây dựng ứng dụng web từ mô tả[23].
  • RepoChat Arena — các tác vụ kỹ thuật AI liên quan đến mã/kho lưu trữ[24].
  • Search Arena — các mô hình có kết nối tìm kiếm web; ban đầu ra mắt vào tháng 4 năm 2025 (legacy), sau đó được đưa lên trang web chính, đi kèm với dataset và bài công bố[25][26][27].
  • BiomedArena.AI — đánh giá chuyên ngành cho các tác vụ y sinh (hợp tác với DataTecnica)[28].

Ứng dụng và tầm ảnh hưởng

  • Sàn diễn ngành công nghiệp. Các nhà cung cấp lớn nhất (OpenAI, Anthropic, Google và nhiều hơn nữa) thường xuyên kiểm thử và trình diễn mô hình trên LMArena; các phương tiện truyền thông ngành công nghiệp mô tả nền tảng là một định hướng quan trọng[5][29]. Trong ấn phẩm ngành tại NAACL‑2025, điểm Elo của Chatbot Arena được gọi là «tiêu chuẩn vàng của ngành công nghiệp (gold industry‑standard)»[30].
  • Kiểm thử trước khi phát hành. Chính sách cho phép xem trước ẩn danh các mô hình «chưa phát hành» kèm thông báo đến cộng đồng và sau đó công bố điểm đánh giá công khai sau khi phát hành; tối thiểu ≈1000 lượt bình chọn để ổn định[9].
  • Các sự kiện đáng chú ý. Vào mùa xuân năm 2025, mô hình ẩn danh Llama‑4 Maverick‑03‑26‑Experimental được thảo luận rộng rãi (sự cố liên quan đến việc so sánh với các phiên bản công khai), điều này thu hút sự chú ý rộng rãi của báo chí và dẫn đến các cập nhật về quy tắc/truyền thông[31][32]. Vào tháng 8 năm 2025, «nano‑banana» được tiết lộ là Gemini 2.5 Flash Image và chiếm các vị trí dẫn đầu trong các đấu trường trực quan[21][20].

Hạn chế và phê bình

Mặc dù có quy mô và mức độ phổ biến lớn, phương pháp tiếp cận vẫn có những hạn chế:

  • Tính chủ quan và hiệu ứng phong cách. Sở thích bình chọn phụ thuộc vào giọng điệu/cách trình bày câu trả lời; nhóm phát triển triển khai Style/Sentiment Control để tách rời «phong cách» và «nội dung»[16].
  • Tính không đại diện của đối tượng người dùng. Nhóm hạt nhân tích cực — những người đam mê công nghệ/nhà phát triển; để đáp ứng các tình huống theo lĩnh vực, các đấu trường chuyên biệt được tạo ra (Search, WebDev, Biomed và nhiều hơn nữa)[33].
  • Dễ bị thao túng và thiên lệch. Các nghiên cứu năm 2025 cho thấy rằng khi thiếu các biện pháp bảo vệ chặt chẽ, các chiến lược «thổi phiếu» với hàng trăm đến hàng nghìn lượt bình chọn là có thể thực hiện được; đồng thời, sự hợp tác của các nhà nghiên cứu với LMArena đã dẫn đến việc triển khai các biện pháp bảo vệ (CAPTCHA/đăng nhập/bảo vệ bot/phát hiện bất thường) và tăng «chi phí tấn công»[34][35][36].
  • Phê bình phương pháp luận. Công trình The Leaderboard Illusion (tháng 4 năm 2025) chỉ ra các yếu tố hệ thống và thể chế có thể làm méo mó sân chơi cạnh tranh; LMArena đã công bố phản hồi chi tiết và duy trì changelog công khai về phương pháp luận[37][38][39].

Liên kết ngoài

  • Trang web chính thức của LMArena
  • Blog/chính sách và cập nhật của LMArena
  • Trang web của nhóm nghiên cứu LMSYS (lò ươm dự án ban đầu)

Tài liệu tham khảo

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

Chú thích

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
  4. «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
  5. 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
  6. «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
  7. «We Are Now Arena». Arena Blog, 28 января 2026. [4]
  8. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
  9. 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
  10. lm‑sys/FastChat (GitHub). [6]
  11. «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
  12. FAQ. LMArena. [8]
  13. Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
  14. Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
  15. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
  16. 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
  17. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
  18. Text Arena (English). LMArena. [14]
  19. Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
  20. 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
  21. 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
  22. Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
  23. «Introducing WebDev Arena». LMArena Blog, 2025. [20]
  24. «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
  25. «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
  26. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
  27. Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
  28. «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
  29. Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
  30. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
  31. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
  32. Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
  33. «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
  34. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
  35. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
  36. «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
  37. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
  38. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
  39. «Methodology Changelog». LMArena Blog. [36]