LMArena (Chatbot Arena) (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

Arena (sebelum 28 Januari 2026 dikenal sebagai LMArena (Large Model Arena), sebelumnya Chatbot Arena) — platform web crowdsourcing terbuka untuk evaluasi dan peringkat komparatif large language model (LLM) dan model multimodal (teks, gambar, video) berdasarkan preferensi nyata manusia. Fondasi platform ini adalah perbandingan berpasangan anonim (blind battles) antar model dan sistem peringkat Elo; berdasarkan keduanya diterbitkan leaderboard publik yang transparan, yang dianggap sebagai salah satu benchmark independen paling otoritatif untuk model-model frontier kecerdasan buatan.[1][2]

Platform ini lahir pada tahun 2023 sebagai proyek penelitian akademis dari organisasi LMSYS Org (Large Model Systems Organization) di Universitas California, Berkeley (Sky Computing Lab). Pada September 2024, proyek ini "lulus" ke domain mandiri lmarena.ai ("Graduation")[3]. Pada April 2025, perusahaan independen Arena Intelligence Inc. didirikan, dan pada 21 Mei 2025 diperoleh pendanaan seed round sebesar $100 juta (valuasi $600 juta, investor utama — a16z dan UC Investments)[4][5]. Pada 6 Januari 2026, perusahaan menutup putaran Series A senilai $150 juta dengan valuasi post-money sebesar $1,7 miliar[6]. Pada 28 Januari 2026, rebranding final dilakukan — platform berganti nama menjadi Arena dan berpindah ke domain arena.ai[7][8].

Sejarah

Platform ini diluncurkan pada April 2023 dengan nama Chatbot Arena sebagai proyek penelitian organisasi LMSYS Org (Large Model Systems Organization) di Universitas California, Berkeley (Sky Computing Lab). Platform ini menjadi salah satu alat pertama untuk evaluasi crowdsourcing large language model melalui perbandingan berpasangan anonim (blind battles) dan sistem peringkat Elo berdasarkan preferensi nyata pengguna.

  • 24 April 2023 — peluncuran teknis Chatbot Arena.
  • 3 Mei 2023 — rilis publik resmi dan publikasi leaderboard pertama.
  • 2023 — rilis dataset terbuka pertama: 33 ribu dialog berpasangan (Juli) dan LMSYS‑Chat‑1M (September, sekitar 1 juta dialog nyata).
  • 1 Maret 2024 — publikasi kebijakan resmi platform, formalisasi misi sebagai sistem evaluasi terbuka berbasis komunitas (community-driven).
  • 27 Juni 2024 — penambahan dukungan gambar dan awal perluasan ke tugas-tugas multimodal.
  • 20 September 2024 — "Graduation": perpindahan ke domain mandiri lmarena.ai.
  • Akhir 2024 — musim semi 2025 — peluncuran arena-arena khusus (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control, dan lain-lain).
  • 17 April 2025 — inkorporasi resmi sebagai perusahaan independen Arena Intelligence Inc., peluncuran versi beta platform yang diperbarui dengan merek LMArena.
  • 21 Mei 2025 — pengumuman berdirinya perusahaan dan perolehan seed round senilai $100 juta (valuasi — $600 juta).
  • 31 Juli 2025 — publikasi dataset terbuka berisi 140 ribu dialog Text Arena terbaru.
  • 6 Januari 2026 — perolehan putaran Series A senilai $150 juta dengan valuasi post-money $1,7 miliar.
  • Januari 2026 — peluncuran Video Arena (dukungan penuh modalitas video).
  • 28 Januari 2026 — rebranding final: platform berganti nama menjadi Arena dan berpindah ke domain arena.ai.

Hingga Maret 2026, Arena (arena.ai) melayani lebih dari 5 juta pengguna aktif bulanan dari 150+ negara, telah mengumpulkan puluhan juta suara, dan tetap menjadi salah satu alat independen paling otoritatif untuk evaluasi model-model frontier AI berdasarkan preferensi nyata manusia.

Cara Kerja Evaluasi

Pengguna memasukkan permintaan dan menerima dua respons dari model-model anonim yang dipilih secara acak ("A" dan "B"), kemudian memberikan suara untuk respons terbaik (atau mencatat hasil seri/tidak memuaskan). Peringkat didasarkan pada model statistik Bradley–Terry (regresi logistik berdasarkan preferensi berpasangan), yang secara intuitif mirip dengan Elo[1]. Platform mempublikasikan Arena Score beserta interval kepercayaan, serta menerapkan koreksi sampling (re‑weighting) untuk mempertahankan ketidakbiasan saat sampling tidak merata[9].

Transparansi dan keterbukaan. Pipeline evaluasi dan peringkat sumber terbuka tersedia di repositori FastChat[10]; sebagian data mentah dipublikasikan secara berkala untuk verifikasi dan penelitian (misalnya, rilis 140 ribu dialog pada Juli 2025)[9][11]. Menurut FAQ dan peringatan di halaman utama, permintaan pengguna dapat diungkapkan kepada penyedia model dan sebagian dipublikasikan untuk tujuan penelitian — data sensitif tidak boleh dikirimkan[12][13].

Aturan seleksi dan sampling. Leaderboard mencakup model-model yang tersedia untuk umum (bobot terbuka/API publik/layanan publik). Untuk stabilisasi penilaian biasanya diperlukan ≥1000 suara; setidaknya 20% battle hanya dilakukan antar model publik; probabilitas sampling meningkat seiring peringkat dan ketidakpastian, sementara regresi dengan pembobotan ulang memastikan ketidakbiasan penilaian akhir[9].

Metrik otomatis dan kontrol gaya. Untuk mempercepat evaluasi dan mengurangi efek preferensi "bergaya", digunakan metode pendukung: MT‑Bench (LLM-as-a-judge)[14], Arena‑Hard (pembuatan otomatis pertanyaan sulit)[15], serta Style/Sentiment Control (pemodelan dan "penyembuhan" efek nada/emosi terhadap preferensi)[16]. Untuk Arena‑Hard‑Auto dilaporkan tingkat konsistensi yang sangat tinggi dengan suara manusia "langsung" (hingga ≈98,6% dalam kondisi terkontrol)[17].

Arena dan Domain Evaluasi

Platform ini telah berkembang menjadi serangkaian "arena" berdasarkan jenis tugas:

  • Text Arena — dialog/tugas umum, tabel utama[18].
  • Vision Arena — model multimodal "teks→gambar/video/analisis gambar"[19].
  • Text‑to‑Image dan Image Edit — pembuatan dan pengeditan gambar (termasuk kasus nano‑banana)[20][21].
  • Text‑/Image‑to‑Video — pembuatan video[22].
  • WebDev Arena — pembuatan aplikasi web dari deskripsi[23].
  • RepoChat Arena — tugas rekayasa AI pada kode/repositori[24].
  • Search Arena — model dengan koneksi ke pencarian web; pertama kali diluncurkan pada April 2025 (legacy), kemudian dipindahkan ke situs utama, disertai dengan dataset dan publikasi[25][26][27].
  • BiomedArena.AI — evaluasi spesifik domain untuk tugas biomedis (kemitraan dengan DataTecnica)[28].

Penerapan dan Pengaruh

  • Etalase industri. Vendor-vendor terbesar (OpenAI, Anthropic, Google, dan lain-lain) secara rutin menguji dan mendemonstrasikan model di LMArena; media industri menggambarkan platform ini sebagai acuan penting[5][29]. Dalam publikasi industri NAACL‑2025, penilaian Elo Chatbot Arena disebut sebagai "gold industry‑standard"[30].
  • Pengujian pra-rilis. Kebijakan mengizinkan pratinjau anonim model-model yang "belum dirilis" dengan pemberitahuan kepada komunitas dan publikasi penilaian publik setelah rilis; minimal ≈1000 suara untuk stabilisasi[9].
  • Episode terkenal. Pada musim semi 2025, model anonim Llama‑4 Maverick‑03‑26‑Experimental menjadi perbincangan (insiden seputar perbandingan dengan versi publik), yang menarik perhatian luas dari pers dan memicu pembaruan aturan/komunikasi[31][32]. Pada Agustus 2025, "nano‑banana" terungkap sebagai Gemini 2.5 Flash Image dan menduduki posisi terdepan dalam arena visual[21][20].

Keterbatasan dan Kritik

Meskipun berskala besar dan populer, pendekatan ini memiliki keterbatasan:

  • Subjektivitas dan efek gaya. Preferensi suara bergantung pada nada/cara menjawab; tim mengimplementasikan Style/Sentiment Control untuk memisahkan "gaya" dari "konten"[16].
  • Ketidakrepresentatifan audiens. Inti pengguna aktif adalah para penggemar teknologi/pengembang; untuk skenario domain tertentu dibuat arena-arena khusus (Search, WebDev, Biomed, dan lain-lain)[33].
  • Kerentanan terhadap manipulasi dan bias. Penelitian tahun 2025 menunjukkan bahwa tanpa perlindungan yang ketat, strategi "penggelembungan suara" dengan ratusan hingga ribuan suara adalah mungkin; kerja sama peneliti dengan LMArena menghasilkan penerapan langkah-langkah perlindungan (CAPTCHA/login/perlindungan bot/deteksi anomali) dan peningkatan "biaya serangan"[34][35][36].
  • Kritik metodologis. Karya The Leaderboard Illusion (April 2025) menunjukkan faktor sistemik dan institusional yang dapat mendistorsi medan persaingan; LMArena menerbitkan respons terperinci dan memelihara changelog metodologi publik[37][38][39].

Tautan

  • Situs resmi LMArena
  • Blog/kebijakan dan pembaruan LMArena
  • Situs kelompok penelitian LMSYS (inkubator asal proyek)

Daftar Pustaka

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

Catatan

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
  4. «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
  5. 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
  6. «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
  7. «We Are Now Arena». Arena Blog, 28 января 2026. [4]
  8. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
  9. 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
  10. lm‑sys/FastChat (GitHub). [6]
  11. «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
  12. FAQ. LMArena. [8]
  13. Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
  14. Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
  15. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
  16. 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
  17. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
  18. Text Arena (English). LMArena. [14]
  19. Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
  20. 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
  21. 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
  22. Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
  23. «Introducing WebDev Arena». LMArena Blog, 2025. [20]
  24. «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
  25. «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
  26. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
  27. Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
  28. «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
  29. Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
  30. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
  31. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
  32. Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
  33. «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
  34. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
  35. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
  36. «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
  37. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
  38. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
  39. «Methodology Changelog». LMArena Blog. [36]