LMArena (Chatbot Arena) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

Arena (28 Ocak 2026 tarihine kadar — LMArena (Large Model Arena), daha önce — Chatbot Arena) — büyük dil modellerini (LLM) ve çok modlu modelleri (metin, görüntü, video) gerçek insan tercihlerine göre değerlendirmek ve karşılaştırmalı olarak sıralamak amacıyla oluşturulmuş, açık kaynaklı kitlesel kaynak tabanlı bir web platformudur. Platformun temelini modeller arasındaki anonim ikili karşılaştırmalar (blind battles) ve Elo derecelendirme sistemi oluşturmakta olup bu verilere dayanılarak kamuya açık şeffaf liderboardlar yayımlanmaktadır; bu liderboardlar, frontier yapay zeka modellerinin en güvenilir bağımsız benchmark'larından biri olarak kabul görmektedir.[1][2]

Platform, 2023 yılında Kaliforniya Üniversitesi Berkeley bünyesindeki (Sky Computing Lab) LMSYS Org (Large Model Systems Organization) kuruluşunun akademik bir araştırma projesi olarak hayata geçirilmiştir. Eylül 2024'te proje bağımsız lmarena.ai alan adına taşınmıştır («Graduation»)[3]. Nisan 2025'te bağımsız bir şirket olan Arena Intelligence Inc. kurulmuş, 21 Mayıs 2025'te ise $100 milyon tutarında bir tohum turu fonu sağlanmıştır (değerleme: $600 milyon, başlıca yatırımcılar: a16z ve UC Investments)[4][5]. 6 Ocak 2026'da şirket, şirket sonrası değerlemesi $1,7 milyar olan $150 milyonluk bir Series A turu kapattı[6]. 28 Ocak 2026'da nihai marka yenileme gerçekleşti — platform Arena adını aldı ve arena.ai alan adına geçti[7][8].

Tarihçe

Platform, Nisan 2023'te Chatbot Arena adıyla, Kaliforniya Üniversitesi Berkeley bünyesindeki (Sky Computing Lab) LMSYS Org (Large Model Systems Organization) kuruluşunun bir araştırma projesi olarak başlatılmıştır. Platform; anonim ikili karşılaştırmalar (blind battles) ve gerçek kullanıcı tercihlerine dayalı Elo derecelendirme sistemi aracılığıyla büyük dil modellerinin kitlesel kaynak tabanlı değerlendirmesini yapan ilk araçlardan biri olmuştur.

  • 24 Nisan 2023 — Chatbot Arena'nın teknik lansmanı.
  • 3 Mayıs 2023 — Resmi halka açık sürüm ve ilk liderboardun yayımlanması.
  • 2023 — İlk açık dataset'lerin yayımlanması: 33 bin ikili diyalog (Temmuz) ve LMSYS‑Chat‑1M (Eylül, yaklaşık 1 milyon gerçek diyalog).
  • 1 Mart 2024 — Platformun resmi politikasının yayımlanması, misyonun açık community-driven bir değerlendirme sistemi olarak resmileştirilmesi.
  • 27 Haziran 2024 — Görüntü desteğinin eklenmesi ve çok modlu görevlere doğru genişlemenin başlaması.
  • 20 Eylül 2024 — «Graduation»: bağımsız lmarena.ai alan adına geçiş.
  • 2024 sonu — 2025 baharı — Özel arena'ların hayata geçirilmesi (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control vb.).
  • 17 Nisan 2025 — Bağımsız şirket olarak Arena Intelligence Inc.in resmi kuruluşu, LMArena markası altında güncellenmiş platformun beta sürümünün lansmanı.
  • 21 Mayıs 2025 — Şirketin kuruluşunun duyurulması ve $100 milyon tutarında tohum turu finansmanının sağlanması (değerleme: $600 milyon).
  • 31 Temmuz 2025 — Text Arena'dan 140 bin güncel diyaloğu içeren açık dataset'in yayımlanması.
  • 6 Ocak 2026 — Şirket sonrası değerlemesi $1,7 milyar olan $150 milyonluk Series A turunun tamamlanması.
  • Ocak 2026Video Arenanın başlatılması (tam video modalitesi desteği).
  • 28 Ocak 2026 — Nihai marka yenileme: platform Arena adını aldı ve arena.ai alan adına geçti.

Mart 2026 itibarıyla Arena (arena.ai), 150'den fazla ülkeden 5 milyonun üzerinde aylık aktif kullanıcıya hizmet vermekte, onlarca milyon oy biriktirmiş ve gerçek insan tercihlerine dayalı frontier YZ modellerinin değerlendirilmesinde en güvenilir bağımsız araçlardan biri olmayı sürdürmektedir.

Değerlendirme Nasıl Çalışır?

Kullanıcı bir sorgu girer ve rastgele seçilmiş iki anonim modelden («A» ve «B») yanıt alır; ardından en iyi yanıt için oy kullanır (veya beraberlik/tatminsizlik olduğunu belirtir). Sıralama, Bradley–Terry istatistiksel modeline (ikili tercihler üzerinden lojistik regresyon) dayanmakta olup sezgisel olarak Elo'ya yakındır[1]. Platform, Arena Score ve güven aralıklarını yayımlar; düzensiz örneklemede yansızlığı korumak amacıyla örneklem düzeltmeleri (re‑weighting) de uygulamaktadır[9].

Şeffaflık ve açıklık. Değerlendirme ve sıralama pipeline'larının kaynak kodları FastChat deposunda açık olarak mevcuttur[10]; doğrulama ve araştırma amacıyla ham verilerin bir kısmı periyodik olarak yayımlanmaktadır (örn. Temmuz 2025'teki 140K diyalog sürümü)[9][11]. FAQ ve ana sayfadaki uyarılara göre, kullanıcı sorguları model sağlayıcılarına açıklanabilir ve araştırma amacıyla kısmen yayımlanabilir — hassas veri gönderilmemesi önerilir[12][13].

Seçim ve örnekleme kuralları. Liderboardlara yalnızca genel erişime açık modeller (açık ağırlıklar/genel API/genel servis) dahil edilir. Değerlendirmenin stabilize edilmesi için genellikle ≥1000 oy gerekmektedir; battle'ların en az %20si yalnızca genel modeller arasında gerçekleştirilmelidir; örnekleme olasılığı derecelendirme ve belirsizlikle birlikte artmakta, yeniden ağırlıklandırmalı regresyon ise nihai değerlendirmelerin yansızlığını sağlamaktadır[9].

Otomatik metrikler ve stil kontrolü. Değerlendirmeyi hızlandırmak ve «stilistik» tercih etkilerini azaltmak amacıyla yardımcı yöntemler kullanılmaktadır: MT‑Bench (LLM-as-a-judge)[14], Arena‑Hard (otomatik zor soru üretimi)[15] ve Style/Sentiment Control (ton/duygu etkisinin tercihler üzerindeki etkisini modelleme ve «düzeltme»)[16]. Arena‑Hard‑Auto için kontrollü koşullarda canlı insan oylarıyla çok yüksek uyum (≈%98,6'ya kadar) bildirilmiştir[17].

Arena'lar ve Değerlendirme Alanları

Platform, görev türlerine göre bir dizi «arena»ya gelişmiştir:

  • Text Arena — genel diyaloglar/görevler, ana tablo[18].
  • Vision Arena — «metin→görüntü/video/görüntü analizi» çok modlu modeller[19].
  • Text‑to‑Image ve Image Edit — görüntü oluşturma ve düzenleme (nano‑banana vakası dahil)[20][21].
  • Text‑/Image‑to‑Video — video oluşturma[22].
  • WebDev Arena — açıklamalardan web uygulaması oluşturma[23].
  • RepoChat Arena — kod/depo tabanlı YZ mühendisliği görevleri[24].
  • Search Arena — web aramasına bağlı modeller; önce Nisan 2025'te (eski sürüm) başlatıldı, ardından ana siteye entegre edildi; bir dataset ve yayınla desteklenmektedir[25][26][27].
  • BiomedArena.AI — biyomedikal görevler için alan bazlı değerlendirme (DataTecnica ortaklığıyla)[28].

Kullanım ve Etki

  • Sektörel vitrin. Büyük satıcılar (OpenAI, Anthropic, Google vb.) modellerini düzenli olarak LMArena'da test etmekte ve sergilemektedir; sektör medyası platformu önemli bir referans noktası olarak tanımlamaktadır[5][29]. NAACL‑2025 sektör yayınında Chatbot Arena'nın Elo değerlendirmesi «gold industry‑standard» olarak nitelendirilmiştir[30].
  • Ön sürüm testi. Platform politikası, topluluk bilgilendirmesi ve sürümden sonra kamuya açık değerlendirmelerin yayımlanması şartıyla «yayımlanmamış» modellerin anonim ön izlemelerine olanak tanımaktadır; stabilizasyon için minimum ≈1000 oy gerekmektedir[9].
  • Dikkat çekici olaylar. 2025 baharında anonim Llama‑4 Maverick‑03‑26‑Experimental modeli (genel sürümlerle karşılaştırmaya ilişkin tartışma), basında geniş yankı uyandırmış ve kural ile iletişim güncellemelerine yol açmıştır[31][32]. Ağustos 2025'te «nano‑banana»nın aslında Gemini 2.5 Flash Image olduğu ortaya çıkmış ve görsel arena'larda lider konuma yükselmiştir[21][20].

Sınırlılıklar ve Eleştiriler

Ölçeğine ve popülaritesine karşın yaklaşımın bazı sınırlılıkları bulunmaktadır:

  • Öznellik ve stilistik etkiler. Oy tercihleri yanıtın tonu ve üslubuna bağlıdır; ekip, «stil» ile «içerik»i birbirinden ayırt etmek amacıyla Style/Sentiment Control yöntemini uygulamaktadır[16].
  • Kitlesel temsil eksikliği. Çekirdeği oluşturan kullanıcılar ağırlıklı olarak teknoloji meraklıları ve geliştiricilerdir; alan bazlı senaryolar için özel arena'lar (Search, WebDev, Biomed vb.) oluşturulmaktadır[33].
  • Manipülasyon ve yanlılık açıkları. 2025 yılına ait araştırmalar, katı korumalar olmaksızın yüzlerce ila binlerce oy ile «oyu şişirme» stratejilerinin mümkün olduğunu göstermektedir; bununla birlikte LMArena ile araştırmacıların iş birliği, koruyucu önlemlerin (CAPTCHA/giriş/bot koruması/anomali tespiti) hayata geçirilmesine ve «saldırı maliyetinin» artmasına yol açmıştır[34][35][36].
  • Metodolojik eleştiriler. The Leaderboard Illusion (Nisan 2025) adlı çalışma, rekabet ortamını çarpıtabilecek sistematik ve kurumsal faktörlere dikkat çekmektedir; LMArena kapsamlı bir yanıt yayımlamış ve metodoloji değişikliklerini kamuya açık bir changelog ile takip etmektedir[37][38][39].

Dış bağlantılar

  • LMArena resmi sitesi
  • LMArena blog/politikalar ve güncellemeler
  • LMSYS araştırma grubu sitesi (projenin orijinal kuluçka ortamı)

Kaynakça

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

Notlar

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
  4. «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
  5. 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
  6. «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
  7. «We Are Now Arena». Arena Blog, 28 января 2026. [4]
  8. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
  9. 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
  10. lm‑sys/FastChat (GitHub). [6]
  11. «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
  12. FAQ. LMArena. [8]
  13. Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
  14. Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
  15. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
  16. 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
  17. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
  18. Text Arena (English). LMArena. [14]
  19. Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
  20. 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
  21. 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
  22. Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
  23. «Introducing WebDev Arena». LMArena Blog, 2025. [20]
  24. «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
  25. «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
  26. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
  27. Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
  28. «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
  29. Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
  30. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
  31. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
  32. Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
  33. «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
  34. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
  35. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
  36. «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
  37. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
  38. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
  39. «Methodology Changelog». LMArena Blog. [36]