LMArena (Chatbot Arena) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Arena (28 जनवरी 2026 से पहले — LMArena (Large Model Arena), पूर्व में — Chatbot Arena) — बड़े भाषा मॉडलों (LLM) और मल्टीमोडल मॉडलों (टेक्स्ट, छवि, वीडियो) के मूल्यांकन और तुलनात्मक रैंकिंग के लिए एक खुला क्राउडसोर्सिंग-आधारित वेब-प्लेटफ़ॉर्म है, जो वास्तविक मानवीय प्राथमिकताओं पर आधारित है। प्लेटफ़ॉर्म की नींव मॉडलों की अनाम युग्म-तुलनाओं (blind battles) और Elo रेटिंग प्रणाली पर टिकी है; इनके आधार पर पारदर्शी सार्वजनिक लीडरबोर्ड प्रकाशित किए जाते हैं, जिन्हें कृत्रिम बुद्धिमत्ता के frontier-मॉडलों के सर्वाधिक प्रतिष्ठित स्वतंत्र benchmark में से एक माना जाता है।[1][2]

यह प्लेटफ़ॉर्म 2023 में LMSYS Org (Large Model Systems Organization) के एक शैक्षणिक शोध परियोजना के रूप में कैलिफ़ोर्निया विश्वविद्यालय, बर्कली (Sky Computing Lab) में उभरा। सितंबर 2024 में परियोजना एक स्वतंत्र डोमेन lmarena.ai पर स्थानांतरित हुई («Graduation»)[3]। अप्रैल 2025 में स्वतंत्र कंपनी Arena Intelligence Inc. की स्थापना की गई, और 21 मई 2025 को $100 मिलियन का सीड राउंड आकर्षित किया गया ($600 मिलियन मूल्यांकन, प्रमुख निवेशक — a16z और UC Investments)[4][5]। 6 जनवरी 2026 को कंपनी ने $150 मिलियन का Series A राउंड बंद किया, जिसमें पोस्ट-मनी मूल्यांकन $1.7 बिलियन था[6]। 28 जनवरी 2026 को अंतिम रीब्रांडिंग हुई — प्लेटफ़ॉर्म का नाम Arena हो गया और यह domain arena.ai पर स्थानांतरित हो गया[7][8]

इतिहास

प्लेटफ़ॉर्म को अप्रैल 2023 में Chatbot Arena के नाम से LMSYS Org (Large Model Systems Organization) की शोध परियोजना के रूप में कैलिफ़ोर्निया विश्वविद्यालय, बर्कली (Sky Computing Lab) में लॉन्च किया गया। यह वास्तविक उपयोगकर्ता प्राथमिकताओं के आधार पर अनाम युग्म-तुलनाओं (blind battles) और Elo रेटिंग प्रणाली के माध्यम से बड़े भाषा मॉडलों के क्राउडसोर्सिंग-मूल्यांकन के पहले उपकरणों में से एक बना।

  • 24 अप्रैल 2023 — Chatbot Arena का तकनीकी लॉन्च।
  • 3 मई 2023 — आधिकारिक सार्वजनिक रिलीज़ और पहले लीडरबोर्ड का प्रकाशन।
  • 2023 — पहले खुले dataset का रिलीज़: 33 हज़ार युग्म-संवाद (जुलाई) और LMSYS‑Chat‑1M (सितंबर, लगभग 10 लाख वास्तविक संवाद)।
  • 1 मार्च 2024 — प्लेटफ़ॉर्म की आधिकारिक नीति का प्रकाशन, खुली community-driven मूल्यांकन प्रणाली के रूप में मिशन का औपचारिकीकरण।
  • 27 जून 2024 — छवि समर्थन जोड़ना और मल्टीमोडल कार्यों में विस्तार की शुरुआत।
  • 20 सितंबर 2024 — «Graduation»: स्वतंत्र डोमेन lmarena.ai पर स्थानांतरण।
  • 2024 के अंत — 2025 की वसंत — विशेष अरीनाओं का लॉन्च (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control आदि)।
  • 17 अप्रैल 2025 — स्वतंत्र कंपनी Arena Intelligence Inc. के रूप में आधिकारिक निगमन, LMArena ब्रांड के तहत अद्यतन प्लेटफ़ॉर्म के बीटा संस्करण का लॉन्च।
  • 21 मई 2025 — कंपनी की स्थापना की घोषणा और $100 मिलियन का सीड राउंड आकर्षित करना (मूल्यांकन — $600 मिलियन)।
  • 31 जुलाई 2025 — Text Arena के 1.4 लाख हालिया संवादों का खुला dataset प्रकाशित।
  • 6 जनवरी 2026 — पोस्ट-मनी मूल्यांकन $1.7 बिलियन के साथ $150 मिलियन का Series A राउंड आकर्षित।
  • जनवरी 2026Video Arena का लॉन्च (वीडियो-मोडैलिटी का पूर्ण समर्थन)।
  • 28 जनवरी 2026 — अंतिम रीब्रांडिंग: प्लेटफ़ॉर्म का नाम Arena हो गया और यह arena.ai डोमेन पर स्थानांतरित हो गया।

मार्च 2026 तक Arena (arena.ai) 150 से अधिक देशों के 50 लाख से अधिक मासिक सक्रिय उपयोगकर्ताओं की सेवा करता है, करोड़ों वोट संग्रहीत हो चुके हैं, और यह वास्तविक मानवीय प्राथमिकताओं के आधार पर AI के frontier-मॉडलों के मूल्यांकन के सबसे प्रतिष्ठित स्वतंत्र उपकरणों में से एक बना हुआ है।

मूल्यांकन कैसे काम करता है

उपयोगकर्ता एक अनुरोध दर्ज करता है और दो यादृच्छिक रूप से चुने गए अनाम मॉडलों («A» और «B») से उत्तर प्राप्त करता है, जिसके बाद वह बेहतर उत्तर के लिए मतदान करता है (या बराबरी/असंतोष दर्ज करता है)। रैंकिंग ब्रैडली—टेरी सांख्यिकीय मॉडल (युग्म-प्राथमिकताओं पर लॉजिस्टिक रिग्रेशन) पर आधारित है, जो सहज रूप से Elo के करीब है[1]। प्लेटफ़ॉर्म Arena Score और विश्वास अंतराल प्रकाशित करता है, और असमान सैंपलिंग पर निष्पक्षता बनाए रखने के लिए नमूना सुधार (re‑weighting) भी लागू करता है[9]

पारदर्शिता और खुलापन। मूल्यांकन और रैंकिंग के मूल पाइपलाइन FastChat रिपॉजिटरी में खुले हैं[10]; सत्यापन और शोध के लिए कच्चे डेटा के अंश समय-समय पर प्रकाशित किए जाते हैं (जैसे, जुलाई 2025 में 140K संवादों का रिलीज़)[9][11]। मुख्य पृष्ठ पर FAQ और चेतावनियों के अनुसार, उपयोगकर्ता अनुरोध मॉडल प्रदाताओं को प्रकट किए जा सकते हैं और शोध उद्देश्यों के लिए आंशिक रूप से प्रकाशित हो सकते हैं — संवेदनशील डेटा न भेजें[12][13]

चयन और सैंपलिंग के नियम। लीडरबोर्ड में सार्वजनिक पहुंच वाले मॉडल (खुले वज़न/सार्वजनिक API/सार्वजनिक सेवा) शामिल किए जाते हैं। मूल्यांकन स्थिरीकरण के लिए सामान्यतः ≥1000 वोट आवश्यक हैं; कम से कम 20% battles केवल सार्वजनिक मॉडलों के बीच होते हैं; सैंपलिंग की संभावना रेटिंग और अनिश्चितता के साथ बढ़ती है, और पुनर्भार के साथ रिग्रेशन अंतिम मूल्यांकनों की निष्पक्षता सुनिश्चित करता है[9]

स्वतः-मेट्रिक्स और शैली नियंत्रण। त्वरित मूल्यांकन और «शैलीगत» प्राथमिकता प्रभावों को कम करने के लिए सहायक विधियां लागू की जाती हैं: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (जटिल प्रश्नों की स्वत: पीढ़ी)[15], तथा Style/Sentiment Control (स्वर/भावनाओं के प्राथमिकताओं पर प्रभाव का मॉडलिंग और «उपचार»)[16]Arena‑Hard‑Auto के लिए नियंत्रित परिस्थितियों में वास्तविक मानवीय वोटों के साथ बहुत उच्च सहमति (≈98.6% तक) रिपोर्ट की गई है[17]

अरीनाएं और मूल्यांकन के क्षेत्र

प्लेटफ़ॉर्म कार्य प्रकारों के अनुसार «अरीनाओं» के एक समूह में विकसित हो चुका है:

  • Text Arena — सामान्य संवाद/कार्य, मुख्य तालिका[18]
  • Vision Arena — मल्टीमोडल मॉडल «टेक्स्ट→छवि/वीडियो/छवि विश्लेषण»[19]
  • Text‑to‑Image और Image Edit — छवि निर्माण और संपादन (सहित nano‑banana मामला)[20][21]
  • Text‑/Image‑to‑Video — वीडियो निर्माण[22]
  • WebDev Arena — विवरणों से वेब-अनुप्रयोगों का निर्माण[23]
  • RepoChat Arena — कोड/रिपॉजिटरी पर AI-इंजीनियरिंग कार्य[24]
  • Search Arena — वेब-खोज से जुड़े मॉडल; पहले अप्रैल 2025 में लॉन्च (legacy), फिर मुख्य साइट पर लाया गया, साथ में dataset और प्रकाशन[25][26][27]
  • BiomedArena.AI — बायोमेडिकल कार्यों के लिए डोमेन-विशिष्ट मूल्यांकन (DataTecnica के साथ साझेदारी)[28]

अनुप्रयोग और प्रभाव

  • औद्योगिक शोकेस। प्रमुख विक्रेता (OpenAI, Anthropic, Google आदि) नियमित रूप से LMArena पर मॉडलों का परीक्षण और प्रदर्शन करते हैं; उद्योग मीडिया प्लेटफ़ॉर्म को एक महत्वपूर्ण मानदंड के रूप में वर्णित करता है[5][29]। NAACL‑2025 के एक औद्योगिक प्रकाशन में Chatbot Arena के Elo-मूल्यांकन को «gold industry‑standard» कहा गया है[30]
  • प्री-रिलीज़ परीक्षण। नीति अनामित «अनरिलीज़्ड» मॉडलों के पूर्वावलोकन की अनुमति देती है, समुदाय को सूचना देकर और रिलीज़ के बाद सार्वजनिक मूल्यांकन प्रकाशित करके; स्थिरीकरण के लिए न्यूनतम ≈1000 वोट[9]
  • उल्लेखनीय घटनाएं। वसंत 2025 में अनाम मॉडल Llama‑4 Maverick‑03‑26‑Experimental की चर्चा हुई (सार्वजनिक संस्करणों के साथ तुलना को लेकर विवाद), जिसने व्यापक मीडिया ध्यान आकर्षित किया और नियमों/संचार में अद्यतन को प्रेरित किया[31][32]। अगस्त 2025 में «nano‑banana» Gemini 2.5 Flash Image के रूप में सामने आया और दृश्य अरीनाओं में अग्रणी स्थान पर पहुंचा[21][20]

सीमाएं और आलोचना

पैमाने और लोकप्रियता के बावजूद, इस दृष्टिकोण की सीमाएं हैं:

  • व्यक्तिपरकता और शैलीगत प्रभाव। वोट की प्राथमिकताएं उत्तर के स्वर/ढंग पर निर्भर करती हैं; टीम «शैली» और «सामग्री» को अलग करने के लिए Style/Sentiment Control लागू करती है[16]
  • दर्शकों की अप्रतिनिधित्वता। मुख्य सक्रिय उपयोगकर्ता तकनीकी उत्साही/डेवलपर हैं; डोमेन परिदृश्यों के लिए विशेष अरीनाएं बनाई गई हैं (Search, WebDev, Biomed आदि)[33]
  • हेरफेर और पूर्वाग्रह की संवेदनशीलता। 2025 के अध्ययन दर्शाते हैं कि कड़ी सुरक्षा के अभाव में सैकड़ों-हज़ारों वोटों के साथ «धांधली» की रणनीतियां संभव हैं; साथ ही LMArena के साथ शोधकर्ताओं के सहयोग ने सुरक्षा उपाय (CAPTCHA/लॉगिन/बॉट-सुरक्षा/असंगति का पता लगाना) लागू करने और «हमले की लागत» बढ़ाने का नेतृत्व किया[34][35][36]
  • कार्यप्रणाली संबंधी आलोचना। The Leaderboard Illusion (अप्रैल 2025) कार्य में व्यवस्थित और संस्थागत कारकों की ओर इशारा किया गया जो प्रतिस्पर्धा क्षेत्र को विकृत कर सकते हैं; LMArena ने विस्तृत प्रतिक्रिया प्रकाशित की और कार्यप्रणाली का सार्वजनिक changelog बनाए रखती है[37][38][39]

संदर्भ

  • LMArena की आधिकारिक वेबसाइट
  • LMArena का ब्लॉग/नीतियां और अद्यतन
  • LMSYS शोध समूह की वेबसाइट (परियोजना का मूल इनक्यूबेटर)

साहित्य

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

टिप्पणियां

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
  4. «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [१]
  5. 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [२]
  6. «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [३]
  7. «We Are Now Arena». Arena Blog, 28 января 2026. [४]
  8. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
  9. 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [५]
  10. lm‑sys/FastChat (GitHub). [६]
  11. «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [७]
  12. FAQ. LMArena. [८]
  13. Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [९]
  14. Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [१०]
  15. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [११]
  16. 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [१२]
  17. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [१३]
  18. Text Arena (English). LMArena. [१४]
  19. Vision Arena. LMArena, обновлено 2 сентября 2025. [१५]
  20. 20.0 20.1 Text-to-Image Leaderboard. LMArena. [१६]
  21. 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [१७]
  22. Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [१८] [१९]
  23. «Introducing WebDev Arena». LMArena Blog, 2025. [२०]
  24. «Introducing RepoChat Arena». LMArena Blog, 2025. [२१]
  25. «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [२२]
  26. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [२३]
  27. Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [२४]
  28. «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [२५]
  29. Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [२६]
  30. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [२७]
  31. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [२८]
  32. Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [२९]
  33. «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [३०]
  34. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [३१]
  35. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [३२]
  36. «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [३३]
  37. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [३४]
  38. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [३५]
  39. «Methodology Changelog». LMArena Blog. [३६]