LMArena (Chatbot Arena) (UR)
Arena (28 جنوری 2026 سے پہلے — LMArena (Large Model Arena)، اس سے قبل — Chatbot Arena) — ایک کھلا crowdsourcing پر مبنی ویب پلیٹ فارم ہے جو بڑے زبانی ماڈلز (LLM) اور ملٹی موڈل ماڈلز (متن، تصویر، ویڈیو) کی حقیقی انسانی ترجیحات کی بنیاد پر جانچ اور تقابلی درجہ بندی کے لیے وقف ہے۔ پلیٹ فارم کی بنیاد ماڈلز کے گمنام جوڑے والے موازنوں (blind battles) اور Elo درجہ بندی کے نظام پر قائم ہے؛ انہی کی بنیاد پر شفاف عوامی لیڈربورڈ شائع کیے جاتے ہیں، جنہیں frontier مصنوعی ذہانت ماڈلز کے سب سے معتبر آزاد benchmarks میں شمار کیا جاتا ہے۔[1][2]
یہ پلیٹ فارم 2023 میں LMSYS Org (Large Model Systems Organization) کی ایک علمی تحقیقی منصوبے کے طور پر کیلیفورنیا یونیورسٹی برکلے (Sky Computing Lab) میں سامنے آیا۔ ستمبر 2024 میں منصوبہ آزادانہ ڈومین lmarena.ai پر منتقل ہوا («Graduation»)[3]۔ اپریل 2025 میں ایک آزاد کمپنی Arena Intelligence Inc. قائم کی گئی، اور 21 مئی 2025 کو $100 ملین کا seed راؤنڈ حاصل کیا گیا (تشخیص $600 ملین، اہم سرمایہ کار — a16z اور UC Investments)[4][5]۔ 6 جنوری 2026 کو کمپنی نے $150 ملین کا Series A راؤنڈ $1.7 بلین کی post-money تشخیص پر مکمل کیا[6]۔ 28 جنوری 2026 کو حتمی rebranding ہوا — پلیٹ فارم کا نام Arena رکھا گیا اور یہ ڈومین arena.ai پر منتقل ہو گیا[7][8]۔
تاریخ
یہ پلیٹ فارم اپریل 2023 میں Chatbot Arena کے نام سے LMSYS Org (Large Model Systems Organization) کے ایک تحقیقی منصوبے کے طور پر کیلیفورنیا یونیورسٹی برکلے (Sky Computing Lab) میں شروع کیا گیا۔ یہ گمنام جوڑے والے موازنوں (blind battles) اور حقیقی صارف ترجیحات پر مبنی Elo درجہ بندی کے ذریعے بڑے زبانی ماڈلز کی crowdsourcing جانچ کے ابتدائی ذرائع میں سے ایک بنا۔
- 24 اپریل 2023 — Chatbot Arena کا تکنیکی آغاز۔
- 3 مئی 2023 — باضابطہ عوامی اجرا اور پہلے لیڈربورڈ کی اشاعت۔
- 2023 — پہلے کھلے datasets کا اجرا: 33 ہزار جوڑے والے مکالمے (جولائی) اور LMSYS‑Chat‑1M (ستمبر، تقریباً 10 لاکھ حقیقی مکالمے)۔
- 1 مارچ 2024 — پلیٹ فارم کی باضابطہ پالیسی کی اشاعت، مشن کو ایک کھلے community-driven جانچ نظام کے طور پر رسمی شکل دینا۔
- 27 جون 2024 — تصاویر کی حمایت کا اضافہ اور ملٹی موڈل کاموں تک توسیع کا آغاز۔
- 20 ستمبر 2024 — «Graduation»: آزادانہ ڈومین lmarena.ai پر منتقلی۔
- 2024 کے آخر — بہار 2025 — خصوصی arenasکا آغاز (Arena-Hard، WebDev Arena، RepoChat Arena، Style/Sentiment Control وغیرہ)۔
- 17 اپریل 2025 — آزاد کمپنی Arena Intelligence Inc. کی باضابطہ رجسٹریشن، LMArena برانڈ کے تحت نئے پلیٹ فارم کے beta ورژن کا آغاز۔
- 21 مئی 2025 — کمپنی کے قیام کا اعلان اور $100 ملین کے seed راؤنڈ کا حصول (تشخیص — $600 ملین)۔
- 31 جولائی 2025 — Text Arena کے 140 ہزار حالیہ مکالمات پر مشتمل کھلے dataset کی اشاعت۔
- 6 جنوری 2026 — $1.7 بلین کی post-money تشخیص پر $150 ملین کا Series A راؤنڈ۔
- جنوری 2026 — Video Arena کا آغاز (ویڈیو موڈالٹی کی مکمل حمایت)۔
- 28 جنوری 2026 — حتمی rebranding: پلیٹ فارم کا نام Arena رکھا گیا اور یہ ڈومین arena.ai پر منتقل ہو گیا۔
مارچ 2026 تک Arena (arena.ai) 150 سے زائد ممالک کے 50 لاکھ سے زیادہ ماہانہ فعال صارفین کی خدمت کر رہا ہے، کروڑوں ووٹ جمع کر چکا ہے اور حقیقی انسانی ترجیحات کی بنیاد پر frontier AI ماڈلز کی جانچ کے سب سے معتبر آزاد ذرائع میں سے ایک ہے۔
جانچ کا طریقہ کار
صارف ایک سوال داخل کرتا ہے اور بے ترتیب منتخب دو گمنام ماڈلز («A» اور «B») سے جوابات حاصل کرتا ہے، پھر بہترین جواب کو ووٹ دیتا ہے (یا برابری/عدم اطمینان درج کرتا ہے)۔ درجہ بندی Bradley–Terry شماریاتی ماڈل (جوڑے والی ترجیحات پر logistic regression) پر مبنی ہے جو Elo سے مشابہت رکھتا ہے[1]۔ پلیٹ فارم Arena Score اور اعتماد کے وقفے شائع کرتا ہے، اور غیر متناسب sampling کے دوران غیر جانبداری برقرار رکھنے کے لیے نمونے کی اصلاح (re‑weighting) بھی لاگو کرتا ہے[9]۔
شفافیت اور کھلا پن۔ جانچ اور درجہ بندی کے سورس pipelines FastChat ریپوزٹری میں کھلے ہیں[10]؛ تصدیق اور تحقیق کے لیے وقتاً فوقتاً خام ڈیٹا کے حصے شائع کیے جاتے ہیں (مثلاً جولائی 2025 میں 140K مکالمات کا اجرا)[9][11]۔ FAQ اور مرکزی صفحے کی تنبیہات کے مطابق، صارف کے سوالات ماڈل فراہم کنندگان کو ظاہر کیے جا سکتے ہیں اور تحقیقی مقاصد کے لیے جزوی طور پر شائع کیے جا سکتے ہیں — حساس ڈیٹا نہیں بھیجنا چاہیے[12][13]۔
انتخاب اور sampling کے اصول۔ لیڈربورڈز میں عام رسائی والے ماڈلز (کھلے weights/عوامی API/عوامی سروس) شامل کیے جاتے ہیں۔ درجہ بندی کو مستحکم کرنے کے لیے عموماً ≥1000 ووٹ درکار ہوتے ہیں؛ کم از کم 20% مقابلے صرف عوامی ماڈلز کے درمیان ہوتے ہیں؛ sampling کا امکان درجہ بندی اور غیر یقینی صورتحال کے ساتھ بڑھتا ہے، اور دوبارہ وزن دینے والی regression حتمی تشخیصات کی غیر جانبداری یقینی بناتی ہے[9]۔
خودکار میٹرکس اور اسلوب کا کنٹرول۔ تیز تر جانچ اور «اسلوبی» ترجیحات کے اثرات کو کم کرنے کے لیے معاون طریقہ کار استعمال کیے جاتے ہیں: MT‑Bench (LLM‑as‑a‑judge)[14]، Arena‑Hard (مشکل سوالات کی خودکار تیاری)[15]، اور Style/Sentiment Control (لہجے/جذبات کے ترجیحات پر اثر کی ماڈلنگ اور اصلاح)[16]۔ Arena‑Hard‑Auto کے لیے «براہ راست» انسانی ووٹوں کے ساتھ بہت زیادہ ہم آہنگی رپورٹ کی گئی ہے (کنٹرول شدہ حالات میں ≈98.6% تک)[17]۔
Arenas اور جانچ کے شعبے
پلیٹ فارم کاموں کی اقسام کے مطابق «arenas» کے مجموعے میں ترقی پا چکا ہے:
- Text Arena — عام مکالمے/کام، مرکزی جدول[18]۔
- Vision Arena — ملٹی موڈل ماڈلز «متن←تصویر/ویڈیو/تصویر کا تجزیہ»[19]۔
- Text‑to‑Image اور Image Edit — تصاویر کی تیاری اور ترمیم (بشمول nano‑banana کیس)[20][21]۔
- Text‑/Image‑to‑Video — ویڈیو تیاری[22]۔
- WebDev Arena — تفصیل سے ویب ایپلیکیشنز بنانا[23]۔
- RepoChat Arena — کوڈ/ریپوزٹریز پر AI انجینئرنگ کے کام[24]۔
- Search Arena — ویب تلاش سے منسلک ماڈلز؛ پہلے اپریل 2025 میں (legacy) شروع کیا گیا، پھر مرکزی سائٹ پر لایا گیا، اس کے ساتھ dataset اور اشاعت ہے[25][26][27]۔
- BiomedArena.AI — حیاتی طبی کاموں کے لیے domain-specific جانچ (DataTecnica کے ساتھ شراکت داری)[28]۔
استعمال اور اثر
- صنعتیショーکیس۔ بڑے vendors (OpenAI، Anthropic، Google وغیرہ) باقاعدگی سے LMArena پر ماڈلز آزماتے اور پیش کرتے ہیں؛ صنعتی میڈیا پلیٹ فارم کو ایک اہم معیار کے طور پر بیان کرتا ہے[5][29]۔ NAACL‑2025 کی ایک صنعتی اشاعت میں Chatbot Arena کی Elo تشخیص کو «gold industry‑standard» کہا گیا ہے[30]۔
- پیش اجرا جانچ۔ پالیسی گمنام پیش نظارہ «ابھی جاری نہ ہونے والے» ماڈلز کی اجازت دیتی ہے، بشرطیکہ کمیونٹی کو آگاہ کیا جائے اور اجرا کے بعد عوامی تشخیصات شائع کی جائیں؛ مستحکم کرنے کے لیے کم از کم ≈1000 ووٹ ضروری ہیں[9]۔
- مشہور واقعات۔ بہار 2025 میں گمنام ماڈل Llama‑4 Maverick‑03‑26‑Experimental (عوامی ورژنز سے موازنے کا واقعہ) زیر بحث رہا، جس نے میڈیا کی وسیع توجہ حاصل کی اور قوانین/مواصلات میں تجدید کا باعث بنا[31][32]۔ اگست 2025 میں «nano‑banana» کا انکشاف Gemini 2.5 Flash Image کے طور پر ہوا اور اس نے بصری arenas میں سرفہرست مقام حاصل کیا[21][20]۔
حدود اور تنقید
وسعت اور مقبولیت کے باوجود، اس نقطہ نظر کی کچھ حدود ہیں:
- موضوعیت اور اسلوبی اثرات۔ ووٹ کی ترجیحات جواب کے لہجے/انداز پر منحصر ہوتی ہیں؛ ٹیم «اسلوب» اور «مواد» کو الگ کرنے کے لیے Style/Sentiment Control نافذ کر رہی ہے[16]۔
- غیر نمائندہ سامعین۔ فعال مرکز تکنیکی شوقین/ڈویلپرز پر مشتمل ہے؛ domain-specific منظرناموں کے لیے خصوصی arenas بنائی جا رہی ہیں (Search، WebDev، Biomed وغیرہ)[33]۔
- ہیرا پھیری اور تعصب کا خطرہ۔ 2025 کی تحقیقات سے پتہ چلتا ہے کہ سخت تحفظات کے بغیر سینکڑوں سے ہزاروں ووٹوں سے «بھرائی» کی حکمت عملی ممکن ہے؛ LMArena کے ساتھ محققین کے تعاون سے حفاظتی اقدامات (CAPTCHA/لاگ ان/bot تحفظ/اسامانیتا کا پتہ لگانا) نافذ ہوئے اور «حملے کی قیمت» بڑھ گئی[34][35][36]۔
- طریقہ کار کی تنقید۔ The Leaderboard Illusion (اپریل 2025) مقالہ منظم اور ادارہ جاتی عوامل کی طرف اشارہ کرتا ہے جو مقابلے کے میدان کو مسخ کر سکتے ہیں؛ LMArena نے ایک تفصیلی جواب شائع کیا اور طریقہ کار کا عوامی changelog برقرار رکھتا ہے[37][38][39]۔
روابط
- LMArena کی سرکاری ویب سائٹ
- LMArena کا بلاگ/پالیسیاں اور تازہ کاری
- LMSYS تحقیقی گروپ کی ویب سائٹ (منصوبے کا اصل incubator)
ادبیات
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
حواشی
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]