LMArena (Chatbot Arena) (FA)
Arena (تا ۲۸ ژانویه ۲۰۲۶ — LMArena (Large Model Arena)، پیشتر — Chatbot Arena) — یک پلتفرم وب جمعسپاریشده و متنباز برای ارزیابی و رتبهبندی مقایسهای مدلهای زبانی بزرگ (LLM) و مدلهای چندوجهی (متن، تصویر، ویدیو) بر اساس ترجیحات واقعی انسانی است. پایههای این پلتفرم بر مقایسههای زوجی ناشناس (blind battles) میان مدلها و سیستم رتبهبندی Elo استوار است؛ بر این اساس، لیدربوردهای عمومی شفافی منتشر میشوند که به عنوان یکی از معتبرترین benchmarkهای مستقل برای مدلهای frontier هوش مصنوعی شناخته میشوند.[1][2]
این پلتفرم در سال ۲۰۲۳ به عنوان یک پروژه پژوهشی دانشگاهی توسط سازمان LMSYS Org (Large Model Systems Organization) در دانشگاه کالیفرنیا، برکلی (Sky Computing Lab) پایهگذاری شد. در سپتامبر ۲۰۲۴، پروژه به دامنه مستقل lmarena.ai «فارغالتحصیل» شد («Graduation»)[3]. در آوریل ۲۰۲۵، شرکت مستقل Arena Intelligence Inc. تأسیس شد و در ۲۱ مه ۲۰۲۵، یک سید-راند به مبلغ ۱۰۰ میلیون دلار جذب شد (ارزشگذاری ۶۰۰ میلیون دلار؛ سرمایهگذاران اصلی: a16z و UC Investments)[4][5]. در ۶ ژانویه ۲۰۲۶، شرکت یک راند Series A به مبلغ ۱۵۰ میلیون دلار با ارزشگذاری پس از سرمایهگذاری ۱٫۷ میلیارد دلار بست[6]. در ۲۸ ژانویه ۲۰۲۶، ریبرندینگ نهایی انجام شد — پلتفرم Arena نام گرفت و به دامنه arena.ai منتقل شد[7][8].
تاریخچه
این پلتفرم در آوریل ۲۰۲۳ با نام Chatbot Arena به عنوان یک پروژه پژوهشی سازمان LMSYS Org (Large Model Systems Organization) در دانشگاه کالیفرنیا، برکلی (Sky Computing Lab) راهاندازی شد. این پلتفرم یکی از اولین ابزارهای جمعسپاری برای ارزیابی مدلهای زبانی بزرگ از طریق مقایسههای زوجی ناشناس (blind battles) و سیستم رتبهبندی Elo بر اساس ترجیحات واقعی کاربران بود.
- ۲۴ آوریل ۲۰۲۳ — راهاندازی فنی Chatbot Arena.
- ۳ مه ۲۰۲۳ — انتشار عمومی رسمی و انتشار اولین لیدربورد.
- ۲۰۲۳ — انتشار اولین datasetهای متنباز: ۳۳ هزار دیالوگ زوجی (جولای) و LMSYS‑Chat‑1M (سپتامبر، حدود ۱ میلیون دیالوگ واقعی).
- ۱ مارس ۲۰۲۴ — انتشار سیاست رسمی پلتفرم، رسمیسازی مأموریت به عنوان یک سیستم ارزیابی متنباز community-driven.
- ۲۷ ژوئن ۲۰۲۴ — افزوده شدن پشتیبانی از تصویر و آغاز گسترش به سمت وظایف چندوجهی.
- ۲۰ سپتامبر ۲۰۲۴ — «Graduation»: انتقال به دامنه مستقل lmarena.ai.
- اواخر ۲۰۲۴ — بهار ۲۰۲۵ — راهاندازی آرناهای تخصصی (Arena-Hard، WebDev Arena، RepoChat Arena، Style/Sentiment Control و غیره).
- ۱۷ آوریل ۲۰۲۵ — ثبت رسمی به عنوان شرکت مستقل Arena Intelligence Inc.، راهاندازی نسخه بتای پلتفرم بهروز شده تحت برند LMArena.
- ۲۱ مه ۲۰۲۵ — اعلام تأسیس شرکت و جذب سید-راند به مبلغ ۱۰۰ میلیون دلار (ارزشگذاری — ۶۰۰ میلیون دلار).
- ۳۱ جولای ۲۰۲۵ — انتشار dataset متنباز شامل ۱۴۰ هزار دیالوگ اخیر Text Arena.
- ۶ ژانویه ۲۰۲۶ — جذب راند Series A به مبلغ ۱۵۰ میلیون دلار با ارزشگذاری پس از سرمایهگذاری ۱٫۷ میلیارد دلار.
- ژانویه ۲۰۲۶ — راهاندازی Video Arena (پشتیبانی کامل از وجه ویدیویی).
- ۲۸ ژانویه ۲۰۲۶ — ریبرندینگ نهایی: پلتفرم Arena نام گرفت و به دامنه arena.ai منتقل شد.
تا مارس ۲۰۲۶، Arena (arena.ai) بیش از ۵ میلیون کاربر فعال ماهانه از بیش از ۱۵۰ کشور دارد، دهها میلیون رأی جمعآوری کرده و همچنان یکی از معتبرترین ابزارهای مستقل ارزیابی مدلهای frontier هوش مصنوعی بر اساس ترجیحات واقعی انسانی محسوب میشود.
نحوه کار ارزیابی
کاربر یک درخواست وارد میکند و دو پاسخ از مدلهای ناشناس بهصورت تصادفی انتخابشده («A» و «B») دریافت میکند، سپس به پاسخ بهتر رأی میدهد (یا تساوی/نارضایتی را ثبت میکند). رتبهبندی بر پایه مدل آماری Bradley–Terry (رگرسیون لجستیک بر اساس ترجیحات زوجی) استوار است که از نظر شهودی به Elo نزدیک است[1]. پلتفرم Arena Score و فاصلههای اطمینان را منتشر میکند و همچنین از تصحیحهای نمونهگیری (re‑weighting) استفاده میکند تا در شرایط نمونهگیری نامتوازن، نتایج بیطرفانه باقی بمانند[9].
شفافیت و متنبازی. پایپلاینهای اصلی ارزیابی و رتبهبندی در مخزن FastChat متنباز هستند[10]؛ بهصورت دورهای بخشهایی از دادههای خام برای تأیید و پژوهش منتشر میشوند (مانند انتشار ۱۴۰K دیالوگ در جولای ۲۰۲۵)[9][11]. طبق FAQ و هشدارهای صفحه اصلی، درخواستهای کاربران ممکن است برای ارائهدهندگان مدلها فاش شوند و بخشی از آنها برای اهداف پژوهشی منتشر شوند — نباید دادههای حساس ارسال شود[12][13].
قوانین انتخاب و نمونهگیری. مدلهای دسترسی عمومی (وزنهای متنباز / API عمومی / سرویس عمومی) در لیدربوردها گنجانده میشوند. برای پایدارسازی ارزیابی معمولاً ≥۱۰۰۰ رأی لازم است؛ حداقل ۲۰٪ از battleها باید فقط میان مدلهای عمومی باشد؛ احتمال نمونهگیری با رتبه و عدمقطعیت افزایش مییابد و رگرسیون با وزندهی مجدد، بیطرفی ارزیابیهای نهایی را تضمین میکند[9].
متریکهای خودکار و کنترل سبک. برای ارزیابی سریعتر و کاهش اثرات ترجیحات «سبکی»، روشهای کمکی به کار میروند: MT‑Bench (LLM‑as‑a‑judge)[14]، Arena‑Hard (تولید خودکار سؤالات دشوار)[15]، و همچنین Style/Sentiment Control (مدلسازی و «درمان» اثر لحن/احساسات بر ترجیحات)[16]. برای Arena‑Hard‑Auto همبستگی بسیار بالایی با رأیهای «زنده» انسانی گزارش شده است (تا ≈۹۸٫۶٪ در شرایط کنترلشده)[17].
آرناها و حوزههای ارزیابی
این پلتفرم به مجموعهای از «آرناها» بر اساس نوع وظیفه تکامل یافته است:
- Text Arena — دیالوگها/وظایف عمومی، جدول اصلی[18].
- Vision Arena — مدلهای چندوجهی «متن→تصویر/ویدیو/تحلیل تصویر»[19].
- Text‑to‑Image و Image Edit — تولید و ویرایش تصاویر (از جمله مورد nano‑banana)[20][21].
- Text‑/Image‑to‑Video — تولید ویدیو[22].
- WebDev Arena — ساخت برنامههای وب از روی توضیحات[23].
- RepoChat Arena — وظایف مهندسی هوش مصنوعی بر روی کد/مخازن[24].
- Search Arena — مدلهایی با اتصال به جستجوی وب؛ ابتدا در آوریل ۲۰۲۵ راهاندازی شد (legacy)، سپس به سایت اصلی منتقل شد و با dataset و انتشار مقاله همراه است[25][26][27].
- BiomedArena.AI — ارزیابی تخصصی دامنه برای وظایف زیستپزشکی (مشارکت با DataTecnica)[28].
کاربرد و تأثیر
- ویترین صنعتی. بزرگترین فروشندگان (OpenAI، Anthropic، Google و دیگران) بهطور منظم مدلهای خود را روی LMArena آزمایش و نمایش میدهند؛ رسانههای صنعتی این پلتفرم را به عنوان یک معیار مهم توصیف میکنند[5][29]. در یک انتشار صنعتی NAACL‑2025، نمره Elo از Chatbot Arena «gold industry‑standard» نامیده شده است[30].
- آزمایش پیش از انتشار. سیاست پلتفرم اجازه پیشنمایشهای ناشناس مدلهای «هنوز منتشرنشده» را با اطلاعرسانی به جامعه و انتشار بعدی امتیازات عمومی پس از انتشار رسمی میدهد؛ حداقل ≈۱۰۰۰ رأی برای پایدارسازی لازم است[9].
- رویدادهای مشهور. در بهار ۲۰۲۵، مدل ناشناس Llama‑4 Maverick‑03‑26‑Experimental (ماجرای مقایسه با نسخههای عمومی) مورد بحث قرار گرفت که توجه گسترده رسانهها را جلب کرد و به بهروزرسانی قوانین/ارتباطات منجر شد[31][32]. در اوت ۲۰۲۵، «nano‑banana» به عنوان Gemini 2.5 Flash Image شناسایی شد و در آرناهای بینایی جایگاههای پیشرو کسب کرد[21][20].
محدودیتها و انتقادات
علیرغم مقیاس و محبوبیت، این رویکرد محدودیتهایی دارد:
- ذهنیت و اثرات سبکی. ترجیحات رأی به لحن/شیوه پاسخ وابسته است؛ تیم توسعهدهنده Style/Sentiment Control را برای جداسازی «سبک» از «محتوا» پیادهسازی کرده است[16].
- غیرنمایندگی بودن مخاطبان. هسته اصلی کاربران فعال — علاقهمندان فناوری/توسعهدهندگان هستند؛ برای سناریوهای تخصصی، آرناهای تخصصی (Search، WebDev، Biomed و غیره) ایجاد شدهاند[33].
- آسیبپذیری در برابر دستکاری و انحراف. پژوهشهای سال ۲۰۲۵ نشان میدهند که در غیاب محافظتهای سختگیرانه، استراتژیهای «دستکاری رأی» با صدها تا هزاران رأی ممکن است؛ با این حال، همکاری پژوهشگران با LMArena به پیادهسازی اقدامات حفاظتی (CAPTCHA/ورود/محافظت از ربات/تشخیص ناهنجاری) و افزایش «هزینه حمله» منجر شده است[34][35][36].
- انتقاد روششناختی. مقاله The Leaderboard Illusion (آوریل ۲۰۲۵) به عوامل سیستماتیک و نهادی اشاره میکند که میتوانند فضای رقابت را تحریف کنند؛ LMArena پاسخ مفصلی منتشر کرده و changelog عمومی روششناسی را نگهداری میکند[37][38][39].
پیوندها
- وبسایت رسمی LMArena
- وبلاگ/سیاستها و بهروزرسانیهای LMArena
- وبسایت گروه پژوهشی LMSYS (انکوباتور اصلی پروژه)
منابع
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
یادداشتها
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [۱]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [۲]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [۳]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [۴]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [۵]
- ↑ lm‑sys/FastChat (GitHub). [۶]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [۷]
- ↑ FAQ. LMArena. [۸]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [۹]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [۱۰]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [۱۱]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [۱۲]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [۱۳]
- ↑ Text Arena (English). LMArena. [۱۴]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [۱۵]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [۱۶]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [۱۷]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [۱۸] [۱۹]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [۲۰]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [۲۱]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [۲۲]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [۲۳]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [۲۴]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [۲۵]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [۲۶]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [۲۷]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [۲۸]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [۲۹]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [۳۰]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [۳۱]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [۳۲]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [۳۳]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [۳۴]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [۳۵]
- ↑ «Methodology Changelog». LMArena Blog. [۳۶]