LMArena (Chatbot Arena) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Arena (تا ۲۸ ژانویه ۲۰۲۶ — LMArena (Large Model Arena)، پیش‌تر — Chatbot Arena) — یک پلتفرم وب جمع‌سپاری‌شده و متن‌باز برای ارزیابی و رتبه‌بندی مقایسه‌ای مدل‌های زبانی بزرگ (LLM) و مدل‌های چندوجهی (متن، تصویر، ویدیو) بر اساس ترجیحات واقعی انسانی است. پایه‌های این پلتفرم بر مقایسه‌های زوجی ناشناس (blind battles) میان مدل‌ها و سیستم رتبه‌بندی Elo استوار است؛ بر این اساس، لیدربوردهای عمومی شفافی منتشر می‌شوند که به عنوان یکی از معتبرترین benchmark‌های مستقل برای مدل‌های frontier هوش مصنوعی شناخته می‌شوند.[1][2]

این پلتفرم در سال ۲۰۲۳ به عنوان یک پروژه پژوهشی دانشگاهی توسط سازمان LMSYS Org (Large Model Systems Organization) در دانشگاه کالیفرنیا، برکلی (Sky Computing Lab) پایه‌گذاری شد. در سپتامبر ۲۰۲۴، پروژه به دامنه مستقل lmarena.ai «فارغ‌التحصیل» شد («Graduation»)[3]. در آوریل ۲۰۲۵، شرکت مستقل Arena Intelligence Inc. تأسیس شد و در ۲۱ مه ۲۰۲۵، یک سید-راند به مبلغ ۱۰۰ میلیون دلار جذب شد (ارزش‌گذاری ۶۰۰ میلیون دلار؛ سرمایه‌گذاران اصلی: a16z و UC Investments)[4][5]. در ۶ ژانویه ۲۰۲۶، شرکت یک راند Series A به مبلغ ۱۵۰ میلیون دلار با ارزش‌گذاری پس از سرمایه‌گذاری ۱٫۷ میلیارد دلار بست[6]. در ۲۸ ژانویه ۲۰۲۶، ریبرندینگ نهایی انجام شد — پلتفرم Arena نام گرفت و به دامنه arena.ai منتقل شد[7][8].

تاریخچه

این پلتفرم در آوریل ۲۰۲۳ با نام Chatbot Arena به عنوان یک پروژه پژوهشی سازمان LMSYS Org (Large Model Systems Organization) در دانشگاه کالیفرنیا، برکلی (Sky Computing Lab) راه‌اندازی شد. این پلتفرم یکی از اولین ابزارهای جمع‌سپاری برای ارزیابی مدل‌های زبانی بزرگ از طریق مقایسه‌های زوجی ناشناس (blind battles) و سیستم رتبه‌بندی Elo بر اساس ترجیحات واقعی کاربران بود.

  • ۲۴ آوریل ۲۰۲۳ — راه‌اندازی فنی Chatbot Arena.
  • ۳ مه ۲۰۲۳ — انتشار عمومی رسمی و انتشار اولین لیدربورد.
  • ۲۰۲۳ — انتشار اولین dataset‌های متن‌باز: ۳۳ هزار دیالوگ زوجی (جولای) و LMSYS‑Chat‑1M (سپتامبر، حدود ۱ میلیون دیالوگ واقعی).
  • ۱ مارس ۲۰۲۴ — انتشار سیاست رسمی پلتفرم، رسمی‌سازی مأموریت به عنوان یک سیستم ارزیابی متن‌باز community-driven.
  • ۲۷ ژوئن ۲۰۲۴ — افزوده شدن پشتیبانی از تصویر و آغاز گسترش به سمت وظایف چندوجهی.
  • ۲۰ سپتامبر ۲۰۲۴ — «Graduation»: انتقال به دامنه مستقل lmarena.ai.
  • اواخر ۲۰۲۴ — بهار ۲۰۲۵ — راه‌اندازی آرناهای تخصصی (Arena-Hard، WebDev Arena، RepoChat Arena، Style/Sentiment Control و غیره).
  • ۱۷ آوریل ۲۰۲۵ — ثبت رسمی به عنوان شرکت مستقل Arena Intelligence Inc.، راه‌اندازی نسخه بتای پلتفرم به‌روز شده تحت برند LMArena.
  • ۲۱ مه ۲۰۲۵ — اعلام تأسیس شرکت و جذب سید-راند به مبلغ ۱۰۰ میلیون دلار (ارزش‌گذاری — ۶۰۰ میلیون دلار).
  • ۳۱ جولای ۲۰۲۵ — انتشار dataset متن‌باز شامل ۱۴۰ هزار دیالوگ اخیر Text Arena.
  • ۶ ژانویه ۲۰۲۶ — جذب راند Series A به مبلغ ۱۵۰ میلیون دلار با ارزش‌گذاری پس از سرمایه‌گذاری ۱٫۷ میلیارد دلار.
  • ژانویه ۲۰۲۶ — راه‌اندازی Video Arena (پشتیبانی کامل از وجه ویدیویی).
  • ۲۸ ژانویه ۲۰۲۶ — ریبرندینگ نهایی: پلتفرم Arena نام گرفت و به دامنه arena.ai منتقل شد.

تا مارس ۲۰۲۶، Arena (arena.ai) بیش از ۵ میلیون کاربر فعال ماهانه از بیش از ۱۵۰ کشور دارد، ده‌ها میلیون رأی جمع‌آوری کرده و همچنان یکی از معتبرترین ابزارهای مستقل ارزیابی مدل‌های frontier هوش مصنوعی بر اساس ترجیحات واقعی انسانی محسوب می‌شود.

نحوه کار ارزیابی

کاربر یک درخواست وارد می‌کند و دو پاسخ از مدل‌های ناشناس به‌صورت تصادفی انتخاب‌شده («A» و «B») دریافت می‌کند، سپس به پاسخ بهتر رأی می‌دهد (یا تساوی/نارضایتی را ثبت می‌کند). رتبه‌بندی بر پایه مدل آماری Bradley–Terry (رگرسیون لجستیک بر اساس ترجیحات زوجی) استوار است که از نظر شهودی به Elo نزدیک است[1]. پلتفرم Arena Score و فاصله‌های اطمینان را منتشر می‌کند و همچنین از تصحیح‌های نمونه‌گیری (re‑weighting) استفاده می‌کند تا در شرایط نمونه‌گیری نامتوازن، نتایج بی‌طرفانه باقی بمانند[9].

شفافیت و متن‌بازی. پایپلاین‌های اصلی ارزیابی و رتبه‌بندی در مخزن FastChat متن‌باز هستند[10]؛ به‌صورت دوره‌ای بخش‌هایی از داده‌های خام برای تأیید و پژوهش منتشر می‌شوند (مانند انتشار ۱۴۰K دیالوگ در جولای ۲۰۲۵)[9][11]. طبق FAQ و هشدارهای صفحه اصلی، درخواست‌های کاربران ممکن است برای ارائه‌دهندگان مدل‌ها فاش شوند و بخشی از آن‌ها برای اهداف پژوهشی منتشر شوند — نباید داده‌های حساس ارسال شود[12][13].

قوانین انتخاب و نمونه‌گیری. مدل‌های دسترسی عمومی (وزن‌های متن‌باز / API عمومی / سرویس عمومی) در لیدربوردها گنجانده می‌شوند. برای پایدارسازی ارزیابی معمولاً ≥۱۰۰۰ رأی لازم است؛ حداقل ۲۰٪ از battle‌ها باید فقط میان مدل‌های عمومی باشد؛ احتمال نمونه‌گیری با رتبه و عدم‌قطعیت افزایش می‌یابد و رگرسیون با وزن‌دهی مجدد، بی‌طرفی ارزیابی‌های نهایی را تضمین می‌کند[9].

متریک‌های خودکار و کنترل سبک. برای ارزیابی سریع‌تر و کاهش اثرات ترجیحات «سبکی»، روش‌های کمکی به کار می‌روند: MT‑Bench (LLM‑as‑a‑judge)[14]، Arena‑Hard (تولید خودکار سؤالات دشوار)[15]، و همچنین Style/Sentiment Control (مدل‌سازی و «درمان» اثر لحن/احساسات بر ترجیحات)[16]. برای Arena‑Hard‑Auto همبستگی بسیار بالایی با رأی‌های «زنده» انسانی گزارش شده است (تا ≈۹۸٫۶٪ در شرایط کنترل‌شده)[17].

آرناها و حوزه‌های ارزیابی

این پلتفرم به مجموعه‌ای از «آرناها» بر اساس نوع وظیفه تکامل یافته است:

  • Text Arena — دیالوگ‌ها/وظایف عمومی، جدول اصلی[18].
  • Vision Arena — مدل‌های چندوجهی «متن→تصویر/ویدیو/تحلیل تصویر»[19].
  • Text‑to‑Image و Image Edit — تولید و ویرایش تصاویر (از جمله مورد nano‑banana)[20][21].
  • Text‑/Image‑to‑Video — تولید ویدیو[22].
  • WebDev Arena — ساخت برنامه‌های وب از روی توضیحات[23].
  • RepoChat Arena — وظایف مهندسی هوش مصنوعی بر روی کد/مخازن[24].
  • Search Arena — مدل‌هایی با اتصال به جستجوی وب؛ ابتدا در آوریل ۲۰۲۵ راه‌اندازی شد (legacy)، سپس به سایت اصلی منتقل شد و با dataset و انتشار مقاله همراه است[25][26][27].
  • BiomedArena.AI — ارزیابی تخصصی دامنه برای وظایف زیست‌پزشکی (مشارکت با DataTecnica)[28].

کاربرد و تأثیر

  • ویترین صنعتی. بزرگ‌ترین فروشندگان (OpenAI، Anthropic، Google و دیگران) به‌طور منظم مدل‌های خود را روی LMArena آزمایش و نمایش می‌دهند؛ رسانه‌های صنعتی این پلتفرم را به عنوان یک معیار مهم توصیف می‌کنند[5][29]. در یک انتشار صنعتی NAACL‑2025، نمره Elo از Chatbot Arena «gold industry‑standard» نامیده شده است[30].
  • آزمایش پیش از انتشار. سیاست پلتفرم اجازه پیش‌نمایش‌های ناشناس مدل‌های «هنوز منتشرنشده» را با اطلاع‌رسانی به جامعه و انتشار بعدی امتیازات عمومی پس از انتشار رسمی می‌دهد؛ حداقل ≈۱۰۰۰ رأی برای پایدارسازی لازم است[9].
  • رویدادهای مشهور. در بهار ۲۰۲۵، مدل ناشناس Llama‑4 Maverick‑03‑26‑Experimental (ماجرای مقایسه با نسخه‌های عمومی) مورد بحث قرار گرفت که توجه گسترده رسانه‌ها را جلب کرد و به به‌روزرسانی قوانین/ارتباطات منجر شد[31][32]. در اوت ۲۰۲۵، «nano‑banana» به عنوان Gemini 2.5 Flash Image شناسایی شد و در آرناهای بینایی جایگاه‌های پیشرو کسب کرد[21][20].

محدودیت‌ها و انتقادات

علی‌رغم مقیاس و محبوبیت، این رویکرد محدودیت‌هایی دارد:

  • ذهنیت و اثرات سبکی. ترجیحات رأی به لحن/شیوه پاسخ وابسته است؛ تیم توسعه‌دهنده Style/Sentiment Control را برای جداسازی «سبک» از «محتوا» پیاده‌سازی کرده است[16].
  • غیرنمایندگی بودن مخاطبان. هسته اصلی کاربران فعال — علاقه‌مندان فناوری/توسعه‌دهندگان هستند؛ برای سناریوهای تخصصی، آرناهای تخصصی (Search، WebDev، Biomed و غیره) ایجاد شده‌اند[33].
  • آسیب‌پذیری در برابر دستکاری و انحراف. پژوهش‌های سال ۲۰۲۵ نشان می‌دهند که در غیاب محافظت‌های سخت‌گیرانه، استراتژی‌های «دستکاری رأی» با صدها تا هزاران رأی ممکن است؛ با این حال، همکاری پژوهشگران با LMArena به پیاده‌سازی اقدامات حفاظتی (CAPTCHA/ورود/محافظت از ربات/تشخیص ناهنجاری) و افزایش «هزینه حمله» منجر شده است[34][35][36].
  • انتقاد روش‌شناختی. مقاله The Leaderboard Illusion (آوریل ۲۰۲۵) به عوامل سیستماتیک و نهادی اشاره می‌کند که می‌توانند فضای رقابت را تحریف کنند؛ LMArena پاسخ مفصلی منتشر کرده و changelog عمومی روش‌شناسی را نگه‌داری می‌کند[37][38][39].

پیوندها

  • وب‌سایت رسمی LMArena
  • وبلاگ/سیاست‌ها و به‌روزرسانی‌های LMArena
  • وب‌سایت گروه پژوهشی LMSYS (انکوباتور اصلی پروژه)

منابع

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

یادداشت‌ها

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
  4. «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [۱]
  5. 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [۲]
  6. «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [۳]
  7. «We Are Now Arena». Arena Blog, 28 января 2026. [۴]
  8. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
  9. 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [۵]
  10. lm‑sys/FastChat (GitHub). [۶]
  11. «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [۷]
  12. FAQ. LMArena. [۸]
  13. Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [۹]
  14. Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [۱۰]
  15. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [۱۱]
  16. 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [۱۲]
  17. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [۱۳]
  18. Text Arena (English). LMArena. [۱۴]
  19. Vision Arena. LMArena, обновлено 2 сентября 2025. [۱۵]
  20. 20.0 20.1 Text-to-Image Leaderboard. LMArena. [۱۶]
  21. 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [۱۷]
  22. Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [۱۸] [۱۹]
  23. «Introducing WebDev Arena». LMArena Blog, 2025. [۲۰]
  24. «Introducing RepoChat Arena». LMArena Blog, 2025. [۲۱]
  25. «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [۲۲]
  26. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [۲۳]
  27. Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [۲۴]
  28. «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [۲۵]
  29. Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [۲۶]
  30. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [۲۷]
  31. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [۲۸]
  32. Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [۲۹]
  33. «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [۳۰]
  34. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [۳۱]
  35. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [۳۲]
  36. «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [۳۳]
  37. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [۳۴]
  38. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [۳۵]
  39. «Methodology Changelog». LMArena Blog. [۳۶]