---
title: "LMArena"
source: "https://systems-analysis.info/wiki/LMArena"
wiki: "systems-analysis.info/wiki"
article: "LMArena"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 138
wiki_created_at: 2026-09-06T21:55:36Z
wiki_modified_at: 2026-09-06T21:55:36Z
downloaded_at: 2026-09-07T22:17:43Z
---

# LMArena

**Arena** (до 28 января 2026 года — **LMArena** (*Large Model Arena*), ранее — **Chatbot Arena**) — открытая краудсорсинговая веб-платформа для оценки и сравнительного ранжирования [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM) и мультимодальных моделей (текст, изображение, видео) по реальным человеческим предпочтениям. Основу платформы составляют анонимные парные сравнения (blind battles) моделей и система рейтинга Elo; на их основе публикуются прозрачные публичные лидерборды, считающиеся одним из наиболее авторитетных независимых бенчмарков frontier-моделей искусственного интеллекта.<sup>[\[1\]](https://systems-analysis.info/wiki/LMArena#cite_note-chiang2024-1)[\[2\]](https://systems-analysis.info/wiki/LMArena#cite_note-hello_2025-2)</sup>

Платформа возникла в 2023 году как академический исследовательский проект организации **LMSYS Org** (Large Model Systems Organization) при Калифорнийском университете в Беркли (Sky Computing Lab). В сентябре 2024 года проект «выпустился» на самостоятельный домен lmarena.ai («Graduation»)<sup>[\[3\]](https://systems-analysis.info/wiki/LMArena#cite_note-new_site_2024-3)</sup>. В апреле 2025 года была создана независимая компания **Arena Intelligence Inc.**, а 21 мая 2025 года привлечён сид-раунд в **\$100 млн** (оценка \$600 млн, основные инвесторы — a16z и UC Investments)<sup>[\[4\]](https://systems-analysis.info/wiki/LMArena#cite_note-seed_prn-4)[\[5\]](https://systems-analysis.info/wiki/LMArena#cite_note-tc_seed-5)</sup>. 6 января 2026 года компания закрыла раунд Series A объёмом **\$150 млн** при пост-мани оценке **\$1,7 млрд**<sup>[\[6\]](https://systems-analysis.info/wiki/LMArena#cite_note-series_a_2026-6)</sup>. 28 января 2026 года состоялся финальный ребрендинг — платформа стала называться **Arena** и перешла на домен <a href="https://arena.ai/" class="external text" rel="nofollow">arena.ai</a><sup>[\[7\]](https://systems-analysis.info/wiki/LMArena#cite_note-arena_rebrand_2026-7)[\[8\]](https://systems-analysis.info/wiki/LMArena#cite_note-new_beta_2025-8)</sup>.

## История

Платформа была запущена в апреле 2023 года под названием **Chatbot Arena** как исследовательский проект организации LMSYS Org (Large Model Systems Organization) при Калифорнийском университете в Беркли (Sky Computing Lab). Она стала одним из первых инструментов краудсорсинговой оценки больших языковых моделей через анонимные парные сравнения (blind battles) и систему рейтинга Elo на основе реальных предпочтений пользователей.

- **24 апреля 2023** — технический запуск Chatbot Arena.
- **3 мая 2023** — официальный публичный релиз и публикация первого лидерборда.
- **2023** — релиз первых открытых датасетов: 33 тыс. парных диалогов (июль) и **LMSYS‑Chat‑1M** (сентябрь, около 1 млн реальных диалогов).
- **1 марта 2024** — публикация официальной политики платформы, формализация миссии как открытой community-driven системы оценки.
- **27 июня 2024** — добавление поддержки изображений и начало расширения на мультимодальные задачи.
- **20 сентября 2024** — «Graduation»: переход на самостоятельный домен **lmarena.ai**.
- **Конец 2024 — весна 2025** — запуск специализированных арен (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control и др.).
- **17 апреля 2025** — официальная инкорпорация как независимая компания **Arena Intelligence Inc.**, запуск бета-версии обновлённой платформы под брендом LMArena.
- **21 мая 2025** — объявление о создании компании и привлечение сид-раунда в **\$100 млн** (оценка — \$600 млн).
- **31 июля 2025** — публикация открытого датасета из **140 тыс.** недавних диалогов Text Arena.
- **6 января 2026** — привлечение раунда Series A в **\$150 млн** при пост-мани оценке **\$1,7 млрд**.
- **Январь 2026** — запуск **Video Arena** (полная поддержка видео-модальности).
- **28 января 2026** — финальный ребрендинг: платформа стала называться **Arena** и перешла на домен **arena.ai**.

К марту 2026 года Arena (arena.ai) обслуживает более 5 млн ежемесячных активных пользователей из 150+ стран, накопила десятки миллионов голосов и остаётся одним из наиболее авторитетных независимых инструментов оценки frontier-моделей ИИ по реальным человеческим предпочтениям.

## Как работает оценка

Пользователь вводит запрос и получает два ответа от случайно выбранных анонимных моделей («A» и «B»), после чего голосует за лучший ответ (либо фиксирует ничью/неудовлетворительность). Ранжирование основано на статистической модели **Брэдли—Терри** (логистическая регрессия по парным предпочтениям), интуитивно близкой к Эло<sup>[\[1\]](https://systems-analysis.info/wiki/LMArena#cite_note-chiang2024-1)</sup>. Платформа публикует **Arena Score** и доверительные интервалы, а также применяет коррекции выборки (re‑weighting), чтобы сохранить несмещённость при неравномерном семплировании<sup>[\[9\]](https://systems-analysis.info/wiki/LMArena#cite_note-policy-9)</sup>.

**Прозрачность и открытость.** Исходные пайплайны оценки и ранжирования открыты в репозитории **FastChat**<sup>[\[10\]](https://systems-analysis.info/wiki/LMArena#cite_note-10)</sup>; периодически публикуются части сырых данных для верификации и исследований (напр., релиз 140K диалогов в июле 2025)<sup>[\[9\]](https://systems-analysis.info/wiki/LMArena#cite_note-policy-9)[\[11\]](https://systems-analysis.info/wiki/LMArena#cite_note-opendata_2025-11)</sup>. Согласно *FAQ* и предупреждениям на главной странице, пользовательские запросы могут раскрываться провайдерам моделей и частично публиковаться для исследовательских целей — не следует отправлять чувствительные данные<sup>[\[12\]](https://systems-analysis.info/wiki/LMArena#cite_note-12)[\[13\]](https://systems-analysis.info/wiki/LMArena#cite_note-13)</sup>.

**Правила отбора и семплирования.** В лидерборды включаются модели общего доступа (открытые веса/публичный API/публичный сервис). Для стабилизации оценки требуется обычно ≥**1000** голосов; не менее **20%** баттлов — только между публичными моделями; вероятность семплирования растёт с рейтингом и неопределённостью, а регрессия с перевзвешиванием обеспечивает несмещённость итоговых оценок<sup>[\[9\]](https://systems-analysis.info/wiki/LMArena#cite_note-policy-9)</sup>.

**Авто‑метрики и контроль стиля.** Для ускоренной оценки и уменьшения эффектов «стилевых» предпочтений применяются вспомогательные методики: *MT‑Bench* (LLM‑as‑a‑judge)<sup>[\[14\]](https://systems-analysis.info/wiki/LMArena#cite_note-14)</sup>, *Arena‑Hard* (автогенерация сложных вопросов)<sup>[\[15\]](https://systems-analysis.info/wiki/LMArena#cite_note-arena_hard-15)</sup>, а также **Style/Sentiment Control** (моделирование и «вылечивание» эффекта тона/эмоций на предпочтения)<sup>[\[16\]](https://systems-analysis.info/wiki/LMArena#cite_note-sentiment_control-16)</sup>. Для *Arena‑Hard‑Auto* сообщалась очень высокая согласованность с «живыми» человеческими голосами (до **≈98,6%** в контролируемых условиях)<sup>[\[17\]](https://systems-analysis.info/wiki/LMArena#cite_note-17)</sup>.

## Арены и домены оценки

Платформа развилась в набор «арен» по типам задач:

- **Text Arena** — общие диалоги/задачи, основная таблица<sup>[\[18\]](https://systems-analysis.info/wiki/LMArena#cite_note-text_stats-18)</sup>.
- **Vision Arena** — мультимодальные модели «текст→изображение/видео/анализ изображений»<sup>[\[19\]](https://systems-analysis.info/wiki/LMArena#cite_note-19)</sup>.
- **Text‑to‑Image** и **Image Edit** — генерация и правки изображений (в т.ч. кейс *nano‑banana*)<sup>[\[20\]](https://systems-analysis.info/wiki/LMArena#cite_note-tti_page-20)[\[21\]](https://systems-analysis.info/wiki/LMArena#cite_note-nanobanana_blog-21)</sup>.
- **Text‑/Image‑to‑Video** — генерация видео<sup>[\[22\]](https://systems-analysis.info/wiki/LMArena#cite_note-22)</sup>.
- **WebDev Arena** — сборка веб‑приложений из описаний<sup>[\[23\]](https://systems-analysis.info/wiki/LMArena#cite_note-webdev_arena-23)</sup>.
- **RepoChat Arena** — задачи ИИ‑инженерии по коду/репозиториям<sup>[\[24\]](https://systems-analysis.info/wiki/LMArena#cite_note-repochat_arena-24)</sup>.
- **Search Arena** — модели с подключением к веб‑поиску; сначала запущена в апреле 2025 (legacy), затем выведена на основной сайт, сопровождается набором данных и публикацией<sup>[\[25\]](https://systems-analysis.info/wiki/LMArena#cite_note-25)[\[26\]](https://systems-analysis.info/wiki/LMArena#cite_note-26)[\[27\]](https://systems-analysis.info/wiki/LMArena#cite_note-27)</sup>.
- **BiomedArena.AI** — доменно‑специфическая оценка для биомедицинских задач (партнёрство с DataTecnica)<sup>[\[28\]](https://systems-analysis.info/wiki/LMArena#cite_note-28)</sup>.

## Применение и влияние

- **Индустриальная витрина.** Крупнейшие вендоры (OpenAI, Anthropic, Google и др.) регулярно тестируют и демонстрируют модели на LMArena; индустриальные медиа описывают платформу как важный ориентир<sup>[\[5\]](https://systems-analysis.info/wiki/LMArena#cite_note-tc_seed-5)[\[29\]](https://systems-analysis.info/wiki/LMArena#cite_note-29)</sup>. В индустриальной публикации NAACL‑2025 Elo‑оценка Chatbot Arena названа «**gold industry‑standard**»<sup>[\[30\]](https://systems-analysis.info/wiki/LMArena#cite_note-30)</sup>.
- **Предрелизное тестирование.** Политика допускает анонимные предпросмотры «нерелизнутых» моделей с уведомлением сообщества и последующей публикацией публичных оценок после релиза; минимум ≈1000 голосов для стабилизации<sup>[\[9\]](https://systems-analysis.info/wiki/LMArena#cite_note-policy-9)</sup>.
- **Известные эпизоды.** Весной 2025 обсуждалась анонимная модель *Llama‑4 Maverick‑03‑26‑Experimental* (инцидент вокруг сравнения с публичными версиями), что привлекло широкое внимание прессы и спровоцировало обновления правил/коммуникаций<sup>[\[31\]](https://systems-analysis.info/wiki/LMArena#cite_note-31)[\[32\]](https://systems-analysis.info/wiki/LMArena#cite_note-32)</sup>. В августе 2025 «nano‑banana» раскрылся как **[Gemini](https://systems-analysis.info/wiki/Gemini "Gemini") 2.5 Flash Image** и занял лидирующие позиции в визуальных аренах<sup>[\[21\]](https://systems-analysis.info/wiki/LMArena#cite_note-nanobanana_blog-21)[\[20\]](https://systems-analysis.info/wiki/LMArena#cite_note-tti_page-20)</sup>.

## Ограничения и критика

Несмотря на масштаб и популярность, подход имеет ограничения:

- **Субъективность и стилевые эффекты.** Предпочтения голоса зависят от тона/манеры ответа; команда внедряет **Style/Sentiment Control** для декуплинга «стиля» и «содержания»<sup>[\[16\]](https://systems-analysis.info/wiki/LMArena#cite_note-sentiment_control-16)</sup>.
- **Непредставительность аудитории.** Актив ядра — техно‑энтузиасты/разработчики; для доменных сценариев создаются специализированные арены (Search, WebDev, Biomed и др.)<sup>[\[33\]](https://systems-analysis.info/wiki/LMArena#cite_note-33)</sup>.
- **Уязвимость к манипуляциям и смещениям.** Исследования 2025 года показывают, что при отсутствии жёстких защит возможны стратегии «накрутки» с сотнями–тысячами голосов; при этом совместная работа исследователей с LMArena привела к внедрению мер защиты (CAPTCHA/логин/бот‑протекция/детект аномалий) и росту «стоимости атаки»<sup>[\[34\]](https://systems-analysis.info/wiki/LMArena#cite_note-34)[\[35\]](https://systems-analysis.info/wiki/LMArena#cite_note-35)[\[36\]](https://systems-analysis.info/wiki/LMArena#cite_note-36)</sup>.
- **Методологическая критика.** Работа *The Leaderboard Illusion* (апрель 2025) указывает на систематические и институциональные факторы, способные искажать поле соревнования; LMArena опубликовала развёрнутый ответ и ведёт публичный *changelog* методологии<sup>[\[37\]](https://systems-analysis.info/wiki/LMArena#cite_note-37)[\[38\]](https://systems-analysis.info/wiki/LMArena#cite_note-38)[\[39\]](https://systems-analysis.info/wiki/LMArena#cite_note-changelog-39)</sup>.

## См. также

- [MT-Bench benchmark](https://systems-analysis.info/wiki/MT-Bench_benchmark "MT-Bench benchmark")
- [Бенчмарки LLM](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")
- [Оценка LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [BBQ](https://systems-analysis.info/wiki/BBQ "BBQ")

## Ссылки

- <a href="https://lmarena.ai/" class="external text" rel="nofollow">Официальный сайт LMArena</a>
- <a href="https://news.lmarena.ai/" class="external text" rel="nofollow">Блог/политики и обновления LMArena</a>
- <a href="https://lmsys.org/" class="external text" rel="nofollow">Сайт исследовательской группы LMSYS (оригинальный инкубатор проекта)</a>

## Литература

- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Zheng, L. et al. (2023). *Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena*. <a href="https://arxiv.org/abs/2306.05685" class="external text" rel="nofollow">arXiv:2306.05685</a>.
- Li, T. et al. (2024). *From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline*. <a href="https://arxiv.org/abs/2406.11939" class="external text" rel="nofollow">arXiv:2406.11939</a>.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). *A Statistical Framework for Ranking LLM-Based Chatbots*. <a href="https://arxiv.org/abs/2412.18407" class="external text" rel="nofollow">arXiv:2412.18407</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings*. <a href="https://arxiv.org/abs/2508.11847" class="external text" rel="nofollow">arXiv:2508.11847</a>.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non-Transitivity in LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2502.14074" class="external text" rel="nofollow">arXiv:2502.14074</a>.
- Li, H. et al. (2024). *LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods*. <a href="https://arxiv.org/abs/2412.05579" class="external text" rel="nofollow">arXiv:2412.05579</a>.
- Zheng, L. et al. (2024). *LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset*. <a href="https://arxiv.org/abs/2309.11998" class="external text" rel="nofollow">arXiv:2309.11998</a>.
- Dubois, Y. et al. (2024). *Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators*. <a href="https://arxiv.org/abs/2404.04475" class="external text" rel="nofollow">arXiv:2404.04475</a>.
- Singh, S. et al. (2025). *The Leaderboard Illusion*. <a href="https://arxiv.org/abs/2504.20879" class="external text" rel="nofollow">arXiv:2504.20879</a>.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). *Improving Your Model Ranking on Chatbot Arena by Vote Rigging*. <a href="https://arxiv.org/abs/2501.17858" class="external text" rel="nofollow">arXiv:2501.17858</a>.

## Примечания

1.  <span id="cite_note-chiang2024-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/LMArena#cite_ref-chiang2024_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/LMArena#cite_ref-chiang2024_1-1)</sup> Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». *arXiv:2403.04132*, 2024.</span>
2.  <span id="cite_note-hello_2025-2">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-hello_2025_2-0) «Hello from LMArena: The Community Platform for Exploring Frontier AI». *LMArena Blog*, 23 июня 2025.</span>
3.  <span id="cite_note-new_site_2024-3">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-new_site_2024_3-0) «Announcing a New Site for Chatbot Arena». *LMSYS Blog*, 20 сентября 2024.</span>
4.  <span id="cite_note-seed_prn-4">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-seed_prn_4-0) «Arena Intelligence Raises \$100M Seed Round to Build the Standard for AI Evaluation». *PR Newswire / Arena Intelligence*, 21 мая 2025. <a href="https://www.prnewswire.com/news-releases/arena-intelligence-raises-100m-seed-round.html" class="external autonumber" rel="nofollow">[1]</a></span>
5.  <span id="cite_note-tc_seed-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/LMArena#cite_ref-tc_seed_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/LMArena#cite_ref-tc_seed_5-1)</sup> Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises \$100M seed at a \$600M valuation». *TechCrunch*, 21 мая 2025. <a href="https://techcrunch.com/2025/05/21/lmarena-chatbot-arena-spinoff-raises-100m-seed/" class="external autonumber" rel="nofollow">[2]</a></span>
6.  <span id="cite_note-series_a_2026-6">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-series_a_2026_6-0) «Arena Intelligence Closes \$150M Series A at \$1.7B Valuation». *Arena Intelligence Blog*, 6 января 2026. <a href="https://news.lmarena.ai/series-a-2026/" class="external autonumber" rel="nofollow">[3]</a></span>
7.  <span id="cite_note-arena_rebrand_2026-7">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-arena_rebrand_2026_7-0) «We Are Now Arena». *Arena Blog*, 28 января 2026. <a href="https://news.arena.ai/we-are-now-arena/" class="external autonumber" rel="nofollow">[4]</a></span>
8.  <span id="cite_note-new_beta_2025-8">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-new_beta_2025_8-0) «LMArena is Growing to Support our Community Platform». *LMArena Blog*, 17 апреля 2025.</span>
9.  <span id="cite_note-policy-9">↑ <sup>[9,0](https://systems-analysis.info/wiki/LMArena#cite_ref-policy_9-0)</sup> <sup>[9,1](https://systems-analysis.info/wiki/LMArena#cite_ref-policy_9-1)</sup> <sup>[9,2](https://systems-analysis.info/wiki/LMArena#cite_ref-policy_9-2)</sup> <sup>[9,3](https://systems-analysis.info/wiki/LMArena#cite_ref-policy_9-3)</sup> *LMArena Leaderboard Policy*. *LMArena Blog*, ред. 8 сентября 2025. <a href="https://news.lmarena.ai/policy/" class="external autonumber" rel="nofollow">[5]</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-10) lm‑sys/FastChat (GitHub). <a href="https://github.com/lm-sys/FastChat" class="external autonumber" rel="nofollow">[6]</a></span>
11. <span id="cite_note-opendata_2025-11">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-opendata_2025_11-0) «Releasing 140K Text Arena Conversations». *LMArena Blog*, 31 июля 2025. <a href="https://news.lmarena.ai/140k-text-arena-conversations/" class="external autonumber" rel="nofollow">[7]</a></span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-12) *FAQ*. *LMArena*. <a href="https://lmarena.ai/faq" class="external autonumber" rel="nofollow">[8]</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-13) Главная страница *LMArena* (дисклеймер о возможной публикации данных и передачи провайдерам). <a href="https://lmarena.ai/" class="external autonumber" rel="nofollow">[9]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-14) Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». *arXiv:2306.05685*, 2023. <a href="https://arxiv.org/abs/2306.05685" class="external autonumber" rel="nofollow">[10]</a></span>
15. <span id="cite_note-arena_hard-15">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-arena_hard_15-0) Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». *arXiv:2406.11939*, 2024. <a href="https://arxiv.org/abs/2406.11939" class="external autonumber" rel="nofollow">[11]</a></span>
16. <span id="cite_note-sentiment_control-16">↑ <sup>[16,0](https://systems-analysis.info/wiki/LMArena#cite_ref-sentiment_control_16-0)</sup> <sup>[16,1](https://systems-analysis.info/wiki/LMArena#cite_ref-sentiment_control_16-1)</sup> «Style and Sentiment Control in the Arena». *LMArena Blog*, 2025. <a href="https://news.lmarena.ai/style-sentiment-control/" class="external autonumber" rel="nofollow">[12]</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-17) Li, T. et al. «From Crowdsourced Data…» *arXiv:2406.11939* (таблицы согласованности). <a href="https://arxiv.org/abs/2406.11939" class="external autonumber" rel="nofollow">[13]</a></span>
18. <span id="cite_note-text_stats-18">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-text_stats_18-0) *Text Arena (English)*. *LMArena*. <a href="https://lmarena.ai/leaderboard/text/english" class="external autonumber" rel="nofollow">[14]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-19) *Vision Arena*. *LMArena*, обновлено 2 сентября 2025. <a href="https://lmarena.ai/leaderboard/vision" class="external autonumber" rel="nofollow">[15]</a></span>
20. <span id="cite_note-tti_page-20">↑ <sup>[20,0](https://systems-analysis.info/wiki/LMArena#cite_ref-tti_page_20-0)</sup> <sup>[20,1](https://systems-analysis.info/wiki/LMArena#cite_ref-tti_page_20-1)</sup> *Text-to-Image Leaderboard*. *LMArena*. <a href="https://lmarena.ai/leaderboard/text-to-image" class="external autonumber" rel="nofollow">[16]</a></span>
21. <span id="cite_note-nanobanana_blog-21">↑ <sup>[21,0](https://systems-analysis.info/wiki/LMArena#cite_ref-nanobanana_blog_21-0)</sup> <sup>[21,1](https://systems-analysis.info/wiki/LMArena#cite_ref-nanobanana_blog_21-1)</sup> «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». *LMArena Blog*, август 2025. <a href="https://news.lmarena.ai/nano-banana-reveal/" class="external autonumber" rel="nofollow">[17]</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-22) *Text‑to‑Video* и *Image‑to‑Video Leaderboards*. *LMArena*, август 2025. <a href="https://lmarena.ai/leaderboard/text-to-video" class="external autonumber" rel="nofollow">[18]</a> <a href="https://lmarena.ai/leaderboard/image-to-video" class="external autonumber" rel="nofollow">[19]</a></span>
23. <span id="cite_note-webdev_arena-23">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-webdev_arena_23-0) «Introducing WebDev Arena». *LMArena Blog*, 2025. <a href="https://news.lmarena.ai/webdev-arena/" class="external autonumber" rel="nofollow">[20]</a></span>
24. <span id="cite_note-repochat_arena-24">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-repochat_arena_24-0) «Introducing RepoChat Arena». *LMArena Blog*, 2025. <a href="https://news.lmarena.ai/repochat-arena/" class="external autonumber" rel="nofollow">[21]</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-25) «Introducing the Search Arena». *LMArena Blog*, 14 апреля 2025. <a href="https://news.lmarena.ai/search-arena/" class="external autonumber" rel="nofollow">[22]</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-26) «Search Arena & What We're Learning About Human Preference». *LMArena Blog*, 23 июля 2025. <a href="https://news.lmarena.ai/search-arena-update/" class="external autonumber" rel="nofollow">[23]</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-27) Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». *arXiv:2506.05334*, 2025. <a href="https://arxiv.org/abs/2506.05334" class="external autonumber" rel="nofollow">[24]</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-28) «Introducing BiomedArena.AI». *LMArena Blog*, 19 августа 2025. <a href="https://news.lmarena.ai/introducing-biomedarena/" class="external autonumber" rel="nofollow">[25]</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-29) Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). <a href="https://blog.google/technology/developers/gemma-3/" class="external autonumber" rel="nofollow">[26]</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-30) Spangher, L. et al. «Chatbot Arena Estimate…». *NAACL Industry*, 2025. <a href="https://aclanthology.org/2025.naacl-industry.77.pdf" class="external autonumber" rel="nofollow">[27]</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-31) «Meta's experimental Llama 4 model briefly topped AI leaderboard…». *The Register*, 7 апреля 2025. <a href="https://www.theregister.com/2025/04/07/meta_llama_arena/" class="external autonumber" rel="nofollow">[28]</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-32) Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). <a href="https://x.com/lmarena_ai/status/1776881220809552182" class="external autonumber" rel="nofollow">[29]</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-33) «Search Arena & What We're Learning…». *LMArena Blog*, 23 июля 2025. <a href="https://news.lmarena.ai/search-arena-update/" class="external autonumber" rel="nofollow">[30]</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-34) Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». *arXiv:2501.17858*, 2025. <a href="https://arxiv.org/abs/2501.17858" class="external autonumber" rel="nofollow">[31]</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-35) Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». *arXiv:2501.07493*, 2025. <a href="https://arxiv.org/abs/2501.07493" class="external autonumber" rel="nofollow">[32]</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-36) «Hundreds of rigged votes can skew…». *Fast Company*, 6 февраля 2025. <a href="https://www.fastcompany.com/91273226/rigged-votes-ai-model-rankings-chatbot-arena" class="external autonumber" rel="nofollow">[33]</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-37) Singh, S. et al. «The Leaderboard Illusion». *arXiv:2504.20879*, 2025. <a href="https://arxiv.org/abs/2504.20879" class="external autonumber" rel="nofollow">[34]</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-38) «Our Response to 'The Leaderboard Illusion'». *LMArena Blog*, 9 мая 2025. <a href="https://news.lmarena.ai/our-response/" class="external autonumber" rel="nofollow">[35]</a></span>
39. <span id="cite_note-changelog-39">[↑](https://systems-analysis.info/wiki/LMArena#cite_ref-changelog_39-0) «Methodology Changelog». *LMArena Blog*. <a href="https://news.lmarena.ai/changelog/" class="external autonumber" rel="nofollow">[36]</a></span>
