---
title: "LMArena (Chatbot Arena) (PT)"
source: "https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)"
wiki: "systems-analysis.info/int"
article: "LMArena_(Chatbot_Arena)_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 3711
wiki_created_at: 2026-09-06T23:24:50Z
wiki_modified_at: 2026-09-06T23:24:50Z
downloaded_at: 2026-09-07T22:58:29Z
---

# LMArena (Chatbot Arena) (PT)

**Arena** (até 28 de janeiro de 2026, **LMArena** (*Large Model Arena*); anteriormente, **Chatbot Arena**) é uma plataforma web aberta de avaliação colaborativa (*crowdsourcing*) e comparação de **grandes modelos de linguagem** (LLM) e modelos multimodais (texto, imagem, vídeo) baseada em preferências humanas reais. Seu núcleo são as comparações anônimas pareadas (*blind battles*) de modelos e o sistema de pontuação Elo; a partir delas, publicam-se tabelas de classificação públicas e transparentes, consideradas uma das referências independentes mais reconhecidas para os modelos de IA de fronteira (*frontier*).<sup>[\[1\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-chiang2024-1)[\[2\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-hello_2025-2)</sup>

A plataforma surgiu em 2023 como um projeto acadêmico de pesquisa da organização **LMSYS Org** (Large Model Systems Organization) da Universidade da Califórnia em Berkeley (Sky Computing Lab). Em setembro de 2024, o projeto «graduou-se» para um domínio próprio, lmarena.ai («Graduation»)<sup>[\[3\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-new_site_2024-3)</sup>. Em abril de 2025, foi constituída a empresa independente **Arena Intelligence Inc.**, e em 21 de maio de 2025 a plataforma fechou uma rodada seed de **100 milhões de dólares** (avaliação de 600 milhões; principais investidores: a16z e UC Investments)<sup>[\[4\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-seed_prn-4)[\[5\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-tc_seed-5)</sup>. Em 6 de janeiro de 2026, a empresa fechou uma rodada Série A de **150 milhões de dólares** com uma avaliação pós-investimento de **1,7 bilhão**, liderada por Felicis e UC Investments<sup>[\[6\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-series_a_2026-6)[\[7\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-tc_seriesa-7)</sup>. Em 28 de janeiro de 2026, ocorreu a mudança de marca definitiva: a plataforma passou a se chamar **Arena** e migrou para o domínio <a href="https://arena.ai/" class="external text" rel="nofollow">arena.ai</a><sup>[\[8\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-arena_rebrand_2026-8)[\[9\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-new_beta_2025-9)</sup>.

## História

A plataforma foi lançada em abril de 2023 com o nome de **Chatbot Arena**, como projeto de pesquisa da organização LMSYS Org (Large Model Systems Organization) na Universidade da Califórnia em Berkeley (Sky Computing Lab). Foi uma das primeiras ferramentas de avaliação colaborativa de grandes modelos de linguagem por meio de comparações anônimas pareadas (*blind battles*) e do sistema de pontuação Elo a partir das preferências reais dos usuários.

- **24 de abril de 2023** — lançamento técnico do Chatbot Arena.
- **3 de maio de 2023** — lançamento público oficial e publicação da primeira tabela de classificação.
- **2023** — publicação dos primeiros conjuntos de dados abertos: 33 mil diálogos pareados (julho) e **LMSYS-Chat-1M** (setembro, cerca de 1 milhão de diálogos reais).
- **1.º de março de 2024** — publicação da política oficial da plataforma e formalização de sua missão como sistema de avaliação aberto e orientado pela comunidade.
- **27 de junho de 2024** — incorporação do suporte a imagens e início da expansão para tarefas multimodais.
- **20 de setembro de 2024** — «Graduation»: migração para o domínio independente **lmarena.ai**.
- **Final de 2024 – início de 2025** — lançamento de arenas especializadas (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control etc.).
- **17 de abril de 2025** — constituição oficial como empresa independente **Arena Intelligence Inc.** e lançamento da versão beta da plataforma renovada sob a marca LMArena.
- **21 de maio de 2025** — anúncio da constituição da empresa e fechamento da rodada seed de **100 milhões de dólares** (avaliação: 600 milhões).
- **31 de julho de 2025** — publicação de um conjunto de dados aberto com **140 mil** diálogos recentes da Text Arena.
- **18 de dezembro de 2025** — publicação do **Arena-Rank**, o pacote de código aberto que implementa a metodologia de classificação.
- **6 de janeiro de 2026** — fechamento da rodada Série A de **150 milhões de dólares** com uma avaliação pós-investimento de **1,7 bilhão**.
- **Janeiro de 2026** — lançamento da **Video Arena** (suporte completo à modalidade de vídeo).
- **28 de janeiro de 2026** — mudança de marca definitiva: a plataforma passou a se chamar **Arena** e migrou para o domínio **arena.ai**.

Em março de 2026, a Arena (arena.ai) atende a mais de 5 milhões de usuários ativos mensais de mais de 150 países, acumulou dezenas de milhões de votos e continua sendo uma das ferramentas independentes mais reconhecidas para avaliar modelos de IA de fronteira segundo as preferências humanas reais.

## Como funciona a avaliação

O usuário insere uma consulta (*prompt*) e recebe duas respostas de modelos anônimos selecionados aleatoriamente («A» e «B»), após o que vota na melhor resposta (ou registra um empate ou que nenhuma é satisfatória). A classificação baseia-se no modelo estatístico de **Bradley-Terry** (uma regressão logística sobre preferências pareadas), conceitualmente próximo ao sistema Elo<sup>[\[1\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-chiang2024-1)</sup>. A plataforma publica o **Arena Score** e os intervalos de confiança e aplica correções de amostragem (*re-weighting*) para manter a imparcialidade diante de uma amostragem não uniforme<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-policy-10)</sup>.

**Transparência e abertura.** Os pipelines de avaliação e classificação são de código aberto: a infraestrutura original está no repositório **FastChat**<sup>[\[11\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-11)</sup>, e, em dezembro de 2025, a metodologia das tabelas foi publicada como um pacote Python independente, o **Arena-Rank** —que hoje alimenta todas as classificações do site e é cerca de 30 vezes mais rápido que a versão baseada no FastChat—<sup>[\[12\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-arena_rank-12)</sup>. Além disso, periodicamente são publicados trechos dos dados brutos para verificação e pesquisa (por exemplo, a publicação de 140 mil conversas em julho de 2025)<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-policy-10)[\[13\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-opendata_2025-13)</sup>. Segundo o *FAQ* e os avisos na página principal, as consultas dos usuários podem ser compartilhadas com os provedores dos modelos e publicadas parcialmente para fins de pesquisa, de modo que não se devem enviar dados sensíveis<sup>[\[14\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-14)[\[15\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-15)</sup>.

**Regras de seleção e amostragem.** Nas tabelas de classificação, incluem-se modelos de acesso público (pesos abertos, API pública ou serviço público). Para estabilizar a pontuação, normalmente são necessários ≥**1000** votos; ao menos **20%** das batalhas ocorrem apenas entre modelos públicos; a probabilidade de amostragem aumenta com a pontuação e a incerteza, e a regressão com reponderação garante a imparcialidade das pontuações finais<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-policy-10)</sup>.

**Métricas automáticas e controle de estilo.** Para acelerar a avaliação e reduzir os efeitos das preferências de «estilo», empregam-se metodologias auxiliares: *MT-Bench* (LLM-as-a-judge)<sup>[\[16\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-16)</sup>, *Arena-Hard* (geração automática de perguntas difíceis)<sup>[\[17\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-arena_hard-17)</sup> e **Style/Sentiment Control** (modelagem e correção do efeito do tom/emoção sobre as preferências)<sup>[\[18\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-sentiment_control-18)</sup>. Para o *Arena-Hard-Auto*, foi relatada uma concordância muito alta com os votos humanos em tempo real (de até aproximadamente **98,6%** em condições controladas)<sup>[\[19\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-19)</sup>.

## Arenas e domínios de avaliação

A plataforma evoluiu até se tornar um conjunto de «arenas» conforme o tipo de tarefa:

- **Text Arena** — conversas e tarefas gerais; é a tabela principal<sup>[\[20\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-text_stats-20)</sup>.
- **Vision Arena** — modelos multimodais «texto→imagem/vídeo/análise de imagens»<sup>[\[21\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-21)</sup>.
- **Text-to-Image** e **Image Edit** — geração e edição de imagens (incluindo o caso do *nano-banana*)<sup>[\[22\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-tti_page-22)[\[23\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-nanobanana_blog-23)</sup>.
- **Text-/Image-to-Video** — geração de vídeo<sup>[\[24\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-24)</sup>.
- **WebDev Arena** — construção de aplicações web a partir de descrições<sup>[\[25\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-webdev_arena-25)</sup>.
- **RepoChat Arena** — tarefas de engenharia de IA sobre código e repositórios<sup>[\[26\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-repochat_arena-26)</sup>.
- **Search Arena** — modelos com conexão a busca na web; lançada inicialmente em abril de 2025 (legacy), depois migrada para o site principal, acompanhada de um conjunto de dados e uma publicação<sup>[\[27\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-27)[\[28\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-28)[\[29\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-29)</sup>.
- **BiomedArena.AI** — avaliação específica de domínio para tarefas biomédicas (em parceria com a DataTecnica)<sup>[\[30\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-30)</sup>.

## Aplicação e impacto

- **Vitrine para a indústria.** Os principais provedores (OpenAI, Anthropic, Google etc.) testam e apresentam regularmente seus modelos na plataforma; a mídia do setor a descreve como uma referência importante<sup>[\[5\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-tc_seed-5)[\[31\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-31)</sup>. Em uma publicação do setor na NAACL-2025, a pontuação Elo do Chatbot Arena é descrita como o «**gold industry-standard**»<sup>[\[32\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-32)</sup>.
- **Testes de pré-lançamento.** A política permite prévias anônimas de modelos «não lançados», com notificação à comunidade e posterior publicação das avaliações públicas após o lançamento; exige-se um mínimo de ≈1000 votos para a estabilização<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-policy-10)</sup>.
- **Episódios notáveis.** Em abril de 2025, discutiu-se o modelo anônimo *Llama-4 Maverick-03-26-Experimental* (um incidente relacionado à sua comparação com as versões públicas), o que atraiu ampla atenção da imprensa e motivou atualizações nas regras e na comunicação<sup>[\[33\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-33)[\[34\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-34)</sup>. Em agosto de 2025, o «nano-banana» foi revelado como **Gemini 2.5 Flash Image** e ocupou as primeiras posições nas arenas visuais<sup>[\[23\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-nanobanana_blog-23)[\[22\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-tti_page-22)</sup>.

## Limitações e críticas

Apesar de sua escala e popularidade, a abordagem tem limitações:

- **Subjetividade e efeitos de estilo.** As preferências na votação dependem do tom e da forma da resposta; a equipe está implementando o **Style/Sentiment Control** para desacoplar o «estilo» do «conteúdo»<sup>[\[18\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-sentiment_control-18)</sup>.
- **Falta de representatividade do público.** O núcleo ativo é formado por entusiastas de tecnologia e desenvolvedores; para os cenários de domínio específico, criam-se arenas especializadas (Search, WebDev, Biomed etc.)<sup>[\[35\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-35)</sup>.
- **Vulnerabilidade à manipulação e a vieses.** Pesquisas de 2025 demonstram que, sem defesas rigorosas, são possíveis estratégias de manipulação de votos (*vote rigging*) com centenas ou milhares de votos; no entanto, a colaboração entre pesquisadores e a LMArena levou à implementação de medidas de proteção (CAPTCHA, login, proteção contra bots, detecção de anomalias) e ao aumento do «custo do ataque»<sup>[\[36\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-36)[\[37\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-37)[\[38\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-38)</sup>.
- **Críticas metodológicas.** O trabalho *The Leaderboard Illusion* (abril de 2025) aponta fatores sistemáticos e institucionais capazes de distorcer o campo competitivo; a LMArena publicou uma resposta detalhada e mantém um *changelog* público de sua metodologia<sup>[\[39\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-39)[\[40\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-40)[\[41\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_note-changelog-41)</sup>.

## Ligações externas

- <a href="https://arena.ai/" class="external text" rel="nofollow">Site oficial da Arena (anteriormente LMArena)</a>
- <a href="https://arena.ai/blog/" class="external text" rel="nofollow">Blog, políticas e atualizações da Arena</a>
- <a href="https://lmsys.org/" class="external text" rel="nofollow">Site do grupo de pesquisa LMSYS (incubadora original do projeto)</a>

## Bibliografia

- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Zheng, L. et al. (2023). *Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena*. <a href="https://arxiv.org/abs/2306.05685" class="external text" rel="nofollow">arXiv:2306.05685</a>.
- Li, T. et al. (2024). *From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline*. <a href="https://arxiv.org/abs/2406.11939" class="external text" rel="nofollow">arXiv:2406.11939</a>.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). *A Statistical Framework for Ranking LLM-Based Chatbots*. <a href="https://arxiv.org/abs/2412.18407" class="external text" rel="nofollow">arXiv:2412.18407</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings*. <a href="https://arxiv.org/abs/2508.11847" class="external text" rel="nofollow">arXiv:2508.11847</a>.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non-Transitivity in LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2502.14074" class="external text" rel="nofollow">arXiv:2502.14074</a>.
- Li, H. et al. (2024). *LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods*. <a href="https://arxiv.org/abs/2412.05579" class="external text" rel="nofollow">arXiv:2412.05579</a>.
- Zheng, L. et al. (2024). *LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset*. <a href="https://arxiv.org/abs/2309.11998" class="external text" rel="nofollow">arXiv:2309.11998</a>.
- Dubois, Y. et al. (2024). *Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators*. <a href="https://arxiv.org/abs/2404.04475" class="external text" rel="nofollow">arXiv:2404.04475</a>.
- Singh, S. et al. (2025). *The Leaderboard Illusion*. <a href="https://arxiv.org/abs/2504.20879" class="external text" rel="nofollow">arXiv:2504.20879</a>.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). *Improving Your Model Ranking on Chatbot Arena by Vote Rigging*. <a href="https://arxiv.org/abs/2501.17858" class="external text" rel="nofollow">arXiv:2501.17858</a>.

## Notas

1.  <span id="cite_note-chiang2024-1">↑ <sup>[1.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-chiang2024_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-chiang2024_1-1)</sup> Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». *arXiv:2403.04132*, 2024. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv</a></span>
2.  <span id="cite_note-hello_2025-2">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-hello_2025_2-0) «Hello from LMArena: The Community Platform for Exploring Frontier AI». *LMArena Blog*, 23 de junho de 2025. <a href="https://news.lmarena.ai/hello-from-lmarena/" class="external autonumber" rel="nofollow">[1]</a></span>
3.  <span id="cite_note-new_site_2024-3">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-new_site_2024_3-0) «Announcing a New Site for Chatbot Arena». *LMSYS Blog*, 20 de setembro de 2024. <a href="https://lmsys.org/blog/2024-09-20-arena-new-site/" class="external autonumber" rel="nofollow">[2]</a></span>
4.  <span id="cite_note-seed_prn-4">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-seed_prn_4-0) «LMArena Secures \$100M in Seed Funding to Bring Scientific Rigor to AI Reliability». *PR Newswire*, 21 de maio de 2025. <a href="https://www.prnewswire.com/news-releases/lmarena-secures-100m-in-seed-funding-to-bring-scientific-rigor-to-ai-reliability-302462025.html" class="external autonumber" rel="nofollow">[3]</a></span>
5.  <span id="cite_note-tc_seed-5">↑ <sup>[5.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-tc_seed_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-tc_seed_5-1)</sup> Wiggers, K. «LM Arena, the organization behind popular AI leaderboards, lands \$100M». *TechCrunch*, 21 de maio de 2025. <a href="https://techcrunch.com/2025/05/21/lm-arena-the-organization-behind-popular-ai-leaderboards-lands-100m/" class="external autonumber" rel="nofollow">[4]</a></span>
6.  <span id="cite_note-series_a_2026-6">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-series_a_2026_6-0) «LMArena Raises \$150 Million to Build the World's Most Trusted AI Evaluation Platform». *PR Newswire*, 6 de janeiro de 2026. <a href="https://www.prnewswire.com/news-releases/lmarena-raises-150-million-to-build-the-worlds-most-trusted-ai-evaluation-platform-302653012.html" class="external autonumber" rel="nofollow">[5]</a></span>
7.  <span id="cite_note-tc_seriesa-7">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-tc_seriesa_7-0) «LMArena lands \$1.7B valuation four months after launching its product». *TechCrunch*, 6 de janeiro de 2026. <a href="https://techcrunch.com/2026/01/06/lmarena-lands-1-7b-valuation-four-months-after-launching-its-product/" class="external autonumber" rel="nofollow">[6]</a></span>
8.  <span id="cite_note-arena_rebrand_2026-8">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-arena_rebrand_2026_8-0) «LMArena is now Arena». *Arena Blog*, 28 de janeiro de 2026. <a href="https://arena.ai/blog/lmarena-is-now-arena/" class="external autonumber" rel="nofollow">[7]</a></span>
9.  <span id="cite_note-new_beta_2025-9">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-new_beta_2025_9-0) «LMArena is Growing to Support our Community Platform». *LMArena Blog*, 17 de abril de 2025.</span>
10. <span id="cite_note-policy-10">↑ <sup>[10.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-policy_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-policy_10-1)</sup> <sup>[10.2](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-policy_10-2)</sup> <sup>[10.3](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-policy_10-3)</sup> *Arena Leaderboard Policy*. *Arena Blog*, última atualização: 30 de abril de 2026. <a href="https://arena.ai/blog/policy/" class="external autonumber" rel="nofollow">[8]</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-11) lm-sys/FastChat (GitHub). <a href="https://github.com/lm-sys/FastChat" class="external autonumber" rel="nofollow">[9]</a></span>
12. <span id="cite_note-arena_rank-12">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-arena_rank_12-0) «Arena-Rank: Open Sourcing the Leaderboard Methodology». *Arena Blog*, 18 de dezembro de 2025. <a href="https://arena.ai/blog/arena-rank/" class="external autonumber" rel="nofollow">[10]</a>. Repositório: <a href="https://github.com/lmarena/arena-rank" class="external text" rel="nofollow">lmarena/arena-rank</a>.</span>
13. <span id="cite_note-opendata_2025-13">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-opendata_2025_13-0) Y. Song. «A Deep Dive into Recent Arena Data». *LMArena Blog*, 31 de julho de 2025. <a href="https://news.lmarena.ai/opendata-july2025/" class="external autonumber" rel="nofollow">[11]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-14) *FAQ*. *Arena*. <a href="https://arena.ai/faq" class="external autonumber" rel="nofollow">[12]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-15) Página principal da *Arena* (aviso sobre a possível publicação de dados e sua transferência aos provedores). <a href="https://arena.ai/" class="external autonumber" rel="nofollow">[13]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-16) Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv:2306.05685*, 2023. <a href="https://arxiv.org/abs/2306.05685" class="external autonumber" rel="nofollow">[14]</a></span>
17. <span id="cite_note-arena_hard-17">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-arena_hard_17-0) Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». *arXiv:2406.11939*, 2024. <a href="https://arxiv.org/abs/2406.11939" class="external autonumber" rel="nofollow">[15]</a></span>
18. <span id="cite_note-sentiment_control-18">↑ <sup>[18.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-sentiment_control_18-0)</sup> <sup>[18.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-sentiment_control_18-1)</sup> «Does Sentiment Matter Too? Introducing Sentiment Control». *LMArena Blog*, 22 de abril de 2025. <a href="https://news.lmarena.ai/sentiment-control/" class="external autonumber" rel="nofollow">[16]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-19) Li, T. et al. «From Crowdsourced Data…» *arXiv:2406.11939* (tabelas de concordância). <a href="https://arxiv.org/abs/2406.11939" class="external autonumber" rel="nofollow">[17]</a></span>
20. <span id="cite_note-text_stats-20">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-text_stats_20-0) *Text Arena (English)*. *Arena*. <a href="https://arena.ai/leaderboard/text/english" class="external autonumber" rel="nofollow">[18]</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-21) *Vision Arena*. *Arena*. <a href="https://arena.ai/leaderboard/vision" class="external autonumber" rel="nofollow">[19]</a></span>
22. <span id="cite_note-tti_page-22">↑ <sup>[22.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-tti_page_22-0)</sup> <sup>[22.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-tti_page_22-1)</sup> *Text-to-Image Arena*. *Arena*. <a href="https://arena.ai/leaderboard/text-to-image" class="external autonumber" rel="nofollow">[20]</a></span>
23. <span id="cite_note-nanobanana_blog-23">↑ <sup>[23.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-nanobanana_blog_23-0)</sup> <sup>[23.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-nanobanana_blog_23-1)</sup> «Nano-Banana (Gemini 2.5 Flash Image): Try it on LMArena». *LMArena Blog*, 27 de agosto de 2025. <a href="https://news.lmarena.ai/nano-banana/" class="external autonumber" rel="nofollow">[21]</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-24) *Text-to-Video* e *Image-to-Video Leaderboards*. *Arena*. <a href="https://arena.ai/leaderboard/text-to-video" class="external autonumber" rel="nofollow">[22]</a> <a href="https://arena.ai/leaderboard/image-to-video" class="external autonumber" rel="nofollow">[23]</a></span>
25. <span id="cite_note-webdev_arena-25">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-webdev_arena_25-0) «WebDev Arena: A Live LLM Leaderboard for Web App Development». *LMArena Blog*, 10 de março de 2025. <a href="https://lmarena.github.io/blog/2025/webdev-arena/" class="external autonumber" rel="nofollow">[24]</a></span>
26. <span id="cite_note-repochat_arena-26">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-repochat_arena_26-0) «RepoChat Arena: A Live Benchmark for AI Software Engineers». *LMArena Blog*, 9 de abril de 2025. <a href="https://lmarena.github.io/blog/2025/repochat-arena/" class="external autonumber" rel="nofollow">[25]</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-27) «Introducing the Search Arena». *LMArena Blog*, 14 de abril de 2025. <a href="https://news.lmarena.ai/search-arena/" class="external autonumber" rel="nofollow">[26]</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-28) «Search Arena & What We're Learning About Human Preference». *LMArena Blog*, 23 de julho de 2025. <a href="https://news.lmarena.ai/search-arena-update/" class="external autonumber" rel="nofollow">[27]</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-29) Frick, E. et al. «Search Arena: Analyzing Search-Augmented LLMs». *arXiv:2506.05334*, 2025. <a href="https://arxiv.org/abs/2506.05334" class="external autonumber" rel="nofollow">[28]</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-30) «Introducing BiomedArena.AI». *LMArena Blog*, 19 de agosto de 2025. <a href="https://news.lmarena.ai/introducing-biomedarena/" class="external autonumber" rel="nofollow">[29]</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-31) Google. «Gemma 3…», 12 de março de 2025 (link para os resultados da LMArena). <a href="https://blog.google/technology/developers/gemma-3/" class="external autonumber" rel="nofollow">[30]</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-32) Spangher, L. et al. «Chatbot Arena Estimate…». *NAACL Industry*, 2025. <a href="https://aclanthology.org/2025.naacl-industry.77.pdf" class="external autonumber" rel="nofollow">[31]</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-33) «Meta's experimental Llama 4 model briefly topped AI leaderboard…». *The Register*, 7 de abril de 2025. <a href="https://www.theregister.com/2025/04/07/meta_llama_arena/" class="external autonumber" rel="nofollow">[32]</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-34) Esclarecimentos e publicações oficiais da LMArena no X sobre o incidente (abril de 2025). <a href="https://x.com/lmarena_ai/status/1776881220809552182" class="external autonumber" rel="nofollow">[33]</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-35) «Search Arena & What We're Learning…». *LMArena Blog*, 23 de julho de 2025. <a href="https://news.lmarena.ai/search-arena-update/" class="external autonumber" rel="nofollow">[34]</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-36) Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». *arXiv:2501.17858*, 2025. <a href="https://arxiv.org/abs/2501.17858" class="external autonumber" rel="nofollow">[35]</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-37) Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards». *arXiv:2501.07493*, 2025. <a href="https://arxiv.org/abs/2501.07493" class="external autonumber" rel="nofollow">[36]</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-38) «Hundreds of rigged votes can skew…». *Fast Company*, 6 de fevereiro de 2025. <a href="https://www.fastcompany.com/91273226/rigged-votes-ai-model-rankings-chatbot-arena" class="external autonumber" rel="nofollow">[37]</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-39) Singh, S. et al. «The Leaderboard Illusion». *arXiv:2504.20879*, 2025. <a href="https://arxiv.org/abs/2504.20879" class="external autonumber" rel="nofollow">[38]</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-40) «Our Response to 'The Leaderboard Illusion'». *LMArena Blog*, 9 de maio de 2025. <a href="https://news.lmarena.ai/our-response/" class="external autonumber" rel="nofollow">[39]</a></span>
41. <span id="cite_note-changelog-41">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(PT)#cite_ref-changelog_41-0) *Leaderboard Changelog*. *Arena Blog*. <a href="https://arena.ai/blog/leaderboard-changelog/" class="external autonumber" rel="nofollow">[40]</a></span>
