LMArena (Chatbot Arena) (PT)

From Systems analysis Wiki
Jump to navigation Jump to search

Arena (até 28 de janeiro de 2026, LMArena (Large Model Arena); anteriormente, Chatbot Arena) é uma plataforma web aberta de avaliação colaborativa (crowdsourcing) e comparação de grandes modelos de linguagem (LLM) e modelos multimodais (texto, imagem, vídeo) baseada em preferências humanas reais. Seu núcleo são as comparações anônimas pareadas (blind battles) de modelos e o sistema de pontuação Elo; a partir delas, publicam-se tabelas de classificação públicas e transparentes, consideradas uma das referências independentes mais reconhecidas para os modelos de IA de fronteira (frontier).[1][2]

A plataforma surgiu em 2023 como um projeto acadêmico de pesquisa da organização LMSYS Org (Large Model Systems Organization) da Universidade da Califórnia em Berkeley (Sky Computing Lab). Em setembro de 2024, o projeto «graduou-se» para um domínio próprio, lmarena.ai («Graduation»)[3]. Em abril de 2025, foi constituída a empresa independente Arena Intelligence Inc., e em 21 de maio de 2025 a plataforma fechou uma rodada seed de 100 milhões de dólares (avaliação de 600 milhões; principais investidores: a16z e UC Investments)[4][5]. Em 6 de janeiro de 2026, a empresa fechou uma rodada Série A de 150 milhões de dólares com uma avaliação pós-investimento de 1,7 bilhão, liderada por Felicis e UC Investments[6][7]. Em 28 de janeiro de 2026, ocorreu a mudança de marca definitiva: a plataforma passou a se chamar Arena e migrou para o domínio arena.ai[8][9].

História

A plataforma foi lançada em abril de 2023 com o nome de Chatbot Arena, como projeto de pesquisa da organização LMSYS Org (Large Model Systems Organization) na Universidade da Califórnia em Berkeley (Sky Computing Lab). Foi uma das primeiras ferramentas de avaliação colaborativa de grandes modelos de linguagem por meio de comparações anônimas pareadas (blind battles) e do sistema de pontuação Elo a partir das preferências reais dos usuários.

  • 24 de abril de 2023 — lançamento técnico do Chatbot Arena.
  • 3 de maio de 2023 — lançamento público oficial e publicação da primeira tabela de classificação.
  • 2023 — publicação dos primeiros conjuntos de dados abertos: 33 mil diálogos pareados (julho) e LMSYS-Chat-1M (setembro, cerca de 1 milhão de diálogos reais).
  • 1.º de março de 2024 — publicação da política oficial da plataforma e formalização de sua missão como sistema de avaliação aberto e orientado pela comunidade.
  • 27 de junho de 2024 — incorporação do suporte a imagens e início da expansão para tarefas multimodais.
  • 20 de setembro de 2024 — «Graduation»: migração para o domínio independente lmarena.ai.
  • Final de 2024 – início de 2025 — lançamento de arenas especializadas (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control etc.).
  • 17 de abril de 2025 — constituição oficial como empresa independente Arena Intelligence Inc. e lançamento da versão beta da plataforma renovada sob a marca LMArena.
  • 21 de maio de 2025 — anúncio da constituição da empresa e fechamento da rodada seed de 100 milhões de dólares (avaliação: 600 milhões).
  • 31 de julho de 2025 — publicação de um conjunto de dados aberto com 140 mil diálogos recentes da Text Arena.
  • 18 de dezembro de 2025 — publicação do Arena-Rank, o pacote de código aberto que implementa a metodologia de classificação.
  • 6 de janeiro de 2026 — fechamento da rodada Série A de 150 milhões de dólares com uma avaliação pós-investimento de 1,7 bilhão.
  • Janeiro de 2026 — lançamento da Video Arena (suporte completo à modalidade de vídeo).
  • 28 de janeiro de 2026 — mudança de marca definitiva: a plataforma passou a se chamar Arena e migrou para o domínio arena.ai.

Em março de 2026, a Arena (arena.ai) atende a mais de 5 milhões de usuários ativos mensais de mais de 150 países, acumulou dezenas de milhões de votos e continua sendo uma das ferramentas independentes mais reconhecidas para avaliar modelos de IA de fronteira segundo as preferências humanas reais.

Como funciona a avaliação

O usuário insere uma consulta (prompt) e recebe duas respostas de modelos anônimos selecionados aleatoriamente («A» e «B»), após o que vota na melhor resposta (ou registra um empate ou que nenhuma é satisfatória). A classificação baseia-se no modelo estatístico de Bradley-Terry (uma regressão logística sobre preferências pareadas), conceitualmente próximo ao sistema Elo[1]. A plataforma publica o Arena Score e os intervalos de confiança e aplica correções de amostragem (re-weighting) para manter a imparcialidade diante de uma amostragem não uniforme[10].

Transparência e abertura. Os pipelines de avaliação e classificação são de código aberto: a infraestrutura original está no repositório FastChat[11], e, em dezembro de 2025, a metodologia das tabelas foi publicada como um pacote Python independente, o Arena-Rank —que hoje alimenta todas as classificações do site e é cerca de 30 vezes mais rápido que a versão baseada no FastChat—[12]. Além disso, periodicamente são publicados trechos dos dados brutos para verificação e pesquisa (por exemplo, a publicação de 140 mil conversas em julho de 2025)[10][13]. Segundo o FAQ e os avisos na página principal, as consultas dos usuários podem ser compartilhadas com os provedores dos modelos e publicadas parcialmente para fins de pesquisa, de modo que não se devem enviar dados sensíveis[14][15].

Regras de seleção e amostragem. Nas tabelas de classificação, incluem-se modelos de acesso público (pesos abertos, API pública ou serviço público). Para estabilizar a pontuação, normalmente são necessários ≥1000 votos; ao menos 20% das batalhas ocorrem apenas entre modelos públicos; a probabilidade de amostragem aumenta com a pontuação e a incerteza, e a regressão com reponderação garante a imparcialidade das pontuações finais[10].

Métricas automáticas e controle de estilo. Para acelerar a avaliação e reduzir os efeitos das preferências de «estilo», empregam-se metodologias auxiliares: MT-Bench (LLM-as-a-judge)[16], Arena-Hard (geração automática de perguntas difíceis)[17] e Style/Sentiment Control (modelagem e correção do efeito do tom/emoção sobre as preferências)[18]. Para o Arena-Hard-Auto, foi relatada uma concordância muito alta com os votos humanos em tempo real (de até aproximadamente 98,6% em condições controladas)[19].

Arenas e domínios de avaliação

A plataforma evoluiu até se tornar um conjunto de «arenas» conforme o tipo de tarefa:

  • Text Arena — conversas e tarefas gerais; é a tabela principal[20].
  • Vision Arena — modelos multimodais «texto→imagem/vídeo/análise de imagens»[21].
  • Text-to-Image e Image Edit — geração e edição de imagens (incluindo o caso do nano-banana)[22][23].
  • Text-/Image-to-Video — geração de vídeo[24].
  • WebDev Arena — construção de aplicações web a partir de descrições[25].
  • RepoChat Arena — tarefas de engenharia de IA sobre código e repositórios[26].
  • Search Arena — modelos com conexão a busca na web; lançada inicialmente em abril de 2025 (legacy), depois migrada para o site principal, acompanhada de um conjunto de dados e uma publicação[27][28][29].
  • BiomedArena.AI — avaliação específica de domínio para tarefas biomédicas (em parceria com a DataTecnica)[30].

Aplicação e impacto

  • Vitrine para a indústria. Os principais provedores (OpenAI, Anthropic, Google etc.) testam e apresentam regularmente seus modelos na plataforma; a mídia do setor a descreve como uma referência importante[5][31]. Em uma publicação do setor na NAACL-2025, a pontuação Elo do Chatbot Arena é descrita como o «gold industry-standard»[32].
  • Testes de pré-lançamento. A política permite prévias anônimas de modelos «não lançados», com notificação à comunidade e posterior publicação das avaliações públicas após o lançamento; exige-se um mínimo de ≈1000 votos para a estabilização[10].
  • Episódios notáveis. Em abril de 2025, discutiu-se o modelo anônimo Llama-4 Maverick-03-26-Experimental (um incidente relacionado à sua comparação com as versões públicas), o que atraiu ampla atenção da imprensa e motivou atualizações nas regras e na comunicação[33][34]. Em agosto de 2025, o «nano-banana» foi revelado como Gemini 2.5 Flash Image e ocupou as primeiras posições nas arenas visuais[23][22].

Limitações e críticas

Apesar de sua escala e popularidade, a abordagem tem limitações:

  • Subjetividade e efeitos de estilo. As preferências na votação dependem do tom e da forma da resposta; a equipe está implementando o Style/Sentiment Control para desacoplar o «estilo» do «conteúdo»[18].
  • Falta de representatividade do público. O núcleo ativo é formado por entusiastas de tecnologia e desenvolvedores; para os cenários de domínio específico, criam-se arenas especializadas (Search, WebDev, Biomed etc.)[35].
  • Vulnerabilidade à manipulação e a vieses. Pesquisas de 2025 demonstram que, sem defesas rigorosas, são possíveis estratégias de manipulação de votos (vote rigging) com centenas ou milhares de votos; no entanto, a colaboração entre pesquisadores e a LMArena levou à implementação de medidas de proteção (CAPTCHA, login, proteção contra bots, detecção de anomalias) e ao aumento do «custo do ataque»[36][37][38].
  • Críticas metodológicas. O trabalho The Leaderboard Illusion (abril de 2025) aponta fatores sistemáticos e institucionais capazes de distorcer o campo competitivo; a LMArena publicou uma resposta detalhada e mantém um changelog público de sua metodologia[39][40][41].

Ligações externas

Bibliografia

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

Notas

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024. arXiv
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 de junho de 2025. [1]
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 de setembro de 2024. [2]
  4. «LMArena Secures $100M in Seed Funding to Bring Scientific Rigor to AI Reliability». PR Newswire, 21 de maio de 2025. [3]
  5. 5.0 5.1 Wiggers, K. «LM Arena, the organization behind popular AI leaderboards, lands $100M». TechCrunch, 21 de maio de 2025. [4]
  6. «LMArena Raises $150 Million to Build the World's Most Trusted AI Evaluation Platform». PR Newswire, 6 de janeiro de 2026. [5]
  7. «LMArena lands $1.7B valuation four months after launching its product». TechCrunch, 6 de janeiro de 2026. [6]
  8. «LMArena is now Arena». Arena Blog, 28 de janeiro de 2026. [7]
  9. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 de abril de 2025.
  10. 10.0 10.1 10.2 10.3 Arena Leaderboard Policy. Arena Blog, última atualização: 30 de abril de 2026. [8]
  11. lm-sys/FastChat (GitHub). [9]
  12. «Arena-Rank: Open Sourcing the Leaderboard Methodology». Arena Blog, 18 de dezembro de 2025. [10]. Repositório: lmarena/arena-rank.
  13. Y. Song. «A Deep Dive into Recent Arena Data». LMArena Blog, 31 de julho de 2025. [11]
  14. FAQ. Arena. [12]
  15. Página principal da Arena (aviso sobre a possível publicação de dados e sua transferência aos provedores). [13]
  16. Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv:2306.05685, 2023. [14]
  17. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [15]
  18. 18.0 18.1 «Does Sentiment Matter Too? Introducing Sentiment Control». LMArena Blog, 22 de abril de 2025. [16]
  19. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (tabelas de concordância). [17]
  20. Text Arena (English). Arena. [18]
  21. Vision Arena. Arena. [19]
  22. 22.0 22.1 Text-to-Image Arena. Arena. [20]
  23. 23.0 23.1 «Nano-Banana (Gemini 2.5 Flash Image): Try it on LMArena». LMArena Blog, 27 de agosto de 2025. [21]
  24. Text-to-Video e Image-to-Video Leaderboards. Arena. [22] [23]
  25. «WebDev Arena: A Live LLM Leaderboard for Web App Development». LMArena Blog, 10 de março de 2025. [24]
  26. «RepoChat Arena: A Live Benchmark for AI Software Engineers». LMArena Blog, 9 de abril de 2025. [25]
  27. «Introducing the Search Arena». LMArena Blog, 14 de abril de 2025. [26]
  28. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 de julho de 2025. [27]
  29. Frick, E. et al. «Search Arena: Analyzing Search-Augmented LLMs». arXiv:2506.05334, 2025. [28]
  30. «Introducing BiomedArena.AI». LMArena Blog, 19 de agosto de 2025. [29]
  31. Google. «Gemma 3…», 12 de março de 2025 (link para os resultados da LMArena). [30]
  32. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [31]
  33. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 de abril de 2025. [32]
  34. Esclarecimentos e publicações oficiais da LMArena no X sobre o incidente (abril de 2025). [33]
  35. «Search Arena & What We're Learning…». LMArena Blog, 23 de julho de 2025. [34]
  36. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [35]
  37. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards». arXiv:2501.07493, 2025. [36]
  38. «Hundreds of rigged votes can skew…». Fast Company, 6 de fevereiro de 2025. [37]
  39. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [38]
  40. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 de maio de 2025. [39]
  41. Leaderboard Changelog. Arena Blog. [40]