LMArena (Chatbot Arena) (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

Arena (έως τις 28 Ιανουαρίου 2026 γνωστή ως LMArena (Large Model Arena), προηγουμένως — Chatbot Arena) — ανοιχτή crowdsourcing διαδικτυακή πλατφόρμα για την αξιολόγηση και τη συγκριτική κατάταξη μεγάλων γλωσσικών μοντέλων (LLM) και πολυτροπικών μοντέλων (κείμενο, εικόνα, βίντεο) βάσει πραγματικών ανθρώπινων προτιμήσεων. Τη βάση της πλατφόρμας αποτελούν ανώνυμες συγκρίσεις ζευγών (blind battles) μοντέλων και το σύστημα βαθμολόγησης Elo· βάσει αυτών δημοσιεύονται διαφανείς δημόσιες κατατάξεις (leaderboards), που θεωρούνται ένα από τα πλέον έγκυρα ανεξάρτητα benchmarks για τα frontier μοντέλα τεχνητής νοημοσύνης.[1][2]

Η πλατφόρμα δημιουργήθηκε το 2023 ως ακαδημαϊκό ερευνητικό έργο της οργάνωσης LMSYS Org (Large Model Systems Organization) στο Πανεπιστήμιο της Καλιφόρνιας στο Μπέρκλεϊ (Sky Computing Lab). Τον Σεπτέμβριο του 2024 το έργο «αποφοίτησε» σε αυτόνομο domain lmarena.ai («Graduation»)[3]. Τον Απρίλιο του 2025 ιδρύθηκε η ανεξάρτητη εταιρεία Arena Intelligence Inc., ενώ στις 21 Μαΐου 2025 αντλήθηκε γύρος seed ύψους $100 εκατ. (αποτίμηση $600 εκατ., κύριοι επενδυτές — a16z και UC Investments)[4][5]. Στις 6 Ιανουαρίου 2026 η εταιρεία ολοκλήρωσε γύρο Series A ύψους $150 εκατ. με post-money αποτίμηση $1,7 δισ.[6]. Στις 28 Ιανουαρίου 2026 πραγματοποιήθηκε η τελική αλλαγή ονόματος — η πλατφόρμα μετονομάστηκε σε Arena και μεταφέρθηκε στο domain arena.ai[7][8].

Ιστορία

Η πλατφόρμα κυκλοφόρησε τον Απρίλιο του 2023 με το όνομα Chatbot Arena ως ερευνητικό έργο της οργάνωσης LMSYS Org (Large Model Systems Organization) στο Πανεπιστήμιο της Καλιφόρνιας στο Μπέρκλεϊ (Sky Computing Lab). Υπήρξε ένα από τα πρώτα εργαλεία crowdsourcing αξιολόγησης μεγάλων γλωσσικών μοντέλων μέσω ανώνυμων συγκρίσεων ζευγών (blind battles) και συστήματος βαθμολόγησης Elo βάσει πραγματικών προτιμήσεων χρηστών.

  • 24 Απριλίου 2023 — τεχνική κυκλοφορία του Chatbot Arena.
  • 3 Μαΐου 2023 — επίσημη δημόσια κυκλοφορία και δημοσίευση του πρώτου leaderboard.
  • 2023 — κυκλοφορία των πρώτων ανοιχτών dataset: 33 χιλ. διαλόγων ζευγών (Ιούλιος) και LMSYS‑Chat‑1M (Σεπτέμβριος, περίπου 1 εκατ. πραγματικοί διάλογοι).
  • 1 Μαρτίου 2024 — δημοσίευση επίσημης πολιτικής πλατφόρμας, επισημοποίηση της αποστολής ως ανοιχτού community-driven συστήματος αξιολόγησης.
  • 27 Ιουνίου 2024 — προσθήκη υποστήριξης εικόνων και έναρξη επέκτασης σε πολυτροπικές εργασίες.
  • 20 Σεπτεμβρίου 2024 — «Graduation»: μετάβαση σε αυτόνομο domain lmarena.ai.
  • Τέλη 2024 — άνοιξη 2025 — κυκλοφορία εξειδικευμένων αρένων (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control κ.ά.).
  • 17 Απριλίου 2025 — επίσημη σύσταση ως ανεξάρτητης εταιρείας Arena Intelligence Inc., κυκλοφορία beta της ανανεωμένης πλατφόρμας υπό την επωνυμία LMArena.
  • 21 Μαΐου 2025 — ανακοίνωση ίδρυσης της εταιρείας και άντληση γύρου seed ύψους $100 εκατ. (αποτίμηση — $600 εκατ.).
  • 31 Ιουλίου 2025 — δημοσίευση ανοιχτού dataset αποτελούμενου από 140 χιλ. πρόσφατων διαλόγων του Text Arena.
  • 6 Ιανουαρίου 2026 — άντληση γύρου Series A ύψους $150 εκατ. με post-money αποτίμηση $1,7 δισ..
  • Ιανουάριος 2026 — κυκλοφορία του Video Arena (πλήρης υποστήριξη video-τροπικότητας).
  • 28 Ιανουαρίου 2026 — τελική αλλαγή ονόματος: η πλατφόρμα μετονομάστηκε σε Arena και μεταφέρθηκε στο domain arena.ai.

Έως τον Μάρτιο του 2026 το Arena (arena.ai) εξυπηρετεί πάνω από 5 εκατ. μηνιαίους ενεργούς χρήστες από 150+ χώρες, έχει συγκεντρώσει δεκάδες εκατομμύρια ψήφους και παραμένει ένα από τα πλέον έγκυρα ανεξάρτητα εργαλεία αξιολόγησης frontier μοντέλων ΤΝ βάσει πραγματικών ανθρώπινων προτιμήσεων.

Πώς λειτουργεί η αξιολόγηση

Ο χρήστης εισάγει ένα ερώτημα και λαμβάνει δύο απαντήσεις από τυχαία επιλεγμένα ανώνυμα μοντέλα («A» και «B»), μετά από τα οποία ψηφίζει για την καλύτερη απάντηση (ή καταγράφει ισοπαλία/αποτυχία). Η κατάταξη βασίζεται στο στατιστικό μοντέλο Bradley–Terry (λογιστική παλινδρόμηση επί ζευγαρωτών προτιμήσεων), εννοιολογικά παρόμοιο με το Elo[1]. Η πλατφόρμα δημοσιεύει το Arena Score και τα διαστήματα εμπιστοσύνης, ενώ εφαρμόζει διορθώσεις δείγματος (re‑weighting) για τη διατήρηση της αμεροληψίας κατά την ανομοιόμορφη δειγματοληψία[9].

Διαφάνεια και ανοιχτότητα. Τα pipelines αξιολόγησης και κατάταξης είναι ανοιχτά στο αποθετήριο FastChat[10]· περιοδικά δημοσιεύονται μέρη των ακατέργαστων δεδομένων για επαλήθευση και έρευνα (π.χ., κυκλοφορία 140K διαλόγων τον Ιούλιο του 2025)[9][11]. Σύμφωνα με το FAQ και τις προειδοποιήσεις στην κεντρική σελίδα, τα ερωτήματα χρηστών ενδέχεται να αποκαλυφθούν σε παρόχους μοντέλων και να δημοσιευθούν εν μέρει για ερευνητικούς σκοπούς — δεν πρέπει να αποστέλλονται ευαίσθητα δεδομένα[12][13].

Κανόνες επιλογής και δειγματοληψίας. Στα leaderboards συμπεριλαμβάνονται μοντέλα γενικής πρόσβασης (ανοιχτά βάρη/δημόσιο API/δημόσια υπηρεσία). Για τη σταθεροποίηση της αξιολόγησης απαιτούνται συνήθως ≥1000 ψήφοι· τουλάχιστον 20% των battles — αποκλειστικά μεταξύ δημόσιων μοντέλων· η πιθανότητα δειγματοληψίας αυξάνεται με τη βαθμολογία και την αβεβαιότητα, ενώ η παλινδρόμηση με αναβάθμιση βαρών διασφαλίζει την αμεροληψία των τελικών εκτιμήσεων[9].

Αυτόματες μετρικές και έλεγχος στυλ. Για την επιτάχυνση της αξιολόγησης και τη μείωση των επιδράσεων «στυλιστικών» προτιμήσεων χρησιμοποιούνται βοηθητικές μεθοδολογίες: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (αυτόματη δημιουργία σύνθετων ερωτήσεων)[15], καθώς και Style/Sentiment Control (μοντελοποίηση και «εξάλειψη» της επίδρασης τόνου/συναισθήματος στις προτιμήσεις)[16]. Για το Arena‑Hard‑Auto αναφέρθηκε πολύ υψηλή συμφωνία με «ζωντανές» ανθρώπινες ψήφους (έως ≈98,6% υπό ελεγχόμενες συνθήκες)[17].

Αρένες και τομείς αξιολόγησης

Η πλατφόρμα έχει εξελιχθεί σε ένα σύνολο «αρένων» ανά τύπο εργασιών:

  • Text Arena — γενικοί διάλογοι/εργασίες, κύριος πίνακας κατάταξης[18].
  • Vision Arena — πολυτροπικά μοντέλα «κείμενο→εικόνα/βίντεο/ανάλυση εικόνων»[19].
  • Text‑to‑Image και Image Edit — δημιουργία και επεξεργασία εικόνων (συμπεριλαμβανομένης της υπόθεσης nano‑banana)[20][21].
  • Text‑/Image‑to‑Video — δημιουργία βίντεο[22].
  • WebDev Arena — κατασκευή διαδικτυακών εφαρμογών από περιγραφές[23].
  • RepoChat Arena — εργασίες ΤΝ-μηχανικής με κώδικα/αποθετήρια[24].
  • Search Arena — μοντέλα με σύνδεση σε διαδικτυακή αναζήτηση· αρχικά κυκλοφόρησε τον Απρίλιο του 2025 (legacy), στη συνέχεια ενσωματώθηκε στον κύριο ιστότοπο, συνοδεύεται από dataset και δημοσίευση[25][26][27].
  • BiomedArena.AI — τομεακή αξιολόγηση για βιοϊατρικές εργασίες (συνεργασία με DataTecnica)[28].

Εφαρμογή και επίδραση

  • Βιτρίνα κλάδου. Οι μεγαλύτεροι κατασκευαστές (OpenAI, Anthropic, Google κ.ά.) δοκιμάζουν και παρουσιάζουν τακτικά μοντέλα στο LMArena· τα μέσα του κλάδου περιγράφουν την πλατφόρμα ως σημαντικό σημείο αναφοράς[5][29]. Σε δημοσίευση του κλάδου στο NAACL‑2025 η βαθμολογία Elo του Chatbot Arena χαρακτηρίζεται «gold industry‑standard»[30].
  • Δοκιμή πριν την κυκλοφορία. Η πολιτική επιτρέπει ανώνυμες προεπισκοπήσεις «μη κυκλοφορημένων» μοντέλων με ειδοποίηση της κοινότητας και δημοσίευση δημόσιων βαθμολογιών μετά την κυκλοφορία· ελάχιστο ≈1000 ψήφοι για σταθεροποίηση[9].
  • Αξιοσημείωτα επεισόδια. Την άνοιξη του 2025 συζητήθηκε το ανώνυμο μοντέλο Llama‑4 Maverick‑03‑26‑Experimental (επεισόδιο σχετικό με τη σύγκριση μεταξύ πειραματικών και δημόσιων εκδόσεων), το οποίο προσέλκυσε ευρεία προσοχή του τύπου και οδήγησε σε ενημέρωση κανόνων και επικοινωνιών[31][32]. Τον Αύγουστο του 2025 το «nano‑banana» αποκαλύφθηκε ως Gemini 2.5 Flash Image και κατέλαβε κορυφαίες θέσεις στις οπτικές αρένες[21][20].

Περιορισμοί και κριτική

Παρά την κλίμακα και τη δημοτικότητά της, η προσέγγιση έχει περιορισμούς:

  • Υποκειμενικότητα και στυλιστικές επιδράσεις. Οι προτιμήσεις ψήφου εξαρτώνται από τον τόνο/τρόπο της απάντησης· η ομάδα εισάγει Style/Sentiment Control για την αποσύζευξη «στυλ» και «περιεχομένου»[16].
  • Μη αντιπροσωπευτικότητα κοινού. Ο πυρήνας των ενεργών χρηστών αποτελείται από τεχνο-ενθουσιαστές/προγραμματιστές· για τομεακά σενάρια δημιουργούνται εξειδικευμένες αρένες (Search, WebDev, Biomed κ.ά.)[33].
  • Ευπάθεια σε χειραγώγηση και μεροληψίες. Έρευνες του 2025 δείχνουν ότι, ελλείψει αυστηρών προστασιών, είναι δυνατές στρατηγικές «φουσκώματος» με εκατοντάδες έως χιλιάδες ψήφους· η συνεργασία ερευνητών με το LMArena οδήγησε στην εφαρμογή μέτρων προστασίας (CAPTCHA/σύνδεση/προστασία bots/ανίχνευση ανωμαλιών) και στην αύξηση του «κόστους επίθεσης»[34][35][36].
  • Μεθοδολογική κριτική. Η εργασία The Leaderboard Illusion (Απρίλιος 2025) επισημαίνει συστηματικούς και θεσμικούς παράγοντες που ενδέχεται να στρεβλώνουν το ανταγωνιστικό πεδίο· το LMArena δημοσίευσε εκτενή απάντηση και διατηρεί δημόσιο changelog της μεθοδολογίας[37][38][39].

Σύνδεσμοι

  • Επίσημος ιστότοπος LMArena
  • Ιστολόγιο/πολιτικές και ενημερώσεις LMArena
  • Ιστότοπος της ερευνητικής ομάδας LMSYS (αρχικός φορέας ανάπτυξης του έργου)

Βιβλιογραφία

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

Παραπομπές

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
  4. «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
  5. 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
  6. «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
  7. «We Are Now Arena». Arena Blog, 28 января 2026. [4]
  8. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
  9. 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
  10. lm‑sys/FastChat (GitHub). [6]
  11. «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
  12. FAQ. LMArena. [8]
  13. Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
  14. Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
  15. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
  16. 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
  17. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
  18. Text Arena (English). LMArena. [14]
  19. Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
  20. 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
  21. 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
  22. Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
  23. «Introducing WebDev Arena». LMArena Blog, 2025. [20]
  24. «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
  25. «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
  26. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
  27. Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
  28. «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
  29. Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
  30. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
  31. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
  32. Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
  33. «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
  34. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
  35. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
  36. «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
  37. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
  38. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
  39. «Methodology Changelog». LMArena Blog. [36]