LMArena (Chatbot Arena) (TH)
Arena (ก่อนวันที่ 28 มกราคม 2026 รู้จักในชื่อ LMArena (Large Model Arena) และก่อนหน้านั้นคือ Chatbot Arena) — เว็บแพลตฟอร์มแบบ crowdsourcing แบบเปิดสำหรับการประเมินและจัดอันดับเปรียบเทียบ Large Language Model (LLM) และโมเดลมัลติโมดัล (ข้อความ รูปภาพ วิดีโอ) โดยอิงจากความพึงพอใจของมนุษย์จริง รากฐานของแพลตฟอร์มคือการเปรียบเทียบแบบคู่ที่ไม่เปิดเผยตัวตน (blind battles) ของโมเดลต่าง ๆ และระบบคะแนน Elo ซึ่งเป็นพื้นฐานของลีดเดอร์บอร์ดสาธารณะที่โปร่งใส อันถือเป็นหนึ่งใน benchmark อิสระที่น่าเชื่อถือที่สุดสำหรับ frontier model ของปัญญาประดิษฐ์[1][2]
แพลตฟอร์มนี้เกิดขึ้นในปี 2023 ในฐานะโครงการวิจัยเชิงวิชาการขององค์กร LMSYS Org (Large Model Systems Organization) ที่มหาวิทยาลัยแคลิฟอร์เนีย เบิร์กลีย์ (Sky Computing Lab) ในเดือนกันยายน 2024 โครงการ "สำเร็จการศึกษา" ออกไปยังโดเมนอิสระ lmarena.ai ("Graduation")[3] ในเดือนเมษายน 2025 มีการจัดตั้งบริษัทอิสระ Arena Intelligence Inc. และในวันที่ 21 พฤษภาคม 2025 ได้ระดมทุน seed round จำนวน 100 ล้านดอลลาร์สหรัฐ (มูลค่า 600 ล้านดอลลาร์สหรัฐ โดยมีนักลงทุนหลักคือ a16z และ UC Investments)[4][5] วันที่ 6 มกราคม 2026 บริษัทปิด Series A round มูลค่า 150 ล้านดอลลาร์สหรัฐ โดยมีมูลค่าหลังการลงทุน 1.7 พันล้านดอลลาร์สหรัฐ[6] วันที่ 28 มกราคม 2026 มีการรีแบรนด์ขั้นสุดท้าย — แพลตฟอร์มเปลี่ยนชื่อเป็น Arena และย้ายไปยังโดเมน arena.ai[7][8]
ประวัติ
แพลตฟอร์มเปิดตัวในเดือนเมษายน 2023 ภายใต้ชื่อ Chatbot Arena ในฐานะโครงการวิจัยขององค์กร LMSYS Org (Large Model Systems Organization) ที่มหาวิทยาลัยแคลิฟอร์เนีย เบิร์กลีย์ (Sky Computing Lab) โดยเป็นหนึ่งในเครื่องมือแรก ๆ สำหรับการประเมิน LLM แบบ crowdsourcing ผ่านการเปรียบเทียบแบบคู่ที่ไม่เปิดเผยตัวตน (blind battles) และระบบคะแนน Elo บนพื้นฐานความพึงพอใจจริงของผู้ใช้
- 24 เมษายน 2023 — เปิดตัวทางเทคนิคของ Chatbot Arena
- 3 พฤษภาคม 2023 — เปิดตัวสาธารณะอย่างเป็นทางการและเผยแพร่ลีดเดอร์บอร์ดชุดแรก
- 2023 — เผยแพร่ dataset เปิดชุดแรก: บทสนทนาคู่ 33,000 รายการ (กรกฎาคม) และ LMSYS‑Chat‑1M (กันยายน ประมาณ 1 ล้านบทสนทนาจริง)
- 1 มีนาคม 2024 — เผยแพร่นโยบายอย่างเป็นทางการของแพลตฟอร์ม กำหนดภารกิจเป็นระบบการประเมินแบบเปิดที่ขับเคลื่อนโดยชุมชน (community-driven)
- 27 มิถุนายน 2024 — เพิ่มการรองรับรูปภาพและเริ่มขยายไปสู่งานมัลติโมดัล
- 20 กันยายน 2024 — "Graduation": ย้ายไปยังโดเมนอิสระ lmarena.ai
- ปลายปี 2024 — ต้นปี 2025 — เปิดตัวอารีนาเฉพาะทาง (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control ฯลฯ)
- 17 เมษายน 2025 — จดทะเบียนบริษัทอย่างเป็นทางการในฐานะบริษัทอิสระ Arena Intelligence Inc. เปิดตัวเวอร์ชันเบต้าของแพลตฟอร์มที่ปรับปรุงใหม่ภายใต้แบรนด์ LMArena
- 21 พฤษภาคม 2025 — ประกาศก่อตั้งบริษัทและระดมทุน seed round 100 ล้านดอลลาร์สหรัฐ (มูลค่า 600 ล้านดอลลาร์สหรัฐ)
- 31 กรกฎาคม 2025 — เผยแพร่ dataset เปิดจำนวน 140,000 บทสนทนาล่าสุดจาก Text Arena
- 6 มกราคม 2026 — ระดมทุน Series A จำนวน 150 ล้านดอลลาร์สหรัฐ โดยมีมูลค่าหลังการลงทุน 1.7 พันล้านดอลลาร์สหรัฐ
- มกราคม 2026 — เปิดตัว Video Arena (รองรับโหมดวิดีโอเต็มรูปแบบ)
- 28 มกราคม 2026 — รีแบรนด์ขั้นสุดท้าย: แพลตฟอร์มเปลี่ยนชื่อเป็น Arena และย้ายไปยังโดเมน arena.ai
ภายในเดือนมีนาคม 2026 Arena (arena.ai) ให้บริการผู้ใช้งานที่ใช้งานรายเดือนมากกว่า 5 ล้านคนจากกว่า 150 ประเทศ สะสมคะแนนโหวตหลายสิบล้านครั้ง และยังคงเป็นหนึ่งในเครื่องมือประเมิน frontier model ของ AI ที่น่าเชื่อถือที่สุดโดยอิงจากความพึงพอใจของมนุษย์จริง
วิธีการประเมิน
ผู้ใช้ป้อนคำถามและรับคำตอบสองชุดจากโมเดลที่เลือกมาแบบสุ่มและไม่เปิดเผยตัวตน ("A" และ "B") จากนั้นลงคะแนนให้คำตอบที่ดีกว่า (หรือระบุว่าเสมอกัน/ไม่พอใจทั้งคู่) การจัดอันดับอิงจากแบบจำลองทางสถิติ Bradley–Terry (การถดถอยโลจิสติกบนความพึงพอใจแบบคู่) ซึ่งใกล้เคียงกับ Elo โดยสัญชาตญาณ[1] แพลตฟอร์มเผยแพร่ Arena Score และช่วงความเชื่อมั่น พร้อมทั้งใช้การปรับน้ำหนักของตัวอย่าง (re‑weighting) เพื่อรักษาความไม่เอนเอียงในกรณีที่การสุ่มตัวอย่างไม่สม่ำเสมอ[9]
ความโปร่งใสและการเปิดเผย. pipeline การประเมินและการจัดอันดับต้นฉบับเปิดเผยในที่เก็บโค้ด FastChat[10] โดยมีการเผยแพร่ข้อมูลดิบบางส่วนเป็นระยะเพื่อการตรวจสอบและวิจัย (เช่น การเผยแพร่บทสนทนา 140K รายการในเดือนกรกฎาคม 2025)[9][11] ตาม FAQ และคำเตือนบนหน้าหลัก คำถามของผู้ใช้อาจถูกเปิดเผยต่อผู้ให้บริการโมเดลและเผยแพร่บางส่วนเพื่อวัตถุประสงค์ด้านการวิจัย — ไม่ควรส่งข้อมูลที่ละเอียดอ่อน[12][13]
กฎการคัดเลือกและการสุ่มตัวอย่าง. โมเดลที่รวมอยู่ในลีดเดอร์บอร์ดต้องเป็นโมเดลที่เปิดให้เข้าถึงสาธารณะ (น้ำหนักแบบเปิด/API สาธารณะ/บริการสาธารณะ) เพื่อการทำให้คะแนนมีเสถียรภาพโดยทั่วไปต้องการคะแนนโหวต ≥1,000 ครั้ง โดยไม่น้อยกว่า 20% ของการต่อสู้ต้องอยู่ระหว่างโมเดลสาธารณะเท่านั้น ความน่าจะเป็นของการสุ่มตัวอย่างเพิ่มขึ้นตามคะแนนและความไม่แน่นอน และการถดถอยพร้อมการปรับน้ำหนักใหม่รับประกันความไม่เอนเอียงของคะแนนสุดท้าย[9]
เมตริกอัตโนมัติและการควบคุมสไตล์. เพื่อเร่งการประเมินและลดผลของความพึงพอใจด้าน "สไตล์" จึงมีการใช้วิธีเสริม ได้แก่ MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (การสร้างคำถามที่ซับซ้อนอัตโนมัติ)[15] และ Style/Sentiment Control (การสร้างแบบจำลองและ "แก้ไข" ผลของน้ำเสียง/อารมณ์ต่อความพึงพอใจ)[16] สำหรับ Arena‑Hard‑Auto มีการรายงานความสอดคล้องสูงมากกับคะแนนโหวตของมนุษย์จริง (สูงถึง ≈98.6% ในสภาวะควบคุม)[17]
อารีนาและโดเมนการประเมิน
แพลตฟอร์มพัฒนาเป็นชุด "อารีนา" แยกตามประเภทงาน:
- Text Arena — บทสนทนา/งานทั่วไป ตารางหลัก[18]
- Vision Arena — โมเดลมัลติโมดัล "ข้อความ→รูปภาพ/วิดีโอ/การวิเคราะห์รูปภาพ"[19]
- Text‑to‑Image และ Image Edit — การสร้างและแก้ไขรูปภาพ (รวมถึงกรณี nano‑banana)[20][21]
- Text‑/Image‑to‑Video — การสร้างวิดีโอ[22]
- WebDev Arena — การสร้างเว็บแอปพลิเคชันจากคำอธิบาย[23]
- RepoChat Arena — งานวิศวกรรม AI ด้านโค้ด/ที่เก็บโค้ด[24]
- Search Arena — โมเดลที่เชื่อมต่อกับการค้นหาเว็บ โดยเปิดตัวครั้งแรกในเดือนเมษายน 2025 (legacy) จากนั้นนำมาไว้บนเว็บไซต์หลัก พร้อมมี dataset และสิ่งพิมพ์ประกอบ[25][26][27]
- BiomedArena.AI — การประเมินเฉพาะโดเมนสำหรับงานชีวการแพทย์ (ความร่วมมือกับ DataTecnica)[28]
การนำไปใช้และผลกระทบ
- การแสดงผลในอุตสาหกรรม. ผู้จำหน่ายรายใหญ่ (OpenAI, Anthropic, Google ฯลฯ) ทดสอบและนำเสนอโมเดลบน LMArena เป็นประจำ สื่ออุตสาหกรรมอธิบายแพลตฟอร์มนี้ว่าเป็นเกณฑ์มาตรฐานที่สำคัญ[5][29] ในสิ่งพิมพ์อุตสาหกรรม NAACL‑2025 คะแนน Elo ของ Chatbot Arena ถูกเรียกว่า "gold industry‑standard"[30]
- การทดสอบก่อนเปิดตัว. นโยบายอนุญาตให้มีการดูตัวอย่างโมเดลที่ "ยังไม่เปิดตัว" แบบไม่ระบุตัวตน พร้อมแจ้งชุมชนและเผยแพร่คะแนนสาธารณะหลังจากเปิดตัว โดยต้องมีโหวตอย่างน้อย ≈1,000 ครั้งเพื่อให้คะแนนมีเสถียรภาพ[9]
- เหตุการณ์ที่น่าสนใจ. ในฤดูใบไม้ผลิปี 2025 มีการถกเถียงเกี่ยวกับโมเดลที่ไม่ระบุตัวตน Llama‑4 Maverick‑03‑26‑Experimental (เหตุการณ์เกี่ยวกับการเปรียบเทียบกับเวอร์ชันสาธารณะ) ซึ่งดึงดูดความสนใจจากสื่ออย่างกว้างขวางและกระตุ้นให้มีการปรับปรุงกฎและการสื่อสาร[31][32] ในเดือนสิงหาคม 2025 "nano‑banana" เปิดเผยตัวว่าเป็น Gemini 2.5 Flash Image และขึ้นสู่อันดับต้น ๆ ในอารีนาภาพ[21][20]
ข้อจำกัดและคำวิจารณ์
แม้จะมีขนาดและความนิยม แต่แนวทางนี้ก็มีข้อจำกัด:
- ความเป็นอัตวิสัยและผลของสไตล์. ความพึงพอใจในการโหวตขึ้นอยู่กับน้ำเสียงและลักษณะของคำตอบ ทีมงานได้นำ Style/Sentiment Control มาใช้เพื่อแยก "สไตล์" ออกจาก "เนื้อหา"[16]
- ผู้ชมที่ไม่เป็นตัวแทน. ผู้ใช้หลักคือนักเทคโนโลยีที่กระตือรือร้น/นักพัฒนา สำหรับสถานการณ์เฉพาะโดเมนจึงมีการสร้างอารีนาเฉพาะทาง (Search, WebDev, Biomed ฯลฯ)[33]
- ความเสี่ยงต่อการบิดเบือนและอคติ. งานวิจัยปี 2025 แสดงให้เห็นว่าหากไม่มีการป้องกันที่เข้มงวด กลยุทธ์ "การโกงโหวต" ด้วยโหวตหลายร้อยถึงหลายพันครั้งเป็นไปได้ โดยความร่วมมือระหว่างนักวิจัยกับ LMArena นำไปสู่การนำมาตรการป้องกันมาใช้ (CAPTCHA/การเข้าสู่ระบบ/การป้องกันบอต/การตรวจจับความผิดปกติ) และเพิ่ม "ต้นทุนการโจมตี"[34][35][36]
- คำวิจารณ์ด้านระเบียบวิธี. งาน The Leaderboard Illusion (เมษายน 2025) ชี้ให้เห็นปัจจัยเชิงระบบและเชิงสถาบันที่อาจบิดเบือนสนามการแข่งขัน LMArena ได้เผยแพร่คำตอบอย่างละเอียดและดูแล changelog ของระเบียบวิธีแบบสาธารณะ[37][38][39]
ลิงก์
- เว็บไซต์ทางการของ LMArena
- บล็อก/นโยบายและการอัปเดตของ LMArena
- เว็บไซต์กลุ่มวิจัย LMSYS (ผู้บ่มเพาะโครงการดั้งเดิม)
บรรณานุกรม
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
หมายเหตุ
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]