ELO-ranggo ng mga modelo

From Systems analysis Wiki
Jump to navigation Jump to search

ELO-ranggo ng mga modelo ng wika — ito ay isang paraan ng pagsusuri at paghahambing ng malalaking modelo ng wika (LLM), batay sa inangkop na sistema ng mga rating ng Elo, na orihinal na binuo para sa chess. Ang pamamaraang ito ay gumagamit ng pairwise na paghahambing ng mga modelo batay sa mga kagustuhan ng tao upang lumikha ng isang pinag-isang ranggo na sumasalamin sa relatibong pagganap ng mga modelo[1].

Sa kaibahan sa mga tradisyonal na benchmark na sumusukat ng mga ganap na tagapagpakita sa mga partikular na gawain, ang mga sistema ng ELO ay tinutukoy ang mga relatibong kakayahan ng mga modelo batay sa direktang paghahambing ng kanilang mga sagot ng mga tagasuri ng tao. Ang pangunahing prinsipyo ay ang mga gumagamit ay naghahambing ng mga sagot ng dalawang anonymous na modelo sa iisang kahilingan at pinipili ang pinakamahusay na pagpipilian. Batay sa mga kagustuhang ito, kinakalkula ang rating ng bawat modelo, kung saan ang mas mataas na rating ay nagpapahiwatig ng kahusayan sa mga pagsusuri ng tao[2].

Kasaysayan ng pag-unlad

Pinagmulan ng sistema ng ELO

Ang sistema ng mga rating ng ELO ay binuo ng Hungaryano-Amerikanong pisiko na si Arpad Elo (Arpad Emrick Elo, 1903–1992) noong dekada 1960 para sa pagsusuri ng kahusayan ng mga manlalaro ng chess. Si Elo, isang propesor ng pisika, ay lumikha ng sistema bilang isang pagpapabuti ng umiiral na sistema ng Harkness, na may malalaking kakulangan sa katumpakan ng mga pagsusuri[3].

  • 1960: Opisyal na tinanggap ng Chess Federation ng USA (USCF) ang sistema ng Elo.
  • 1970: Nagsimulang gumamit ang World Chess Federation (FIDE) ng sistema[4].

Pag-angkop para sa mga modelo ng wika

Ang paggamit ng ELO para sa pagsusuri ng LLM ay nagsimula sa paglulunsad ng platform na LMSYS Chatbot Arena noong Mayo 3, 2023. Ang platform ay nilikha ng organisasyong LMSYS (Large Model Systems Organization) — isang kolaborasyon ng mga mananaliksik mula sa UC Berkeley SkyLab, UC San Diego at Carnegie Mellon University[5].

Pamamaraan

Mga matematikang pundasyon

Klasikong pormula ng ELO

Ang klasikong pormula ng ELO para sa pagkalkula ng inaasahang posibilidad ng tagumpay ng modelo A laban sa modelo B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` kung saan ang `R_A` at `R_B` — ang mga kasalukuyang rating ng mga modelo.

Ang pag-update ng rating pagkatapos ng paghahambing ay nangyayari ayon sa pormula: `R'_A = R_A + K × (S_A - E_A)` kung saan ang `K` — ay ang koepisiyon ng pag-unlad (K-factor), ang `S_A` — ang aktwal na resulta (1 para sa tagumpay, 0.5 para sa draw, 0 para sa pagkatalo), at ang `E_A` — ang inaasahang resulta[4].

Modelo ng Bradley-Terry

Ang mga modernong platform, kabilang ang LMSYS Chatbot Arena, ay lumipat sa modelo ng Bradley-Terry, na kumakatawan sa isang mas makatistika na makatwirang pamamaraan. Ang posibilidad ng kagustuhan ng modelo `i` kaysa sa modelo `j` ay kinakalkula bilang:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` kung saan ang `β_i` at `β_j` — ang mga koepisiyon (mga rating) ng mga modelo, tinatantiya ng paraan ng maximum likelihood[2]. Ang pamamaraang ito ay mas matatag at nagpapakita ng mas mahusay na pagsasabay sa mga kagustuhan ng tao[6].

Proseso ng pagsusuri sa Chatbot Arena

  1. Anonymous na paghahambing: Ang mga gumagamit ay nakikipag-ugnayan sa dalawang anonymous na modelo nang sabay-sabay.
  2. Pagboto: Pagkatapos matanggap ang mga sagot, pipili ang mga gumagamit ng mas gustong pagpipilian.
  3. Pagbubunyag ng pagkakakilanlan: Ang mga pangalan ng modelo ay ipinapakita lamang pagkatapos ng pagboto.
  4. Pag-update ng rating: Ang mga rating ay ina-update batay sa mga resulta ng pagboto, karaniwang sa pamamagitan ng batch processing para sa mas mataas na katatagan[2].

Mga kalamangan at kahinaan

Mga kalamangan

  • Kasimplihan at kalinawan: Ang sistema ay madaling maunawaan at ipatupad.
  • Kakayahang mapalawak: Nagbibigay-daan sa pagsusuri ng malaking bilang ng mga modelo nang hindi kinakailangan ang buong pairwise na paghahambing.
  • Pagsasabay sa mga kagustuhan ng tao: Ang rating ay direktang sumasalamin sa mga tunay na kagustuhan ng mga gumagamit, at hindi sa mga abstract na sukatan.

Mga kahinaan at limitasyon

  • Mga isyu sa katatagan: Ang mga indibidwal na kalkulasyon ng ELO ay maaaring magpakita ng makabuluhang pagbabago.
  • Mga paglabag sa transitividad: Hindi palagi ang sistema na natutugunan ang kondisyon na A>B at B>C → A>C, na isang pangunahing limitasyon.
  • Pag-asa sa laki ng sample: Para sa pagkuha ng mga matatag na rating, kailangan ang malaking sample (daan-daan at libo-libong paghahambing)[6].
  • Mga kinikilingan sa pagsusuri: Ang mga resulta ay maaaring lumihis dahil sa kagustuhan ng mga gumagamit para sa mas mahabang o stilistikong naformatang mga sagot, pati na rin dahil sa mga kultural na pagkakaiba ng mga tagasuri.

Kongklusyon

Ang ELO-ranggo ay kumakatawan sa isang mahalagang kasangkapan sa ecosystem ng pagsusuri ng mga modelo ng wika, na nagbibigay ng isang madaling maunawaan na paraan ng paghahambing ng mga ito batay sa mga kagustuhan ng tao. Sa kabila ng tagumpay ng mga platform tulad ng LMSYS Chatbot Arena, ang pamamaraan ay may mga pangunahing limitasyon, kabilang ang mga isyu sa transitividad at katatagan. Ang paglipat mula sa klasikong ELO patungo sa modelo ng Bradley-Terry ay isang mahalagang pagpapabuti, ngunit ang kinabukasan ng pagsusuri ng LLM ay malamang na matatagpuan sa pagsasama ng maraming pamamaraan upang makakuha ng mas kumpletong larawan ng mga kakayahan ng mga modelo.

Mga sanggunian

  • Opisyal na website ng LMSYS Chatbot Arena
  • Leaderboard ng LMSYS Chatbot Arena

Panitikan

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.


Mga tala

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [1]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
  3. «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]