WinoGrande Benchmark (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — ito ay isang malakihang etalon na dataset na dinisenyo upang suriin ang kakayahan ng mga sistema ng artificial intelligence sa pangangatuwiran batay sa common sense. Naglalaman ito ng humigit-kumulang 44,000 gawain batay sa format ng Winograd Schema Challenge (WSC), ngunit makabuluhang pinalawak at ginawang mas kumplikado sa pamamagitan ng "adversarial" na paraan ng pagsasala upang alisin ang mga istatistikal na pahiwatig[1].

Ang dataset ay binuo noong 2019 ng isang grupo ng mga mananaliksik mula sa Allen Institute for AI at Unibersidad ng Washington. Ang bawat gawain ay isang pangungusap na may puwang na kailangang punan ng isa sa dalawang pagpipilian, na pinipili ang tamang sagot batay sa konteksto at pag-unawa sa sitwasyon. Ang WinoGrande ay naging isa sa mga pangunahing benchmark sa larangan ng natural language processing (NLP)[2].

Mga Kinakailangan para sa Paglikha: Pagkaluma ng WSC

Ang orihinal na Winograd Schema Challenge (WSC), na iminungkahi noong 2011, ay naglalaman lamang ng 273 gawain at matagal na itinuturing na isang mapagkakatiwalaang pagsubok sa common sense. Ang mga gawain dito ay itinayo upang mangailangan ng pag-unawa sa mundo, at hindi simpleng pagtatapat ng mga salita[3].

Ngunit sa pagsapit ng 2018–2019, kasabay ng pagdating ng malalaking language model batay sa arkitektura ng Transformer, tulad ng BERT, nagbago ang sitwasyon. Natuto ang mga modelo na "salakayin" ang pagsubok, na nakamit ang katumpakan na humigit-kumulang 90% sa pamamagitan ng pagsasamantala sa mga hindi sinadyang istatistikal na pattern (artefact) sa datos, at hindi dahil sa tunay na pag-unawa[4]. Ang WSC ay tumigil na maging isang mapagkakatiwalaang tagapagpahiwatig, na humantong sa pangangailangan na lumikha ng bagong, mas kumplikado at mas malawak na benchmark — ang WinoGrande.

Pagbuo at Paraan ng Adversarial Filtering

Ang paglikha ng WinoGrande ay dumaan sa dalawang pangunahing yugto: malawakang paglikha ng mga gawain at ang kasunod na pagsasala.

Crowdsourcing

Sa unang yugto, sa tulong ng platform na Amazon Mechanical Turk, nakolekta ang isang malaking base na may higit sa 47,000 pangungusap. Ang mga manggagawa sa crowdsourcing ay lumikha ng mga pares ng pangungusap ayon sa pamamaraan ng Winograd, na nagbigay ng linggwistikong pagkakaiba-iba at "ingay" na katangian ng natural na pananalita, kumpara sa mga gawain na isinulat ng isang maliit na grupo ng mga eksperto[1].

Algoritmo ng AfLite

Ang pangunahing inobasyon ng WinoGrande ay ang algoritmo ng AfLite (Adversarial Filtering Lite). Ang pamamaraang ito ay binuo para sa awtomatikong pag-aalis ng mga gawain na maaaring malutas sa pamamagitan ng simpleng istatistikal na pahiwatig, nang hindi nangangailangan ng common sense. Ang algoritmo ay gumamit ng mga simpleng modelo upang tukuyin at alisin ang mga halimbawa kung saan ang isa sa mga sagot ay malinaw na nauugnay sa ibang mga salita sa pangungusap. Halimbawa, ang gawaing «Kinain ng mga leon ang mga zebra dahil sila ay mga mandaragit» ay maisasala, dahil ang salitang «mga mandaragit» ay istatistikal na malapit na nauugnay sa «mga leon».

Bilang resulta ng pagsasala, humigit-kumulang 14% ng nakolektang datos ay inalis. Ang panghuling bersyon ng dataset ay kinabibilangan ng 43,972 gawain, na ginagawa itong isang mas mapagkakatiwalaan at mas mahirap na pagsubok[1].

Mga Resulta ng Modelo at Pag-unlad

Sa paglabas ng WinoGrande, ang mga pinakamahusay na modelo sa panahong iyon ay nagpakita ng mga resultang makabuluhang mas mababa kaysa sa mga tao.

  • RoBERTa (pinahusay na bersyon ng BERT) ay nakamit ang katumpakan na ~79%.
  • Ang tao ay karaniwang nalulutas ng mga gawain nang may katumpakan na ~94%[1].

Ang pagkakaibang ito ay nagpatunay na ang AfLite-filtering ay matagumpay na nag-alis ng maraming "madaling" landas para sa mga modelo. Ngunit sa pag-unlad ng LLM, ang pagkakaibang ito ay nagsimulang lumit.

  • Sa 2022, ang modelo ng ST-MoE-32B ay nakamit ang 96.1% na katumpakan, na nalampasan ang antas ng tao[5].
  • Ang GPT-3 ay nagpakita ng resultang humigit-kumulang 88%[6].
  • Ang GPT-4, nang walang espesyal na fine-tuning, ay nalulutas ng mga gawain nang may katumpakan na ~87.5%[7].

Impluwensya at Kritisismo

Ang WinoGrande ay naging isa sa mga pangunahing benchmark para sa pagtatasa ng common sense at regular na ginagamit para sa pagsubok ng mga bagong modelo. Ang mga resulta nito ay inilalathala sa mga teknikal na ulat ng mga nangungunang kumpanya ng AI at sa mga platform para sa paghahambing ng mga modelo[8].

Sa kabila nito, ang pamamaraan ng paglikha ng dataset ay naging paksa ng siyentipikong talakayan. Itinuturo ng ilang mananaliksik na ang malawakang crowdsourcing ay maaaring humantong sa paglitaw ng mga hindi natural o malabong parirala. Nagkaroon din ng mga pagdududa na ang awtomatikong pagsasala ng AfLite ay ganap na makaaalis ng lahat ng nakatagong artefact[5]. Gayunpaman, ang WinoGrande ay nagpasigla hindi lamang ng pag-unlad sa mga sukatan, kundi pati na rin ng isang mahalagang talakayan tungkol sa paglikha ng mas matibay at mas mapagkakatiwalaang mga pamamaraan ng pagtatasa ng AI.

Mga Sanggunian

  • Opisyal na website ng WinoGrande
  • Dataset sa platform ng Hugging Face

Panitikan

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Mga Tala

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]