HellaSwag Benchmark (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

HellaSwag — ito ay isang benchmark (etalong hanay ng datos), na ipinakita noong 2019 para sa pagtatasa ng kakayahan ng mga modelo ng artificial intelligence sa pag-unawa sa mga pang-araw-araw na sitwasyon (commonsense reasoning) sa natural na wika[1]. Ang benchmark ay binuo ng isang grupo ng mga mananaliksik mula sa Unibersidad ng Washington at sa Allen Institute for Artificial Intelligence.

Ang gawain ng HellaSwag ay ang pagpili ng pinaka-makatotohanang pagwawakas para sa isang ibinigay na tekstong konteksto. Ang pangunahing katangian ng hanay ng datos ay ito ay madali para sa tao, ngunit nagpapalito kahit sa mga advanced na language model na umaasa sa mga mababaw na istatistikal na pattern[2].

Kasaysayan at mga Paunang Kondisyon

Ang HellaSwag ay isang pagpapaunlad ng mga ideya ng dataset na SWAG (Situations With Adversarial Generations), na iminungkahi ng parehong grupo ng mga may-akda noong 2018. Sa gawain ng SWAG, kinakailangan ng mga modelo na pumili ng pinaka-malamang na pagpapatuloy para sa paglalarawan ng isang simpleng sitwasyon. Sa simula, ang SWAG ay mahirap para sa mga algorithm, ngunit nang lumabas ang modelo ng BERT, ang mga resulta nito sa SWAG ay umabot sa antas na ~86%, halos katumbas ng antas ng tao[2].

Ang tagumpay na ito ay nagdulot ng mga pagdududa: talagang "nauunawaan" ba ng BERT ang teksto, o natuto lamang itong makilala ang mga istatistikal na artefak at mga pattern na naroroon sa hanay ng datos? Inilabas ng mga may-akda ng HellaSwag ang hipotesis na ang mataas na resulta ng BERT ay hindi dahil sa tunay na pag-unawa, kundi sa pag-aayon sa espesipikong katangian ng dataset. Ipinakita nila na sa pinakamaliit na pagbabago ng distribusyon ng datos, ang katumpakan ng BERT ay biglang bumababa. Nangangahulugan ito na para sa layuning pagtatasa ng pag-unlad sa NLP, kailangan ang isang bago, mas kumplikado at mas "tuso" na benchmark[2].

Paglalarawan at Mga Layunin ng Dataset

Ang HellaSwag ay nilikha bilang isang pagsubok na naglalayong tukuyin ang mga limitasyon ng mga kasalukuyang modelo sa pag-unawa ng mga sanhi-at-bunga na ugnayan at mga pang-araw-araw na sitwasyon.

Estruktura ng Gawain

Ang bawat halimbawa sa HellaSwag ay binubuo ng dalawang bahagi:

  1. Konteksto: Isang maikling talata (hanggang tatlong pangungusap), na naglalarawan ng simula ng isang sitwasyon.
  2. Apat na opsyon ng pagwawakas: Apat na posibleng pagpapatuloy ng kuwento, na binubuo rin ng ilang pangungusap.

Isang pagwawakas lamang ang tama (tunay), at ang natitirang tatlo ay huwad, na espesyal na ginawa upang malito ang modelo.

Mga Pinagkukunan ng Datos

Ang mga halimbawa ng sitwasyon ay kinuha mula sa dalawang pinagkukunan, na sumasaklaw sa malawak na hanay ng mga pang-araw-araw na sitwasyon:

  • ActivityNet Captions: Mga paglalarawan ng mga aksyon mula sa mga video (halimbawa, "binubuksan ng isang tao ang isang garapon ng mga pipino").
  • WikiHow: Mga tagubilin mula sa mga artikulo (halimbawa, "paano palitan ang gulong ng sasakyan").

Ang layunin ng HellaSwag ay lumikha ng benchmark na madaling malutas ng tao (sa pamamagitan ng intuisyon), ngunit pinakamahirap para sa mga modelo na walang ganap na sentido komun. Ang epektong ito ay tinawag ng mga may-akda na "Goldilocks effect"[1].

Pamamaraan ng Adversarial Filtering (AF)

Ang pangunahing inobasyon sa paggawa ng HellaSwag ay ang pamamaraan ng Adversarial Filtering (AF) — isang paulit-ulit na pagpili ng mga "bitag" na inilaan para sa isang partikular na modelo-"biktima". Ang pamamaraang ito ay nagbigay-daan sa paglikha ng mga huwad na opsyon na mapanlinlang na katulad ng mga tamang opsyon mula sa pananaw ng mga istatistikal na modelo.

Ang pamamaraan ng AF ay gumagana tulad ng sumusunod:

  1. Paglikha. Batay sa orihinal na konteksto, ang isang language model-generator (halimbawa, GPT) ay gumagawa ng maraming potensyal na maling pagwawakas.
  2. Diskriminasyon. Ang modelo-classifier (halimbawa, BERT), na gumaganap ng papel na "biktima", ay sinusubukan na ihiwalay ang mga nabuong pagpapatuloy mula sa tunay (tamang) isa.
  3. Pagpili. Ang mga huwad na opsyon na itinuturing ng classifier na pinaka-makatotohanan ang pinipili, ibig sabihin, ang mga pinakamalamang na nagpapagkamali ito.
  4. Pag-ulit. Ang proseso ay paulit-ulit nang maraming beses hanggang ang mga maling sagot ay maging pinaka-katulad ng tamang sagot para sa algorithm.
  5. Pagpapatunay ng Tao. Sa huling yugto, ang mga nabuong hanay (konteksto + 1 tamang pagwawakas + 3 pinakamahusay na huwad) ay sinusuri ng mga tao. Kinikilala ng mga tagasuri na ang tamang opsyon ay malinaw na ang pinaka-natural, at ang lahat ng mga alternatibo ay naglalaman ng ilang ilogikalidad na kapansin-pansin ng tao[2].

Sa tulong ng AF, ang bawat halimbawa sa HellaSwag ay orihinal na itinayo upang ililigaw ang modelo, ngunit manatiling malinaw para sa tao.

Mga Resulta at Kahalagahan

Ang HellaSwag ay naging mahigpit na pagsubok para sa mga modelo ng pag-unawa ng teksto. Ang mga resulta ng pagsubok ay nagpakita ng malaking pagkakaiba sa pagitan ng makina at ng katalinuhan ng tao:

  • Ang tao ay halos walang pagkakamali sa pagsasagawa ng mga gawain ng HellaSwag, na may katumpakan na humigit-kumulang 95-96%[2].
  • Ang pinakamahusay na modelo sa oras ng paglikha, BERT-Large, ay umabot lamang sa ~47% ng katumpakan. Ang mas simpleng mga pamamaraan ay nagpakita ng resulta na bahagya lamang na mas mataas kaysa sa random na hula (25%)[2].

Ang agwat na higit sa 45 puntos ng porsyento ay nagpatunay sa hipotesis na ang mataas na mga resulta sa mga nakaraang pagsubok ay hindi nangangahulugang tunay na pag-unawa. Ipinakita ng HellaSwag na kahit pagkatapos ng pagsasanay sa napakaraming datos, ang mga modelo ay hindi makabuo ng pangkalahatang sentido komun para sa mga bagong sitwasyon.

Sa mga sumunod na taon, ang HellaSwag ay naging bahagi ng mga karaniwang pagsubok para sa mga bagong language model. Ang pag-unlad ng mga AI system ay maaaring masubaybayan sa pamamagitan ng kanilang mga resulta sa benchmark na ito.

  • Noong 2020, ang modelo ng GPT-3 (175 bilyong parameter) ay nagpakita ng katumpakan na ~79% sa few-shot na mode, na nalampasan ang antas ng maraming espesyalisadong modelo ng panahon na iyon, ngunit malayo pa rin sa antas ng tao[3].
  • Noong 2023 lamang, ang mga modelo ng bagong henerasyon, tulad ng GPT-4, ay nakamit sa HellaSwag ang resulta na maihahambing sa antas ng tao (humigit-kumulang 95% na katumpakan)[4].

Ang paglikha ng HellaSwag ay nagmarka ng isang bagong diskarte sa pagtatasa ng pag-unlad sa NLP, batay sa ideya ng mga nagbabagong benchmark: habang ang mga modelo ay nagiging mas mahusay, kinakailangang lumikha ng mga bago, mas kumplikadong pagsubok na nagtatukoy ng kanilang mga kahinaan.

  • Opisyal na website ng proyekto ng HellaSwag
  • Siyentipikong artikulo «HellaSwag: Can a Machine Really Finish Your Sentence?»

Mga Sanggunian

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Mga Tala

  1. 1.0 1.1 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv:1905.07830, 2019. [2]
  3. Brown, T. B. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165, 2020. [3]
  4. Zellers, R. et al. «HellaSwag Project Page». [4]