SuperGLUE (benchmark) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

SuperGLUE — ito ay isang komprehensibong benchmark (hanay ng mga pagsubok) para sa pagtatasa ng mga sistema ng pagproseso ng natural na wika, lalo na ng malalaking modelo ng wika (LLM)[1]. Ito ay ipinakilala noong 2019 ng isang grupo ng mga mananaliksik sa ilalim ng pamumuno ni Alex Wang mula sa New York University, kasama ang Facebook AI Research at iba pang organisasyon[1].

Ang paglikha ng SuperGLUE ay sanhi ng katotohanang sa kalagitnaan ng 2019, ang naunang benchmark na GLUE ay naging "madaling gawain" para sa mga makabagong modelo: ang pinagsama-samang puntos ng pinakamahusay na mga modelo sa GLUE ay umabot sa 88.4, na nalampasan ang average na antas ng tao (87.1)[1]. Sa gayon, ang puwang para sa karagdagang pag-unlad ay lumipas[1]. Bilang tugon, binuo ng mga may-akda ang SuperGLUE bilang isang mas mahirap na alternatibo, na nagbibigay ng mas mahigpit na pagsubok sa pag-unawa ng mga modelo sa wika[1]. Ang layunin ng SuperGLUE ay magbigay ng neutral at mahirap na "mapag-aralan" na sukatan ng pag-unlad sa larangan ng pangkalahatang pag-unawa sa wikang Ingles[1]. Inaasahan na ang kapansin-pansing pagpapabuti ng mga resulta sa SuperGLUE ay mangangailangan ng mahahalagang inobasyon sa mga pamamaraan ng Machine Learning — halimbawa, mas epektibong pag-aaral sa maliliit na sample, multitask at self-supervised na pagsasanay[1]. Sa madaling salita, ang SuperGLUE ay nagsasama ng mga gawaing madali para sa tao ngunit mahirap para sa makina[1], upang mapalakas ang pagbuo ng mga modelo na may tunay na malalim na pag-unawa sa wika.

Mga Katangian at Pagkakaiba mula sa GLUE

Ang SuperGLUE ay karaniwang sumusunod sa format ng GLUE — nag-aalok ito ng isang solong pinagsama-samang sukatan ng kalidad sa kabuuan ng mga gawain, isang pampublikong leaderboard at hanay ng mga kasangkapan para sa pagsusuri ng mga modelo[1]. Gayunpaman, nagdadala ang SuperGLUE ng ilang mga pagpapabuti at inobasyon kumpara sa hinalinhan nito[1]:

  • Mas mahihirap na mga gawain: sa SuperGLUE, pinili ang walong pinaka-mahirap na gawain[1]. Dalawa sa mga ito ay nagmula sa GLUE (kabilang sa pinakamahirap doon), at ang iba ay pinili mula sa mga bagong kandidato batay sa kanilang kahirapan para sa mga makabagong NLP na modelo[1]. Sa gayon, ang benchmark ay nakatuon sa mga aspeto ng pag-unawa kung saan ang mga modelo ay dating nagpapakita ng pinakamasamang mga resulta.
  • Iba't ibang format: kung sa GLUE ang lahat ng gawain ay bumabagsak sa pag-uuri ng mga pangungusap o pares ng pangungusap, ang SuperGLUE naman ay nagsasama ng isang mas malawak na hanay ng mga format[1]. Bukod sa pag-uuri, idinagdag ang mga gawain sa resolusyon ng coreference at pagsagot sa mga tanong, na nangangailangan ng modelo na maunawaan ang magkakaugnay na teksto at lohikal na paghinuha[1].
  • Pagtatasa ng tao sa lahat ng gawain: para sa bawat gawain ng SuperGLUE, kinakalkula ang batayang antas ng pagganap ng tao (non-expert)[1], na nagpapatunay na maging ang malakas na mga modelo tulad ng BERT ay makabuluhang nahuli sa tao sa oras ng paglulunsad ng benchmark[1]. Ang pagkakaroon ng sangguniang antas ng tao (~90% sa kabuuan) ay nagbibigay ng "puwang" para sa paglago ng modelo at nagsisilbing target na sanggunian[1].
  • Malinaw na mga panuntunan at kasangkapan: binago ang mga panuntunan sa pag-post ng mga resulta sa leaderboard (upang matiyak ang patas na paghahambing at pagkilala sa kontribusyon ng mga may-akda ng dataset)[1]. Gayundin, inilathala ang isang bagong bukas na hanay ng mga kasangkapan para sa kaginhawaan ng fine-tuning at multitask na pagsasanay ng mga modelo sa datos ng SuperGLUE[1].

Sa kabuuan, ginagawa ng mga hakbang na ito ang SuperGLUE na mas maaasahang pagsubok para sa pangkalahatang kakayahan sa wika ng mga modelo, na hindi nagpapahintulot na makamit ang mataas na mga resulta sa pamamagitan ng makitid na pandaraya o pag-angkop sa mga espesipikong format ng dating GLUE[1].

Hanay ng mga Gawain ng SuperGLUE

Ang SuperGLUE ay binubuo ng walong gawain, na sumasaklaw sa iba't ibang aspeto ng pag-unawa sa teksto.

  • BoolQ (Boolean Questions): isang gawaing uri ng tanong-sagot (QA), kung saan ang bawat halimbawa ay may maikling teksto (sipi mula sa Wikipedia) at isang tanong na dapat sagutin ng "oo" o "hindi"[1]. Ang mga tanong ay binuo ng mga gumagamit (mula sa mga paghahanap sa Google) at nangangailangan ng pagkuha ng tahasang o ipinahiwatig na katotohanan mula sa teksto; ang sukatan ng kalidad ay ang bahagi ng tamang mga sagot (accuracy)[1].
  • CB (CommitmentBank): isang gawaing lohikal na paghinuha (textual entailment) na may tatlong klase[1]. Ang dataset ay binubuo ng mga maikling teksto na naglalaman ng mga kumplikadong pangungusap; kinakailangan na matukoy kung hanggang saan ang may-akda ng teksto ay nakatuon sa katotohanan ng nakapaloob na pahayag[1]. Sa katunayan, ito ay isang pagsusuri kung ang pahayag ay nagmula sa ibinigay na konteksto. Ang gawain ay mahirap dahil sa maliit na laki ng sample (mga 250 halimbawa) at kawalan ng balanse ng mga klase; ang kalidad ay tinatasa sa pamamagitan ng katumpakan at F1-measure, na ina-average sa mga klase[1].
  • COPA (Choice of Plausible Alternatives): isang gawaing sanhi-bunga na pag-iisip[1]. Ang modelo ay binibigyan ng paunang kondisyon (isang pangungusap) at kailangang pumili ng tamang sanhi o bunga mula sa dalawang pagpipilian[1]. Lahat ng halimbawa ng COPA ay mano-manong binuo at nangangailangan ng pangkaraniwang katwiran para sa pagtatatag ng sanhi-bunga na ugnayan. Ang mga paksa ay kinabibilangan ng mga sitwasyon mula sa mga blog at espesyal na ensiklopedya; ang sukatan ay katumpakan (bahagi ng tamang mga pagpipilian)[1]. Halimbawa: binibigyan ng pangungusap na "ang bata ay nakakuha ng immunity sa sakit" at ang tanong na "ano ang dahilan?" — agad naiintindihan ng tao na ang tamang sagot ay "nakatanggap siya ng bakuna", habang ang modelo ay kailangang hulaan ang sanhi-bunga na ugnayan[1].
  • MultiRC (Multi-Sentence Reading Comprehension): isang gawaing multi-sentence na pag-unawa sa teksto na may mga elemento ng maramihang pagpipilian[1]. Ang modelo ay tumatanggap ng isang talata ng teksto, isang tanong tungkol sa nilalaman ng talata at isang listahan ng mga posibleng sagot; kailangang matukoy kung aling mga sagot ang tama (maaaring magkaroon ng maraming tamang sagot sa bawat tanong)[1]. Mga katangian: upang masagot ang tanong, karaniwang kinakailangan na pagsamahin ang impormasyon mula sa maraming pangungusap ng teksto, na nagsusubok sa kakayahan ng modelo na mag-ugnay ng mga katotohanan[1]. Ang kalidad ay sinusukat ng dalawang sukatan: F1 sa mga sagot (isinasaalang-alang ang bahagyang tamang mga hanay) at Exact Match — bahagi ng mga tanong na binibigyan ng ganap na tamang mga hanay ng sagot[1].
  • ReCoRD (Reading Comprehension with Commonsense Reasoning Dataset): isang gawaing pagbabasa na may pag-unawa at paggamit ng kaalaman[1]. Ito ay isang binagong Cloze test: binibigyan ng isang tekstong balita (artikulo ng CNN/Daily Mail) at isang pangungusap na may nawawalang salitang entidad; dapat piliin ng modelo kung aling entidad mula sa teksto ang angkop sa lugar ng nawawala[1]. Ang mga pagpipilian ng sagot ay ibinibigay bilang lahat ng mga entidad na binanggit sa artikulo, na maaaring magkatugma sa esensya[1]. Para sa matagumpay na solusyon, kinakailangan ng pag-unawa sa konteksto at pangkaraniwang katwiran. Ang mga sukatan ay maximum na token-level F1 at Exact Match (eksaktong tugma) para sa mga hinulaang sagot[1].
  • RTE (Recognizing Textual Entailment): isang gawaing binary na pag-uuri sa textual entailment (entailment vs. not entailment)[1]. Pinagsasama ng dataset ang mga halimbawa mula sa ilang mga kompetisyon sa pagkilala ng textual entailment (serye ng RTE 1-5)[1]. Ang bawat gawain ay naglalaman ng isang pares ng mga tekstong fragment (premise-hypothesis); dapat matukoy ng modelo kung ang hypothesis ay sumusunod sa teksto. Hindi tulad ng maraming malalaking dataset, ang RTE ay medyo maliit (mga 2,500 halimbawa ng pagsasanay), ngunit nagpakita ng malaking pakinabang mula sa transfer learning: ang katumpakan ay lumago mula ~56% (antas ng random na paghula) hanggang ~86% sa pagdating ng mga modelo tulad ng BERT[1]. Gayunpaman, sa oras ng paglulunsad ng SuperGLUE, ang katumpakan ng mga modelo ay nahuli pa rin sa tao ng humigit-kumulang 8 porsyentong puntos[1], kaya ang RTE ay isinama bilang isa sa mga gawaing nagpapanatili ng agwat sa antas ng tao.
  • WiC (Word-in-Context): isang gawaing resolusyon ng kamalabuan ng kahulugan ng salita sa konteksto (WSD)[1]. Dalawang independyenteng pangungusap ang ibinibigay, kung saan bawat isa ay naglalaman ng parehong salitang may maraming kahulugan; kailangang matukoy kung ang salita ay ginamit sa parehong kahulugan sa parehong kaso[1]. Ang datos ay kinuha mula sa mga leksikal na mapagkukunan (WordNet, VerbNet, Wiktionary), kaya sumasaklaw ng malawak na hanay ng mga salita at kahulugan[1]. Ang gawain ay pormalisado bilang binary na pag-uuri at tinatasa sa pamamagitan ng bahagi ng tamang mga sagot. Ang WiC ay nangangailangan ng modelo na maunawaan ang mga banayad na pagkakaibang semantiko, na nagsusubok ng leksikal na semantika.
  • WSC (Winograd Schema Challenge): isang gawaing resolusyon ng coreference gamit ang pangkaraniwang katwiran[1]. Ang bawat gawain ay binubuo ng isang pangungusap na naglalaman ng isang panghalip, at isang listahan ng dalawang entidad (mga pangngalan) mula sa parehong pangungusap[1]. Kinakailangan na matukoy kung aling pangngalan ang tinutukoy ng naibigay na panghalip[1]. Halimbawa ng klasikong winograd na pangungusap: "Hindi kasya ang tropeyo sa maleta dahil ito ay masyadong maliit" — naiintindihan ng tao na ang "ito" ay tumutukoy sa maleta (masyadong maliit ang maleta). Ang ganitong mga halimbawa ay hindi malulutas nang wala ang pang-araw-araw na kaalaman at konteksto[1]. Sa GLUE ay mayroon nang pinasimpleng bersyon ng gawaing ito (WNLI), ngunit ang mga modelo ay matagal na hindi makahigit kahit sa antas ng random sa loob nito[1]. Tanging mga espesyal na pamamaraan, tulad ng pagdaragdag ng panlabas na datos na may katulad na mga halimbawa, ang nagtaas ng kalidad ng mga modelo sa WSC sa ~90% sa 2019[1]. Gayunpaman, halos walang error ang tao sa paglutas ng mga gawain ng WSC (~96-100% tamang sagot)[1]. Sa SuperGLUE, kasama ang orihinal na bersyon ng WSC sa format ng binary na pag-uuri (para sa bawat pares na "panghalip-entidad", sinasagot ng modelo kung magkatugma ba ang mga ito sa sanggunian)[1]. Ang gawaing ito ay nananatiling isa sa mga pinaka-mahirap na pagsubok na nangangailangan ng commonsense na pag-iisip.

Ang lahat ng pagsubok ng SuperGLUE ay may saradong mga test set na ang mga sagot ay hindi alam ng mga developer[1]. Isinusubmit ng mga modelo ang kanilang mga hula sa server, kung saan kinakalkula ang pinagsama-samang marka — ang katumpakang ina-average sa mga gawain (para sa mga gawain na may maraming sukatan, ang panloob na sukatan ay unang ina-average)[1]. Ang ganitong solong SuperGLUE score ay nagpapadali sa paghahambing ng mga modelo ayon sa pangkalahatang antas ng linhawang pangwika.

Mga Resulta at Pag-unlad ng mga Modelo

Sa paglulunsad ng SuperGLUE, ibinigay ng mga may-akda bilang sanggunian ang mga resulta ng isang malakas na base na modelo (pinahusay na BERT) — at ang mga ito ay naging makabuluhang mas mababa sa mga resulta ng tao sa lahat ng gawain[1]. Sa average, ang pinakamahusay na modelo sa panahon na iyon ay nakakuha ng humigit-kumulang 20 puntos na mas mababa kaysa sa tao ayon sa pinagsama-samang sukatan[1]. Sa ilang mga gawain, ang agwat ay lalo pang malaki: halimbawa, sa gawaing WSC ang modelo ay halos umabot lamang sa ~65% na katumpakan kumpara sa 100% ng tao (agwat na ~35 puntos)[1]. Kahit sa mga gawaing mukhang "mas madali" (BoolQ, CB, RTE, WiC), ang mga automated na sistema ay nahuli ng ~10 puntos sa antas ng tao[1]. Ang mga pagkakaibang ito ay nagpatunay na ang SuperGLUE ay tunay na nagtatanggal ng seryosong hamon sa kasalukuyang mga teknolohiya at hindi malulutas nang walang kahirapan.

Gayunpaman, ilang buwan lamang pagkatapos ng paglabas ng SuperGLUE, nagsimula ang mabilis na pag-unlad[1]. Sa katapusan ng 2019, ipinakita ng mga mananaliksik ng Google ang modelo ng T5 (Text-To-Text Transfer Transformer) na may 11 bilyong parameter, na nakamit ang pinagsama-samang resulta na 88.9, na malapit na lumalapit sa antas ng tao na ~89.8[2]. Sa katunayan, pinabuti ng T5 ang nakaraang rekord sa SuperGLUE nang 4.3 puntos at binawasan ang bahagi ng mga error ng halos isang ikatlo[2], na nag-iiwan ng minimal na agwat na 0.9 puntos lamang sa marka ng tao[2]. Nabanggit ng mga developer na ang SuperGLUE ay sadyang piili upang ang mga gawain ay madali para sa mga tao, kaya ang pagdating ng modelo sa antas ng ~89% ay isang mahalagang tagumpay[2].

Ang unang nakaabot na nalampasan ang average na kalidad ng tao ay ang modelo ng Microsoft na DeBERTa (Decoding-enhanced BERT with disentangled attention)[3]. Noong Enero 2021, iniulat ng mga mananaliksik na ang bersyon ng DeBERTa na may 1.5 bilyong parameter ay nakakuha ng 89.9 puntos, bahagyang mas mataas kaysa sa sangguniang antas ng tao na 89.8[3]. Ito ang unang pagkakataon na ang isang solong modelo ay nalampasan ang tao sa sukatan ng SuperGLUE[3]. Bukod pa rito, ang ensemble ng maraming modelo ng DeBERTa ay nagtaas ng rekord sa ~90.3 puntos[3]. Nalampasan ng modelo ng DeBERTa ang dating lider (Google T5) ng humigit-kumulang 0.6% at nagpakita ng pagiging epektibo ng mga bagong ideya sa arkitektura ng Transformer (hiwalay na representasyon ng nilalaman at posisyon ng mga salita, pinahusay na mask decoder, atbp.)[4].

Hindi huminto ang pag-unlad sa nakamit: habang lumalaki ang laki at kumplikasyon ng mga modelo ng wika, patuloy na bumuti ang mga resulta ng SuperGLUE[5]. Sa katapusan ng 2021, ang modelo ng Microsoft na T-NLRv5 (pamilya ng Microsoft Turing NLR) ay napunta sa tuktok ng leaderboard — lalong pinadami nito ang agwat na lampas sa antas ng tao[5]. Ang mga huling hindi pa nalulutas na gawain ng GLUE para sa mga makina (halimbawa, ang mga subtlety ng NLI) ay "nasara" ng modelong ito, na malapit na lumapit sa ganap na pagkakapantay-pantay sa tao kahit sa mga pinaka-mahirap na sub-gawain[5].

Noong 2022-2023, ang threshold ng antas ng tao sa SuperGLUE ay mapagkumpiyansang nalampasan ng ilang independyenteng malalaking modelo[6]. Halimbawa, ang modelo ng PaLM mula sa Google (540 bilyong parameter) sa fine-tuning sa mga gawain ng SuperGLUE ay umabot sa humigit-kumulang 90.4 puntos, at ang modelo ng GPT-4 (na binuo ng OpenAI) ay nagpakita ng kahit bahagyang mas mataas na resulta[6]. Sa kalagitnaan ng 2023, sa talahanayan ng mga lider ng SuperGLUE ay may ilang mga modelo na may resulta na higit sa 90 (ibig sabihin, lumalagpas sa average na antas ng tao)[6]. Masasabi na ang benchmark ay halos nalutas ng mga modernong sistema[6]: ang mga puntos ng pinakamahusay na mga modelo ay napakataas na nalampasan na nila ang kakayahan ng karamihan ng mga hindi dalubhasang tao[6]. Ang tagumpay na ito ay nagpapatunay ng napakalaking pag-unlad sa NLP sa maikling panahon, ngunit sabay na nagpapahiwatig ng pangangailangan para sa mga bago, mas kumplikadong pagsubok para sa mga pinakabagong modelo[6]. Lumalabas na ang mga susunod na benchmark (halimbawa, MMLU, BIG-Bench at iba pa), na naglalayong suriin ang mga modelo sa mas malawak na pag-unawa at kaalaman na lumalagpas sa mga hangganan ng mga gawain ng SuperGLUE[6].

Impluwensya at Karagdagang Pananaliksik

Ang SuperGLUE, sa gayon, ay naitatag bilang isang mahalagang yugto sa pag-unlad ng mga pamamaraan ng pagtatasa sa pagproseso ng wika[3]. Sa mga bilog ng mga mahilig at siyentipiko, ang mga resulta nito ay naging isang uri ng "litmus test" para sa mga bagong arkitektura ng LLM: ang pagkamit o paglampas sa antas ng tao sa SuperGLUE ay itinuturing na tanda ng advanced na modelo na may malalim na pag-unawa sa wika[3]. Ito ay nakaapekto rin sa kasanayan — maraming modernong modelo ng wika na nakamit ang mataas na mga resulta sa SuperGLUE ang naging pundasyon ng mga inilapat na sistema ng tanong-sagot, mga ahente ng diyalogo, mga sistema ng pagbubuod ng teksto at iba pa[3]. Patuloy na ginagamit ang SuperGLUE ng mga mananaliksik para sa fine-tuning at paghahambing ng mga algorithm, kahit na ang advanced na posisyon ay unti-unting lumilipat na ngayon patungo sa mga bagong hangganan ng pagtatasa ng artificial intelligence.

Mga Sanggunian

  • Opisyal na website ng SuperGLUE
  • Orihinal na artikulo ng SuperGLUE (NeurIPS)
  • Artikulo ng Microsoft tungkol sa pagkamit ng antas ng tao ng DeBERTa
  • Pahina ng dataset ng SuperGLUE sa Papers With Code

Talasanggunian

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Mga Tala

[1] [2] [3] [4] [5] [6] </references>

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS. [1]
  2. 2.0 2.1 2.2 2.3 2.4 «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit /r/linguistics. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». Microsoft Research Blog. [3]
  4. 4.0 4.1 «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». Synced Review. [4]
  5. 5.0 5.1 5.2 5.3 «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». Microsoft Research Blog. [5]
  6. 6.0 6.1 6.2 6.3 6.4 6.5 6.6 6.7 «The Ultimate Guide to AI Benchmarks». The AI Navigator. [6]