GLUE Benchmark (TL)
GLUE (acronym ng General Language Understanding Evaluation, «Pangkalahatang Pagtatasa ng Pag-unawa sa Wika») — ito ay isang multi-task benchmark para sa pagtatasa ng kalidad ng mga modelo ng natural language understanding (NLU). Ang benchmark ay iminungkahi noong 2018 ng isang grupo ng mga mananaliksik mula sa New York University, University of Washington, at DeepMind, kabilang si Alex Wang at Samuel Bowman, at naging laganap ito sa komunidad ng pananaliksik[1].
Ang pangunahing layunin ng GLUE — magbigay ng iisang, neutral, at mapaghamong test suite para sa paghahambing ng mga kakayahan ng mga NLU-modelo sa iba't ibang hanay ng mga gawain na lumalagpas sa iisang partikular na larangan. Kasama sa benchmark ang isang online na platform na may leaderboard (talahanayan ng mga rekord), na nagsisiguro ng layuning paghahambing ng mga modelo at pumipigil sa pag-angkop sa test data, dahil ang tunay na mga label para sa ilang bahagi ng mga pagsubok ay hindi inilalathala at naa-access lamang sa pamamagitan ng evaluation server. Inaasahan na upang makamit ang mataas na resulta, ang modelo ay kailangang makaalam ng pangkalahatang representasyon ng wika at epektibong ilipat ang kaalaman sa pagitan ng iba't ibang uri ng mga gawain.
Komposisyon at mga Gawain ng Benchmark
Pinagsasama ng benchmark na GLUE ang siyam na iba't ibang gawain sa pag-unawa sa wika, batay sa mga naunang umiiral at mapaghamong dataset para sa AI. Lahat ng gawain ay nakabalangkas bilang klasipikasyon o regression sa iisang pangungusap o sa isang pares ng mga pangungusap[1].
- CoLA (Corpus of Linguistic Acceptability) — gawain ng pagtukoy ng gramatikang katanggap-tanggap ng isang pangungusap. Sukatan ng kalidad — Matthew's Correlation Coefficient.
- SST-2 (Stanford Sentiment Treebank) — gawain ng pagtukoy ng tono (positibo/negatibo) ng isang review ng pelikula. Sukatan — katumpakan (accuracy).
- MRPC (Microsoft Research Paraphrase Corpus) — gawain ng pagtuklas ng mga paraphrase sa isang pares ng mga pangungusap mula sa mga pinagkukunan ng balita. Mga sukatan — katumpakan at F1-measure.
- QQP (Quora Question Pairs) — gawain ng pagtukoy ng mga duplicate na tanong mula sa komunidad ng Quora. Mga sukatan — katumpakan at F1-measure.
- STS-B (Semantic Textual Similarity Benchmark) — gawain ng semantikong paghahambing ng dalawang pangungusap. Kailangang hulaan ng modelo ang antas ng pagkakatulad ng kahulugan sa sukat mula 1 hanggang 5. Mga sukatan — Pearson at Spearman correlation coefficient.
- MNLI (Multi-Genre Natural Language Inference) — gawain ng pagkilala ng textual entailment sa mga pares ng pangungusap mula sa iba't ibang genre ng mga pinagkukunan (konklusyon, kontradiksyon, neutralidad). Ang mga resulta ay tinatasa nang hiwalay sa magkatugmang (matched) at hindi magkatugmang (mismatched) mga subset.
- QNLI (Question Natural Language Inference) — gawain na nakuha sa pamamagitan ng pagbabago ng dataset na SQuAD. Kinakailangan na tukuyin kung naglalaman ang pangungusap mula sa isang talata ng sagot sa ibinigay na tanong.
- RTE (Recognizing Textual Entailment) — pinagsama-samang dataset sa textual entailment na nagsasama ng ilang maliliit na koleksyon. Gawain — binary na pag-uuri ng relasyon sa pagitan ng mga pangungusap.
- WNLI (Winograd NLI) — binagong bersyon ng Winograd schema, inangkop sa format ng NLI. Gawain sa paglutas ng anaphora: binibigyan ang sistema ng pangungusap na may hindi malinaw na panghalip, at kailangang ipahiwatig kung aling dalawang bagay ang tinutukoy nito.
Pamamaraan ng Pagtatasa
Para sa pagtatasa sa GLUE, isinusumite ng mga mananaliksik ang mga hula ng kanilang modelo sa isang espesyal na server, pagkatapos ay tumatanggap sila ng awtomatikong kalkulasyon ng mga sukatan para sa bawat gawain at isang pinagsama-samang puntos.
- GLUE-score — panghuling tagapagpakita, na kinakalkula bilang average na halaga ng mga resulta sa lahat ng siyam na pangunahing gawain.
- Leaderboard — pampublikong talahanayan na nagpapakita ng kasalukuyang estado ng mga bagay at nagpapakita kung aling mga modelo ang mas mahusay sa mga gawain ng NLU. Ang paggamit ng mga nakatagong test set ay nagsisiguro ng tapat na paghahambing.
- Diagnostic set — isang espesyal na hanay ng 1100 halimbawa, na mano-manong inanotahan ng mga eksperto para sa malalim na linggwistikong pagsusuri. Hindi ito nakakaapekto sa ranggo, kundi nagsisilbing instrumento ng kalitatibon pagsusuri upang suriin kung anong mga linggwistikong phenomena (lexical semantics, lohika, makatwirang pag-iisip) ang kayang kilalanin ng modelo, at kung aling mga ito ang nagdudulot sa kanya ng kahirapan[1].
Mga Resulta at Impluwensya sa Industriya
Sa paglulunsad ng GLUE noong 2018, ang pinakamahusay na mga modelo noon (halimbawa, BiLSTM na may ELMo) ay nakamit ang pinagsama-samang resulta na humigit-kumulang 70 puntos (sa sukat na 0–100), na makabuluhang mas mababa kaysa sa antas ng tao (humigit-kumulang 87 puntos)[2].
Ang paglalabas ng GLUE at ng bukas na leaderboard ay nagpasigla ng mabilis na pag-unlad sa larangan ng transfer learning sa NLP.
- Sa Mayo 2019, wala pang isang taon, ang bagong henerasyon ng mga modelo batay sa mga transformer (pangunahin na, BERT) ay nagtaas ng state-of-the-art na antas hanggang 83.9 puntos.
- Sa ikalawang kalahati ng 2019, ang benchmark na GLUE ay halos «nalampasan» na: ang pinakamahusay na mga sistema ay malapit na sa antas ng tao, at sa ilang mga gawain ay nalampasan pa ito[3].
Naglaro ang GLUE ng napakalaking papel bilang iisang punto ng sanggunian sa pagpapaunlad ng mga modelo ng pag-unawa sa wika. Salamat sa kanya, nagawa ng mga mananaliksik na direktang ihambing ang iba't ibang arkitektura sa isang komplikadong hanay ng mga gawain, matukoy ang mga kalakasan at kahinaan ng mga pamamaraan, at mabilis na magbahagi ng mga tagumpay sa pamamagitan ng pampublikong leaderboard.
SuperGLUE: Kasunod na Pag-unlad
Ang mabilis na tagumpay ng GLUE ay humantong sa katotohanan na pagkalipas ng isang taon, ang parehong grupo ng mga may-akda, kasama ang mga kasamahan mula sa Facebook AI, ay nagpresenta ng bagong, mas mapaghamong kumplikasyon na tinatawag na SuperGLUE[4].
Ang SuperGLUE ay inihayag sa katapusan ng 2019 bilang isang «mas matibay» (stickier) na hanay ng mga pagsubok, na layuning muling lumikha ng agwat sa pagitan ng mga kakayahan ng mga modernong modelo at ng tao. Nagsama ito ng walong gawain na nangangailangan ng mas malalim na pag-unawa sa wika, pati na rin pinahusay ang mga kasangkapan at mga panuntunan para sa mga kalahok. Bagaman patuloy na ginagamit ang GLUE bilang pangunahing pagsubok, ang pangunahing pokus ng mapagkumpetensyang pagpapabuti ay lumipat sa SuperGLUE at sa iba pang mas espesyalisadong mga benchmark.
Mga Sanggunian
- Opisyal na site ng GLUE Benchmark
- Pahina ng GLUE sa Papers With Code na may mga resulta ng mga modelo
Panitikan
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Mga Tala
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]