WinoGrande Benchmark (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — adalah dataset benchmark berskala besar yang dirancang untuk mengevaluasi kemampuan sistem kecerdasan buatan dalam melakukan penalaran berbasis akal sehat. Dataset ini berisi sekitar 44.000 soal yang didasarkan pada format Winograd Schema Challenge (WSC), namun diperluas dan dipersulit secara signifikan menggunakan metode penyaringan adversarial untuk menghilangkan petunjuk statistik[1].

Dataset ini dikembangkan pada tahun 2019 oleh sekelompok peneliti dari Allen Institute for AI dan Universitas Washington. Setiap soal berupa kalimat dengan bagian yang kosong, yang harus diisi dengan salah satu dari dua pilihan, dipilih berdasarkan konteks dan pemahaman situasi. WinoGrande menjadi salah satu benchmark utama dalam bidang pemrosesan bahasa alami (NLP)[2].

Latar Belakang Pembuatan: Keusangan WSC

Orisinal Winograd Schema Challenge (WSC), yang diusulkan pada tahun 2011, hanya berisi 273 soal dan selama bertahun-tahun dianggap sebagai uji akal sehat yang andal. Soal-soal di dalamnya dirancang sedemikian rupa sehingga membutuhkan pemahaman tentang dunia, bukan sekadar pencocokan kata sederhana[3].

Namun, pada tahun 2018–2019, dengan munculnya model bahasa besar berbasis arsitektur Transformer seperti BERT, situasinya berubah. Model-model tersebut belajar "membobol" tes ini, mencapai akurasi sekitar 90% dengan mengeksploitasi pola statistik yang tidak disengaja (artefak) dalam data, bukan melalui pemahaman yang sesungguhnya[4]. WSC tidak lagi menjadi indikator yang andal, dan hal inilah yang mendorong perlunya pembuatan benchmark baru yang lebih kompleks dan berskala besar — WinoGrande.

Pengembangan dan Metode Adversarial Filtering

Pembuatan WinoGrande berlangsung dalam dua tahap utama: pembuatan soal secara massal dan penyaringan selanjutnya.

Crowdsourcing

Pada tahap pertama, dengan menggunakan platform Amazon Mechanical Turk, dikumpulkan basis data besar yang berisi lebih dari 47.000 kalimat. Para pekerja crowdsource membuat pasangan kalimat berdasarkan skema Winograd, yang menghasilkan keragaman linguistik dan "kebisingan" yang khas dari ujaran alami, berbeda dengan soal-soal yang dibuat oleh sekelompok kecil pakar[1].

Algoritma AfLite

Inovasi utama WinoGrande adalah algoritma AfLite (Adversarial Filtering Lite). Metode ini dikembangkan untuk secara otomatis menyaring soal-soal yang dapat diselesaikan menggunakan petunjuk statistik sederhana tanpa memerlukan akal sehat. Algoritma ini menggunakan model sederhana untuk mengidentifikasi dan menghapus contoh-contoh di mana salah satu jawaban terlalu jelas terkait dengan kata-kata lain dalam kalimat. Misalnya, soal "Singa memakan zebra karena mereka adalah predator" akan disaring, karena kata "predator" secara statistik sangat erat berasosiasi dengan "singa".

Hasil penyaringan membuang sekitar 14% data yang telah dikumpulkan. Versi final dataset mencakup 43.972 soal, sehingga menjadikannya uji yang jauh lebih andal dan menantang[1].

Hasil Model dan Perkembangan

Saat WinoGrande dirilis, model-model terbaik saat itu menunjukkan hasil yang jauh di bawah kemampuan manusia.

  • RoBERTa (versi peningkatan dari BERT) mencapai akurasi ~79%.
  • Manusia rata-rata menyelesaikan soal dengan akurasi ~94%[1].

Selisih ini mengonfirmasi bahwa penyaringan AfLite berhasil menghilangkan banyak "jalur mudah" bagi model. Namun, seiring perkembangan LLM, selisih ini mulai menyempit.

  • Pada tahun 2022, model ST-MoE-32B mencapai akurasi 96,1%, melampaui tingkat kemampuan manusia[5].
  • GPT-3 menunjukkan hasil sekitar 88%[6].
  • GPT-4, tanpa fine-tuning khusus, menyelesaikan soal dengan akurasi ~87,5%[7].

Pengaruh dan Kritik

WinoGrande menjadi salah satu benchmark utama untuk evaluasi akal sehat dan secara rutin digunakan untuk menguji model-model baru. Hasilnya dipublikasikan dalam laporan teknis perusahaan AI terkemuka dan pada platform perbandingan model[8].

Pada saat yang sama, metode pembuatan dataset ini menjadi bahan diskusi ilmiah. Beberapa peneliti mencatat bahwa crowdsourcing massal dapat menghasilkan frasa yang tidak natural atau ambigu. Keraguan juga diungkapkan mengenai apakah penyaringan otomatis AfLite mampu sepenuhnya menghilangkan semua artefak tersembunyi[5]. Meski demikian, WinoGrande tidak hanya mendorong kemajuan dalam metrik, tetapi juga memicu diskusi penting tentang pengembangan metode evaluasi AI yang lebih tahan uji dan andal.

Tautan

  • Situs resmi WinoGrande
  • Dataset di platform Hugging Face

Literatur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Catatan

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]