WinoGrande Benchmark (BN)
WinoGrande — এটি একটি বৃহৎ মাপের এটালন ডেটাসেট, যা কৃত্রিম বুদ্ধিমত্তা সিস্টেমের সাধারণ জ্ঞানভিত্তিক যুক্তিচিন্তার ক্ষমতা মূল্যায়নের জন্য তৈরি করা হয়েছে। এতে প্রায় ৪৪,০০০ টি কাজ রয়েছে, যা Winograd Schema Challenge (WSC) ফরম্যাটের উপর ভিত্তি করে তৈরি, তবে পরিসংখ্যানগত ইঙ্গিত দূর করার জন্য «adversarial» ফিল্টারিং পদ্ধতির মাধ্যমে উল্লেখযোগ্যভাবে বিস্তৃত ও জটিল করা হয়েছে[1]।
ডেটাসেটটি ২০১৯ সালে Allen Institute for AI এবং ওয়াশিংটন বিশ্ববিদ্যালয়ের গবেষকদের একটি দল তৈরি করেছিল। প্রতিটি কাজ একটি বাক্যের ফাঁকা জায়গা পূরণের আকারে উপস্থাপিত হয়, যেখানে দুটি বিকল্পের মধ্য থেকে প্রসঙ্গ ও পরিস্থিতির বোঝাপড়ার ভিত্তিতে সঠিকটি বেছে নিতে হয়। WinoGrande প্রাকৃতিক ভাষা প্রক্রিয়াকরণ (NLP) ক্ষেত্রে একটি মূল benchmark হিসেবে পরিণত হয়েছে[2]।
পূর্বশর্ত: WSC-এর পুরনো হয়ে যাওয়া
মূল Winograd Schema Challenge (WSC), যা ২০১১ সালে প্রস্তাবিত হয়েছিল, মাত্র ২৭৩টি কাজ ধারণ করত এবং দীর্ঘদিন ধরে সাধারণ জ্ঞানের একটি নির্ভরযোগ্য পরীক্ষা হিসেবে বিবেচিত হত। এতে কাজগুলি এমনভাবে তৈরি করা হয়েছিল যাতে শুধু শব্দ মিলানো নয়, বরং বিশ্বসম্পর্কীয় বোঝাপড়ার প্রয়োজন হয়[3]।
তবে ২০১৮–২০১৯ সালের মধ্যে, Transformer আর্কিটেকচারভিত্তিক বড় ভাষা মডেল যেমন BERT-এর আবির্ভাবের সাথে পরিস্থিতি বদলে যায়। মডেলগুলি ডেটায় থাকা অনিচ্ছাকৃত পরিসংখ্যানগত নিদর্শন (আর্টিফ্যাক্ট) ব্যবহার করে পরীক্ষা «ভাঙতে» শিখেছিল এবং প্রকৃত বোঝাপড়া ছাড়াই প্রায় ৯০% নির্ভুলতা অর্জন করছিল[4]। WSC একটি নির্ভরযোগ্য সূচক হিসেবে কার্যকারিতা হারিয়ে ফেলল, যা নতুন, আরও জটিল ও বৃহৎ benchmark — WinoGrande তৈরির প্রয়োজনীয়তা সৃষ্টি করল।
তৈরির প্রক্রিয়া এবং adversarial filtering পদ্ধতি
WinoGrande তৈরির কাজ দুটি মূল ধাপে সম্পন্ন হয়েছিল: বৃহৎ পরিসরে কাজ তৈরি এবং পরবর্তী ফিল্টারিং।
ক্রাউডসোর্সিং
প্রথম ধাপে Amazon Mechanical Turk প্ল্যাটফর্মের সাহায্যে ৪৭,০০০-এরও বেশি বাক্যের একটি বড় ভিত্তি সংগ্রহ করা হয়েছিল। ক্রাউড-কর্মীরা Winograd স্কিম অনুযায়ী বাক্যের জোড়া তৈরি করেছিলেন, যা ভাষাগত বৈচিত্র্য এবং স্বাভাবিক বাকভঙ্গির «শব্দ» নিশ্চিত করেছিল — বিশেষজ্ঞদের ছোট দলের লেখা কাজের বিপরীতে[1]।
AfLite অ্যালগরিদম
WinoGrande-এর মূল উদ্ভাবন ছিল AfLite (Adversarial Filtering Lite) অ্যালগরিদম। এই পদ্ধতিটি স্বয়ংক্রিয়ভাবে সেই কাজগুলি বাদ দেওয়ার জন্য তৈরি করা হয়েছিল যা সাধারণ জ্ঞান ছাড়াই সহজ পরিসংখ্যানগত ইঙ্গিতের মাধ্যমে সমাধান করা যায়। অ্যালগরিদমটি সহজ মডেল ব্যবহার করে সেই উদাহরণগুলি চিহ্নিত ও অপসারণ করত যেখানে একটি উত্তর বাক্যের অন্যান্য শব্দের সাথে অতিরিক্ত স্পষ্টভাবে যুক্ত। উদাহরণস্বরূপ, «সিংহরা জেব্রাদের খেয়ে ফেলল, কারণ তারা শিকারি» — এই ধরনের কাজ ফিল্টার করা হত, কারণ «শিকারি» শব্দটি পরিসংখ্যানগতভাবে «সিংহ»-এর সাথে ঘনিষ্ঠভাবে যুক্ত।
ফিল্টারিংয়ের ফলে সংগৃহীত ডেটার প্রায় ১৪% বাতিল হয়ে যায়। চূড়ান্ত সংস্করণে ৪৩,৯৭২টি কাজ রয়েছে, যা এটিকে উল্লেখযোগ্যভাবে আরও নির্ভরযোগ্য ও কঠিন পরীক্ষায় পরিণত করেছে[1]।
মডেলের ফলাফল এবং অগ্রগতি
WinoGrande প্রকাশের সময় সেরা মডেলগুলি মানুষের তুলনায় উল্লেখযোগ্যভাবে কম ফলাফল দেখিয়েছিল।
- RoBERTa (BERT-এর উন্নত সংস্করণ) ~৭৯% নির্ভুলতা অর্জন করেছিল।
- মানুষ গড়ে ~৯৪% নির্ভুলতায় কাজগুলি সমাধান করে[1]।
এই ব্যবধান নিশ্চিত করেছিল যে AfLite ফিল্টারিং মডেলগুলির জন্য অনেক «সহজ» পথ সফলভাবে দূর করেছে। তবে LLM-এর বিকাশের সাথে সাথে এই ব্যবধান সংকুচিত হতে শুরু করেছে।
- ২০২২ সাল নাগাদ ST-MoE-32B মডেল ৯৬.১% নির্ভুলতা অর্জন করে মানব স্তর অতিক্রম করে[5]।
- GPT-3 প্রায় ৮৮% ফলাফল দেখিয়েছে[6]।
- GPT-4 বিশেষ fine-tuning ছাড়াই ~৮৭.৫% নির্ভুলতায় কাজগুলি সমাধান করে[7]।
প্রভাব এবং সমালোচনা
WinoGrande সাধারণ জ্ঞান মূল্যায়নের একটি মূল benchmark হয়ে উঠেছে এবং নিয়মিতভাবে নতুন মডেল পরীক্ষার জন্য ব্যবহৃত হয়। এর ফলাফল শীর্ষস্থানীয় AI কোম্পানিগুলির প্রযুক্তিগত প্রতিবেদনে এবং মডেল তুলনার প্ল্যাটফর্মে প্রকাশিত হয়[8]।
একই সময়ে ডেটাসেট তৈরির পদ্ধতি বৈজ্ঞানিক আলোচনার বিষয় হয়ে উঠেছে। কিছু গবেষক উল্লেখ করেন যে বৃহৎ পরিসরের ক্রাউডসোর্সিং অস্বাভাবিক বা দ্বিঅর্থবোধক বাক্যাংশ তৈরিতে নিয়ে যেতে পারে। এছাড়াও সন্দেহ প্রকাশ করা হয়েছে যে AfLite-এর স্বয়ংক্রিয় ফিল্টারিং সব লুকানো আর্টিফ্যাক্ট সম্পূর্ণভাবে দূর করতে সক্ষম কিনা[5]। তবুও, WinoGrande শুধু মেট্রিক্সে অগ্রগতি নয়, AI মূল্যায়নের আরও টেকসই ও নির্ভরযোগ্য পদ্ধতি তৈরি সম্পর্কে একটি গুরুত্বপূর্ণ আলোচনাও উদ্দীপিত করেছে।
তথ্যসূত্র
- WinoGrande-এর অফিসিয়াল ওয়েবসাইট
- Hugging Face প্ল্যাটফর্মে ডেটাসেট
সাহিত্য
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
টীকা
- ↑ 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [১]
- ↑ «allenai/winogrande». Hugging Face. [২]
- ↑ «Winograd schema challenge». In Wikipedia. [৩]
- ↑ Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [৪]
- ↑ 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [৫]
- ↑ Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [৬]
- ↑ OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [৭]
- ↑ «Common Sense Reasoning On Winogrande». HyperAI. [৮]