GLUE Benchmark (BN)
GLUE (General Language Understanding Evaluation-এর সংক্ষিপ্ত রূপ, «ভাষা বোঝার সামগ্রিক মূল্যায়ন») — এটি প্রাকৃতিক ভাষা বোঝার (NLU) মডেলের গুণমান মূল্যায়নের জন্য একটি বহু-কাজভিত্তিক benchmark। এই benchmark টি ২০১৮ সালে নিউ ইয়র্ক বিশ্ববিদ্যালয়, ওয়াশিংটন বিশ্ববিদ্যালয় এবং DeepMind-এর একদল গবেষক — যাদের মধ্যে ছিলেন অ্যালেক্স ওয়াং এবং স্যামুয়েল বাউম্যান — প্রস্তাব করেন এবং গবেষণা সম্প্রদায়ে এটি ব্যাপক প্রচলন লাভ করে[1]।
GLUE-এর মূল লক্ষ্য হলো NLU মডেলের সক্ষমতার তুলনামূলক মূল্যায়নের জন্য একটি একক, নিরপেক্ষ ও চ্যালেঞ্জিং পরীক্ষা-সংকলন প্রদান করা, যা কোনো একটি নির্দিষ্ট ক্ষেত্রের গণ্ডি ছাড়িয়ে বিভিন্ন ধরনের কাজ অন্তর্ভুক্ত করে। এই benchmark-এ একটি অনলাইন প্ল্যাটফর্ম রয়েছে যেখানে লিডারবোর্ড (রেকর্ড টেবিল) আছে, যা মডেলগুলোর মধ্যে বস্তুনিষ্ঠ তুলনা নিশ্চিত করে এবং পরীক্ষার তথ্যের সাথে মিলিয়ে নেওয়া ঠেকায়, কারণ কিছু পরীক্ষার প্রকৃত লেবেল প্রকাশ করা হয় না এবং সেগুলো শুধুমাত্র মূল্যায়ন সার্ভারের মাধ্যমে পাওয়া যায়। ধারণা করা হয় যে উচ্চ ফলাফল অর্জনের জন্য একটি মডেলকে সার্বজনীন ভাষিক উপস্থাপনা বের করতে এবং বিভিন্ন ধরনের কাজের মধ্যে কার্যকরভাবে জ্ঞান স্থানান্তর করতে সক্ষম হতে হবে।
Benchmark-এর গঠন ও কাজসমূহ
GLUE benchmark নয়টি ভিন্ন ভাষা বোঝার কাজকে একত্রিত করে, যা ইতোমধ্যে বিদ্যমান এবং AI-এর জন্য কঠিন dataset-এর উপর ভিত্তি করে তৈরি। সবগুলো কাজ একটি বাক্য বা বাক্যের জোড়ার উপর শ্রেণিবিভাগ বা রিগ্রেশন হিসেবে সংজ্ঞায়িত করা হয়েছে[1]।
- CoLA (Corpus of Linguistic Acceptability) — একটি বাক্যের ব্যাকরণগত গ্রহণযোগ্যতা নির্ধারণের কাজ। গুণমানের মেট্রিক হলো Matthews Correlation Coefficient।
- SST-2 (Stanford Sentiment Treebank) — একটি চলচ্চিত্র পর্যালোচনার অনুভূতি (ইতিবাচক/নেতিবাচক) নির্ধারণের কাজ। মেট্রিক হলো সঠিকতা (accuracy)।
- MRPC (Microsoft Research Paraphrase Corpus) — সংবাদ উৎস থেকে নেওয়া বাক্যের জোড়ায় প্যারাফ্রেজ শনাক্ত করার কাজ। মেট্রিক হলো সঠিকতা এবং F1-score।
- QQP (Quora Question Pairs) — Quora কমিউনিটির প্রশ্নের মধ্যে ডুপ্লিকেট নির্ধারণের কাজ। মেট্রিক হলো সঠিকতা এবং F1-score।
- STS-B (Semantic Textual Similarity Benchmark) — দুটি বাক্যের অর্থগত তুলনার কাজ। মডেলকে ১ থেকে ৫ স্কেলে অর্থগত নৈকট্যের মাত্রা পূর্বানুমান করতে হয়। মেট্রিক হলো Pearson এবং Spearman correlation coefficient।
- MNLI (Multi-Genre Natural Language Inference) — বহু-ধারার উৎস থেকে নেওয়া বাক্যের জোড়ায় পাঠ্য অনুসরণ চেনার কাজ (অনুমান, বৈপরীত্য, নিরপেক্ষতা)। ফলাফল মিলে যাওয়া (matched) এবং না মিলে যাওয়া (mismatched) উপ-সেটে আলাদাভাবে মূল্যায়ন করা হয়।
- QNLI (Question Natural Language Inference) — SQuAD dataset রূপান্তর করে তৈরি করা একটি কাজ। অনুচ্ছেদ থেকে নেওয়া কোনো বাক্যে নির্দিষ্ট প্রশ্নের উত্তর আছে কিনা তা নির্ধারণ করতে হয়।
- RTE (Recognizing Textual Entailment) — পাঠ্য অনুসরণের উপর একটি সমন্বিত dataset, যা বেশ কয়েকটি ছোট সংকলন একত্রিত করে। কাজ হলো বাক্যের মধ্যকার সম্পর্ককে দ্বিমাত্রিকভাবে শ্রেণিবদ্ধ করা।
- WNLI (Winograd NLI) — NLI ফরম্যাটে অভিযোজিত Winograd schema-র পরিবর্তিত সংস্করণ। অ্যানাফোরা সমাধানের কাজ: সিস্টেমকে একটি দ্ব্যর্থবোধক সর্বনামসহ বাক্য দেওয়া হয় এবং দুটি বস্তুর মধ্যে কোনটির সাথে এটি সম্পর্কিত তা নির্দেশ করতে হয়।
মূল্যায়ন পদ্ধতি
GLUE-এ মূল্যায়নের জন্য গবেষকরা তাদের মডেলের পূর্বানুমান একটি বিশেষ সার্ভারে পাঠান, এরপর প্রতিটি কাজের মেট্রিক এবং সামগ্রিক স্কোরের স্বয়ংক্রিয় হিসাব পান।
- GLUE-score — চূড়ান্ত সূচক, যা নয়টি প্রধান কাজের ফলাফলের গড় হিসেবে গণনা করা হয়।
- লিডারবোর্ড — একটি সর্বজনীন টেবিল, যা বর্তমান পরিস্থিতি প্রতিফলিত করে এবং দেখায় কোন মডেলগুলো NLU কাজে ভালো করছে। গোপন পরীক্ষা সেটের ব্যবহার ন্যায্য তুলনা নিশ্চিত করে।
- ডায়াগনস্টিক সেট — বিশেষজ্ঞদের দ্বারা হাতে অ্যানোটেট করা ১১০০টি উদাহরণের একটি বিশেষ সেট, যা সূক্ষ্ম ভাষাগত বিশ্লেষণের জন্য তৈরি। এটি র্যাঙ্কিংকে প্রভাবিত করে না, বরং গুণগত বিশ্লেষণের হাতিয়ার হিসেবে কাজ করে — মডেল কোন ভাষিক ঘটনাগুলো (শব্দার্থিক অর্থ, যুক্তি, সাধারণ জ্ঞান) চিনতে পারে এবং কোনগুলোতে অসুবিধায় পড়ে তা পরীক্ষা করার জন্য[1]।
শিল্পে ফলাফল ও প্রভাব
২০১৮ সালে GLUE চালু করার সময় সেই মুহূর্তের সেরা মডেলগুলো (যেমন ELMo-সহ BiLSTM) সামগ্রিকভাবে প্রায় ৭০ পয়েন্ট অর্জন করেছিল (০–১০০ স্কেলে), যা মানব স্তরের (প্রায় ৮৭ পয়েন্ট) তুলনায় উল্লেখযোগ্যভাবে কম ছিল[2]।
GLUE এবং উন্মুক্ত লিডারবোর্ডের আবির্ভাব NLP-তে transfer learning-এর ক্ষেত্রে দ্রুত অগ্রগতিকে উৎসাহিত করেছিল।
- ২০১৯ সালের মে মাসের মধ্যে, এক বছরেরও কম সময়ে, transformer-ভিত্তিক মডেলের নতুন প্রজন্ম (প্রথমত BERT) state-of-the-art মানদণ্ড ৮৩.৯ পয়েন্টে নিয়ে যায়।
- ২০১৯ সালের দ্বিতীয়ার্ধে GLUE benchmark কার্যত «পার হয়ে যায়»: সেরা সিস্টেমগুলো মানব স্তরের একদম কাছাকাছি পৌঁছে যায় এবং কিছু কাজে তা ছাড়িয়েও যায়[3]।
GLUE ভাষা বোঝার মডেল উন্নয়নে একক রেফারেন্স পয়েন্ট হিসেবে বিশাল ভূমিকা পালন করেছে। এর মাধ্যমে গবেষকরা জটিল কাজের সংকলনে বিভিন্ন আর্কিটেকচার সরাসরি তুলনা করতে, পদ্ধতিগুলোর শক্তি ও দুর্বলতা চিহ্নিত করতে এবং সর্বজনীন লিডারবোর্ডের মাধ্যমে দ্রুত অর্জন ভাগ করে নিতে পেরেছেন।
SuperGLUE: পরবর্তী উন্নয়ন
GLUE-এর দ্রুত সাফল্যের ফলে মাত্র এক বছরের মধ্যে একই লেখক দল Facebook AI-এর সহকর্মীদের সাথে মিলে SuperGLUE নামে একটি নতুন, আরও কঠিন সংকলন উপস্থাপন করেন[4]।
SuperGLUE ২০১৯ সালের শেষে একটি «আরও আঁটোসাঁটো» (stickier) পরীক্ষা সেট হিসেবে ঘোষণা করা হয়েছিল, যার লক্ষ্য ছিল আধুনিক মডেল ও মানুষের সক্ষমতার মধ্যে আবার একটি ব্যবধান তৈরি করা। এতে ভাষার আরও গভীর বোঝাপড়া দাবি করে এমন আটটি কাজ অন্তর্ভুক্ত করা হয়েছিল, এবং অংশগ্রহণকারীদের জন্য হাতিয়ার ও নিয়মকানুনও উন্নত করা হয়েছিল। যদিও GLUE একটি মৌলিক পরীক্ষা হিসেবে ব্যবহৃত হতে থাকে, প্রতিযোগিতামূলক উন্নয়নের মূল মনোযোগ SuperGLUE এবং অন্যান্য আরও বিশেষায়িত benchmark-এ সরে গেছে।
ওয়েবলিংক
- GLUE Benchmark-এর অফিসিয়াল সাইট
- Papers With Code-এ মডেলের ফলাফলসহ GLUE পাতা
সাহিত্য
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
তথ্যসূত্র
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [১]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [২]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [৩]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [৪]