---
title: "SuperGLUE (benchmark) (BN)"
source: "https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)"
wiki: "systems-analysis.info/int"
article: "SuperGLUE_(benchmark)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 6998
wiki_created_at: 2026-09-07T00:14:21Z
wiki_modified_at: 2026-09-07T00:14:21Z
downloaded_at: 2026-09-07T23:16:48Z
---

# SuperGLUE (benchmark) (BN)

**SuperGLUE** — এটি একটি ব্যাপক **benchmark** (পরীক্ষামূলক কার্যের সমষ্টি) যা প্রাকৃতিক ভাষা প্রক্রিয়াকরণ ব্যবস্থা, বিশেষত **বৃহৎ ভাষা মডেল** (Large Language Model, LLM)-এর মূল্যায়নের জন্য তৈরি<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এটি ২০১৯ সালে নিউ ইয়র্ক বিশ্ববিদ্যালয়ের অ্যালেক্স ওয়াং-এর নেতৃত্বে একটি গবেষক দল Facebook AI Research এবং অন্যান্য প্রতিষ্ঠানের সহযোগিতায় উপস্থাপন করেছিল<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।

SuperGLUE তৈরির কারণ ছিল এই যে, ২০১৯ সালের মাঝামাঝি নাগাদ পূর্ববর্তী benchmark GLUE আধুনিক মডেলগুলোর কাছে একটি "সহজ কাজ" হয়ে পড়েছিল: GLUE-তে সেরা মডেলগুলোর সমষ্টিগত স্কোর ৮৮.৪-এ পৌঁছে মানুষের গড় স্তর (৮৭.১) ছাড়িয়ে গিয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। ফলে আরও অগ্রগতির সুযোগ সংকুচিত হয়ে পড়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এর প্রতিক্রিয়ায় লেখকরা SuperGLUE তৈরি করেন একটি কঠিনতর বিকল্প হিসেবে, যা মডেলগুলোর ভাষা বোঝার ক্ষমতার আরও কঠোর পরীক্ষা নিশ্চিত করতে সক্ষম<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। SuperGLUE-এর লক্ষ্য হলো ইংরেজি ভাষার সাধারণ বোঝাপড়ার ক্ষেত্রে অগ্রগতির একটি নিরপেক্ষ এবং সহজে "শেখানো" যায় না এমন পরিমাপক প্রদান করা<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। আশা করা হয়েছিল যে SuperGLUE-তে উল্লেখযোগ্য উন্নতির জন্য Machine Learning পদ্ধতিতে সত্যিকারের উদ্ভাবন প্রয়োজন হবে — যেমন ছোট নমুনায় আরও দক্ষ প্রশিক্ষণ, মাল্টি-টাস্ক এবং স্ব-তত্ত্বাবধায়িত শেখার পদ্ধতি<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। অন্যভাবে বলতে গেলে, SuperGLUE-তে এমন কাজ অন্তর্ভুক্ত করা হয়েছে যা মানুষের কাছে সহজ কিন্তু কৃত্রিম বুদ্ধিমত্তার জন্য কঠিন<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>, যাতে সত্যিকারের গভীর ভাষা বোঝাপড়াসম্পন্ন মডেল তৈরিতে উৎসাহ দেওয়া যায়।

## GLUE থেকে বৈশিষ্ট্য ও পার্থক্য

SuperGLUE মূলত GLUE-এর ফরম্যাট অনুসরণ করে — এটি কার্যের সমষ্টির উপর ভিত্তি করে একটি একক **সমন্বিত মান সূচক**, একটি সর্বজনীন **লিডারবোর্ড** এবং মডেল বিশ্লেষণের জন্য একটি **টুলকিট** প্রদান করে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। তবে SuperGLUE তার পূর্বসূরির তুলনায় বেশ কিছু উন্নতি ও নতুনত্ব নিয়ে এসেছে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>:

- **আরও কঠিন কাজ**: SuperGLUE-তে **আটটি সবচেয়ে কঠিন কাজ** বাছাই করা হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এর মধ্যে দুটি GLUE থেকে উত্তরাধিকারসূত্রে পাওয়া (সেখানকার সবচেয়ে কঠিন কাজগুলোর মধ্যে থেকে), বাকিগুলো আধুনিক NLP মডেলগুলোর জন্য কঠিন হওয়ার ভিত্তিতে নতুন প্রার্থীদের মধ্য থেকে বাছাই করা হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এইভাবে, benchmark-টি বোঝাপড়ার সেই দিকগুলোতে মনোযোগ দেয় যেখানে মডেলগুলো আগে সবচেয়ে খারাপ ফলাফল দেখিয়েছে।
- **ফরম্যাটের বৈচিত্র্য**: GLUE-তে সব কাজ যদি বাক্য বা বাক্য-জোড়ার শ্রেণিবিন্যাসে সীমাবদ্ধ থাকত, তাহলে SuperGLUE আরও **বিস্তৃত ফরম্যাটের পরিসর** অন্তর্ভুক্ত করে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। শ্রেণিবিন্যাসের পাশাপাশি **কো-রেফারেন্স সমাধান** এবং **প্রশ্নোত্তর** কার্য যোগ করা হয়েছে, যার জন্য মডেলকে সংযুক্ত পাঠ বুঝতে এবং **যৌক্তিক অনুমান** করতে হয়<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।
- **সব কাজে মানব মূল্যায়ন**: প্রতিটি কাজের জন্য SuperGLUE-তে **মানব কর্মক্ষমতার একটি মানদণ্ড স্তর** (অ-বিশেষজ্ঞ) গণনা করা হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>, যা নিশ্চিত করে যে benchmark চালু হওয়ার সময় BERT-এর মতো শক্তিশালী মডেলগুলোও মানুষের তুলনায় উল্লেখযোগ্যভাবে পিছিয়ে ছিল<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। **মানব মানদণ্ড** (~৯০% সামগ্রিকভাবে) থাকায় মডেলের বৃদ্ধির "সুযোগ" নিশ্চিত হয় এবং এটি লক্ষ্যমাত্রা হিসেবে কাজ করে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।
- **স্বচ্ছ নিয়ম ও সরঞ্জাম**: লিডারবোর্ডে ফলাফল পোস্ট করার নিয়মগুলো পুনর্বিবেচনা করা হয়েছে (ন্যায্য তুলনা নিশ্চিত করতে এবং dataset লেখকদের অবদান উল্লেখ করতে)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এছাড়াও SuperGLUE ডেটায় মডেলের fine-tuning এবং মাল্টি-টাস্ক প্রশিক্ষণের সুবিধার জন্য একটি নতুন উন্মুক্ত কোড টুলকিট প্রকাশিত হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।

একত্রে এই পদক্ষেপগুলো SuperGLUE-কে মডেলগুলোর **সাধারণীকৃত ভাষা দক্ষতার** একটি আরও নির্ভরযোগ্য পরীক্ষায় পরিণত করে, যা পূর্বের GLUE-এর নির্দিষ্ট ফরম্যাটের সাথে সংকীর্ণ প্রতারণা বা খাপ খাওয়ানোর মাধ্যমে উচ্চ ফলাফল অর্জনের সুযোগ দেয় না<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।

## SuperGLUE-এর কার্য সমষ্টি

SuperGLUE **আটটি কার্য** নিয়ে গঠিত, যা পাঠ বোঝাপড়ার বিভিন্ন দিক অন্তর্ভুক্ত করে।

- **BoolQ** (Boolean Questions): **প্রশ্নোত্তর (QA)** ধরনের একটি কার্য, যেখানে প্রতিটি উদাহরণে একটি সংক্ষিপ্ত পাঠ (উইকিপিডিয়া থেকে একটি অনুচ্ছেদ) এবং একটি প্রশ্ন দেওয়া হয় যার উত্তর "হ্যাঁ" বা "না" দিতে হয়<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। প্রশ্নগুলো ব্যবহারকারীদের দ্বারা তৈরি (Google অনুসন্ধান প্রশ্ন থেকে) এবং পাঠ থেকে স্পষ্ট বা অন্তর্নিহিত তথ্য বের করার প্রয়োজন হয়; মান পরিমাপক হলো সঠিক উত্তরের হার (accuracy)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।
- **CB** (CommitmentBank): তিনটি শ্রেণি সহ **যৌক্তিক অনুসরণ** (textual entailment) কার্য<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। Dataset-টি জটিল যৌগিক বাক্য সম্বলিত সংক্ষিপ্ত পাঠ নিয়ে গঠিত; নির্ধারণ করতে হয় যে পাঠের লেখক অন্তর্ভুক্ত বিবৃতির সত্যতার প্রতি কতটুকু **প্রতিশ্রুতিবদ্ধ**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। মূলত এটি পরীক্ষা করে যে প্রদত্ত প্রসঙ্গ থেকে দাবিটি অনুসরণ করে কিনা। ছোট নমুনার আকার (প্রায় ২৫০টি উদাহরণ) এবং শ্রেণির ভারসাম্যহীনতার কারণে কার্যটি কঠিন; মান নির্ণয় করা হয় নির্ভুলতা এবং শ্রেণি অনুযায়ী গড় F1-মাপ দিয়ে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।
- **COPA** (Choice of Plausible Alternatives): **কারণ-ফলাফল যুক্তি** বিষয়ক কার্য<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। মডেলকে একটি পূর্বশর্ত (একটি বাক্য) দেওয়া হয় এবং দুটি বিকল্প থেকে সঠিক কারণ বা ফলাফল বেছে নিতে হয়<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। COPA-এর সমস্ত উদাহরণ হাতে তৈরি এবং কারণ-ফলাফল সম্পর্ক নির্ধারণের জন্য **সাধারণ জ্ঞান** প্রয়োজন। বিষয়বস্তু ব্লগ এবং বিশেষায়িত বিশ্বকোষের পরিস্থিতি অন্তর্ভুক্ত করে; মাপক হলো নির্ভুলতা (সঠিক পছন্দের হার)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। উদাহরণ: "শিশুটি রোগ থেকে প্রতিরোধ ক্ষমতা অর্জন করেছে" বাক্যটি এবং "এর কারণ কী?" প্রশ্ন দেওয়া হলে — মানুষ তৎক্ষণাৎ বুঝতে পারে যে সঠিক উত্তর "সে টিকা পেয়েছিল", তবে মডেলকে কার্যকারণ সম্পর্ক অনুমান করতে হয়<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।
- **MultiRC** (Multi-Sentence Reading Comprehension): একাধিক পছন্দের উপাদান সহ **বহু-বাক্যিক পাঠ বোঝাপড়া** কার্য<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। মডেল একটি পাঠের অনুচ্ছেদ, অনুচ্ছেদের বিষয়বস্তু সম্পর্কিত একটি প্রশ্ন এবং সম্ভাব্য উত্তরের একটি তালিকা পায়; নির্ধারণ করতে হয় কোন উত্তরগুলো সঠিক (প্রতিটি প্রশ্নে একাধিক সঠিক উত্তর থাকতে পারে)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। বিশেষত্ব: প্রশ্নের উত্তর দিতে সাধারণত পাঠের একাধিক বাক্য থেকে তথ্য একত্রিত করার প্রয়োজন হয়, যা মডেলের **তথ্য সংযুক্ত করার** ক্ষমতা পরীক্ষা করে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। মান পরিমাপ করা হয় দুটি মাপকে: উত্তর-ভিত্তিক F1 (আংশিক সঠিক সেট বিবেচনা করে) এবং Exact Match — যে প্রশ্নগুলোর সম্পূর্ণ সঠিক উত্তর সেট দেওয়া হয়েছে তার হার<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।
- **ReCoRD** (Reading Comprehension with Commonsense Reasoning Dataset): **জ্ঞান ব্যবহার সহ পাঠ বোঝাপড়া** কার্য<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এটি একটি পরিবর্তিত Cloze-পরীক্ষা: একটি সংবাদ পাঠ (CNN/Daily Mail নিবন্ধ) এবং একটি সত্তা শব্দ বাদ দেওয়া বাক্য দেওয়া হয়; মডেলকে পাঠ থেকে কোন সত্তাটি শূন্যস্থান পূরণ করে তা বেছে নিতে হবে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। উত্তরের বিকল্প হিসেবে নিবন্ধে উল্লিখিত সমস্ত সত্তা ব্যবহার করা হয়, যা মূলত একই হতে পারে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। সফল সমাধানের জন্য প্রসঙ্গ বোঝা এবং সাধারণ জ্ঞান প্রয়োজন। মাপক হলো সর্বোচ্চ token-level F1 এবং Exact Match (সঠিক মিল) পূর্বাভাসিত উত্তরের জন্য<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>।
- **RTE** (Recognizing Textual Entailment): **পাঠ্য অনুসরণ** (entailment বনাম not entailment) বিষয়ক বাইনারি শ্রেণিবিন্যাস কার্য<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। Dataset-টি পাঠ্য অনুমান স্বীকৃতি সংক্রান্ত একাধিক প্রতিযোগিতার উদাহরণ একত্রিত করে (RTE 1-5 সিরিজ)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। প্রতিটি কাজে পাঠ্য খণ্ডের একটি জোড়া (premise-hypothesis) থাকে; মডেলকে নির্ধারণ করতে হয় যে পাঠ থেকে অনুমান অনুসরণ করে কিনা। অনেক বড় dataset-এর বিপরীতে, RTE বেশ ছোট (প্রায় ২,৫০০ প্রশিক্ষণ উদাহরণ), কিন্তু transfer learning থেকে উল্লেখযোগ্য সুবিধা দেখিয়েছে: নির্ভুলতা ~৫৬% (এলোমেলো অনুমানের স্তর) থেকে BERT-এর মতো মডেলের আবির্ভাবের সাথে ~৮৬%-এ উন্নীত হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। তবুও, SuperGLUE চালু হওয়ার সময় মডেলগুলোর নির্ভুলতা মানুষের তুলনায় প্রায় ৮ শতাংশ পয়েন্ট পিছিয়ে ছিল<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>, তাই RTE-কে মানব স্তরে পৌঁছানোর ব্যবধান বজায় রাখা একটি কাজ হিসেবে অন্তর্ভুক্ত করা হয়েছিল।
- **WiC** (Word-in-Context): প্রসঙ্গে **শব্দের অর্থ দ্ব্যর্থতা নিরসন** (WSD) কার্য<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। দুটি স্বাধীন বাক্য দেওয়া হয়, যার প্রতিটিতে একই বহুঅর্থী শব্দ রয়েছে; নির্ধারণ করতে হয় যে শব্দটি উভয় ক্ষেত্রে **একই অর্থে** ব্যবহৃত হয়েছে কিনা<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। ডেটা অভিধান উৎস থেকে নেওয়া হয়েছে (WordNet, VerbNet, Wiktionary), তাই এটি বিস্তৃত শব্দ ও অর্থ অন্তর্ভুক্ত করে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। কাজটি বাইনারি শ্রেণিবিন্যাস হিসেবে আনুষ্ঠানিকরূপ দেওয়া হয়েছে এবং সঠিক উত্তরের হার দ্বারা মূল্যায়ন করা হয়। WiC মডেলের কাছ থেকে সূক্ষ্ম অর্থগত পার্থক্য বোঝার দাবি রাখে, মূলত **শাব্দিক অর্থবিদ্যা** পরীক্ষা করে।
- **WSC** (Winograd Schema Challenge): **সাধারণ জ্ঞান ব্যবহার করে কো-রেফারেন্স সমাধান** কার্য<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। প্রতিটি কাজে একটি সর্বনাম সম্বলিত একটি বাক্য এবং সেই একই বাক্য থেকে দুটি সত্তার (বিশেষ্য) একটি তালিকা থাকে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। নির্ধারণ করতে হয় যে প্রদত্ত সর্বনামটি প্রস্তাবিত বিশেষ্যগুলোর কোনটিকে নির্দেশ করে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। একটি ক্লাসিক Winograd বাক্যের উদাহরণ: "ট্রফিটি স্যুটকেসে ঢুকল না কারণ এটি খুব ছোট ছিল" — মানুষ বোঝে যে "এটি" স্যুটকেসকে নির্দেশ করে (স্যুটকেসটি খুব ছোট ছিল)। এই ধরনের উদাহরণ **দৈনন্দিন জ্ঞান ও প্রসঙ্গ** ছাড়া সমাধান করা অসম্ভব<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। GLUE-তে এই কাজের একটি সরলীকৃত সংস্করণ (WNLI) ইতিমধ্যে ছিল, কিন্তু মডেলগুলো দীর্ঘদিন এমনকি এলোমেলো অনুমানের স্তরও ছাড়াতে পারেনি<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। শুধুমাত্র বিশেষ কৌশল, যেমন অনুরূপ উদাহরণ সহ বাহ্যিক ডেটা যোগ করা, ২০১৯ সালের মধ্যে WSC-তে মডেলের মান ~৯০%-এ নিয়ে গেছে<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। তবে মানুষ WSC কাজগুলো প্রায় কোনো ভুল ছাড়াই সমাধান করে (~৯৬-১০০% সঠিক উত্তর)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। SuperGLUE-তে বাইনারি শ্রেণিবিন্যাস ফরম্যাটে WSC-এর মূল সংস্করণ অন্তর্ভুক্ত করা হয়েছে (প্রতিটি "সর্বনাম-সত্তা" জোড়ার জন্য মডেল উত্তর দেয় যে তারা রেফারেন্সে মিলে কিনা)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এই কাজটি সাধারণ জ্ঞান-ভিত্তিক যুক্তির প্রয়োজনীয় সবচেয়ে কঠিন পরীক্ষাগুলোর মধ্যে একটি হিসেবে রয়ে গেছে।

SuperGLUE-এর সমস্ত পরীক্ষার **বন্ধ পরীক্ষা সেট** রয়েছে যার উত্তর ডেভেলপারদের কাছে অজানা<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। মডেলগুলো একটি সার্ভারে তাদের পূর্বাভাস পাঠায়, যেখানে একটি সামগ্রিক স্কোর গণনা করা হয় — কাজ অনুযায়ী গড় নির্ভুলতা (একাধিক মাপক সহ কাজের জন্য প্রথমে অভ্যন্তরীণ মাপক গড় করা হয়)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এই একক **SuperGLUE score** সাধারণ ভাষা বুদ্ধিমত্তার স্তর অনুযায়ী মডেলগুলোর তুলনা সহজ করে।

## মডেলের ফলাফল ও অগ্রগতি

SuperGLUE চালু হওয়ার সময় লেখকরা একটি শক্তিশালী বেসলাইন মডেল (উন্নত BERT) এর ফলাফল মানদণ্ড হিসেবে উপস্থাপন করেছিলেন — এবং সেগুলো সব কাজে মানব ফলাফলের চেয়ে **উল্লেখযোগ্যভাবে কম** ছিল<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। গড়ে সেই সময়ের সেরা মডেলটি সমন্বিত মাপকে মানুষের চেয়ে প্রায় **২০ পয়েন্ট কম** পেয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। পৃথক কাজে ব্যবধান বিশেষত বড় ছিল: উদাহরণস্বরূপ, WSC কাজে মডেল মানুষের ১০০%-এর বিপরীতে মাত্র ~৬৫% নির্ভুলতায় পৌঁছেছিল (~৩৫ পয়েন্টের ব্যবধান)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এমনকি "সহজ" দেখতে কাজগুলোতেও (BoolQ, CB, RTE, WiC) স্বয়ংক্রিয় সিস্টেমগুলো মানব স্তর থেকে ~১০ পয়েন্ট পিছিয়ে ছিল<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। এই পার্থক্যগুলো নিশ্চিত করেছে যে SuperGLUE সত্যিই বর্তমান প্রযুক্তির কাছে একটি গুরুতর চ্যালেঞ্জ উপস্থাপন করে এবং তুচ্ছভাবে সমাধান করা যায় না।

তবুও, SuperGLUE আবির্ভাবের মাত্র কয়েক মাস পরেই **দ্রুত অগ্রগতি** শুরু হয়<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup>। ২০১৯ সালের শেষে Google-এর গবেষকরা ১১ বিলিয়ন প্যারামিটার সহ **T5** (Text-To-Text Transfer Transformer) মডেল উপস্থাপন করেন, যা ৮৮.৯-এর সামগ্রিক ফলাফল অর্জন করে মানব স্তর ~৮৯.৮-এর অত্যন্ত কাছে পৌঁছে যায়<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-reddit-t5-2)</sup>। কার্যত, T5 SuperGLUE-তে আগের রেকর্ড একসাথে ৪.৩ পয়েন্ট উন্নত করেছে এবং ত্রুটির হার প্রায় এক তৃতীয়াংশ হ্রাস করেছে<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-reddit-t5-2)</sup>, মানব স্কোরের সাথে মাত্র **০.৯ পয়েন্টের** ব্যবধান রেখে<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-reddit-t5-2)</sup>। ডেভেলপাররা উল্লেখ করেছিলেন যে SuperGLUE ইচ্ছাকৃতভাবে এমনভাবে তৈরি করা হয়েছে যাতে মানুষের কাছে কাজগুলো সহজ হয়, তাই মডেলের ~৮৯% স্তরে পৌঁছানো একটি গুরুত্বপূর্ণ মাইলফলক হয়ে দাঁড়ায়<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-reddit-t5-2)</sup>।

**গড় মানব মানের বাইরে যাওয়া**র ক্ষেত্রে প্রথম সফল মডেলটি ছিল Microsoft-এর **DeBERTa** (Decoding-enhanced BERT with disentangled attention)<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-deberta-3)</sup>। ২০২১ সালের জানুয়ারিতে গবেষকরা জানান যে ১.৫ বিলিয়ন প্যারামিটার সহ DeBERTa সংস্করণটি **৮৯.৯ পয়েন্ট** পেয়েছে, যা মানব মানদণ্ড ৮৯.৮-এর সামান্য উপরে<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-deberta-3)</sup>। এটি ছিল **প্রথমবার** যে একটি একক মডেল SuperGLUE মাপকে মানুষকে ছাড়িয়ে গেছে<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-deberta-3)</sup>। এছাড়াও, বেশ কিছু DeBERTa মডেলের ensemble রেকর্ড ~৯০.৩ পয়েন্টে নিয়ে গেছে<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-deberta-3)</sup>। DeBERTa মডেলটি আগের শীর্ষস্থানধারী (Google T5) কে প্রায় ০.৬% ছাড়িয়ে Transformer আর্কিটেকচারে নতুন ধারণার কার্যকারিতা প্রদর্শন করেছে (শব্দের বিষয়বস্তু এবং অবস্থানের আলাদা উপস্থাপনা, উন্নত মাস্ক ডিকোডার ইত্যাদি)<sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-syncedreview-deberta-4)</sup>।

অগ্রগতি অর্জিত সাফল্যে থামেনি: ভাষা মডেলগুলোর আকার ও জটিলতা বৃদ্ধির সাথে সাথে SuperGLUE-এর ফলাফল আরও উন্নত হতে থাকে<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-scaling-5)</sup>। ২০২১ সালের শেষের দিকে লিডারবোর্ডের শীর্ষে ছিল Microsoft-এর **T-NLRv5** (Microsoft Turing NLR পরিবার) মডেল — এটি মানব স্তরের উপরে ব্যবধান আরও বাড়িয়েছে<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-scaling-5)</sup>। GLUE-এর যে কাজগুলো মেশিনের জন্য শেষ পর্যন্ত সমাধান হয়নি (উদাহরণস্বরূপ, NLI-এর সূক্ষ্মতা) এই মডেলটি সেগুলো "বন্ধ" করে দিয়েছে, এমনকি সবচেয়ে কঠিন উপকাজগুলোতেও **মানুষের সাথে পূর্ণ সমতার** অত্যন্ত কাছে পৌঁছেছে<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-scaling-5)</sup>।

২০২২-২০২৩ সালে SuperGLUE-তে মানব স্তরের সীমা বেশ কিছু স্বাধীন বৃহৎ মডেল দ্বারা আত্মবিশ্বাসের সাথে অতিক্রম করা হয়েছে<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-ainavigator-benchmarks-6)</sup>। উদাহরণস্বরূপ, Google-এর **PaLM** মডেল (৫৪০ বিলিয়ন প্যারামিটার) SuperGLUE কাজে fine-tuning করে প্রায় ৯০.৪ পয়েন্ট অর্জন করেছে, এবং OpenAI-এর তৈরি **GPT-4** মডেল এর চেয়েও কিছুটা বেশি ফলাফল দেখিয়েছে<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-ainavigator-benchmarks-6)</sup>। ২০২৩ সালের মাঝামাঝি নাগাদ SuperGLUE-এর লিডার টেবিলে ৯০-এর উপরে (অর্থাৎ গড় মানব স্তর ছাড়িয়ে) ফলাফল সহ বেশ কয়েকটি মডেল ছিল<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-ainavigator-benchmarks-6)</sup>। বলা যায় যে benchmark-টি আধুনিক সিস্টেম দ্বারা **কার্যত সমাধান** হয়ে গেছে<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-ainavigator-benchmarks-6)</sup>: সেরা মডেলগুলোর স্কোর এত বেশি যে বেশিরভাগ অদক্ষ মানুষের ক্ষমতাকে ছাড়িয়ে যায়<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-ainavigator-benchmarks-6)</sup>। এই সাফল্য অল্প সময়ে NLP-তে বিশাল অগ্রগতির প্রমাণ, কিন্তু একই সাথে সর্বশেষ মডেলগুলোর জন্য নতুন, আরও কঠিন পরীক্ষার প্রয়োজনীয়তার দিকে ইঙ্গিত করে<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-ainavigator-benchmarks-6)</sup>। ইতিমধ্যে পরবর্তী benchmark-গুলো আবির্ভূত হচ্ছে (উদাহরণস্বরূপ, MMLU, BIG-Bench ইত্যাদি), যা SuperGLUE-এর কাজের বাইরে আরও বিস্তৃত বোঝাপড়া এবং জ্ঞানের জন্য মডেলগুলো পরীক্ষা করার লক্ষ্যে কাজ করে<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-ainavigator-benchmarks-6)</sup>।

## প্রভাব ও আরও গবেষণা

SuperGLUE এইভাবে ভাষা প্রক্রিয়াকরণে **মূল্যায়ন পদ্ধতির বিকাশের একটি গুরুত্বপূর্ণ ধাপ** হিসেবে প্রতিষ্ঠিত হয়েছে<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-deberta-3)</sup>। উৎসাহী ও বৈজ্ঞানিক মহলে এর ফলাফলগুলো নতুন LLM আর্কিটেকচারের জন্য এক ধরনের "লিটমাস পরীক্ষা" হয়ে উঠেছে: SuperGLUE-তে মানব স্তর অর্জন বা ছাড়িয়ে যাওয়াকে গভীর ভাষা বোঝাপড়াসম্পন্ন একটি অগ্রণী মডেলের চিহ্ন হিসেবে বিবেচনা করা হয়<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-deberta-3)</sup>। এটি বাস্তব প্রয়োগেও প্রতিফলিত হয়েছে — SuperGLUE-তে উচ্চ ফলাফল অর্জনকারী অনেক আধুনিক ভাষা মডেল প্রয়োগিত প্রশ্নোত্তর সিস্টেম, কথোপকথন এজেন্ট, পাঠ সংক্ষেপণ সিস্টেম ইত্যাদির ভিত্তি হয়েছে<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-deberta-3)</sup>। গবেষকরা অ্যালগরিদম fine-tuning ও তুলনা করতে SuperGLUE ব্যবহার করতে থাকেন, যদিও অগ্রণী অবস্থান এখন ধীরে ধীরে কৃত্রিম বুদ্ধিমত্তা মূল্যায়নের নতুন সীমানার দিকে সরে যাচ্ছে।

## সূত্র

- SuperGLUE-এর অফিশিয়াল ওয়েবসাইট
- SuperGLUE মূল নিবন্ধ (NeurIPS)
- DeBERTa মানব স্তর অর্জন সংক্রান্ত Microsoft নিবন্ধ
- Papers With Code-তে SuperGLUE dataset পৃষ্ঠা

## সাহিত্য

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## টীকা

<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-neurips-main-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-reddit-t5-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-deberta-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-syncedreview-deberta-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-microsoft-scaling-5)</sup> <sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_note-ainavigator-benchmarks-6)</sup> \</references\>

1.  <span id="cite_note-neurips-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-neurips-main_1-59)</sup> Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS*. <a href="http://papers.neurips.cc/paper/8589-superglue-a-stickier-benchmark-for-general-purpose-language-understanding-systems.pdf" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-reddit-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-reddit-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-reddit-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-reddit-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-reddit-t5_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-reddit-t5_2-4)</sup> «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit /r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-microsoft-deberta-3">↑ <sup>[3.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-deberta_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-deberta_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-deberta_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-deberta_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-deberta_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-deberta_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-deberta_3-6)</sup> <sup>[3.7](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-deberta_3-7)</sup> «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/microsoft-deberta-surpasses-human-performance-on-the-superglue-benchmark/" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-syncedreview-deberta-4">↑ <sup>[4.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-syncedreview-deberta_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-syncedreview-deberta_4-1)</sup> «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». *Synced Review*. <a href="https://syncedreview.com/2021/01/06/microsoft-deberta-tops-human-performance-on-superglue-nlu-benchmark/" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-microsoft-scaling-5">↑ <sup>[5.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-scaling_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-scaling_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-scaling_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-microsoft-scaling_5-3)</sup> «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/efficiently-and-effectively-scaling-up-language-model-pretraining-for-best-language-representation-model-on-glue-and-superglue/" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-ainavigator-benchmarks-6">↑ <sup>[6.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-ainavigator-benchmarks_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-ainavigator-benchmarks_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-ainavigator-benchmarks_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-ainavigator-benchmarks_6-3)</sup> <sup>[6.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-ainavigator-benchmarks_6-4)</sup> <sup>[6.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-ainavigator-benchmarks_6-5)</sup> <sup>[6.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-ainavigator-benchmarks_6-6)</sup> <sup>[6.7](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(BN)#cite_ref-ainavigator-benchmarks_6-7)</sup> «The Ultimate Guide to AI Benchmarks». *The AI Navigator*. <a href="https://www.theainavigator.com/blog/the-ultimate-guide-to-ai-benchmarks/" class="external autonumber" rel="nofollow">[৬]</a></span>
