SuperGLUE (benchmark) (BN)
SuperGLUE — এটি একটি ব্যাপক benchmark (পরীক্ষামূলক কার্যের সমষ্টি) যা প্রাকৃতিক ভাষা প্রক্রিয়াকরণ ব্যবস্থা, বিশেষত বৃহৎ ভাষা মডেল (Large Language Model, LLM)-এর মূল্যায়নের জন্য তৈরি[1]। এটি ২০১৯ সালে নিউ ইয়র্ক বিশ্ববিদ্যালয়ের অ্যালেক্স ওয়াং-এর নেতৃত্বে একটি গবেষক দল Facebook AI Research এবং অন্যান্য প্রতিষ্ঠানের সহযোগিতায় উপস্থাপন করেছিল[1]।
SuperGLUE তৈরির কারণ ছিল এই যে, ২০১৯ সালের মাঝামাঝি নাগাদ পূর্ববর্তী benchmark GLUE আধুনিক মডেলগুলোর কাছে একটি "সহজ কাজ" হয়ে পড়েছিল: GLUE-তে সেরা মডেলগুলোর সমষ্টিগত স্কোর ৮৮.৪-এ পৌঁছে মানুষের গড় স্তর (৮৭.১) ছাড়িয়ে গিয়েছিল[1]। ফলে আরও অগ্রগতির সুযোগ সংকুচিত হয়ে পড়েছিল[1]। এর প্রতিক্রিয়ায় লেখকরা SuperGLUE তৈরি করেন একটি কঠিনতর বিকল্প হিসেবে, যা মডেলগুলোর ভাষা বোঝার ক্ষমতার আরও কঠোর পরীক্ষা নিশ্চিত করতে সক্ষম[1]। SuperGLUE-এর লক্ষ্য হলো ইংরেজি ভাষার সাধারণ বোঝাপড়ার ক্ষেত্রে অগ্রগতির একটি নিরপেক্ষ এবং সহজে "শেখানো" যায় না এমন পরিমাপক প্রদান করা[1]। আশা করা হয়েছিল যে SuperGLUE-তে উল্লেখযোগ্য উন্নতির জন্য Machine Learning পদ্ধতিতে সত্যিকারের উদ্ভাবন প্রয়োজন হবে — যেমন ছোট নমুনায় আরও দক্ষ প্রশিক্ষণ, মাল্টি-টাস্ক এবং স্ব-তত্ত্বাবধায়িত শেখার পদ্ধতি[1]। অন্যভাবে বলতে গেলে, SuperGLUE-তে এমন কাজ অন্তর্ভুক্ত করা হয়েছে যা মানুষের কাছে সহজ কিন্তু কৃত্রিম বুদ্ধিমত্তার জন্য কঠিন[1], যাতে সত্যিকারের গভীর ভাষা বোঝাপড়াসম্পন্ন মডেল তৈরিতে উৎসাহ দেওয়া যায়।
GLUE থেকে বৈশিষ্ট্য ও পার্থক্য
SuperGLUE মূলত GLUE-এর ফরম্যাট অনুসরণ করে — এটি কার্যের সমষ্টির উপর ভিত্তি করে একটি একক সমন্বিত মান সূচক, একটি সর্বজনীন লিডারবোর্ড এবং মডেল বিশ্লেষণের জন্য একটি টুলকিট প্রদান করে[1]। তবে SuperGLUE তার পূর্বসূরির তুলনায় বেশ কিছু উন্নতি ও নতুনত্ব নিয়ে এসেছে[1]:
- আরও কঠিন কাজ: SuperGLUE-তে আটটি সবচেয়ে কঠিন কাজ বাছাই করা হয়েছে[1]। এর মধ্যে দুটি GLUE থেকে উত্তরাধিকারসূত্রে পাওয়া (সেখানকার সবচেয়ে কঠিন কাজগুলোর মধ্যে থেকে), বাকিগুলো আধুনিক NLP মডেলগুলোর জন্য কঠিন হওয়ার ভিত্তিতে নতুন প্রার্থীদের মধ্য থেকে বাছাই করা হয়েছে[1]। এইভাবে, benchmark-টি বোঝাপড়ার সেই দিকগুলোতে মনোযোগ দেয় যেখানে মডেলগুলো আগে সবচেয়ে খারাপ ফলাফল দেখিয়েছে।
- ফরম্যাটের বৈচিত্র্য: GLUE-তে সব কাজ যদি বাক্য বা বাক্য-জোড়ার শ্রেণিবিন্যাসে সীমাবদ্ধ থাকত, তাহলে SuperGLUE আরও বিস্তৃত ফরম্যাটের পরিসর অন্তর্ভুক্ত করে[1]। শ্রেণিবিন্যাসের পাশাপাশি কো-রেফারেন্স সমাধান এবং প্রশ্নোত্তর কার্য যোগ করা হয়েছে, যার জন্য মডেলকে সংযুক্ত পাঠ বুঝতে এবং যৌক্তিক অনুমান করতে হয়[1]।
- সব কাজে মানব মূল্যায়ন: প্রতিটি কাজের জন্য SuperGLUE-তে মানব কর্মক্ষমতার একটি মানদণ্ড স্তর (অ-বিশেষজ্ঞ) গণনা করা হয়েছে[1], যা নিশ্চিত করে যে benchmark চালু হওয়ার সময় BERT-এর মতো শক্তিশালী মডেলগুলোও মানুষের তুলনায় উল্লেখযোগ্যভাবে পিছিয়ে ছিল[1]। মানব মানদণ্ড (~৯০% সামগ্রিকভাবে) থাকায় মডেলের বৃদ্ধির "সুযোগ" নিশ্চিত হয় এবং এটি লক্ষ্যমাত্রা হিসেবে কাজ করে[1]।
- স্বচ্ছ নিয়ম ও সরঞ্জাম: লিডারবোর্ডে ফলাফল পোস্ট করার নিয়মগুলো পুনর্বিবেচনা করা হয়েছে (ন্যায্য তুলনা নিশ্চিত করতে এবং dataset লেখকদের অবদান উল্লেখ করতে)[1]। এছাড়াও SuperGLUE ডেটায় মডেলের fine-tuning এবং মাল্টি-টাস্ক প্রশিক্ষণের সুবিধার জন্য একটি নতুন উন্মুক্ত কোড টুলকিট প্রকাশিত হয়েছে[1]।
একত্রে এই পদক্ষেপগুলো SuperGLUE-কে মডেলগুলোর সাধারণীকৃত ভাষা দক্ষতার একটি আরও নির্ভরযোগ্য পরীক্ষায় পরিণত করে, যা পূর্বের GLUE-এর নির্দিষ্ট ফরম্যাটের সাথে সংকীর্ণ প্রতারণা বা খাপ খাওয়ানোর মাধ্যমে উচ্চ ফলাফল অর্জনের সুযোগ দেয় না[1]।
SuperGLUE-এর কার্য সমষ্টি
SuperGLUE আটটি কার্য নিয়ে গঠিত, যা পাঠ বোঝাপড়ার বিভিন্ন দিক অন্তর্ভুক্ত করে।
- BoolQ (Boolean Questions): প্রশ্নোত্তর (QA) ধরনের একটি কার্য, যেখানে প্রতিটি উদাহরণে একটি সংক্ষিপ্ত পাঠ (উইকিপিডিয়া থেকে একটি অনুচ্ছেদ) এবং একটি প্রশ্ন দেওয়া হয় যার উত্তর "হ্যাঁ" বা "না" দিতে হয়[1]। প্রশ্নগুলো ব্যবহারকারীদের দ্বারা তৈরি (Google অনুসন্ধান প্রশ্ন থেকে) এবং পাঠ থেকে স্পষ্ট বা অন্তর্নিহিত তথ্য বের করার প্রয়োজন হয়; মান পরিমাপক হলো সঠিক উত্তরের হার (accuracy)[1]।
- CB (CommitmentBank): তিনটি শ্রেণি সহ যৌক্তিক অনুসরণ (textual entailment) কার্য[1]। Dataset-টি জটিল যৌগিক বাক্য সম্বলিত সংক্ষিপ্ত পাঠ নিয়ে গঠিত; নির্ধারণ করতে হয় যে পাঠের লেখক অন্তর্ভুক্ত বিবৃতির সত্যতার প্রতি কতটুকু প্রতিশ্রুতিবদ্ধ[1]। মূলত এটি পরীক্ষা করে যে প্রদত্ত প্রসঙ্গ থেকে দাবিটি অনুসরণ করে কিনা। ছোট নমুনার আকার (প্রায় ২৫০টি উদাহরণ) এবং শ্রেণির ভারসাম্যহীনতার কারণে কার্যটি কঠিন; মান নির্ণয় করা হয় নির্ভুলতা এবং শ্রেণি অনুযায়ী গড় F1-মাপ দিয়ে[1]।
- COPA (Choice of Plausible Alternatives): কারণ-ফলাফল যুক্তি বিষয়ক কার্য[1]। মডেলকে একটি পূর্বশর্ত (একটি বাক্য) দেওয়া হয় এবং দুটি বিকল্প থেকে সঠিক কারণ বা ফলাফল বেছে নিতে হয়[1]। COPA-এর সমস্ত উদাহরণ হাতে তৈরি এবং কারণ-ফলাফল সম্পর্ক নির্ধারণের জন্য সাধারণ জ্ঞান প্রয়োজন। বিষয়বস্তু ব্লগ এবং বিশেষায়িত বিশ্বকোষের পরিস্থিতি অন্তর্ভুক্ত করে; মাপক হলো নির্ভুলতা (সঠিক পছন্দের হার)[1]। উদাহরণ: "শিশুটি রোগ থেকে প্রতিরোধ ক্ষমতা অর্জন করেছে" বাক্যটি এবং "এর কারণ কী?" প্রশ্ন দেওয়া হলে — মানুষ তৎক্ষণাৎ বুঝতে পারে যে সঠিক উত্তর "সে টিকা পেয়েছিল", তবে মডেলকে কার্যকারণ সম্পর্ক অনুমান করতে হয়[1]।
- MultiRC (Multi-Sentence Reading Comprehension): একাধিক পছন্দের উপাদান সহ বহু-বাক্যিক পাঠ বোঝাপড়া কার্য[1]। মডেল একটি পাঠের অনুচ্ছেদ, অনুচ্ছেদের বিষয়বস্তু সম্পর্কিত একটি প্রশ্ন এবং সম্ভাব্য উত্তরের একটি তালিকা পায়; নির্ধারণ করতে হয় কোন উত্তরগুলো সঠিক (প্রতিটি প্রশ্নে একাধিক সঠিক উত্তর থাকতে পারে)[1]। বিশেষত্ব: প্রশ্নের উত্তর দিতে সাধারণত পাঠের একাধিক বাক্য থেকে তথ্য একত্রিত করার প্রয়োজন হয়, যা মডেলের তথ্য সংযুক্ত করার ক্ষমতা পরীক্ষা করে[1]। মান পরিমাপ করা হয় দুটি মাপকে: উত্তর-ভিত্তিক F1 (আংশিক সঠিক সেট বিবেচনা করে) এবং Exact Match — যে প্রশ্নগুলোর সম্পূর্ণ সঠিক উত্তর সেট দেওয়া হয়েছে তার হার[1]।
- ReCoRD (Reading Comprehension with Commonsense Reasoning Dataset): জ্ঞান ব্যবহার সহ পাঠ বোঝাপড়া কার্য[1]। এটি একটি পরিবর্তিত Cloze-পরীক্ষা: একটি সংবাদ পাঠ (CNN/Daily Mail নিবন্ধ) এবং একটি সত্তা শব্দ বাদ দেওয়া বাক্য দেওয়া হয়; মডেলকে পাঠ থেকে কোন সত্তাটি শূন্যস্থান পূরণ করে তা বেছে নিতে হবে[1]। উত্তরের বিকল্প হিসেবে নিবন্ধে উল্লিখিত সমস্ত সত্তা ব্যবহার করা হয়, যা মূলত একই হতে পারে[1]। সফল সমাধানের জন্য প্রসঙ্গ বোঝা এবং সাধারণ জ্ঞান প্রয়োজন। মাপক হলো সর্বোচ্চ token-level F1 এবং Exact Match (সঠিক মিল) পূর্বাভাসিত উত্তরের জন্য[1]।
- RTE (Recognizing Textual Entailment): পাঠ্য অনুসরণ (entailment বনাম not entailment) বিষয়ক বাইনারি শ্রেণিবিন্যাস কার্য[1]। Dataset-টি পাঠ্য অনুমান স্বীকৃতি সংক্রান্ত একাধিক প্রতিযোগিতার উদাহরণ একত্রিত করে (RTE 1-5 সিরিজ)[1]। প্রতিটি কাজে পাঠ্য খণ্ডের একটি জোড়া (premise-hypothesis) থাকে; মডেলকে নির্ধারণ করতে হয় যে পাঠ থেকে অনুমান অনুসরণ করে কিনা। অনেক বড় dataset-এর বিপরীতে, RTE বেশ ছোট (প্রায় ২,৫০০ প্রশিক্ষণ উদাহরণ), কিন্তু transfer learning থেকে উল্লেখযোগ্য সুবিধা দেখিয়েছে: নির্ভুলতা ~৫৬% (এলোমেলো অনুমানের স্তর) থেকে BERT-এর মতো মডেলের আবির্ভাবের সাথে ~৮৬%-এ উন্নীত হয়েছে[1]। তবুও, SuperGLUE চালু হওয়ার সময় মডেলগুলোর নির্ভুলতা মানুষের তুলনায় প্রায় ৮ শতাংশ পয়েন্ট পিছিয়ে ছিল[1], তাই RTE-কে মানব স্তরে পৌঁছানোর ব্যবধান বজায় রাখা একটি কাজ হিসেবে অন্তর্ভুক্ত করা হয়েছিল।
- WiC (Word-in-Context): প্রসঙ্গে শব্দের অর্থ দ্ব্যর্থতা নিরসন (WSD) কার্য[1]। দুটি স্বাধীন বাক্য দেওয়া হয়, যার প্রতিটিতে একই বহুঅর্থী শব্দ রয়েছে; নির্ধারণ করতে হয় যে শব্দটি উভয় ক্ষেত্রে একই অর্থে ব্যবহৃত হয়েছে কিনা[1]। ডেটা অভিধান উৎস থেকে নেওয়া হয়েছে (WordNet, VerbNet, Wiktionary), তাই এটি বিস্তৃত শব্দ ও অর্থ অন্তর্ভুক্ত করে[1]। কাজটি বাইনারি শ্রেণিবিন্যাস হিসেবে আনুষ্ঠানিকরূপ দেওয়া হয়েছে এবং সঠিক উত্তরের হার দ্বারা মূল্যায়ন করা হয়। WiC মডেলের কাছ থেকে সূক্ষ্ম অর্থগত পার্থক্য বোঝার দাবি রাখে, মূলত শাব্দিক অর্থবিদ্যা পরীক্ষা করে।
- WSC (Winograd Schema Challenge): সাধারণ জ্ঞান ব্যবহার করে কো-রেফারেন্স সমাধান কার্য[1]। প্রতিটি কাজে একটি সর্বনাম সম্বলিত একটি বাক্য এবং সেই একই বাক্য থেকে দুটি সত্তার (বিশেষ্য) একটি তালিকা থাকে[1]। নির্ধারণ করতে হয় যে প্রদত্ত সর্বনামটি প্রস্তাবিত বিশেষ্যগুলোর কোনটিকে নির্দেশ করে[1]। একটি ক্লাসিক Winograd বাক্যের উদাহরণ: "ট্রফিটি স্যুটকেসে ঢুকল না কারণ এটি খুব ছোট ছিল" — মানুষ বোঝে যে "এটি" স্যুটকেসকে নির্দেশ করে (স্যুটকেসটি খুব ছোট ছিল)। এই ধরনের উদাহরণ দৈনন্দিন জ্ঞান ও প্রসঙ্গ ছাড়া সমাধান করা অসম্ভব[1]। GLUE-তে এই কাজের একটি সরলীকৃত সংস্করণ (WNLI) ইতিমধ্যে ছিল, কিন্তু মডেলগুলো দীর্ঘদিন এমনকি এলোমেলো অনুমানের স্তরও ছাড়াতে পারেনি[1]। শুধুমাত্র বিশেষ কৌশল, যেমন অনুরূপ উদাহরণ সহ বাহ্যিক ডেটা যোগ করা, ২০১৯ সালের মধ্যে WSC-তে মডেলের মান ~৯০%-এ নিয়ে গেছে[1]। তবে মানুষ WSC কাজগুলো প্রায় কোনো ভুল ছাড়াই সমাধান করে (~৯৬-১০০% সঠিক উত্তর)[1]। SuperGLUE-তে বাইনারি শ্রেণিবিন্যাস ফরম্যাটে WSC-এর মূল সংস্করণ অন্তর্ভুক্ত করা হয়েছে (প্রতিটি "সর্বনাম-সত্তা" জোড়ার জন্য মডেল উত্তর দেয় যে তারা রেফারেন্সে মিলে কিনা)[1]। এই কাজটি সাধারণ জ্ঞান-ভিত্তিক যুক্তির প্রয়োজনীয় সবচেয়ে কঠিন পরীক্ষাগুলোর মধ্যে একটি হিসেবে রয়ে গেছে।
SuperGLUE-এর সমস্ত পরীক্ষার বন্ধ পরীক্ষা সেট রয়েছে যার উত্তর ডেভেলপারদের কাছে অজানা[1]। মডেলগুলো একটি সার্ভারে তাদের পূর্বাভাস পাঠায়, যেখানে একটি সামগ্রিক স্কোর গণনা করা হয় — কাজ অনুযায়ী গড় নির্ভুলতা (একাধিক মাপক সহ কাজের জন্য প্রথমে অভ্যন্তরীণ মাপক গড় করা হয়)[1]। এই একক SuperGLUE score সাধারণ ভাষা বুদ্ধিমত্তার স্তর অনুযায়ী মডেলগুলোর তুলনা সহজ করে।
মডেলের ফলাফল ও অগ্রগতি
SuperGLUE চালু হওয়ার সময় লেখকরা একটি শক্তিশালী বেসলাইন মডেল (উন্নত BERT) এর ফলাফল মানদণ্ড হিসেবে উপস্থাপন করেছিলেন — এবং সেগুলো সব কাজে মানব ফলাফলের চেয়ে উল্লেখযোগ্যভাবে কম ছিল[1]। গড়ে সেই সময়ের সেরা মডেলটি সমন্বিত মাপকে মানুষের চেয়ে প্রায় ২০ পয়েন্ট কম পেয়েছিল[1]। পৃথক কাজে ব্যবধান বিশেষত বড় ছিল: উদাহরণস্বরূপ, WSC কাজে মডেল মানুষের ১০০%-এর বিপরীতে মাত্র ~৬৫% নির্ভুলতায় পৌঁছেছিল (~৩৫ পয়েন্টের ব্যবধান)[1]। এমনকি "সহজ" দেখতে কাজগুলোতেও (BoolQ, CB, RTE, WiC) স্বয়ংক্রিয় সিস্টেমগুলো মানব স্তর থেকে ~১০ পয়েন্ট পিছিয়ে ছিল[1]। এই পার্থক্যগুলো নিশ্চিত করেছে যে SuperGLUE সত্যিই বর্তমান প্রযুক্তির কাছে একটি গুরুতর চ্যালেঞ্জ উপস্থাপন করে এবং তুচ্ছভাবে সমাধান করা যায় না।
তবুও, SuperGLUE আবির্ভাবের মাত্র কয়েক মাস পরেই দ্রুত অগ্রগতি শুরু হয়[1]। ২০১৯ সালের শেষে Google-এর গবেষকরা ১১ বিলিয়ন প্যারামিটার সহ T5 (Text-To-Text Transfer Transformer) মডেল উপস্থাপন করেন, যা ৮৮.৯-এর সামগ্রিক ফলাফল অর্জন করে মানব স্তর ~৮৯.৮-এর অত্যন্ত কাছে পৌঁছে যায়[2]। কার্যত, T5 SuperGLUE-তে আগের রেকর্ড একসাথে ৪.৩ পয়েন্ট উন্নত করেছে এবং ত্রুটির হার প্রায় এক তৃতীয়াংশ হ্রাস করেছে[2], মানব স্কোরের সাথে মাত্র ০.৯ পয়েন্টের ব্যবধান রেখে[2]। ডেভেলপাররা উল্লেখ করেছিলেন যে SuperGLUE ইচ্ছাকৃতভাবে এমনভাবে তৈরি করা হয়েছে যাতে মানুষের কাছে কাজগুলো সহজ হয়, তাই মডেলের ~৮৯% স্তরে পৌঁছানো একটি গুরুত্বপূর্ণ মাইলফলক হয়ে দাঁড়ায়[2]।
গড় মানব মানের বাইরে যাওয়ার ক্ষেত্রে প্রথম সফল মডেলটি ছিল Microsoft-এর DeBERTa (Decoding-enhanced BERT with disentangled attention)[3]। ২০২১ সালের জানুয়ারিতে গবেষকরা জানান যে ১.৫ বিলিয়ন প্যারামিটার সহ DeBERTa সংস্করণটি ৮৯.৯ পয়েন্ট পেয়েছে, যা মানব মানদণ্ড ৮৯.৮-এর সামান্য উপরে[3]। এটি ছিল প্রথমবার যে একটি একক মডেল SuperGLUE মাপকে মানুষকে ছাড়িয়ে গেছে[3]। এছাড়াও, বেশ কিছু DeBERTa মডেলের ensemble রেকর্ড ~৯০.৩ পয়েন্টে নিয়ে গেছে[3]। DeBERTa মডেলটি আগের শীর্ষস্থানধারী (Google T5) কে প্রায় ০.৬% ছাড়িয়ে Transformer আর্কিটেকচারে নতুন ধারণার কার্যকারিতা প্রদর্শন করেছে (শব্দের বিষয়বস্তু এবং অবস্থানের আলাদা উপস্থাপনা, উন্নত মাস্ক ডিকোডার ইত্যাদি)[4]।
অগ্রগতি অর্জিত সাফল্যে থামেনি: ভাষা মডেলগুলোর আকার ও জটিলতা বৃদ্ধির সাথে সাথে SuperGLUE-এর ফলাফল আরও উন্নত হতে থাকে[5]। ২০২১ সালের শেষের দিকে লিডারবোর্ডের শীর্ষে ছিল Microsoft-এর T-NLRv5 (Microsoft Turing NLR পরিবার) মডেল — এটি মানব স্তরের উপরে ব্যবধান আরও বাড়িয়েছে[5]। GLUE-এর যে কাজগুলো মেশিনের জন্য শেষ পর্যন্ত সমাধান হয়নি (উদাহরণস্বরূপ, NLI-এর সূক্ষ্মতা) এই মডেলটি সেগুলো "বন্ধ" করে দিয়েছে, এমনকি সবচেয়ে কঠিন উপকাজগুলোতেও মানুষের সাথে পূর্ণ সমতার অত্যন্ত কাছে পৌঁছেছে[5]।
২০২২-২০২৩ সালে SuperGLUE-তে মানব স্তরের সীমা বেশ কিছু স্বাধীন বৃহৎ মডেল দ্বারা আত্মবিশ্বাসের সাথে অতিক্রম করা হয়েছে[6]। উদাহরণস্বরূপ, Google-এর PaLM মডেল (৫৪০ বিলিয়ন প্যারামিটার) SuperGLUE কাজে fine-tuning করে প্রায় ৯০.৪ পয়েন্ট অর্জন করেছে, এবং OpenAI-এর তৈরি GPT-4 মডেল এর চেয়েও কিছুটা বেশি ফলাফল দেখিয়েছে[6]। ২০২৩ সালের মাঝামাঝি নাগাদ SuperGLUE-এর লিডার টেবিলে ৯০-এর উপরে (অর্থাৎ গড় মানব স্তর ছাড়িয়ে) ফলাফল সহ বেশ কয়েকটি মডেল ছিল[6]। বলা যায় যে benchmark-টি আধুনিক সিস্টেম দ্বারা কার্যত সমাধান হয়ে গেছে[6]: সেরা মডেলগুলোর স্কোর এত বেশি যে বেশিরভাগ অদক্ষ মানুষের ক্ষমতাকে ছাড়িয়ে যায়[6]। এই সাফল্য অল্প সময়ে NLP-তে বিশাল অগ্রগতির প্রমাণ, কিন্তু একই সাথে সর্বশেষ মডেলগুলোর জন্য নতুন, আরও কঠিন পরীক্ষার প্রয়োজনীয়তার দিকে ইঙ্গিত করে[6]। ইতিমধ্যে পরবর্তী benchmark-গুলো আবির্ভূত হচ্ছে (উদাহরণস্বরূপ, MMLU, BIG-Bench ইত্যাদি), যা SuperGLUE-এর কাজের বাইরে আরও বিস্তৃত বোঝাপড়া এবং জ্ঞানের জন্য মডেলগুলো পরীক্ষা করার লক্ষ্যে কাজ করে[6]।
প্রভাব ও আরও গবেষণা
SuperGLUE এইভাবে ভাষা প্রক্রিয়াকরণে মূল্যায়ন পদ্ধতির বিকাশের একটি গুরুত্বপূর্ণ ধাপ হিসেবে প্রতিষ্ঠিত হয়েছে[3]। উৎসাহী ও বৈজ্ঞানিক মহলে এর ফলাফলগুলো নতুন LLM আর্কিটেকচারের জন্য এক ধরনের "লিটমাস পরীক্ষা" হয়ে উঠেছে: SuperGLUE-তে মানব স্তর অর্জন বা ছাড়িয়ে যাওয়াকে গভীর ভাষা বোঝাপড়াসম্পন্ন একটি অগ্রণী মডেলের চিহ্ন হিসেবে বিবেচনা করা হয়[3]। এটি বাস্তব প্রয়োগেও প্রতিফলিত হয়েছে — SuperGLUE-তে উচ্চ ফলাফল অর্জনকারী অনেক আধুনিক ভাষা মডেল প্রয়োগিত প্রশ্নোত্তর সিস্টেম, কথোপকথন এজেন্ট, পাঠ সংক্ষেপণ সিস্টেম ইত্যাদির ভিত্তি হয়েছে[3]। গবেষকরা অ্যালগরিদম fine-tuning ও তুলনা করতে SuperGLUE ব্যবহার করতে থাকেন, যদিও অগ্রণী অবস্থান এখন ধীরে ধীরে কৃত্রিম বুদ্ধিমত্তা মূল্যায়নের নতুন সীমানার দিকে সরে যাচ্ছে।
সূত্র
- SuperGLUE-এর অফিশিয়াল ওয়েবসাইট
- SuperGLUE মূল নিবন্ধ (NeurIPS)
- DeBERTa মানব স্তর অর্জন সংক্রান্ত Microsoft নিবন্ধ
- Papers With Code-তে SuperGLUE dataset পৃষ্ঠা
সাহিত্য
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
টীকা
[1] [2] [3] [4] [5] [6] </references>
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS. [১]
- ↑ 2.0 2.1 2.2 2.3 2.4 «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit /r/linguistics. [২]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». Microsoft Research Blog. [৩]
- ↑ 4.0 4.1 «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». Synced Review. [৪]
- ↑ 5.0 5.1 5.2 5.3 «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». Microsoft Research Blog. [৫]