HellaSwag Benchmark (BN)
HellaSwag — এটি একটি মানদণ্ড ডেটাসেট (benchmark), যা ২০১৯ সালে উপস্থাপিত হয়েছিল কৃত্রিম বুদ্ধিমত্তার মডেলগুলির প্রাকৃতিক ভাষায় দৈনন্দিন পরিস্থিতি বোঝার সক্ষমতা (commonsense reasoning) মূল্যায়ন করতে[1]। benchmark-টি ওয়াশিংটন বিশ্ববিদ্যালয় এবং অ্যালেন কৃত্রিম বুদ্ধিমত্তা ইনস্টিটিউটের গবেষকদের একটি দল দ্বারা তৈরি করা হয়েছিল।
HellaSwag-এর কাজ হলো একটি প্রদত্ত পাঠ্য প্রসঙ্গের জন্য সবচেয়ে বিশ্বাসযোগ্য সমাপ্তি বেছে নেওয়া। ডেটাসেটটির মূল বৈশিষ্ট্য হলো এটি মানুষের জন্য তুচ্ছ, কিন্তু এমনকি উন্নত ভাষা মডেলগুলিকেও থামিয়ে দেয়, যারা পৃষ্ঠতলীয় পরিসংখ্যানগত নিয়মের উপর নির্ভর করে[2]।
ইতিহাস ও পটভূমি
HellaSwag হলো SWAG (Situations With Adversarial Generations) dataset-এর ধারণার বিকাশ, যা ২০১৮ সালে একই লেখকদের দল প্রস্তাব করেছিল। SWAG-এর কাজে মডেলগুলিকে একটি সাধারণ পরিস্থিতির বর্ণনার সবচেয়ে সম্ভাব্য ধারাবাহিকতা বেছে নিতে হতো। প্রাথমিকভাবে SWAG অ্যালগরিদমের জন্য কঠিন ছিল, কিন্তু BERT মডেলটি আসার পর SWAG-এ এর ফলাফল ~৮৬%-এ পৌঁছায়, যা মানুষের সাথে প্রায় সমতুল্য হয়ে ওঠে[2]।
এই সাফল্য সন্দেহ তৈরি করে: BERT কি সত্যিই পাঠ্য "বোঝে", নাকি সে শুধু ডেটাসেটে উপস্থিত পরিসংখ্যানগত নিদর্শন ও শাব্লোন চিনতে শিখেছে? HellaSwag-এর লেখকরা এই অনুমান উপস্থাপন করেন যে BERT-এর উচ্চ ফলাফল প্রকৃত বোধের কারণে নয়, বরং dataset-এর বিশেষত্বের সাথে সংযোজনের কারণে। তারা দেখালেন যে ডেটার বিতরণে সামান্য পরিবর্তন হলেই BERT-এর নির্ভুলতা হঠাৎ কমে যায়। এর মানে হলো NLP-তে অগ্রগতির বস্তুনিষ্ঠ মূল্যায়নের জন্য একটি নতুন, আরও জটিল ও "চালাক" benchmark প্রয়োজন[2]।
Dataset-এর বিবরণ ও লক্ষ্য
HellaSwag তৈরি করা হয়েছিল একটি পরীক্ষা হিসেবে যা কার্যকারণ সম্পর্ক ও দৈনন্দিন পরিস্থিতি বোঝার ক্ষেত্রে আধুনিক মডেলগুলির সীমাবদ্ধতা প্রকাশ করার উদ্দেশ্যে।
কাজের কাঠামো
HellaSwag-এর প্রতিটি উদাহরণ দুটি অংশ নিয়ে গঠিত:
- প্রসঙ্গ: একটি সংক্ষিপ্ত অনুচ্ছেদ (তিনটি বাক্য পর্যন্ত), যা কোনো পরিস্থিতির শুরু বর্ণনা করে।
- চারটি সমাপ্তির বিকল্প: গল্পের চারটি সম্ভাব্য ধারাবাহিকতা, যা কয়েকটি বাক্য নিয়ে গঠিত।
এই সমাপ্তিগুলির মধ্যে কেবল একটি সঠিক (বাস্তব), আর বাকি তিনটি মিথ্যা, যা বিশেষভাবে মডেলকে বিভ্রান্ত করতে তৈরি করা হয়েছে।
ডেটার উৎস
পরিস্থিতির উদাহরণগুলি দুটি উৎস থেকে নেওয়া হয়েছে, যা দৈনন্দিন পরিস্থিতির বিস্তৃত পরিসর জুড়ে রয়েছে:
- ActivityNet Captions: ভিডিও থেকে কার্যকলাপের বর্ণনা (যেমন, "একজন ব্যক্তি শসার বয়াম খুলছেন")।
- WikiHow: নিবন্ধ থেকে নির্দেশাবলী (যেমন, "গাড়িতে টায়ার কীভাবে বদলাতে হয়")।
HellaSwag-এর লক্ষ্য হলো এমন একটি benchmark তৈরি করা যা মানুষের জন্য সহজে (স্বজ্ঞাতভাবে) সমাধানযোগ্য, কিন্তু যেসব মডেলের পূর্ণ সাধারণ জ্ঞান নেই তাদের জন্য সর্বাধিক কঠিন। এই প্রভাবকে লেখকরা "গোল্ডিলক্স প্রভাব" (Goldilocks effect) বলে নাম দিয়েছেন[1]।
Adversarial Filtering (AF) পদ্ধতি
HellaSwag তৈরিতে মূল উদ্ভাবন ছিল Adversarial Filtering (AF) পদ্ধতি — একটি নির্দিষ্ট "শিকার" মডেলের জন্য তৈরি "ফাঁদগুলির" পুনরাবৃত্তিমূলক বাছাই। এই পদ্ধতিটি এমন মিথ্যা বিকল্প তৈরি করতে সক্ষম করেছে যা পরিসংখ্যানগত মডেলের দৃষ্টিকোণ থেকে প্রতারণামূলকভাবে সঠিকের মতো।
AF-এর কার্যপ্রণালী নিম্নরূপ:
- উৎপাদন। মূল প্রসঙ্গের ভিত্তিতে একটি জেনারেটর ভাষা মডেল (যেমন, GPT) বহু সংখ্যক সম্ভাব্য ভুল সমাপ্তি তৈরি করে।
- বিচার। একটি classifier মডেল (যেমন, BERT), "শিকার" হিসেবে কাজ করে, তৈরি করা ধারাবাহিকতাগুলিকে বাস্তব (সঠিক) থেকে আলাদা করার চেষ্টা করে।
- বাছাই। সেই মিথ্যা বিকল্পগুলি বাছাই করা হয় যেগুলিকে classifier সবচেয়ে বিশ্বাসযোগ্য মনে করেছে, অর্থাৎ যেগুলিতে এটি সবচেয়ে বেশি ভুল করেছে।
- পুনরাবৃত্তি। প্রক্রিয়াটি বারবার পুনরাবৃত্তি হয় যতক্ষণ না মিথ্যা উত্তরগুলি অ্যালগরিদমের জন্য সঠিকটির মতো সর্বাধিক সদৃশ হয়ে ওঠে।
- মানুষ দ্বারা যাচাই। চূড়ান্ত পর্যায়ে প্রাপ্ত সেটগুলি (প্রসঙ্গ + ১টি সঠিক সমাপ্তি + ৩টি সেরা মিথ্যা) মানুষ দ্বারা মূল্যায়ন করা হয়। মূল্যায়নকারীরা নিশ্চিত করেন যে সঠিক বিকল্পটি স্পষ্টভাবে সবচেয়ে স্বাভাবিক, এবং সমস্ত বিকল্পে কোনো না কোনো অযৌক্তিকতা রয়েছে যা মানুষের কাছে লক্ষণীয়[2]।
AF-এর কারণে, HellaSwag-এর প্রতিটি উদাহরণ প্রথম থেকেই এমনভাবে তৈরি করা হয়েছে যাতে মডেলকে বিভ্রান্ত করা যায়, কিন্তু মানুষের কাছে স্বচ্ছ থাকে।
ফলাফল ও তাৎপর্য
HellaSwag পাঠ্য বোধের মডেলগুলির জন্য একটি কঠোর পরীক্ষায় পরিণত হয়েছে। পরীক্ষার ফলাফল যন্ত্র ও মানব বুদ্ধিমত্তার মধ্যে বিশাল ব্যবধান দেখিয়েছে:
- মানুষ HellaSwag-এর কাজগুলি প্রায় নির্ভুলভাবে সমাধান করে, প্রায় ৯৫-৯৬% নির্ভুলতায়[2]।
- তৈরির সময়ের সেরা মডেল, BERT-Large, মাত্র ~৪৭% নির্ভুলতা অর্জন করেছিল। আরও সরল পদ্ধতিগুলি এলোমেলো অনুমানের (২৫%) চেয়ে সামান্য বেশি ফলাফল দেখিয়েছিল[2]।
৪৫ শতাংশ পয়েন্টের বেশি ব্যবধান এই অনুমানটি নিশ্চিত করেছে যে পূর্ববর্তী পরীক্ষায় উচ্চ ফলাফল প্রকৃত বোধের ইঙ্গিত দেয় না। HellaSwag প্রদর্শন করেছে যে বিশাল পরিমাণ ডেটায় প্রশিক্ষণের পরেও মডেলগুলি নতুন পরিস্থিতির জন্য সাধারণ জ্ঞান অর্জন করতে পারে না।
পরবর্তী বছরগুলিতে HellaSwag নতুন ভাষা মডেলগুলির জন্য প্রামাণিক পরীক্ষার তালিকায় অন্তর্ভুক্ত হয়। এই benchmark-এ AI সিস্টেমগুলির ফলাফলের মাধ্যমে তাদের অগ্রগতি পর্যবেক্ষণ করা সম্ভব হয়েছিল।
- ২০২০ সালে GPT-3 মডেল (১৭৫ বিলিয়ন প্যারামিটার) few-shot মোডে ~৭৯% নির্ভুলতা দেখিয়েছিল, যা সেই সময়ের অনেক বিশেষায়িত মডেলকে ছাড়িয়ে গিয়েছিল, কিন্তু তখনও মানুষের চেয়ে উল্লেখযোগ্যভাবে পিছিয়ে ছিল[3]।
- কেবল ২০২৩ সালে নতুন প্রজন্মের মডেলগুলি, যেমন GPT-4, HellaSwag-এ মানুষের সমতুল্য ফলাফল অর্জন করতে সক্ষম হয়েছে (প্রায় ৯৫% নির্ভুলতা)[4]।
HellaSwag তৈরি NLP-তে অগ্রগতি মূল্যায়নের একটি নতুন পদ্ধতি চিহ্নিত করেছে, যা বিকশিত benchmark-এর ধারণার উপর ভিত্তি করে: মডেলগুলি যত উন্নত হয়, তাদের দুর্বল দিকগুলি প্রকাশ করে এমন নতুন, আরও জটিল পরীক্ষা তৈরি করা প্রয়োজন।
তথ্যসূত্র
- HellaSwag প্রকল্পের অফিসিয়াল ওয়েবসাইট
- গবেষণাপত্র «HellaSwag: Can a Machine Really Finish Your Sentence?»
সাহিত্য
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
টীকা
- ↑ 1.0 1.1 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. [১]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv:1905.07830, 2019. [২]
- ↑ Brown, T. B. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165, 2020. [৩]
- ↑ Zellers, R. et al. «HellaSwag Project Page». [৪]