BIG-bench (benchmark) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

BIG-bench (সংক্ষিপ্ত রূপ ইংরেজি Beyond the Imitation Game benchmark থেকে) — এটি একটি বৃহৎ মাপের কাজের সংকলন (benchmark), যা বড় ভাষা মডেলের (LLM) সক্ষমতা ও সীমা মূল্যায়নের জন্য তৈরি করা হয়েছে। প্রকল্পটি ২০২১–২০২২ সালে ১৩২টি প্রতিষ্ঠানের ৪৫০-এরও বেশি গবেষকের যৌথ প্রচেষ্টায় Google-এর পৃষ্ঠপোষকতায় তৈরি হয়েছিল[1]

Benchmark-টিতে ২০৪টি বৈচিত্র্যময় কাজ অন্তর্ভুক্ত রয়েছে, যা ভাষাবিজ্ঞান, গণিত, প্রোগ্রামিং, সাধারণ জ্ঞান, জীববিজ্ঞান, পদার্থবিজ্ঞান এবং সামাজিক পক্ষপাত মূল্যায়নসহ বিস্তৃত ক্ষেত্র জুড়ে বিস্তৃত। BIG-bench-এর মূল লক্ষ্য হলো «অনুকরণ খেলা» (টুরিং পরীক্ষা)-এর সীমা অতিক্রম করে এমন কাজে মডেলগুলিকে পরীক্ষা করা, যেগুলি বিদ্যমান আর্কিটেকচারের জন্য কঠিন বা অসমাধানযোগ্য বলে বিবেচিত। Benchmark-টি কেবল বর্তমান সক্ষমতা পরিমাপের জন্য নয়, বরং মডেলের আকার বৃদ্ধির সাথে সাথে ভবিষ্যৎ সক্ষমতার বহির্ভাগ অনুমানের জন্যও তৈরি[2]

তৈরি ও কাঠামো

BIG-bench তৈরির উদ্যোক্তা ছিলেন Google-এর একদল গবেষক, যারা বৈজ্ঞানিক সম্প্রদায়ের কাছ থেকে কাজ সংগ্রহের জন্য একটি উন্মুক্ত প্রক্রিয়া আয়োজন করেছিলেন। ফলস্বরূপ, চূড়ান্ত সংকলনে কয়েক ডজন স্বাধীন দলের ২০৪টি কাজ অন্তর্ভুক্ত হয়েছে। প্রতিটি কাজ LLM-এর জন্য একটি চ্যালেঞ্জ হিসেবে তৈরি করা হয়েছে এবং এর নিজস্ব ফরম্যাট ও মূল্যায়ন মেট্রিক রয়েছে (যেমন, নির্বাচনের নির্ভুলতা, মুক্তভাবে উৎপন্ন উত্তরের মূল্যায়ন)।

কাজগুলি প্রচলিত একাডেমিক প্রশ্ন থেকে শুরু করে অপ্রচলিত ধাঁধা পর্যন্ত বিস্তৃত, যেমন:

  • গাণিতিক ও যৌক্তিক সমস্যা সমাধান।
  • ইমোজি-ক্রম বোঝা।
  • পাঠ্য বিবরণ দ্বারা দাবা সমস্যা সমাধান।
  • মডেলের উত্তরে সামাজিক স্টেরিওটাইপ চিহ্নিত করা।

সম্পূর্ণ benchmark এবং এর কোড GitHub-এ উন্মুক্তভাবে পাওয়া যায়, যা গবেষকদের নতুন মডেল পরীক্ষা করতে এবং অতিরিক্ত কাজ প্রস্তাব করতে সক্ষম করে[3]

মডেল মূল্যায়ন ও মানব ভিত্তি স্তর

২০২২ সালের মূল গবেষণাপত্রে OpenAI-এর GPT পরিবারসহ Google-এর ঘন ও বিরল মডেল যেমন PaLMSwitch Transformers অন্তর্ভুক্ত করে বৃহৎ আকারের পরীক্ষা পরিচালিত হয়েছিল।

ফলাফল তুলনার জন্য একটি মানব ভিত্তি স্তর নির্ধারণ করা হয়েছিল। বিশেষজ্ঞ মূল্যায়নকারীরা উপলব্ধ সম্পদ ব্যবহার করে সব কাজ সম্পন্ন করেছেন। দুটি সূচক নির্ধারিত হয়েছিল:

  • বিশেষজ্ঞদের গড় ফলাফল: শর্তসাপেক্ষ স্বাভাবিকীকরণে প্রায় ৪৫/১০০।
  • বিশেষজ্ঞদের সেরা ফলাফল: প্রায় ৮০/১০০ (যখন কমপক্ষে একজন বিশেষজ্ঞ কাজটি সর্বোত্তমভাবে সমাধান করেন)।

তৎকালীন সবচেয়ে বড় মডেলগুলিও মানুষের চেয়ে উল্লেখযোগ্যভাবে পিছিয়ে ছিল। উদাহরণস্বরূপ, সেরা মডেলগুলি (GPT-3 সহ) মাত্র প্রায় ১৫/১০০ পয়েন্ট অর্জন করেছিল, যা কাজগুলির জটিলতা এবং আরও অগ্রগতির বিশাল সম্ভাবনাকে তুলে ধরেছে[1]

মূল ফলাফল ও উপসংহার

BIG-bench-এর ফলাফল বিশ্লেষণে বেশ কিছু মূল প্রবণতা পরিলক্ষিত হয়েছে:

  1. মাপের প্রভাব। প্রায় সব বিভাগের কাজে প্যারামিটার সংখ্যা বৃদ্ধির সাথে মডেলের নির্ভুলতা বাড়ে।
  2. উদ্ভূত সক্ষমতা (Emergent Behavior)। অনেক কাজে মডেলের কর্মক্ষমতা দীর্ঘদিন এলোমেলো অনুমানের স্তরে থাকে, কিন্তু একটি নির্দিষ্ট «সংকটমূলক» মাপে পৌঁছানোর পর মানের হঠাৎ উল্লম্ফন ঘটে। এই ঘটনাকে emergent behavior বলা হয়।
  3. সামাজিক পক্ষপাত (bias)। মডেলের আকার বাড়ার সাথে সাথে প্রশিক্ষণ ডেটা থেকে আত্মস্থ সামাজিক স্টেরিওটাইপের প্রকাশও বাড়তে পারে। তবে দেখানো হয়েছে যে সঠিক prompt তৈরি (prompting) এই প্রভাব কমাতে পারে।

Benchmark-এর বিবর্তন

মডেলগুলি যত শক্তিশালী হয়েছে, BIG-bench-এর কিছু কাজ আর কঠিন থাকেনি। এর ফলে আরও কঠিন উপসংকলন তৈরি হয়েছে।

Big-bench Hard (BBH)

২০২২ সালে গবেষকরা ২৩টি সবচেয়ে কঠিন কাজ আলাদা করেন, যেগুলিতে সব মডেল প্রাথমিকভাবে গড় মানব স্তরের চেয়ে পিছিয়ে ছিল। এই সংকলনটি BIG-bench Hard (BBH) নামে পরিচিতি পায়। পরীক্ষা-নিরীক্ষায় দেখা গেছে যে Chain-of-Thought (CoT) কৌশল ব্যবহার — যখন মডেল উত্তর দেওয়ার আগে যুক্তির শৃঙ্খল তৈরি করে — কর্মক্ষমতা উল্লেখযোগ্যভাবে বাড়িয়ে দেয়। CoT ব্যবহার করে PaLM মডেল (৫৪০ বিলিয়ন প্যারামিটার) ২৩টির মধ্যে ১০টি কাজে গড় মানব ফলাফল ছাড়িয়ে যেতে পারে, এবং Codex (GPT-3-এর একটি সংস্করণ) — ২৩টির মধ্যে ১৭টিতে[4]

Big-bench Extra Hard (BBEH)

২০২৪ সালের মধ্যে, যখন BBH-এর কাজগুলিও অগ্রণী মডেলগুলি দ্বারা সমাধান করা হতে থাকে, তখন পরবর্তী পর্যায় প্রস্তাবিত হয় — BIG-bench Extra Hard (BBEH)। DeepMind-এর লেখকরা BBH-এর ২৩টি কাজের প্রতিটিকে একটি নতুন কাজ দিয়ে প্রতিস্থাপন করেন, যা যুক্তির ধরনে অনুরূপ কিন্তু উল্লেখযোগ্যভাবে আরও কঠিন[5]। BBEH-এ প্রথম পরীক্ষায় দেখা গেছে যে এমনকি সবচেয়ে শক্তিশালী আধুনিক LLM-গুলিও সেগুলি সমাধান থেকে অনেক দূরে, যা ভবিষ্যতের মডেলগুলির জন্য দীর্ঘমেয়াদী চ্যালেঞ্জ নিশ্চিত করে।

Big-bench Lite (BBL)

দ্রুত ও কম সম্পদ-নিবিড় পরীক্ষার জন্য একটি হালকা সংস্করণ তৈরি করা হয়েছে — BIG-bench Lite (BBL)। এটি সম্পূর্ণ সংকলনের বৈচিত্র্য প্রতিফলিত করে ২৪টি কাজ-এর একটি নির্বাচন। BBL ডেভেলপারদের তাদের মডেলগুলি দ্রুত মূল্যায়ন করতে এবং সর্বজনীন লিডারবোর্ডে তুলনা করতে সক্ষম করে।

ইন্টারনেট সংযোগ

  • GitHub-এ BIG-bench-এর অফিসিয়াল রিপোজিটরি
  • Papers With Code-এ BIG-bench পৃষ্ঠা

সাহিত্য

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

টীকা

  1. 1.0 1.1 Srivastava, A., et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv:2206.04615. [১]
  2. «BIG-Bench: The New Benchmark for Language Models». Deepgram. [২]
  3. «google/BIG-bench». GitHub. [৩]
  4. Suzgun, M., et al. «Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them». arXiv:2210.09261. [৪]
  5. Arora, S., et al. «BIG-Bench Extra Hard». arXiv:2502.19187. [৫]