BIG-bench (benchmark) (FA)
BIG-bench (مخفف انگلیسی Beyond the Imitation Game benchmark) — یک مجموعه آزمون (benchmark) در مقیاس بزرگ است که برای ارزیابی قابلیتها و محدودیتهای مدلهای زبانی بزرگ (LLM) طراحی شده است. این پروژه در سالهای ۲۰۲۱–۲۰۲۲ با همکاری بیش از ۴۵۰ پژوهشگر از ۱۳۲ سازمان زیر نظر Google توسعه یافت[1].
این benchmark شامل ۲۰۴ آزمون متنوع است که طیف گستردهای از حوزهها را پوشش میدهد: زبانشناسی، ریاضیات، برنامهنویسی، استدلال عقل سلیم، زیستشناسی، فیزیک و ارزیابی تعصبات اجتماعی. هدف اصلی BIG-bench فراتر رفتن از «بازی تقلید» (آزمون تورینگ) و آزمایش مدلها با وظایفی است که برای معماریهای موجود دشوار یا غیرقابلحل به شمار میروند. این benchmark نه تنها برای اندازهگیری تواناییهای کنونی، بلکه برای برونیابی قابلیتهای آینده مدلها با افزایش مقیاس طراحی شده است[2].
توسعه و ساختار
گروهی از پژوهشگران Google پیشقدم ایجاد BIG-bench شدند و فرآیند جمعآوری آزادانه آزمونها از جامعه علمی را سازماندهی کردند. در نتیجه، ۲۰۴ آزمون از دهها تیم مستقل در مجموعه نهایی گنجانده شد. هر آزمون به عنوان یک چالش برای LLM طراحی شده و دارای قالب و معیار ارزیابی خاص خود است (برای مثال، دقت انتخاب گزینه یا ارزیابی پاسخ آزاد).
آزمونها از سؤالات استاندارد دانشگاهی تا معماهای غیرمعمول را در بر میگیرند، از جمله:
- حل مسائل ریاضی و منطقی.
- درک توالیهای ایموجی.
- حل مسائل شطرنج بر اساس توصیف متنی.
- شناسایی کلیشههای اجتماعی در پاسخهای مدل.
کل benchmark و کد آن به صورت آزاد در GitHub در دسترس است، که به پژوهشگران امکان میدهد مدلهای جدید را آزمایش کنند و آزمونهای بیشتری پیشنهاد دهند[3].
ارزیابی مدلها و سطح پایه انسانی
در مقاله اصلی سال ۲۰۲۲، آزمایش گستردهای روی مدلها انجام شد، از جمله خانواده GPT از OpenAI و مدلهای چگال و پراکنده Google مانند PaLM و Switch Transformers.
برای مقایسه نتایج، سطح پایه انسانی تعیین شد. ارزیابهای متخصص تمام آزمونها را با استفاده از منابع در دسترس خود انجام دادند. دو شاخص مشخص شد:
- میانگین نتیجه متخصصان: حدود ۴۵ از ۱۰۰ در مقیاسبندی قراردادی.
- بهترین نتیجه متخصصان: حدود ۸۰ از ۱۰۰ (زمانی که حداقل یک متخصص آزمون را به شکل بهینه حل میکرد).
حتی بزرگترین مدلهای آن دوره به طور قابل توجهی از انسانها عقب بودند. برای مثال، بهترین آنها (از جمله GPT-3) تنها حدود ۱۵ از ۱۰۰ امتیاز کسب کردند، که پیچیدگی آزمونها و پتانسیل بزرگ برای پیشرفتهای آینده را نشان داد[1].
نتایج و یافتههای کلیدی
تحلیل نتایج در BIG-bench چندین الگوی کلیدی را آشکار کرد:
- تأثیر مقیاس. دقت مدلها با افزایش تعداد پارامترها در تقریباً همه دستههای آزمون افزایش مییابد.
- قابلیتهای نوظهور (Emergent). در بسیاری از آزمونها، عملکرد مدلها برای مدت طولانی در سطح حدس تصادفی باقی میماند، اما پس از رسیدن به یک مقیاس «بحرانی» مشخص، جهش ناگهانی در کیفیت رخ میدهد. این پدیده رفتار نوظهور (emergent behavior) نام گرفته است.
- تعصبات اجتماعی (bias). با افزایش اندازه مدل، میزان بروز کلیشههای اجتماعی آموختهشده از دادههای آموزشی نیز ممکن است افزایش یابد. با این حال، نشان داده شد که فرمولبندی صحیح درخواست (prompting) میتواند این اثر را کاهش دهد.
تکامل benchmark
همزمان با قدرتمندتر شدن مدلها، برخی از آزمونهای BIG-bench دیگر چالشبرانگیز نبودند. این امر به ایجاد زیرمجموعههای دشوارتر منجر شد.
Big-bench Hard (BBH)
در سال ۲۰۲۲، پژوهشگران ۲۳ آزمون دشوارتر را که در آنها تمام مدلها در ابتدا از سطح میانگین انسانی پایینتر بودند، جدا کردند. این مجموعه BIG-bench Hard (BBH) نام گرفت. آزمایشها نشان داد که استفاده از تکنیک Chain-of-Thought (CoT) — که در آن مدل قبل از پاسخ، زنجیرهای از استدلالها تولید میکند — عملکرد را به شکل چشمگیری بهبود میبخشد. با استفاده از CoT، مدل PaLM (با ۵۴۰ میلیارد پارامتر) توانست از میانگین نتیجه انسانی در ۱۰ آزمون از ۲۳ آزمون فراتر رود، و Codex (نسخهای از GPT-3) در ۱۷ آزمون از ۲۳ آزمون[4].
Big-bench Extra Hard (BBEH)
تا سال ۲۰۲۴، زمانی که حتی آزمونهای BBH توسط مدلهای پیشرفته حل میشدند، مرحله بعدی — BIG-bench Extra Hard (BBEH) — پیشنهاد شد. نویسندگان از DeepMind هر یک از ۲۳ آزمون BBH را با آزمونی جدید جایگزین کردند که از نظر نوع استدلال مشابه اما به مراتب دشوارتر بود[5]. اولین آزمونها روی BBEH نشان داد که حتی قدرتمندترین LLMهای امروزی از حل آنها فاصله زیادی دارند، که چالشی بلندمدت برای مدلهای آینده فراهم میکند.
Big-bench Lite (BBL)
برای آزمایش سریعتر و کمهزینهتر، نسخه سبکتری با نام BIG-bench Lite (BBL) ایجاد شد. این نسخه شامل نمونهای از ۲۴ آزمون است که تنوع مجموعه کامل را بازتاب میدهد. BBL به توسعهدهندگان امکان میدهد مدلهای خود را به سرعت ارزیابی کنند و آنها را در جدول امتیازات عمومی مقایسه کنند.
پیوندها
- مخزن رسمی BIG-bench در GitHub
- صفحه BIG-bench در Papers With Code
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ 1.0 1.1 Srivastava, A., et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv:2206.04615. [۱]
- ↑ «BIG-Bench: The New Benchmark for Language Models». Deepgram. [۲]
- ↑ «google/BIG-bench». GitHub. [۳]
- ↑ Suzgun, M., et al. «Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them». arXiv:2210.09261. [۴]
- ↑ Arora, S., et al. «BIG-Bench Extra Hard». arXiv:2502.19187. [۵]