BIG-bench (benchmark) (BG)
BIG-bench (акроним от англ. Beyond the Imitation Game benchmark) — това е мащабен набор от задания (benchmark), създаден за оценка на възможностите и границите на големите езикови модели (LLM). Проектът е разработен през 2021–2022 г. с общите усилия на повече от 450 изследователи от 132 организации под егидата на Google[1].
Бenchmark-ът включва 204 разнообразни задания, които обхващат широк спектър от области: лингвистика, математика, програмиране, здрав разум, биология, физика и оценка на социални предразсъдъци. Основната цел на BIG-bench е да излезе извън рамките на „играта на имитация" (теста на Тюринг) и да провери моделите на задания, считани за трудни или неразрешими за съществуващите архитектури. Benchmark-ът е предназначен не само за измерване на текущите способности, но и за екстраполация на бъдещите им възможности с нарастването на мащаба[2].
Разработка и структура
Инициатор за създаването на BIG-bench е група изследователи от Google, която организира открит сбор на задания от научната общност. В резултат на това в окончателния набор влязоха 204 задачи от десетки независими екипи. Всяка задача е разработена като предизвикателство за LLM и има собствен формат и метрика за оценка (например точност на избора, оценка на свободно генериран отговор).
Заданията варират от стандартни академични въпроси до нестандартни главоблъсканици, като например:
- Решаване на математически и логически задачи.
- Разбиране на emoji-последователности.
- Решаване на шахматни проблеми по текстово описание.
- Разкриване на социални стереотипи в отговорите на модела.
Целият benchmark и неговият код са в открит достъп в GitHub, което позволява на изследователите да тестват нови модели и да предлагат допълнителни задания[3].
Оценка на моделите и човешкото базово ниво
В оригиналната работа от 2022 г. беше проведено мащабно тестване на модели, включително семейството GPT на OpenAI, както и плътни и разредени модели на Google, като PaLM и Switch Transformers.
За съпоставяне на резултатите беше установено човешко базово ниво. Експерти-оценители изпълниха всички задания, използвайки наличните им ресурси. Бяха определени два показателя:
- Среден резултат на експертите: около 45/100 в условна нормировка.
- Най-добър резултат на експертите: около 80/100 (когато поне един експерт решаваше задачата оптимално).
Дори най-големите модели по онова време значително отстъпваха на хората. Например, най-добрите от тях (включително GPT-3) набираха едва около 15/100 точки, което подчерта сложността на заданията и големия потенциал за по-нататъшен напредък[1].
Ключови резултати и изводи
Анализът на резултатите от BIG-bench разкри няколко ключови закономерности:
- Влияние на мащаба. Точността на моделите нараства с увеличаването на броя параметри практически във всички категории задачи.
- Емерджентни способности. При много задачи производителността на моделите дълго остава на нивото на случайно отгатване, но след достигане на определен „критичен" мащаб настъпва рязък скок в качеството. Това явление получи наименованието емерджентно поведение (emergent behavior).
- Социални предразсъдъци (bias). С увеличаването на размера на модела може да нараства и нивото на проявление на социалните стереотипи, усвоени от обучителните данни. Въпреки това беше показано, че правилното формулиране на заявката (prompting) може да намали този ефект.
Еволюция на benchmark-а
С нарастването на мощността на моделите някои задачи от BIG-bench преставаха да бъдат предизвикателни. Това доведе до създаването на по-трудни поднабори.
Big-bench Hard (BBH)
През 2022 г. изследователите обособиха 23 от най-трудните задания, при които всички модели първоначално отстъпваха на средното човешко ниво. Този набор получи наименованието BIG-bench Hard (BBH). Експериментите показаха, че използването на техниката Chain-of-Thought (CoT) — когато моделът генерира верига от разсъждения преди отговора — рязко повишава производителността. С помощта на CoT моделът PaLM (540 млрд. параметъра) успя да надмине средния човешки резултат при 10 от 23 задачи, а Codex (версия на GPT-3) — при 17 от 23[4].
Big-bench Extra Hard (BBEH)
Към 2024 г., когато дори задачите от BBH започнаха да се решават от водещите модели, беше предложен следващият етап — BIG-bench Extra Hard (BBEH). Авторите от DeepMind замениха всяко от 23-те задания на BBH с ново, сходно по вид на разсъжденията, но значително по-трудно[5]. Първите тестове на BBEH показаха, че дори най-мощните съвременни LLM са далеч от решаването им, което осигурява дългосрочно предизвикателство за бъдещите модели.
Big-bench Lite (BBL)
За бързо и по-малко ресурсоемко тестване беше създадена облекчена версия — BIG-bench Lite (BBL). Тя представлява извадка от 24 задачи, отразяващи разнообразието на пълния набор. BBL позволява на разработчиците бързо да оценяват своите модели и да ги сравняват в публична класация (leaderboard).
Връзки
- Официалното хранилище на BIG-bench в GitHub
- Страницата на BIG-bench в Papers With Code
Литература
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Бележки
- ↑ 1.0 1.1 Srivastava, A., et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv:2206.04615. [1]
- ↑ «BIG-Bench: The New Benchmark for Language Models». Deepgram. [2]
- ↑ «google/BIG-bench». GitHub. [3]
- ↑ Suzgun, M., et al. «Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them». arXiv:2210.09261. [4]
- ↑ Arora, S., et al. «BIG-Bench Extra Hard». arXiv:2502.19187. [5]