BIG-bench (benchmark) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

BIG-bench (акроним от англ. Beyond the Imitation Game benchmark) — това е мащабен набор от задания (benchmark), създаден за оценка на възможностите и границите на големите езикови модели (LLM). Проектът е разработен през 2021–2022 г. с общите усилия на повече от 450 изследователи от 132 организации под егидата на Google[1].

Бenchmark-ът включва 204 разнообразни задания, които обхващат широк спектър от области: лингвистика, математика, програмиране, здрав разум, биология, физика и оценка на социални предразсъдъци. Основната цел на BIG-bench е да излезе извън рамките на „играта на имитация" (теста на Тюринг) и да провери моделите на задания, считани за трудни или неразрешими за съществуващите архитектури. Benchmark-ът е предназначен не само за измерване на текущите способности, но и за екстраполация на бъдещите им възможности с нарастването на мащаба[2].

Разработка и структура

Инициатор за създаването на BIG-bench е група изследователи от Google, която организира открит сбор на задания от научната общност. В резултат на това в окончателния набор влязоха 204 задачи от десетки независими екипи. Всяка задача е разработена като предизвикателство за LLM и има собствен формат и метрика за оценка (например точност на избора, оценка на свободно генериран отговор).

Заданията варират от стандартни академични въпроси до нестандартни главоблъсканици, като например:

  • Решаване на математически и логически задачи.
  • Разбиране на emoji-последователности.
  • Решаване на шахматни проблеми по текстово описание.
  • Разкриване на социални стереотипи в отговорите на модела.

Целият benchmark и неговият код са в открит достъп в GitHub, което позволява на изследователите да тестват нови модели и да предлагат допълнителни задания[3].

Оценка на моделите и човешкото базово ниво

В оригиналната работа от 2022 г. беше проведено мащабно тестване на модели, включително семейството GPT на OpenAI, както и плътни и разредени модели на Google, като PaLM и Switch Transformers.

За съпоставяне на резултатите беше установено човешко базово ниво. Експерти-оценители изпълниха всички задания, използвайки наличните им ресурси. Бяха определени два показателя:

  • Среден резултат на експертите: около 45/100 в условна нормировка.
  • Най-добър резултат на експертите: около 80/100 (когато поне един експерт решаваше задачата оптимално).

Дори най-големите модели по онова време значително отстъпваха на хората. Например, най-добрите от тях (включително GPT-3) набираха едва около 15/100 точки, което подчерта сложността на заданията и големия потенциал за по-нататъшен напредък[1].

Ключови резултати и изводи

Анализът на резултатите от BIG-bench разкри няколко ключови закономерности:

  1. Влияние на мащаба. Точността на моделите нараства с увеличаването на броя параметри практически във всички категории задачи.
  2. Емерджентни способности. При много задачи производителността на моделите дълго остава на нивото на случайно отгатване, но след достигане на определен „критичен" мащаб настъпва рязък скок в качеството. Това явление получи наименованието емерджентно поведение (emergent behavior).
  3. Социални предразсъдъци (bias). С увеличаването на размера на модела може да нараства и нивото на проявление на социалните стереотипи, усвоени от обучителните данни. Въпреки това беше показано, че правилното формулиране на заявката (prompting) може да намали този ефект.

Еволюция на benchmark-а

С нарастването на мощността на моделите някои задачи от BIG-bench преставаха да бъдат предизвикателни. Това доведе до създаването на по-трудни поднабори.

Big-bench Hard (BBH)

През 2022 г. изследователите обособиха 23 от най-трудните задания, при които всички модели първоначално отстъпваха на средното човешко ниво. Този набор получи наименованието BIG-bench Hard (BBH). Експериментите показаха, че използването на техниката Chain-of-Thought (CoT) — когато моделът генерира верига от разсъждения преди отговора — рязко повишава производителността. С помощта на CoT моделът PaLM (540 млрд. параметъра) успя да надмине средния човешки резултат при 10 от 23 задачи, а Codex (версия на GPT-3) — при 17 от 23[4].

Big-bench Extra Hard (BBEH)

Към 2024 г., когато дори задачите от BBH започнаха да се решават от водещите модели, беше предложен следващият етап — BIG-bench Extra Hard (BBEH). Авторите от DeepMind замениха всяко от 23-те задания на BBH с ново, сходно по вид на разсъжденията, но значително по-трудно[5]. Първите тестове на BBEH показаха, че дори най-мощните съвременни LLM са далеч от решаването им, което осигурява дългосрочно предизвикателство за бъдещите модели.

Big-bench Lite (BBL)

За бързо и по-малко ресурсоемко тестване беше създадена облекчена версия — BIG-bench Lite (BBL). Тя представлява извадка от 24 задачи, отразяващи разнообразието на пълния набор. BBL позволява на разработчиците бързо да оценяват своите модели и да ги сравняват в публична класация (leaderboard).

Връзки

  • Официалното хранилище на BIG-bench в GitHub
  • Страницата на BIG-bench в Papers With Code

Литература

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Бележки

  1. 1.0 1.1 Srivastava, A., et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv:2206.04615. [1]
  2. «BIG-Bench: The New Benchmark for Language Models». Deepgram. [2]
  3. «google/BIG-bench». GitHub. [3]
  4. Suzgun, M., et al. «Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them». arXiv:2210.09261. [4]
  5. Arora, S., et al. «BIG-Bench Extra Hard». arXiv:2502.19187. [5]