BIG-bench (benchmark) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

BIG-bench (acronim din engl. Beyond the Imitation Game benchmark) — este un set de sarcini la scară largă (benchmark), creat pentru evaluarea capacităților și limitelor modelelor lingvistice mari (LLM). Proiectul a fost elaborat în anii 2021–2022 prin eforturile comune ale peste 450 de cercetători din 132 de organizații, sub egida Google[1].

Benchmark-ul include 204 sarcini diverse, care acoperă un spectru larg de domenii: lingvistică, matematică, programare, simț comun, biologie, fizică și evaluarea prejudecăților sociale. Scopul principal al BIG-bench este de a depăși cadrul „jocului de imitație" (testul Turing) și de a verifica modelele pe sarcini considerate dificile sau de nerezolvat pentru arhitecturile existente. Benchmark-ul este destinat nu doar măsurării capacităților actuale, ci și extrapolării capacităților viitoare pe măsura creșterii scalei[2].

Dezvoltare și structură

Inițiatorul creării BIG-bench a fost un grup de cercetători de la Google, care a organizat o colectare deschisă de sarcini din comunitatea științifică. Ca rezultat, în setul final au fost incluse 204 sarcini de la zeci de echipe independente. Fiecare sarcină a fost elaborată ca o provocare pentru LLM și dispune de propriul format și metrică de evaluare (de exemplu, acuratețea selecției, evaluarea răspunsului generat liber).

Sarcinile variază de la întrebări academice standard până la puzzle-uri neconvenționale, precum:

  • Rezolvarea problemelor matematice și logice.
  • Înțelegerea secvențelor de emoji.
  • Rezolvarea problemelor de șah pe baza descrierii textuale.
  • Identificarea stereotipurilor sociale în răspunsurile modelului.

Întregul benchmark și codul său se află în acces deschis pe GitHub, ceea ce permite cercetătorilor să testeze modele noi și să propună sarcini suplimentare[3].

Evaluarea modelelor și nivelul de referință uman

În lucrarea originală din 2022 a fost realizată o testare la scară largă a modelelor, inclusiv familia GPT de la OpenAI, precum și modele dense și sparse de la Google, precum PaLM și Switch Transformers.

Pentru compararea rezultatelor a fost stabilit un nivel de referință uman. Evaluatorii experți au realizat toate sarcinile utilizând resursele disponibile. Au fost definiți doi indicatori:

  • Rezultatul mediu al experților: aproximativ 45/100 în normalizarea convențională.
  • Cel mai bun rezultat al experților: aproximativ 80/100 (atunci când cel puțin un expert rezolva sarcina optim).

Chiar și cele mai mari modele ale vremii erau semnificativ inferioare oamenilor. De exemplu, cele mai performante dintre ele (inclusiv GPT-3) obțineau doar aproximativ 15/100 puncte, ceea ce a subliniat complexitatea sarcinilor și potențialul mare pentru progres ulterior[1].

Rezultate-cheie și concluzii

Analiza rezultatelor pe BIG-bench a evidențiat câteva tipare esențiale:

  1. Influența scalei. Acuratețea modelelor crește odată cu creșterea numărului de parametri în aproape toate categoriile de sarcini.
  2. Capacități emergente. Pe multe sarcini, performanța modelelor rămâne mult timp la nivelul ghicirii aleatorii, însă după atingerea unei scale „critice" are loc un salt brusc al calității. Acest fenomen a primit denumirea de comportament emergent (emergent behavior).
  3. Prejudecăți sociale (bias). Odată cu creșterea dimensiunii modelului, poate crește și nivelul de manifestare a stereotipurilor sociale asimilate din datele de antrenament. Cu toate acestea, s-a demonstrat că formularea corectă a interogărilor (prompting) poate reduce acest efect.

Evoluția benchmark-ului

Pe măsură ce modelele deveneau mai puternice, unele sarcini din BIG-bench încetau să mai fie dificile. Aceasta a condus la crearea unor subseturi mai dificile.

Big-bench Hard (BBH)

În 2022, cercetătorii au selectat 23 de sarcini cele mai dificile, la care toate modelele erau inițial inferioare nivelului mediu uman. Acest set a primit denumirea BIG-bench Hard (BBH). Experimentele au arătat că utilizarea tehnicii Chain-of-Thought (CoT) — atunci când modelul generează un lanț de raționamente înainte de răspuns — crește brusc performanța. Cu ajutorul CoT, modelul PaLM (540 de miliarde de parametri) a reușit să depășească rezultatul mediu uman la 10 din 23 de sarcini, iar Codex (versiunea GPT-3) — la 17 din 23[4].

Big-bench Extra Hard (BBEH)

Până în 2024, când chiar și sarcinile din BBH au început să fie rezolvate de modelele de vârf, a fost propusă etapa următoare — BIG-bench Extra Hard (BBEH). Autorii de la DeepMind au înlocuit fiecare dintre cele 23 de sarcini BBH cu una nouă, similară ca tip de raționament, dar semnificativ mai dificilă[5]. Primele teste pe BBEH au arătat că și cele mai puternice LLM actuale sunt departe de a le rezolva, ceea ce asigură o provocare pe termen lung pentru modelele viitoare.

Big-bench Lite (BBL)

Pentru testare rapidă și mai puțin costisitoare din punct de vedere al resurselor, a fost creată o versiune ușoară — BIG-bench Lite (BBL). Aceasta reprezintă o selecție de 24 de sarcini, care reflectă diversitatea setului complet. BBL permite dezvoltatorilor să evalueze rapid propriile modele și să le compare pe un leaderboard public.

Referințe

  • Depozitul oficial BIG-bench pe GitHub
  • Pagina BIG-bench pe Papers With Code

Bibliografie

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Note

  1. 1.0 1.1 Srivastava, A., et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv:2206.04615. [1]
  2. «BIG-Bench: The New Benchmark for Language Models». Deepgram. [2]
  3. «google/BIG-bench». GitHub. [3]
  4. Suzgun, M., et al. «Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them». arXiv:2210.09261. [4]
  5. Arora, S., et al. «BIG-Bench Extra Hard». arXiv:2502.19187. [5]