Benchmarky LLM
Benchmarky velkých jazykových modelů — jsou standardizované sady testů určené k měření, porovnávání a hodnocení kvality a schopností velkých jazykových modelů (LLM)[1]. Každý benchmark obvykle představuje pevnou sadu úloh (například otázky, texty nebo instrukce), pro něž jsou předem známy správné odpovědi nebo hodnotící kritéria. Tento přístup zajišťuje objektivní srovnání různých modelů za stejných podmínek, umožňuje sledovat pokrok v oboru a identifikovat silné a slabé stránky modelů[2].
Pravidelné používání benchmarků hraje klíčovou roli v rozvoji LLM, stimuluje vývojáře ke zlepšování modelů a zajišťuje transparentnost a srovnatelnost výsledků ve vědecké komunitě. Evoluce benchmarků odráží vývoj samotných LLM: od jednoduchých úloh zaměřených na porozumění jazyku až po komplexní testy prověřující víceúrovňové uvažování, zdravý rozum, etiku a bezpečnost[3].
Základní kategorie a příklady
Benchmarky LLM pokrývají různorodé dovednosti a oblasti použití. Níže jsou popsány hlavní kategorie a nejznámější sady úloh v každé z nich.
Obecné jazykové porozumění
Tato kategorie hodnotí základní schopnosti modelu porozumět přirozenému jazyku a interpretovat jej.
- GLUE (General Language Understanding Evaluation, 2019) — jeden z prvních komplexních benchmarků zahrnující řadu různorodých úloh: od určení tónality až po hodnocení logické soudržnosti textu. Výsledky všech úloh jsou agregovány do jediného skóre, což umožnilo porovnávat rané modely podle jejich celkové výkonnosti[4].
- SuperGLUE (2019) — „posílený" nástupce GLUE, vyvinutý v reakci na to, že modely na něm rychle dosáhly úrovně blízké lidské. SuperGLUE obsahuje náročnější úlohy vyžadující hluboké porozumění kontextu a schopnost vyvozovat závěry[5].
- WinoGrande (2019) — rozšířená varianta kvízu Winograd Schema. Obsahuje 44 tisíc úloh zaměřených na rozlišení nejednoznačných zájmen ve větách, k jejichž správné interpretaci je nutný zdravý rozum[6].
Multitaskové a komplexní benchmarky
Tyto sady testují modely na širokém spektru znalostí a dovedností, které přesahují rámec čistě lingvistických úloh.
- MMLU (Massive Multitask Language Understanding, 2020) — soubor úloh ve formě kvízu pokrývající 57 předmětových oblastí: od školních disciplín po úzce specializované odborné znalosti (právo, medicína). MMLU měří šíři erudice modelu[7].
- BIG-bench (Beyond the Imitation Game Benchmark, 2022) — v době vzniku největší kolaborativní benchmark vyvinutý více než 400 autory. Obsahuje přes 200 úloh z nejrůznějších témat, od lingvistiky po fyziku, aby prověřil modely za hranicemi vzorového párování a odhalil jejich limity v nestandardních situacích[8].
Zdravý rozum a pravdivost
Tyto benchmarky hodnotí schopnost modelu vyvozovat logické závěry o každodenních situacích a vyhýbat se šíření nepravdivých informací.
- HellaSwag (2019) — prověřuje zdravý rozum prostřednictvím úlohy výběru nejpravděpodobnějšího zakončení popisu situace. Zvláštností benchmarku je přítomnost „pastí": nesprávné odpovědi jsou generovány automaticky a vypadají velmi věrohodně, což od modelu vyžaduje hluboké porozumění kontextu[9].
- TruthfulQA (2021) — měří sklon modelu šířit populární mýty a omyly. Obsahuje otázky, kde odpověď běžně rozšířená na internetu je nesprávná (například „Způsobují vakcíny autismus?"). Od modelu se vyžaduje, aby nepodlehl nepravdivým stereotypům a podal fakticky správnou odpověď[10].
Matematické úlohy
- GSM8K (2021) — obsahuje tisíce slovních matematických úloh na úrovni základní školy. Každá úloha vyžaduje provedení posloupnosti 2–8 aritmetických kroků k získání odpovědi, čímž prověřuje schopnost modelu k víceúrovňovému uvažování[11].
- MATH (2021) — náročnější sada sestávající z úloh z matematických olympiád a soutěží. Obsahuje části věnované algebře, geometrii a teorii čísel a vyžaduje od modelu znalost netriviálních metod řešení[12].
Generování programového kódu
- HumanEval (2021) — standardní test pro hodnocení schopnosti LLM psát kód. Obsahuje 164 programovacích úloh, kde model musí na základě zadaného popisu vygenerovat správný kód v Pythonu. Správnost je hodnocena pomocí unit testů[13].
- SWE-bench (2023) — realističtější benchmark shromažďující popisy skutečných problémů (issues) z GitHubu. Model musí vygenerovat patch (fragment kódu) odstraňující daný problém. To vyžaduje porozumění velkému objemu cizího kódu a složité postupné uvažování[14].
Hodnocení dialogových modelů
- Chatbot Arena (2024) — otevřená online platforma, kde dva anonymní modely vedou párový dialog s uživatelem. Po dialogu uživatel hlasuje, čí odpověď byla lepší. Na základě tisíců takových „soubojů" se sestavuje Elo rating preferencí uživatelů, který odráží kvalitu modelů v živé komunikaci[15].
- MT-Bench (2023) — automatizovaný benchmark pro zátěžové testování dialogových dovedností. Obsahuje 80 párů otázek napodobujících vícekolový dialog. Odpovědi modelů jsou hodnoceny jiným, výkonnějším LLM („LLM-as-a-judge", například GPT-4) podle předem stanovené škály[16].
Bezpečnost a spolehlivost
- AgentHarm (2024) — benchmark hodnotící sklon LLM agentů plnit nebezpečné instrukce. Obsahuje 110 scénářů představujících škodlivé úlohy (od podvodů po kybernetickou kriminalitu). Dobrý model by měl takové požadavky odmítat[17].
- SafetyBench (2023) — rozsáhlá sada více než 11 tisíc otázek prověřující, jak důsledně se model vyhýbá generování nepřijatelného obsahu a škodlivých rad, včetně reakcí na provokativní dotazy[18].
Omezení a aktuální problémy
- Kontaminace dat: Hlavní hrozbou pro věrohodnost hodnocení je únik testovacích dat do trénovacích sad. Model si může jednoduše zapamatovat odpovědi, což uměle zvyšuje jeho výsledek[2].
- Nasycení benchmarků: S rozvojem modelů jejich výkonnost na starších benchmarcích (jako GLUE) dosahuje stropu a test přestává být užitečný pro rozlišování nových, výkonnějších modelů. To vyžaduje neustálý vývoj náročnějších referenčních testů[2].
- Rozpor s realitou: Vysoké výsledky na benchmarcích nezaručují vždy spolehlivé fungování modelu v reálných, nestrukturovaných scénářích. Reálné prostředí je často bohatší a nepředvídatelnější než jakákoli pevně daná sada úloh[1].
Odkazy
- Open LLM Leaderboard — otevřený žebříček modelů od komunity Hugging Face
- Chatbot Arena Leaderboard — žebříček chatovacích modelů na základě lidských preferencí
Poznámky
- ↑ 1.0 1.1 «What Are LLM Benchmarks?». IBM. [1]
- ↑ 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [2]
- ↑ «Самые популярные LLM бенчмарки». Хабр. [3]
- ↑ Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [4]
- ↑ Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [5]
- ↑ Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [6]
- ↑ Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [7]
- ↑ Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [8]
- ↑ Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [9]
- ↑ Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [10]
- ↑ Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [11]
- ↑ Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [12]
- ↑ Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [13]
- ↑ Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [14]
- ↑ Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [15]
- ↑ Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [16]
- ↑ Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [17]
- ↑ Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [18]