LLM-benchmarks (SV)
Riktmärken för stora språkmodeller är standardiserade testsviter utformade för att mäta, jämföra och utvärdera kvaliteten och kapaciteten hos stora språkmodeller (LLM)[1]. Vanligtvis består varje benchmark av en fast uppsättning uppgifter (till exempel frågor, texter eller instruktioner) för vilka korrekta svar eller bedömningskriterier är kända i förväg. Detta tillvägagångssätt möjliggör objektiv jämförelse av olika modeller under identiska förhållanden, vilket gör det möjligt att följa framsteg inom området och identifiera modellernas styrkor och svagheter[2].
Regelbunden användning av benchmark spelar en nyckelroll i utvecklingen av LLM, genom att stimulera utvecklare att förbättra modeller och säkerställa transparens och jämförbarhet av resultat inom forskarsamhället. Utvecklingen av benchmark återspeglar LLM:s egen framväxt: från enkla uppgifter om språkförståelse till komplexa tester som prövar flerstegsresonemang, sunt förnuft, etik och säkerhet[3].
Huvudkategorier och exempel
Benchmark för LLM täcker en mängd olika färdigheter och tillämpningsområden. Nedan beskrivs de viktigaste kategorierna och de mest kända uppgiftssamlingarna inom var och en av dem.
Allmän språkförståelse
Denna kategori utvärderar modellens grundläggande förmåga att förstå och tolka naturligt språk.
- GLUE (General Language Understanding Evaluation, 2019) — ett av de första heltäckande benchmark, som inkluderar en rad varierade uppgifter: från sentimentanalys till bedömning av logisk sammanhållning i text. Resultaten från alla uppgifter aggregeras till ett enda poängvärde, vilket möjliggjorde jämförelse av tidiga modeller utifrån deras samlade prestanda[4].
- SuperGLUE (2019) — en "förstärkt" efterföljare till GLUE, utvecklad som svar på att modeller snabbt nådde en nivå nära mänsklig prestanda på det ursprungliga testet. SuperGLUE innehåller svårare uppgifter som kräver djup kontextförståelse och förmåga att dra slutsatser[5].
- WinoGrande (2019) — en utvidgad variant av Winograd Schema-quizet. Innehåller 44 000 uppgifter om upplösning av tvetydiga pronomen i meningar som kräver sunt förnuft för att välja rätt tolkning[6].
Multitask- och komplexbenchmark
Dessa samlingar testar modeller på ett brett spektrum av kunskaper och färdigheter, utöver rent språkliga uppgifter.
- MMLU (Massive Multitask Language Understanding, 2020) — en samling quizuppgifter som täcker 57 ämnesområden: från skolämnen till högt specialiserad professionell kunskap (juridik, medicin). MMLU mäter bredden på modellens allmänbildning[7].
- BIG-bench (Beyond the Imitation Game Benchmark, 2022) — det vid skapandetillfället största kollaborativa benchmark, utvecklat av mer än 400 upphovsmän. Det innehåller över 200 uppgifter inom de mest skilda ämnen, från lingvistik till fysik, för att testa modeller bortom schablonmässig matchning och identifiera deras gränser i icke-standardiserade situationer[8].
Sunt förnuft och sanningsenlighet
Dessa benchmark utvärderar modellens förmåga att dra logiska slutsatser om vardagliga situationer och undvika att sprida falsk information.
- HellaSwag (2019) — testar sunt förnuft genom uppgiften att välja det mest trovärdiga avslutandet på en situationsbeskrivning. Benchmark:ets särdrag är förekomsten av "fällor": felaktiga svar är automatiskt genererade och ser mycket trovärdiga ut, vilket kräver att modellen har en djup kontextförståelse[9].
- TruthfulQA (2021) — mäter modellens benägenhet att sprida populära myter och missuppfattningar. Innehåller frågor där det på internet vanligt förekommande svaret är felaktigt (till exempel "Orsakar vacciner autism?"). Modellen måste motstå falska stereotyper och ge ett faktamässigt korrekt svar[10].
Matematiska uppgifter
- GSM8K (2021) — innehåller tusentals textuppgifter i matematik på grundskolenivå. Varje uppgift kräver en sekvens av 2–8 aritmetiska steg för att nå svaret, vilket testar modellens förmåga till flerstegsresonemang[11].
- MATH (2021) — en svårare samling bestående av uppgifter från matematiktävlingar och olympiader. Den inkluderar avsnitt om algebra, geometri och talteori, och kräver att modellen behärskar icke-triviala lösningsmetoder[12].
Generering av programkod
- HumanEval (2021) — ett standardtest för att utvärdera LLM:s förmåga att skriva kod. Innehåller 164 programmeringsuppgifter där modellen ska generera korrekt Python-kod utifrån en given beskrivning. Korrekthet bedöms med hjälp av enhetstester[13].
- SWE-bench (2023) — ett mer realistiskt benchmark som samlar beskrivningar av verkliga problem (issues) från GitHub. Modellen ska generera en patch (ett kodfragment) som löser problemet. Detta kräver förståelse av stora mängder andras kod och komplext stegvis resonemang[14].
Utvärdering av dialogmodeller
- Chatbot Arena (2024) — en öppen onlineplattform där två anonyma modeller deltar i en parvis dialog med en användare. Efter dialogen röstar användaren på vilket svar som var bäst. Baserat på tusentals sådana "dueller" skapas ett Elo-betyg för användarpreferenser, vilket återspeglar modellernas kvalitet i levande kommunikation[15].
- MT-Bench (2023) — ett automatiserat benchmark för stresstestning av dialogförmågor. Det innehåller 80 frågepar som simulerar flerstegsdialoger. Modellernas svar bedöms av en annan, kraftfullare LLM ("LLM-as-a-judge", till exempel GPT-4) enligt en i förväg definierad skala[16].
Säkerhet och tillförlitlighet
- AgentHarm (2024) — ett benchmark som utvärderar LLM-agenters benägenhet att utföra farliga instruktioner. Det inkluderar 110 scenarier som representerar skadliga uppgifter (från bedrägeri till cyberbrott). En bra modell bör vägra att utföra sådana förfrågningar[17].
- SafetyBench (2023) — en bred samling med mer än 11 000 frågor som testar hur konsekvent en modell undviker att generera oacceptabelt innehåll och skadliga råd, inklusive som svar på provocerande förfrågningar[18].
Begränsningar och aktuella problem
- Datakontaminering: Det största hotet mot utvärderingens tillförlitlighet är att testdata läcker in i träningsseten. Modellen kan helt enkelt memorera svaren, vilket artificiellt höjer dess resultat[2].
- Benchmark-mättnad: I takt med att modeller utvecklas når deras prestanda ett tak på äldre benchmark (som GLUE), och testet slutar vara användbart för att skilja nya, kraftfullare modeller åt. Detta kräver kontinuerlig utveckling av mer komplexa referenstest[2].
- Klyftan till verkligheten: Höga resultat på benchmark garanterar inte alltid tillförlitlig prestanda i verkliga, ostrukturerade scenarier. Den verkliga miljön är ofta rikare och mer oförutsägbar än någon fast uppgiftssamling[1].
Externa länkar
- Open LLM Leaderboard — öppen modellranking från Hugging Face-gemenskapen
- Chatbot Arena Leaderboard — ranking av chattmodeller baserad på mänskliga preferenser
Noter
- ↑ 1.0 1.1 «What Are LLM Benchmarks?». IBM. [1]
- ↑ 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [2]
- ↑ «Самые популярные LLM бенчмарки». Хабр. [3]
- ↑ Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [4]
- ↑ Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [5]
- ↑ Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [6]
- ↑ Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [7]
- ↑ Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [8]
- ↑ Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [9]
- ↑ Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [10]
- ↑ Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [11]
- ↑ Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [12]
- ↑ Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [13]
- ↑ Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [14]
- ↑ Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [15]
- ↑ Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [16]
- ↑ Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [17]
- ↑ Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [18]