LLM quality metrics (SV)
Kvalitetsmått för stora språkmodeller (LLM) — är ett systematiskt tillvägagångssätt och en uppsättning standardiserade verktyg för att mäta olika aspekter av språkmodellers prestanda, inklusive noggrannhet, säkerhet, rättvisa och tillförlitlighet[1]. I takt med att LLM:er finner allt bredare tillämpning inom kritiskt viktiga områden som sjukvård, finans och utbildning, uppstår ett akut behov av en heltäckande och objektiv utvärdering av dem[2].
Mått och benchmark fyller flera nyckelfunktioner: de möjliggör objektiv jämförelse av olika modeller, spårning av framsteg i deras utveckling, identifiering av svagheter samt transparens i resultaten för forskare och praktiker[1].
Kategorier av mått
Mått för utvärdering av LLM:er kan delas in i flera huvudkategorier: automatiska mått, utvärdering med mänskligt deltagande samt specialiserade mått för bedömning av säkerhet och tillförlitlighet.
Automatiska mått
Dessa mått möjliggör snabb och skalbar utvärdering utan mänskligt deltagande.
Mått baserade på n-gram
Traditionella mått som mäter lexikal överlappning mellan genererad text och referenstext.
- BLEU (Bilingual Evaluation Understudy): Ursprungligen utvecklad för att utvärdera kvaliteten på maskinöversättning. Mäter noggrannheten i n-gram-matchningar (sekvenser av n ord) och tillämpar ett straff för alltför korta genererade texter[3].
- ROUGE (Recall-Oriented Understudy for Gisting Evaluation): Fokuserar på återkallelse och mäter hur väl n-gram från referenstexten återfinns i den genererade texten. Särskilt effektiv för utvärdering av sammanfattningsuppgifter[3].
- METEOR: Utvidgar möjligheterna hos BLEU genom att ta hänsyn till synonymer, stamord och morfologiska varianter, vilket ger bättre korrelation med mänskliga bedömningar[3].
Semantiska mått
Dessa mått använder kontextuella embedding för att bedöma semantisk likhet, inte bara lexikal överlappning.
- BERTScore: Beräknar semantisk likhet mellan token i den genererade texten och referenstexten med hjälp av embedding från modellen BERT. Detta möjliggör igenkänning av semantisk ekvivalens även vid olika formuleringar[4].
- MAUVE: Mäter divergensen mellan fördelningar av maskingenerad text och mänsklig text i embedding-rummet. Särskilt effektiv för utvärdering av öppen generering där det inte finns någon fast referenstext[5].
Interna mått för språkmodellering
- Perplexitet (Perplexity): Ett grundläggande mått som mäter hur väl en språkmodell förutsäger en sekvens av text. Det återspeglar modellens osäkerhet vid förutsägelse av nästa token. Lägre perplexitetsvärden indikerar bättre prestanda[6].
- Precision och F1-mått: Används allmänt vid klassificeringsuppgifter och fråge-svar-system. F1-måttet är det harmoniska medelvärdet av precision och återkallelse och ger en balanserad utvärdering[6].
Utvärdering med mänskligt deltagande
Mänsklig utvärdering förblir "guldstandarden" eftersom automatiska mått ofta inte kan fånga subtila kvalitetsaspekter som sammanhang, kreativitet och relevans[7].
- Direkt bedömning: Experter eller crowdsource-bedömare utvärderar kvaliteten på genereringen enligt en given skala (t.ex. från 1 till 5) utifrån kriterier som flyt och koherens.
- Jämförande bedömning: Bedömare ombeds jämföra utdata från två eller flera modeller och välja den bästa (parvis jämförelse) eller rangordna dem från bäst till sämst.
Nackdelarna med mänsklig utvärdering är höga kostnader, svårigheter att skala upp och subjektivitet[7].
Utvärdering med hjälp av LLM (LLM-as-a-Judge)
Ett nytt tillvägagångssätt där en (vanligtvis kraftfullare) språkmodell används för att utvärdera svaren från en annan. GPT-4 kan exempelvis rangordna modellernas utdata enligt givna kriterier. Denna metod erbjuder ett skalbart alternativ till mänsklig utvärdering, men har också sina egna utmaningar, såsom känslighet för promptstil och potentiell fördomsfullhet[8].
Specialiserade mått och benchmark
Specialiserade mått och benchmark används för att utvärdera specifika aspekter av LLM:ers prestanda och tillförlitlighet.
Faktamässig tillförlitlighet
Utvärderar modellens förmåga att generera sann information och undvika hallucinationer.
- TruthfulQA: Ett benchmark speciellt utformat för att mäta modellers benägenhet att generera svar baserade på vanliga myter och missuppfattningar. Modellen förväntas ge faktamässigt korrekta snarare än populära svar[9].
Säkerhet och etik
- Toxicitetsbedömning: Mäter förekomsten av kränkande eller skadligt innehåll. För detta används specialiserade klassificerare och API:er, till exempel Perspective API[9].
- Bedömning av fördomsfullhet och rättvisa: Utvärderar om modellen uppvisar diskriminerande beteende gentemot olika demografiska grupper. Forskning visar att LLM:er kan bevara och förstärka sociala stereotyper från träningsdata[10].
- SafetyBench: Ett heltäckande benchmark för säkerhetsutvärdering som inkluderar kontroll av motståndskraft mot adversarial-attacker och förmågan att undvika generering av skadligt innehåll[11].
Heltäckande benchmark
- MMLU (Massive Multitask Language Understanding): Ett av de mest använda benchmark, som innehåller flervalsfrågor inom 57 ämnen, från grundläggande matematik till internationell rätt. Det utvärderar bredden och djupet i modellens kunskaper[12].
- BIG-bench (Beyond the Imitation Game): Innehåller mer än 204 uppgifter utformade för att utvärdera förmågor som går utöver vad standardspråkmodeller klarar av, inklusive uppgifter som att spela schack och gissa emojis[12].
Utmaningar och begränsningar
- Korrelationsproblemet: Traditionella automatiska mått som BLEU och ROUGE korrelerar ofta dåligt med mänskliga bedömningar, särskilt vid kreativa uppgifter[13].
- Datakontaminering (Data Contamination): Det finns en risk att benchmark-testdata kan ha hamnat i modellens träningsuppsättning, vilket leder till uppblåsta och otillförlitliga utvärderingsresultat[14].
- Flerspråkig utvärdering: De flesta befintliga mått och benchmark är inriktade på engelska, vilket begränsar deras tillämpbarhet för utvärdering av LLM:ers flerspråkiga förmågor[15].
Referenser
- What Are LLM Benchmarks? — översiktsartikel från IBM
- 20 LLM evaluation benchmarks and how they work — guide till benchmark från Evidently AI
Litteratur
- Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
- Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
- Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
- Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
- Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
- Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.
Noter
- ↑ 1.0 1.1 «Метрики качества LLM». Perplexity AI.
- ↑ «Специализированные метрики безопасности». Perplexity AI.
- ↑ 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
- ↑ «Семантические метрики». Perplexity AI.
- ↑ «Метрики на основе распределений». Perplexity AI.
- ↑ 6.0 6.1 «Intrinsic метрики». Perplexity AI.
- ↑ 7.0 7.1 «Оценка с участием человека». Perplexity AI.
- ↑ «LLM-as-a-Judge». Perplexity AI.
- ↑ 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
- ↑ «Предвзятость и справедливость». Perplexity AI.
- ↑ «Benchmark'ы безопасности». Perplexity AI.
- ↑ 12.0 12.1 «Comprehensive оценка». Perplexity AI.
- ↑ «Проблемы корреляции». Perplexity AI.
- ↑ «Загрязнение данных». Perplexity AI.
- ↑ «Многоязычная оценка». Perplexity AI.