Metriky kvality LLM
Metriky kvality velkých jazykových modelů (LLM) — to je systematický přístup a soubor standardizovaných nástrojů pro měření různých aspektů výkonnosti jazykových modelů, včetně přesnosti, bezpečnosti, spravedlnosti a spolehlivosti[1]. Jak LLM nacházejí stále širší uplatnění v kriticky důležitých oblastech, jako je zdravotnictví, finance a vzdělávání, vzniká naléhavá potřeba jejich komplexního a objektivního hodnocení[2].
Metriky a benchmarky plní několik klíčových funkcí: umožňují objektivně porovnávat různé modely, sledovat pokrok v jejich vývoji, odhalovat slabá místa a zajišťovat transparentnost výsledků pro výzkumníky i odborníky z praxe[1].
Kategorie metrik
Metriky pro hodnocení LLM lze rozdělit do několika základních kategorií: automatické metriky, hodnocení za účasti člověka a specializované metriky pro hodnocení bezpečnosti a spolehlivosti.
Automatické metriky
Tyto metriky umožňují rychlé a škálovatelné hodnocení bez zapojení člověka.
Metriky založené na n-gramech
Tradiční metriky měřící lexikální shodu mezi vygenerovaným a referenčním textem.
- BLEU (Bilingual Evaluation Understudy): Původně vyvinutá pro hodnocení kvality strojového překladu. Měří přesnost shody n-gramů (sekvencí n slov) a uplatňuje penalizaci za příliš krátké vygenerované texty[3].
- ROUGE (Recall-Oriented Understudy for Gisting Evaluation): Zaměřuje se na úplnost, měří, jak dobře jsou n-gramy z referenčního textu zastoupeny ve vygenerovaném. Zvláště účinná pro hodnocení úloh sumarizace[3].
- METEOR: Rozšiřuje možnosti BLEU tím, že zohledňuje synonyma, příbuzná slova a morfologické varianty, což umožňuje dosáhnout lepší korelace s lidskými hodnoceními[3].
Sémantické metriky
Tyto metriky využívají kontextuální embedding pro hodnocení sémantické blízkosti, nikoli pouze lexikální shody.
- BERTScore: Vypočítává sémantickou podobnost mezi tokeny vygenerovaného a referenčního textu s využitím embeddingů z modelu BERT. To umožňuje rozpoznávat sémantickou ekvivalenci i při odlišném způsobu vyjádření[4].
- MAUVE: Měří divergenci mezi rozloženími strojového a lidského textu v prostoru embeddingů. Zvláště účinná pro hodnocení otevřené generace, kde neexistuje pevně stanovený referenční text[5].
Interní metriky jazykového modelování
- Perplexita (Perplexity): Základní metrika měřící, jak dobře jazykový model předpovídá sekvenci textu. Odráží nejistotu modelu při předpovídání dalšího tokenu. Nižší hodnoty perplexity indikují lepší výkonnost[6].
- Přesnost a F1-míra: Široce používány v úlohách klasifikace a systémech otázek a odpovědí. F1-míra představuje harmonický průměr přesnosti a úplnosti, čímž zajišťuje vyvážené hodnocení[6].
Hodnocení za účasti člověka
Lidské hodnocení zůstává „zlatým standardem", protože automatické metriky často nedokáží zachytit jemné aspekty kvality, jako jsou soudržnost, kreativita a relevance[7].
- Přímé hodnocení: Odborníci nebo účastníci crowdsourcingu hodnotí kvalitu generování na dané škále (například od 1 do 5) podle kritérií, jako jsou plynulost a soudržnost.
- Srovnávací hodnocení: Hodnotitelům je nabídnuto porovnat výstupy dvou nebo více modelů a vybrat nejlepší (párové srovnání) nebo je seřadit od nejlepšího k nejhoršímu.
Nevýhodami lidského hodnocení jsou vysoké náklady, obtížnost škálování a subjektivita[7].
Hodnocení pomocí LLM (LLM-as-a-Judge)
Nový přístup, při němž jeden (obvykle výkonnější) jazykový model slouží k hodnocení odpovědí jiného. Například GPT-4 může řadit výstupy modelů podle zadaných kritérií. Tato metoda poskytuje škálovatelnou alternativu k lidskému hodnocení, ačkoli má i vlastní problémy, jako je citlivost na styl dotazů a potenciální zaujatost[8].
Specializované metriky a benchmarky
Pro hodnocení konkrétních aspektů výkonnosti a spolehlivosti LLM se používají specializované metriky a benchmarky.
Faktická spolehlivost
Hodnotí schopnost modelu generovat pravdivé informace a nevykazovat halucinace.
- TruthfulQA: Benchmark speciálně navržený pro měření sklonu modelů generovat odpovědi založené na rozšířených mýtech a omylech. Od modelu se vyžaduje poskytování fakticky správných, nikoli pouze populárních odpovědí[9].
Bezpečnost a etika
- Hodnocení toxicity: Měří přítomnost urážlivého nebo škodlivého obsahu. K tomu se používají specializované klasifikátory a API, například Perspective API[9].
- Hodnocení zaujatosti a spravedlnosti: Posuzuje, zda model vykazuje diskriminační chování vůči různým demografickým skupinám. Výzkumy ukazují, že LLM mohou uchovávat a zesilovat společenské stereotypy z trénovacích dat[10].
- SafetyBench: Komplexní benchmark pro hodnocení bezpečnosti zahrnující ověření odolnosti vůči adversarial útokům a schopnosti vyhýbat se generování škodlivého obsahu[11].
Komplexní benchmarky
- MMLU (Massive Multitask Language Understanding): Jeden z nejrozšířenějších benchmarků, obsahující otázky s výběrem odpovědí ze 57 předmětů, od základní matematiky až po mezinárodní právo. Hodnotí šíři a hloubku znalostí modelu[12].
- BIG-bench (Beyond the Imitation Game): Obsahuje více než 204 úloh navržených pro hodnocení schopností, které přesahují možnosti standardních jazykových modelů, včetně úloh od hry v šachy po hádání emoji[12].
Výzvy a omezení
- Problém korelace: Tradiční automatické metriky, jako jsou BLEU a ROUGE, často špatně korelují s lidskými hodnoceními, zejména v kreativních úlohách[13].
- Znečištění dat (Data Contamination): Existuje riziko, že testovací data benchmarku mohla proniknout do trénovací sady modelu, což vede k nadhodnoceným a nedůvěryhodným výsledkům hodnocení[14].
- Vícejazyčné hodnocení: Většina existujících metrik a benchmarků se soustředí na anglický jazyk, což omezuje jejich použitelnost pro hodnocení vícejazyčných schopností LLM[15].
Odkazy
- What Are LLM Benchmarks? — přehledový článek od IBM
- 20 LLM evaluation benchmarks and how they work — průvodce benchmarky od Evidently AI
Literatura
- Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
- Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
- Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
- Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
- Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
- Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.
Poznámky
- ↑ 1.0 1.1 «Метрики качества LLM». Perplexity AI.
- ↑ «Специализированные метрики безопасности». Perplexity AI.
- ↑ 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
- ↑ «Семантические метрики». Perplexity AI.
- ↑ «Метрики на основе распределений». Perplexity AI.
- ↑ 6.0 6.1 «Intrinsic метрики». Perplexity AI.
- ↑ 7.0 7.1 «Оценка с участием человека». Perplexity AI.
- ↑ «LLM-as-a-Judge». Perplexity AI.
- ↑ 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
- ↑ «Предвзятость и справедливость». Perplexity AI.
- ↑ «Benchmark'ы безопасности». Perplexity AI.
- ↑ 12.0 12.1 «Comprehensive оценка». Perplexity AI.
- ↑ «Проблемы корреляции». Perplexity AI.
- ↑ «Загрязнение данных». Perplexity AI.
- ↑ «Многоязычная оценка». Perplexity AI.