Metriky kvality LLM

From Systems analysis Wiki
Jump to navigation Jump to search

Metriky kvality velkých jazykových modelů (LLM) — to je systematický přístup a soubor standardizovaných nástrojů pro měření různých aspektů výkonnosti jazykových modelů, včetně přesnosti, bezpečnosti, spravedlnosti a spolehlivosti[1]. Jak LLM nacházejí stále širší uplatnění v kriticky důležitých oblastech, jako je zdravotnictví, finance a vzdělávání, vzniká naléhavá potřeba jejich komplexního a objektivního hodnocení[2].

Metriky a benchmarky plní několik klíčových funkcí: umožňují objektivně porovnávat různé modely, sledovat pokrok v jejich vývoji, odhalovat slabá místa a zajišťovat transparentnost výsledků pro výzkumníky i odborníky z praxe[1].

Kategorie metrik

Metriky pro hodnocení LLM lze rozdělit do několika základních kategorií: automatické metriky, hodnocení za účasti člověka a specializované metriky pro hodnocení bezpečnosti a spolehlivosti.

Automatické metriky

Tyto metriky umožňují rychlé a škálovatelné hodnocení bez zapojení člověka.

Metriky založené na n-gramech

Tradiční metriky měřící lexikální shodu mezi vygenerovaným a referenčním textem.

  • BLEU (Bilingual Evaluation Understudy): Původně vyvinutá pro hodnocení kvality strojového překladu. Měří přesnost shody n-gramů (sekvencí n slov) a uplatňuje penalizaci za příliš krátké vygenerované texty[3].
  • ROUGE (Recall-Oriented Understudy for Gisting Evaluation): Zaměřuje se na úplnost, měří, jak dobře jsou n-gramy z referenčního textu zastoupeny ve vygenerovaném. Zvláště účinná pro hodnocení úloh sumarizace[3].
  • METEOR: Rozšiřuje možnosti BLEU tím, že zohledňuje synonyma, příbuzná slova a morfologické varianty, což umožňuje dosáhnout lepší korelace s lidskými hodnoceními[3].

Sémantické metriky

Tyto metriky využívají kontextuální embedding pro hodnocení sémantické blízkosti, nikoli pouze lexikální shody.

  • BERTScore: Vypočítává sémantickou podobnost mezi tokeny vygenerovaného a referenčního textu s využitím embeddingů z modelu BERT. To umožňuje rozpoznávat sémantickou ekvivalenci i při odlišném způsobu vyjádření[4].
  • MAUVE: Měří divergenci mezi rozloženími strojového a lidského textu v prostoru embeddingů. Zvláště účinná pro hodnocení otevřené generace, kde neexistuje pevně stanovený referenční text[5].

Interní metriky jazykového modelování

  • Perplexita (Perplexity): Základní metrika měřící, jak dobře jazykový model předpovídá sekvenci textu. Odráží nejistotu modelu při předpovídání dalšího tokenu. Nižší hodnoty perplexity indikují lepší výkonnost[6].
  • Přesnost a F1-míra: Široce používány v úlohách klasifikace a systémech otázek a odpovědí. F1-míra představuje harmonický průměr přesnosti a úplnosti, čímž zajišťuje vyvážené hodnocení[6].

Hodnocení za účasti člověka

Lidské hodnocení zůstává „zlatým standardem", protože automatické metriky často nedokáží zachytit jemné aspekty kvality, jako jsou soudržnost, kreativita a relevance[7].

  • Přímé hodnocení: Odborníci nebo účastníci crowdsourcingu hodnotí kvalitu generování na dané škále (například od 1 do 5) podle kritérií, jako jsou plynulost a soudržnost.
  • Srovnávací hodnocení: Hodnotitelům je nabídnuto porovnat výstupy dvou nebo více modelů a vybrat nejlepší (párové srovnání) nebo je seřadit od nejlepšího k nejhoršímu.

Nevýhodami lidského hodnocení jsou vysoké náklady, obtížnost škálování a subjektivita[7].

Hodnocení pomocí LLM (LLM-as-a-Judge)

Nový přístup, při němž jeden (obvykle výkonnější) jazykový model slouží k hodnocení odpovědí jiného. Například GPT-4 může řadit výstupy modelů podle zadaných kritérií. Tato metoda poskytuje škálovatelnou alternativu k lidskému hodnocení, ačkoli má i vlastní problémy, jako je citlivost na styl dotazů a potenciální zaujatost[8].

Specializované metriky a benchmarky

Pro hodnocení konkrétních aspektů výkonnosti a spolehlivosti LLM se používají specializované metriky a benchmarky.

Faktická spolehlivost

Hodnotí schopnost modelu generovat pravdivé informace a nevykazovat halucinace.

  • TruthfulQA: Benchmark speciálně navržený pro měření sklonu modelů generovat odpovědi založené na rozšířených mýtech a omylech. Od modelu se vyžaduje poskytování fakticky správných, nikoli pouze populárních odpovědí[9].

Bezpečnost a etika

  • Hodnocení toxicity: Měří přítomnost urážlivého nebo škodlivého obsahu. K tomu se používají specializované klasifikátory a API, například Perspective API[9].
  • Hodnocení zaujatosti a spravedlnosti: Posuzuje, zda model vykazuje diskriminační chování vůči různým demografickým skupinám. Výzkumy ukazují, že LLM mohou uchovávat a zesilovat společenské stereotypy z trénovacích dat[10].
  • SafetyBench: Komplexní benchmark pro hodnocení bezpečnosti zahrnující ověření odolnosti vůči adversarial útokům a schopnosti vyhýbat se generování škodlivého obsahu[11].

Komplexní benchmarky

  • MMLU (Massive Multitask Language Understanding): Jeden z nejrozšířenějších benchmarků, obsahující otázky s výběrem odpovědí ze 57 předmětů, od základní matematiky až po mezinárodní právo. Hodnotí šíři a hloubku znalostí modelu[12].
  • BIG-bench (Beyond the Imitation Game): Obsahuje více než 204 úloh navržených pro hodnocení schopností, které přesahují možnosti standardních jazykových modelů, včetně úloh od hry v šachy po hádání emoji[12].

Výzvy a omezení

  • Problém korelace: Tradiční automatické metriky, jako jsou BLEU a ROUGE, často špatně korelují s lidskými hodnoceními, zejména v kreativních úlohách[13].
  • Znečištění dat (Data Contamination): Existuje riziko, že testovací data benchmarku mohla proniknout do trénovací sady modelu, což vede k nadhodnoceným a nedůvěryhodným výsledkům hodnocení[14].
  • Vícejazyčné hodnocení: Většina existujících metrik a benchmarků se soustředí na anglický jazyk, což omezuje jejich použitelnost pro hodnocení vícejazyčných schopností LLM[15].

Odkazy

  • What Are LLM Benchmarks? — přehledový článek od IBM
  • 20 LLM evaluation benchmarks and how they work — průvodce benchmarky od Evidently AI

Literatura

  • Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
  • Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
  • Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
  • Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
  • Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
  • Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
  • Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
  • Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
  • Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
  • Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
  • Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
  • Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
  • Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.

Poznámky

  1. 1.0 1.1 «Метрики качества LLM». Perplexity AI.
  2. «Специализированные метрики безопасности». Perplexity AI.
  3. 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
  4. «Семантические метрики». Perplexity AI.
  5. «Метрики на основе распределений». Perplexity AI.
  6. 6.0 6.1 «Intrinsic метрики». Perplexity AI.
  7. 7.0 7.1 «Оценка с участием человека». Perplexity AI.
  8. «LLM-as-a-Judge». Perplexity AI.
  9. 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
  10. «Предвзятость и справедливость». Perplexity AI.
  11. «Benchmark'ы безопасности». Perplexity AI.
  12. 12.0 12.1 «Comprehensive оценка». Perplexity AI.
  13. «Проблемы корреляции». Perplexity AI.
  14. «Загрязнение данных». Perplexity AI.
  15. «Многоязычная оценка». Perplexity AI.