Metrici de calitate LLM
Metricile de calitate ale modelelor lingvistice de mari dimensiuni (LLM) reprezintă o abordare sistematică și un set de instrumente standardizate pentru măsurarea diferitelor aspecte ale performanței modelelor lingvistice, inclusiv acuratețea, siguranța, echitatea și fiabilitatea[1]. Pe măsură ce LLM-urile găsesc o aplicare tot mai largă în domenii critice, precum sănătatea, finanțele și educația, apare o necesitate stringentă de evaluare complexă și obiectivă a acestora[2].
Metricile și benchmark-urile îndeplinesc mai multe funcții esențiale: permit compararea obiectivă a diferitelor modele, urmărirea progresului în dezvoltarea lor, identificarea punctelor slabe și asigurarea transparenței rezultatelor pentru cercetători și practicieni[1].
Categorii de metrici
Metricile pentru evaluarea LLM-urilor pot fi împărțite în mai multe categorii principale: metrici automate, evaluare cu participarea umană și metrici specializate pentru evaluarea siguranței și fiabilității.
Metrici automate
Aceste metrici permit realizarea unei evaluări rapide și scalabile fără participarea umană.
Metrici bazate pe n-grame
Metrici tradiționale care măsoară suprapunerea lexicală dintre textul generat și textul de referință.
- BLEU (Bilingual Evaluation Understudy): Dezvoltată inițial pentru evaluarea calității traducerii automate. Măsoară precizia potrivirii n-gramelor (secvențe de n cuvinte) și aplică o penalizare pentru textele generate prea scurte[3].
- ROUGE (Recall-Oriented Understudy for Gisting Evaluation): Se concentrează pe completitudine, măsurând cât de bine sunt reprezentate n-gramele din textul de referință în textul generat. Este deosebit de eficientă pentru evaluarea sarcinilor de sumarizare[3].
- METEOR: Extinde capacitățile BLEU prin luarea în considerare a sinonimelor, cuvintelor cu aceeași rădăcină și variantelor morfologice, ceea ce permite obținerea unei corelații mai bune cu evaluările umane[3].
Metrici semantice
Aceste metrici utilizează embedding-uri contextuale pentru evaluarea proximității semantice, nu doar a suprapunerii lexicale.
- BERTScore: Calculează similaritatea semantică dintre token-urile textului generat și ale textului de referință, folosind embedding-uri din modelul BERT. Aceasta permite recunoașterea echivalenței semantice chiar și în cazul unor formulări diferite[4].
- MAUVE: Măsoară divergența dintre distribuțiile textului generat de mașină și ale textului uman în spațiul embedding-urilor. Este deosebit de eficientă pentru evaluarea generării deschise, unde nu există un text de referință fix[5].
Metrici interne de modelare lingvistică
- Perplexitatea (Perplexity): O metrică fundamentală care măsoară cât de bine prezice un model lingvistic o secvență de text. Reflectă incertitudinea modelului în prezicerea următorului token. Valorile mai scăzute ale perplexității indică o performanță mai bună[6].
- Precizia și măsura F1: Utilizate pe scară largă în sarcinile de clasificare și în sistemele de întrebări și răspunsuri. Măsura F1 reprezintă media armonică dintre precizie și completitudine, asigurând o evaluare echilibrată[6].
Evaluare cu participarea umană
Evaluarea umană rămâne „standardul de aur", deoarece metricile automate nu reușesc adesea să surprindă aspectele subtile ale calității, cum ar fi coerența, creativitatea și relevanța[7].
- Evaluare directă: Experții sau colaboratorii din crowdsourcing evaluează calitatea generării pe o scară dată (de exemplu, de la 1 la 5) după criterii precum fluența și coerența.
- Evaluare comparativă: Evaluatorilor li se propune să compare ieșirile a două sau mai multe modele și să o aleagă pe cea mai bună (comparație pereche) sau să le clasifice de la cea mai bună la cea mai slabă.
Dezavantajele evaluării umane sunt costul ridicat, dificultatea scalării și subiectivitatea[7].
Evaluare cu ajutorul LLM (LLM-as-a-Judge)
O abordare nouă în care un model lingvistic (de obicei mai puternic) este utilizat pentru a evalua răspunsurile altui model. De exemplu, GPT-4 poate clasifica ieșirile modelelor după criterii date. Această metodă oferă o alternativă scalabilă la evaluarea umană, deși prezintă și propriile provocări, precum sensibilitatea la stilul prompt-urilor și potențialele prejudecăți[8].
Metrici și benchmark-uri specializate
Pentru evaluarea unor aspecte specifice ale performanței și fiabilității LLM-urilor sunt utilizate metrici și benchmark-uri specializate.
Fiabilitate factuală
Evaluează capacitatea modelului de a genera informații veridice și de a evita halucinațiile.
- TruthfulQA: Un benchmark special conceput pentru a măsura tendința modelelor de a genera răspunsuri bazate pe mituri și concepții greșite comune. Modelului i se cere să ofere răspunsuri corecte din punct de vedere factual, nu doar populare[9].
Siguranță și etică
- Evaluarea toxicității: Măsoară prezența conținutului ofensator sau dăunător. În acest scop sunt utilizate clasificatoare specializate și API-uri, de exemplu, Perspective API[9].
- Evaluarea prejudecăților și a echității: Evaluează dacă modelul manifestă comportament discriminatoriu față de diferite grupuri demografice. Studiile arată că LLM-urile pot păstra și amplifica stereotipurile sociale din datele de antrenament[10].
- SafetyBench: Un benchmark complex pentru evaluarea siguranței, care include verificarea rezistenței la atacuri adversariale și a capacității de a evita generarea de conținut dăunător[11].
Benchmark-uri complexe
- MMLU (Massive Multitask Language Understanding): Unul dintre cele mai utilizate benchmark-uri, incluzând întrebări cu variante multiple de răspuns la 57 de discipline, de la matematică elementară până la drept internațional. Evaluează amploarea și profunzimea cunoștințelor modelului[12].
- BIG-bench (Beyond the Imitation Game): Conține peste 204 sarcini concepute pentru a evalua capacități care depășesc posibilitățile modelelor lingvistice standard, incluzând sarcini de la jocul de șah până la ghicirea emoji-urilor[12].
Provocări și limitări
- Problema corelației: Metricile automate tradiționale, cum ar fi BLEU și ROUGE, corelează adesea slab cu evaluările umane, în special în sarcinile creative[13].
- Contaminarea datelor (Data Contamination): Există riscul ca datele de testare ale benchmark-ului să fi fost incluse în setul de antrenament al modelului, ceea ce conduce la evaluări supraestimate și nereliabile[14].
- Evaluarea multilingvă: Majoritatea metricilor și benchmark-urilor existente sunt centrate pe limba engleză, ceea ce le limitează aplicabilitatea pentru evaluarea capacităților multilingve ale LLM-urilor[15].
Referințe
- What Are LLM Benchmarks? — articol de prezentare generală de la IBM
- 20 LLM evaluation benchmarks and how they work — ghid privind benchmark-urile de la Evidently AI
Bibliografie
- Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
- Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
- Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
- Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
- Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
- Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.
Note
- ↑ 1.0 1.1 «Метрики качества LLM». Perplexity AI.
- ↑ «Специализированные метрики безопасности». Perplexity AI.
- ↑ 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
- ↑ «Семантические метрики». Perplexity AI.
- ↑ «Метрики на основе распределений». Perplexity AI.
- ↑ 6.0 6.1 «Intrinsic метрики». Perplexity AI.
- ↑ 7.0 7.1 «Оценка с участием человека». Perplexity AI.
- ↑ «LLM-as-a-Judge». Perplexity AI.
- ↑ 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
- ↑ «Предвзятость и справедливость». Perplexity AI.
- ↑ «Benchmark'ы безопасности». Perplexity AI.
- ↑ 12.0 12.1 «Comprehensive оценка». Perplexity AI.
- ↑ «Проблемы корреляции». Perplexity AI.
- ↑ «Загрязнение данных». Perplexity AI.
- ↑ «Многоязычная оценка». Perplexity AI.