Utvärdering av LLM
Utvärdering av stora språkmodeller (LLM) — är en disciplin inom artificiell intelligens som tillhandahåller standardiserade metoder för att mäta språkmodellers förmågor, begränsningar och risker[1]. I takt med att LLM integreras i kritiska sektorer som sjukvård och finans blir en objektiv utvärdering av dem nödvändig för att säkerställa säkerhet, tillförlitlighet och rättvisa[2].
Utvärdering av LLM fyller flera grundläggande funktioner:
- Mätning av förmågor: Objektiv jämförelse av olika modellers prestanda på standardiserade uppgifter.
- Spårning av framsteg: Registrering av framgångar och identifiering av områden som kräver ytterligare förbättring.
- Minimering av risker: Identifiering av potentiellt skadliga resultat, såsom partiskhet, hallucinationer och säkerhetsproblem.
- Information till utvecklare och användare: Tillhandahållande av transparent information för att välja den mest lämpliga modellen för en specifik tillämpning.
Grundläggande tillvägagångssätt och metodologier
Modern utvärdering av LLM inleddes med framväxten av omfattande benchmark, såsom GLUE (General Language Understanding Evaluation), vilket etablerade standarden för utvärdering av allmän språkförståelse[3]. I takt med att modeller började överträffa mänskliga resultat på GLUE utvecklades mer avancerade efterföljare, såsom SuperGLUE[4].
Ett fundamentalt skifte skedde med införandet av multitask-benchmark som MMLU och BIG-bench, vilka testar modeller på ett brett spektrum av kunskaper och resonemangsförmågor som går bortom rent lingvistiska uppgifter[1].
Viktiga mätvärden och benchmark
Automatiska mätvärden
- Perplexitet (Perplexity): Ett grundläggande mätvärde som mäter hur väl en modell förutsäger text. Lägre perplexitet indikerar större säkerhet hos modellen i sina förutsägelser.
- BLEU och ROUGE: N-gram-baserade mätvärden som mäter lexikal överensstämmelse mellan genererad text och referenstext. BLEU fokuserar på precision, ROUGE på recall[2].
- BERTScore: Ett semantiskt mätvärde som använder embedding från BERT för att beräkna semantisk likhet. Det kan fånga upp synonymi och omformuleringar, vilket gör det mer precist än n-gram-baserade mätvärden[5].
Specialiserade benchmark
För att utvärdera specifika förmågor har riktade benchmark utvecklats:
- Kodgenerering: HumanEval utvärderar modellens förmåga att generera korrekt programkod utifrån en textbeskrivning och verifierar funktionaliteten med hjälp av enhetstester[6].
- Sunt förnuft: HellaSwag testar modellens förståelse av den fysiska världen och orsak-verkan-samband genom att förutsäga den mest sannolika avslutningen på en vardagssituation[7].
- Akademisk kunskap: MMLU (Massive Multitask Language Understanding) täcker 57 ämnen, från grundläggande matematik till juridik och medicin, och prövar bredden på modellens allmänbildning[8].
- Gränser för förmågor: BIG-bench (Beyond the Imitation Game) är ett kollaborativt projekt som samlar 204 uppgifter utformade för att identifiera emergenta förmågor — färdigheter som plötsligt uppstår när modellen når kritisk skala[9].
Utvärdering av säkerhet och etiska aspekter
- Partiskhet: För att utvärdera sociala och demografiska fördomar används dataset som BBQ (Bias Benchmark for Question Answering) och BOLD (Bias in Open-ended Language generation Dataset).
- Toxicitet: Benchmark som RealToxicityPrompts tillhandahåller promptar som provocerar fram generering av toxiskt innehåll, för att utvärdera modellens robusthet.
- Robusthet: Utvärderas med hjälp av adversariella attacker. Ramverket PromptRobust tillhandahåller en omfattande uppsättning promptar för att testa modellens robusthet på tecken-, ord- och meningsnivå.
Moderna standarder och ramverk
- HELM (Holistic Evaluation of Language Models): Ett initiativ från Stanford University som erbjuder en "holistisk" metodologi. HELM utvärderar modeller längs flera dimensioner: noggrannhet, robusthet, rättvisa, partiskhet, toxicitet och effektivitet[10].
- ISO/IEC 42001:2023: Den första internationella standarden för AI-hanteringssystem, som fastställer krav på styrning av AI under hela livscykeln.
- EU-förordning 2024/1689 (EU AI Act): Den första övergripande regleringen av AI, som kräver standardiserade utvärderingar för allmänändamålsmodeller med systemrisker.
- NIST AI Risk Management Framework 1.0: Ett frivilligt ramverk för utveckling och driftsättning av tillförlitlig AI, utvecklat av USA:s nationella institut för standarder och teknik.
Problem och begränsningar med befintliga metoder
- Benchmark-mättnad: Många modeller uppnår nästan perfekta resultat på populära benchmark, vilket leder till fenomenet "benchmark-jakt", där modeller optimeras för specifika tester snarare än för allmänna förmågor.
- Datakontaminering: Ett kritiskt problem där testdata från ett benchmark råkar hamna i träningsdatasetet, vilket leder till överdrivna och orättvisa utvärderingsresultat.
- Låg korrelation med mänskliga bedömningar: Automatiska mätvärden som BLEU och ROUGE korrelerar ofta dåligt med mänsklig kvalitetsbedömning, särskilt i kreativa och öppna uppgifter.
Aktuell forskning och trender
- Paradigmet LLM-as-a-Judge: Användning av kraftfulla LLM (t.ex. GPT-4) som "domare" för att utvärdera andra modellers svar. Detta tillvägagångssätt erbjuder ett skalbart alternativ till kostsam mänsklig utvärdering.
- Dynamisk och adaptiv utvärdering: Plattformar som LMArena presenterar ett crowdsourcing-baserat system med Elo-ratings för verklig utvärdering av modeller i levande interaktion med användare.
- Hybrida tillvägagångssätt: Kombination av automatiserade mätvärden med mänsklig bedömning och LLM-utvärdering för att få en mer fullständig och tillförlitlig bild av modellens prestanda.
Landskapet för LLM-utvärdering fortsätter att utvecklas i riktning mot skapandet av flerdimensionella, standardiserade och reproducerbara ramverk som tar hänsyn inte bara till noggrannhet, utan även till sociala och etiska aspekter av tillämpningen av AI-teknik[1].
Referenser
- Stanford HELM — officiell webbplats för projektet Holistic Evaluation of Language Models.
- Chatbot Arena — plattform för jämförande utvärdering av chattbotar baserad på mänskliga preferenser.
Litteratur
- Wang, A. et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv:1804.07461.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv:1905.00537.
- Zellers, R. et al. (2019). HellaSwag: Can a Machine Really Finish Your Sentence?. arXiv:1905.07830.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. arXiv:2009.11462.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Bommasani, R. et al. (2022). Holistic Evaluation of Language Models. arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Zhuang, Y. et al. (2023). Through the Lens of Core Competency: Survey on Evaluation of Large Language Models. ACL Anthology:2023.ccl-2.8.
- Zhu, K. et al. (2023). PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts. arXiv:2306.04528.
Noter
- ↑ 1.0 1.1 1.2 Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». arXiv. [1]
- ↑ 2.0 2.1 Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». ACL Anthology. [2]
- ↑ Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv.[3]
- ↑ Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». Medium.
- ↑ Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». arXiv.
- ↑ Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». arXiv.
- ↑ Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv.
- ↑ Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». arXiv.
- ↑ Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv.
- ↑ Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». arXiv. [4]