Бенчмаркове на LLM
Бенчмаркове на големите езикови модели — това са стандартизирани набори от тестове, предназначени за измерване, сравнение и оценка на качеството и възможностите на големите езикови модели (LLM)[1]. Обикновено всеки benchmark представлява фиксиран набор от задачи (например въпроси, текстове или инструкции), за които предварително са известни правилните отговори или критериите за оценка. Този подход осигурява обективно сравнение на различни модели при еднакви условия, позволявайки да се проследява напредъкът в областта и да се разкриват силните и слабите страни на моделите[2].
Редовното използване на бенчмаркове играе ключова роля в развитието на LLM, като стимулира разработчиците да подобряват моделите и осигурява прозрачност и съпоставимост на резултатите в научната общност. Еволюцията на бенчмарковете отразява развитието на самите LLM: от прости задачи за разбиране на езика до комплексни тестове, проверяващи многостъпкови разсъждения, здрав разум, етика и безопасност[3].
Основни категории и примери
Бенчмарковете на LLM обхващат разнообразни умения и области на приложение. По-долу са разгледани основните категории и най-известните набори от задачи във всяка от тях.
Общо езиково разбиране
Тази категория оценява базовите способности на модела за разбиране и интерпретация на естествен език.
- GLUE (General Language Understanding Evaluation, 2019) — един от първите комплексни бенчмаркове, включващ редица разнообразни задачи: от определяне на тоналност до оценка на логическата свързаност на текста. Резултатите по всички задания се агрегират в единен бал, което позволи сравняването на ранните модели по тяхната обща ефективност[4].
- SuperGLUE (2019) — „засилен" приемник на GLUE, разработен в отговор на факта, че моделите бързо достигнаха на него ниво, близко до човешкото. SuperGLUE включва по-трудни задачи, изискващи дълбоко разбиране на контекста и умение за правене на изводи[5].
- WinoGrande (2019) — разширен вариант на викторината Winograd Schema. Съдържа 44 хиляди задания за разрешаване на неясни местоимения в изречения, изискващи здрав разум за избор на правилната интерпретация[6].
Многозадачни и комплексни бенчмаркове
Тези набори проверяват моделите върху широк спектър от знания и умения, излизайки извън рамките на чисто лингвистичните задачи.
- MMLU (Massive Multitask Language Understanding, 2020) — сборник от задачи под формата на викторина, обхващащ 57 предметни области: от училищни дисциплини до тясноспециализирани професионални знания (юриспруденция, медицина). MMLU измерва широтата на ерудицията на модела[7].
- BIG-bench (Beyond the Imitation Game Benchmark, 2022) — най-големият към момента на създаването си колаборативен benchmark, разработен от повече от 400 автори. Той включва над 200 задачи по найразлични теми, от лингвистика до физика, за да проверява моделите отвъд шаблонното съответствие и да разкрива границите им в нестандартни ситуации[8].
Здрав разум и правдивост
Тези бенчмаркове оценяват способността на модела да прави логични изводи за ежедневни ситуации и да избягва разпространяването на невярна информация.
- HellaSwag (2019) — проверява здравия разум чрез задача за избор на най-правдоподобното завършване на описание на ситуация. Особеността на бенчмарка е наличието на „капани": неправилните отговори са генерирани автоматично и изглеждат много правдоподобно, което изисква от модела дълбоко разбиране на контекста[9].
- TruthfulQA (2021) — измерва склонността на модела да разпространява популярни митове и заблуди. Съдържа въпроси, при които разпространеният в интернет отговор е неверен (например „Причиняват ли ваксините аутизъм?"). От модела се изисква да не се поддаде на лъжливи стереотипи и да даде фактически коректен отговор[10].
Математически задачи
- GSM8K (2021) — включва хиляди текстови задачи по математика на ниво начално училище. Всяка задача изисква изпълнение на последователност от 2–8 аритметични стъпки за получаване на отговора, което проверява способността на модела за многостъпкови разсъждения[11].
- MATH (2021) — по-сложен набор, състоящ се от задачи от математически олимпиади и конкурси. Той включва раздели по алгебра, геометрия и теория на числата, изисквайки от модела владеене на нетривиални методи за решение[12].
Генериране на програмен код
- HumanEval (2021) — стандартен тест за оценка на способността на LLM да пише код. Съдържа 164 задачи по програмиране, при които моделът трябва да генерира коректен код на Python по зададено описание. Правилността се оценява с помощта на unit тестове[13].
- SWE-bench (2023) — по-реалистичен benchmark, събиращ описания на реални проблеми (issues) от GitHub. Моделът трябва да генерира пач (фрагмент от код), отстраняващ проблема. Това изисква разбиране на голям обем чужд код и сложно поетапно разсъждение[14].
Оценка на диалогови модели
- Chatbot Arena (2024) — отворена онлайн платформа, където два анонимни модела участват в паралелен диалог с потребителя. След диалога потребителят гласува чий отговор е бил по-добър. Въз основа на хиляди такива „двубоя" се формира рейтинг по системата Elo на предпочитанията на потребителите, който отразява качеството на моделите в живото общуване[15].
- MT-Bench (2023) — автоматизиран benchmark за стрес-тестване на диалоговите умения. Той съдържа 80 двойки въпроси, имитиращи многоходов диалог. Отговорите на моделите се оценяват от друг, по-мощен LLM („LLM-as-a-judge", например GPT-4) по предварително зададена скала[16].
Безопасност и надеждност
- AgentHarm (2024) — benchmark, оценяващ склонността на LLM агентите да изпълняват опасни инструкции. Той включва 110 сценария, представляващи злонамерени задачи (от измами до киберпрестъпления). Добрият модел трябва да отказва изпълнението на такива заявки[17].
- SafetyBench (2023) — широк набор от повече от 11 хиляди въпроса, проверяващи доколко последователно моделът избягва генерирането на неприемливо съдържание и вредни съвети, включително при провокативни заявки[18].
Ограничения и актуални проблеми
- Контаминация на данните: Главната заплаха за достоверността на оценката — изтичане на тестови данни в обучителните набори. Моделът може просто да запомни отговорите, което изкуствено завишава резултата му[2].
- Насищане на бенчмарковете: С развитието на моделите тяхната производителност на старите бенчмаркове (като GLUE) достига таван и тестът спира да бъде полезен за разграничаване на нови, по-мощни модели. Това налага непрекъснато разработване на по-сложни еталони[2].
- Разрив с реалността: Високите резултати на бенчмарковете не винаги гарантират надеждна работа на модела в реални, неструктурирани сценарии. Реалната среда често е по-богата и непредсказуема от всеки фиксиран набор от задачи[1].
Връзки
- Open LLM Leaderboard — отворен рейтинг на модели от общността на Hugging Face
- Chatbot Arena Leaderboard — рейтинг на чат модели въз основа на предпочитанията на потребителите
Бележки
- ↑ 1.0 1.1 «What Are LLM Benchmarks?». IBM. [1]
- ↑ 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [2]
- ↑ «Самые популярные LLM бенчмарки». Хабр. [3]
- ↑ Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [4]
- ↑ Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [5]
- ↑ Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [6]
- ↑ Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [7]
- ↑ Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [8]
- ↑ Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [9]
- ↑ Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [10]
- ↑ Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [11]
- ↑ Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [12]
- ↑ Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [13]
- ↑ Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [14]
- ↑ Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [15]
- ↑ Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [16]
- ↑ Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [17]
- ↑ Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [18]