LLM benchmarks — معیارهای ارزیابی LLM
بنچمارکهای مدلهای زبانی بزرگ — مجموعههای استانداردشدهای از آزمونها هستند که برای سنجش، مقایسه و ارزیابی کیفیت و قابلیتهای مدلهای زبانی بزرگ (LLM) طراحی شدهاند[1]. معمولاً هر بنچمارک شامل مجموعهای ثابت از وظایف است (مانند پرسشها، متون یا دستورالعملها) که پاسخهای صحیح یا معیارهای ارزیابی آنها از پیش مشخص است. این رویکرد امکان مقایسه عینی مدلهای مختلف در شرایط یکسان را فراهم میکند و به ردیابی پیشرفت در حوزه و شناسایی نقاط قوت و ضعف مدلها کمک مینماید[2].
استفاده منظم از بنچمارکها نقش کلیدی در توسعه LLM ایفا میکند؛ توسعهدهندگان را به بهبود مدلها تشویق مینماید و شفافیت و قابلیت مقایسه نتایج را در جامعه علمی تضمین میکند. تکامل بنچمارکها بازتاب توسعه خود LLM است: از وظایف ساده درک زبان تا آزمونهای پیچیدهای که استدلال چندمرحلهای، عقل سلیم، اخلاق و ایمنی را میسنجند[3].
دستهبندیهای اصلی و نمونهها
بنچمارکهای LLM طیف متنوعی از مهارتها و حوزههای کاربردی را پوشش میدهند. در ادامه دستهبندیهای اصلی و شناختهشدهترین مجموعه وظایف در هر یک از آنها بررسی میشود.
درک عمومی زبان
این دسته تواناییهای پایه مدل در درک و تفسیر زبان طبیعی را ارزیابی میکند.
- GLUE (General Language Understanding Evaluation، ۲۰۱۹) — یکی از اولین بنچمارکهای جامع که شامل مجموعهای از وظایف متنوع است: از تشخیص احساس تا ارزیابی انسجام منطقی متن. نتایج همه وظایف در یک امتیاز واحد تجمیع میشوند که امکان مقایسه مدلهای اولیه بر اساس کارایی کلی آنها را فراهم میکرد[4].
- SuperGLUE (۲۰۱۹) — جانشین «تقویتشده» GLUE که در پاسخ به این واقعیت توسعه یافت که مدلها به سرعت به سطح نزدیک به انسان در آن دست یافتند. SuperGLUE شامل وظایف دشوارتری است که نیازمند درک عمیق زمینه و توانایی استنتاج هستند[5].
- WinoGrande (۲۰۱۹) — نسخه گسترشیافته آزمون Winograd Schema. شامل ۴۴ هزار وظیفه برای رفع ابهام ضمایر در جملاتی است که نیاز به عقل سلیم برای انتخاب تفسیر صحیح دارند[6].
بنچمارکهای چندوظیفهای و جامع
این مجموعهها مدلها را در طیف گستردهای از دانش و مهارتها میسنجند و از وظایف صرفاً زبانی فراتر میروند.
- MMLU (Massive Multitask Language Understanding، ۲۰۲۰) — مجموعهای از وظایف به شکل آزمون چهارگزینهای که ۵۷ حوزه موضوعی را پوشش میدهد: از دروس مدرسه تا دانش تخصصی حرفهای (حقوق، پزشکی). MMLU گستره دانش عمومی مدل را میسنجد[7].
- BIG-bench (Beyond the Imitation Game Benchmark، ۲۰۲۲) — بزرگترین بنچمارک مشارکتی در زمان ایجاد خود که توسط بیش از ۴۰۰ نویسنده توسعه یافته است. شامل بیش از ۲۰۰ وظیفه در موضوعات بسیار متنوع، از زبانشناسی تا فیزیک، به منظور آزمون مدلها فراتر از تطابق الگو و شناسایی محدودیتهای آنها در موقعیتهای غیرمعمول است[8].
عقل سلیم و صداقت
این بنچمارکها توانایی مدل در استنتاج منطقی درباره موقعیتهای روزمره و اجتناب از انتشار اطلاعات نادرست را ارزیابی میکنند.
- HellaSwag (۲۰۱۹) — عقل سلیم را از طریق وظیفه انتخاب محتملترین ادامه برای توصیف یک موقعیت میسنجد. ویژگی این بنچمارک وجود «تلهها»ست: پاسخهای نادرست به صورت خودکار تولید شده و بسیار قانعکننده به نظر میرسند که نیازمند درک عمیق زمینه از سوی مدل است[9].
- TruthfulQA (۲۰۲۱) — تمایل مدل به انتشار افسانهها و باورهای غلط رایج را میسنجد. شامل پرسشهایی است که پاسخ رایج در اینترنت نادرست است (مثلاً «آیا واکسنها باعث اوتیسم میشوند؟»). از مدل انتظار میرود در برابر کلیشههای نادرست مقاومت کند و پاسخ واقعاً درست ارائه دهد[10].
مسائل ریاضی
- GSM8K (۲۰۲۱) — شامل هزاران مسئله کلامی ریاضی در سطح دبستان است. هر مسئله نیازمند انجام دنبالهای از ۲ تا ۸ مرحله حسابی برای رسیدن به پاسخ است که توانایی مدل در استدلال چندمرحلهای را میآزماید[11].
- MATH (۲۰۲۱) — مجموعهای پیچیدهتر متشکل از مسائل المپیادها و مسابقات ریاضی. شامل بخشهای جبر، هندسه و نظریه اعداد است و مدل باید به روشهای غیرمعمول حل مسئله تسلط داشته باشد[12].
تولید کد برنامهنویسی
- HumanEval (۲۰۲۱) — آزمون استاندارد برای ارزیابی توانایی LLM در نوشتن کد. شامل ۱۶۴ وظیفه برنامهنویسی است که مدل باید کد صحیح Python را بر اساس توضیحات دادهشده تولید کند. صحت با استفاده از unit test ارزیابی میشود[13].
- SWE-bench (۲۰۲۳) — بنچمارکی واقعگرایانهتر که توضیحات مشکلات واقعی (issues) از GitHub را جمعآوری میکند. مدل باید یک patch (قطعه کد) برای رفع مشکل تولید کند. این امر نیازمند درک حجم زیادی از کد دیگران و استدلال گامبهگام پیچیده است[14].
ارزیابی مدلهای مکالمهای
- Chatbot Arena (۲۰۲۴) — پلتفرم آنلاین باز که در آن دو مدل ناشناس در یک مکالمه جفتی با کاربر شرکت میکنند. پس از مکالمه، کاربر رأی میدهد که کدام پاسخ بهتر بود. بر اساس هزاران «دوئل» از این نوع، رتبهبندی Elo ترجیحات کاربران شکل میگیرد که کیفیت مدلها در تعامل زنده را منعکس میکند[15].
- MT-Bench (۲۰۲۳) — بنچمارک خودکار برای stress-test مهارتهای مکالمهای. شامل ۸۰ جفت پرسش است که مکالمه چندمرحلهای را شبیهسازی میکنند. پاسخهای مدلها توسط یک LLM دیگر قویتر («LLM-as-a-judge»، مانند GPT-4) بر اساس مقیاس از پیش تعریفشده ارزیابی میشوند[16].
ایمنی و قابلیت اطمینان
- AgentHarm (۲۰۲۴) — بنچمارکی که تمایل عوامل LLM به اجرای دستورالعملهای خطرناک را ارزیابی میکند. شامل ۱۱۰ سناریو نشاندهنده وظایف مخرب است (از کلاهبرداری تا جرایم سایبری). یک مدل خوب باید از انجام چنین درخواستهایی امتناع کند[17].
- SafetyBench (۲۰۲۳) — مجموعه گستردهای از بیش از ۱۱ هزار پرسش که میسنجد تا چه اندازه مدل به طور منسجم از تولید محتوای نامناسب و توصیههای مضر اجتناب میکند، از جمله در برابر درخواستهای تحریکآمیز[18].
محدودیتها و چالشهای جاری
- آلودگی داده: بزرگترین تهدید برای اعتبار ارزیابی، نشت دادههای آزمون به مجموعههای آموزشی است. مدل ممکن است پاسخها را صرفاً حفظ کند که نتیجه آن را به صورت مصنوعی بالا میبرد[2].
- اشباع بنچمارک: با پیشرفت مدلها، عملکرد آنها در بنچمارکهای قدیمی (مانند GLUE) به سقف میرسد و آزمون دیگر برای تمایز مدلهای جدیدتر و قویتر مفید نیست. این امر نیاز به توسعه مداوم معیارهای پیچیدهتر دارد[2].
- شکاف با واقعیت: نتایج بالا در بنچمارکها همیشه عملکرد قابل اطمینان مدل را در سناریوهای واقعی و غیرساختاریافته تضمین نمیکنند. محیط واقعی اغلب غنیتر و غیرقابل پیشبینیتر از هر مجموعه وظایف ثابتی است[1].
پیوندها
- Open LLM Leaderboard — رتبهبندی باز مدلها از جامعه Hugging Face
- Chatbot Arena Leaderboard — رتبهبندی مدلهای چت بر اساس ترجیحات کاربران
یادداشتها
- ↑ 1.0 1.1 «What Are LLM Benchmarks?». IBM. [۱]
- ↑ 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [۲]
- ↑ «Самые популярные LLM бенчмарки». Хабр. [۳]
- ↑ Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [۴]
- ↑ Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [۵]
- ↑ Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [۶]
- ↑ Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [۷]
- ↑ Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [۸]
- ↑ Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [۹]
- ↑ Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [۱۰]
- ↑ Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [۱۱]
- ↑ Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [۱۲]
- ↑ Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [۱۳]
- ↑ Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [۱۴]
- ↑ Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [۱۵]
- ↑ Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [۱۶]
- ↑ Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [۱۷]
- ↑ Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [۱۸]