LLM benchmarks — معیارهای ارزیابی LLM

From Systems analysis Wiki
Jump to navigation Jump to search

بنچمارک‌های مدل‌های زبانی بزرگ — مجموعه‌های استانداردشده‌ای از آزمون‌ها هستند که برای سنجش، مقایسه و ارزیابی کیفیت و قابلیت‌های مدل‌های زبانی بزرگ (LLM) طراحی شده‌اند[1]. معمولاً هر بنچمارک شامل مجموعه‌ای ثابت از وظایف است (مانند پرسش‌ها، متون یا دستورالعمل‌ها) که پاسخ‌های صحیح یا معیارهای ارزیابی آن‌ها از پیش مشخص است. این رویکرد امکان مقایسه عینی مدل‌های مختلف در شرایط یکسان را فراهم می‌کند و به ردیابی پیشرفت در حوزه و شناسایی نقاط قوت و ضعف مدل‌ها کمک می‌نماید[2].

استفاده منظم از بنچمارک‌ها نقش کلیدی در توسعه LLM ایفا می‌کند؛ توسعه‌دهندگان را به بهبود مدل‌ها تشویق می‌نماید و شفافیت و قابلیت مقایسه نتایج را در جامعه علمی تضمین می‌کند. تکامل بنچمارک‌ها بازتاب توسعه خود LLM است: از وظایف ساده درک زبان تا آزمون‌های پیچیده‌ای که استدلال چندمرحله‌ای، عقل سلیم، اخلاق و ایمنی را می‌سنجند[3].

دسته‌بندی‌های اصلی و نمونه‌ها

بنچمارک‌های LLM طیف متنوعی از مهارت‌ها و حوزه‌های کاربردی را پوشش می‌دهند. در ادامه دسته‌بندی‌های اصلی و شناخته‌شده‌ترین مجموعه وظایف در هر یک از آن‌ها بررسی می‌شود.

درک عمومی زبان

این دسته توانایی‌های پایه مدل در درک و تفسیر زبان طبیعی را ارزیابی می‌کند.

  • GLUE (General Language Understanding Evaluation، ۲۰۱۹) — یکی از اولین بنچمارک‌های جامع که شامل مجموعه‌ای از وظایف متنوع است: از تشخیص احساس تا ارزیابی انسجام منطقی متن. نتایج همه وظایف در یک امتیاز واحد تجمیع می‌شوند که امکان مقایسه مدل‌های اولیه بر اساس کارایی کلی آن‌ها را فراهم می‌کرد[4].
  • SuperGLUE (۲۰۱۹) — جانشین «تقویت‌شده» GLUE که در پاسخ به این واقعیت توسعه یافت که مدل‌ها به سرعت به سطح نزدیک به انسان در آن دست یافتند. SuperGLUE شامل وظایف دشوارتری است که نیازمند درک عمیق زمینه و توانایی استنتاج هستند[5].
  • WinoGrande (۲۰۱۹) — نسخه گسترش‌یافته آزمون Winograd Schema. شامل ۴۴ هزار وظیفه برای رفع ابهام ضمایر در جملاتی است که نیاز به عقل سلیم برای انتخاب تفسیر صحیح دارند[6].

بنچمارک‌های چندوظیفه‌ای و جامع

این مجموعه‌ها مدل‌ها را در طیف گسترده‌ای از دانش و مهارت‌ها می‌سنجند و از وظایف صرفاً زبانی فراتر می‌روند.

  • MMLU (Massive Multitask Language Understanding، ۲۰۲۰) — مجموعه‌ای از وظایف به شکل آزمون چهارگزینه‌ای که ۵۷ حوزه موضوعی را پوشش می‌دهد: از دروس مدرسه تا دانش تخصصی حرفه‌ای (حقوق، پزشکی). MMLU گستره دانش عمومی مدل را می‌سنجد[7].
  • BIG-bench (Beyond the Imitation Game Benchmark، ۲۰۲۲) — بزرگ‌ترین بنچمارک مشارکتی در زمان ایجاد خود که توسط بیش از ۴۰۰ نویسنده توسعه یافته است. شامل بیش از ۲۰۰ وظیفه در موضوعات بسیار متنوع، از زبان‌شناسی تا فیزیک، به منظور آزمون مدل‌ها فراتر از تطابق الگو و شناسایی محدودیت‌های آن‌ها در موقعیت‌های غیرمعمول است[8].

عقل سلیم و صداقت

این بنچمارک‌ها توانایی مدل در استنتاج منطقی درباره موقعیت‌های روزمره و اجتناب از انتشار اطلاعات نادرست را ارزیابی می‌کنند.

  • HellaSwag (۲۰۱۹) — عقل سلیم را از طریق وظیفه انتخاب محتمل‌ترین ادامه برای توصیف یک موقعیت می‌سنجد. ویژگی این بنچمارک وجود «تله‌ها»ست: پاسخ‌های نادرست به صورت خودکار تولید شده و بسیار قانع‌کننده به نظر می‌رسند که نیازمند درک عمیق زمینه از سوی مدل است[9].
  • TruthfulQA (۲۰۲۱) — تمایل مدل به انتشار افسانه‌ها و باورهای غلط رایج را می‌سنجد. شامل پرسش‌هایی است که پاسخ رایج در اینترنت نادرست است (مثلاً «آیا واکسن‌ها باعث اوتیسم می‌شوند؟»). از مدل انتظار می‌رود در برابر کلیشه‌های نادرست مقاومت کند و پاسخ واقعاً درست ارائه دهد[10].

مسائل ریاضی

  • GSM8K (۲۰۲۱) — شامل هزاران مسئله کلامی ریاضی در سطح دبستان است. هر مسئله نیازمند انجام دنباله‌ای از ۲ تا ۸ مرحله حسابی برای رسیدن به پاسخ است که توانایی مدل در استدلال چندمرحله‌ای را می‌آزماید[11].
  • MATH (۲۰۲۱) — مجموعه‌ای پیچیده‌تر متشکل از مسائل المپیادها و مسابقات ریاضی. شامل بخش‌های جبر، هندسه و نظریه اعداد است و مدل باید به روش‌های غیرمعمول حل مسئله تسلط داشته باشد[12].

تولید کد برنامه‌نویسی

  • HumanEval (۲۰۲۱) — آزمون استاندارد برای ارزیابی توانایی LLM در نوشتن کد. شامل ۱۶۴ وظیفه برنامه‌نویسی است که مدل باید کد صحیح Python را بر اساس توضیحات داده‌شده تولید کند. صحت با استفاده از unit test ارزیابی می‌شود[13].
  • SWE-bench (۲۰۲۳) — بنچمارکی واقع‌گرایانه‌تر که توضیحات مشکلات واقعی (issues) از GitHub را جمع‌آوری می‌کند. مدل باید یک patch (قطعه کد) برای رفع مشکل تولید کند. این امر نیازمند درک حجم زیادی از کد دیگران و استدلال گام‌به‌گام پیچیده است[14].

ارزیابی مدل‌های مکالمه‌ای

  • Chatbot Arena (۲۰۲۴) — پلتفرم آنلاین باز که در آن دو مدل ناشناس در یک مکالمه جفتی با کاربر شرکت می‌کنند. پس از مکالمه، کاربر رأی می‌دهد که کدام پاسخ بهتر بود. بر اساس هزاران «دوئل» از این نوع، رتبه‌بندی Elo ترجیحات کاربران شکل می‌گیرد که کیفیت مدل‌ها در تعامل زنده را منعکس می‌کند[15].
  • MT-Bench (۲۰۲۳) — بنچمارک خودکار برای stress-test مهارت‌های مکالمه‌ای. شامل ۸۰ جفت پرسش است که مکالمه چندمرحله‌ای را شبیه‌سازی می‌کنند. پاسخ‌های مدل‌ها توسط یک LLM دیگر قوی‌تر («LLM-as-a-judge»، مانند GPT-4) بر اساس مقیاس از پیش تعریف‌شده ارزیابی می‌شوند[16].

ایمنی و قابلیت اطمینان

  • AgentHarm (۲۰۲۴) — بنچمارکی که تمایل عوامل LLM به اجرای دستورالعمل‌های خطرناک را ارزیابی می‌کند. شامل ۱۱۰ سناریو نشان‌دهنده وظایف مخرب است (از کلاهبرداری تا جرایم سایبری). یک مدل خوب باید از انجام چنین درخواست‌هایی امتناع کند[17].
  • SafetyBench (۲۰۲۳) — مجموعه گسترده‌ای از بیش از ۱۱ هزار پرسش که می‌سنجد تا چه اندازه مدل به طور منسجم از تولید محتوای نامناسب و توصیه‌های مضر اجتناب می‌کند، از جمله در برابر درخواست‌های تحریک‌آمیز[18].

محدودیت‌ها و چالش‌های جاری

  • آلودگی داده: بزرگ‌ترین تهدید برای اعتبار ارزیابی، نشت داده‌های آزمون به مجموعه‌های آموزشی است. مدل ممکن است پاسخ‌ها را صرفاً حفظ کند که نتیجه آن را به صورت مصنوعی بالا می‌برد[2].
  • اشباع بنچمارک: با پیشرفت مدل‌ها، عملکرد آن‌ها در بنچمارک‌های قدیمی (مانند GLUE) به سقف می‌رسد و آزمون دیگر برای تمایز مدل‌های جدیدتر و قوی‌تر مفید نیست. این امر نیاز به توسعه مداوم معیارهای پیچیده‌تر دارد[2].
  • شکاف با واقعیت: نتایج بالا در بنچمارک‌ها همیشه عملکرد قابل اطمینان مدل را در سناریوهای واقعی و غیرساختاریافته تضمین نمی‌کنند. محیط واقعی اغلب غنی‌تر و غیرقابل پیش‌بینی‌تر از هر مجموعه وظایف ثابتی است[1].

پیوندها

  • Open LLM Leaderboard — رتبه‌بندی باز مدل‌ها از جامعه Hugging Face
  • Chatbot Arena Leaderboard — رتبه‌بندی مدل‌های چت بر اساس ترجیحات کاربران

یادداشت‌ها

  1. 1.0 1.1 «What Are LLM Benchmarks?». IBM. [۱]
  2. 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [۲]
  3. Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [۴]
  4. Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [۵]
  5. Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [۶]
  6. Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [۷]
  7. Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [۸]
  8. Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [۹]
  9. Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [۱۰]
  10. Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [۱۱]
  11. Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [۱۲]
  12. Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [۱۳]
  13. Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [۱۴]
  14. Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [۱۵]
  15. Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [۱۶]
  16. Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [۱۷]
  17. Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [۱۸]