LLM-as-a-Judge (FA)
LLM-as-a-Judge (LLM در نقش داور) — رویکردی در یادگیری ماشین است که در آن یک مدل زبانی بزرگ (LLM) برای ارزیابی کیفیت متن تولیدشده توسط مدل هوش مصنوعی دیگری، بر اساس معیارهای از پیش تعیینشده، بهکار میرود[1]. ایده اصلی این است که خود هوش مصنوعی نقش «داور» را بر عهده بگیرد و پاسخها را بر اساس پارامترهای مشخصی ارزیابی کند.
این روش از سال ۲۰۲۳ بهعنوان جایگزینی عملی برای ارزیابی دستی پرهزینه، در وظایف باز تولید متن، محبوبیت یافت. معیارهای سنتی (مانند BLEU یا ROUGE) برای پاسخهای متنی آزاد مناسب نیستند و استفاده از ارزیابهای انسانی برای وظایف در مقیاس بزرگ امکانپذیر نیست. LLM-as-a-Judge این مشکل را حل میکند: بهجای انسان، خود مدل زبانی کیفیت متن را ارزیابی میکند و پاسخ مورد بررسی به همراه دستورالعمل prompt حاوی معیارهای ارزیابی را دریافت مینماید[2].
روشهای ارزیابی با استفاده از LLM
رویکرد LLM-as-a-Judge در سناریوها و اشکال مختلف ارزیابی بهکار میرود.
- مقایسه زوجی (pairwise comparison): رایجترین روش است. مدل داور دو پاسخ (پاسخ الف، پاسخ ب) را برای یک درخواست یکسان دریافت میکند و باید تصمیم بگیرد کدامیک بر اساس معیارهای تعیینشده بهتر است، یا تساوی اعلام کند.
- ارزیابی مستقیم بر اساس معیار: ارزیاب LLM یک پاسخ تولیدشده را بررسی کرده و بر اساس ویژگی مشخصی (مثلاً «دقت»، «وضوح بیان»، «ادب») نمرهای در مقیاس عددی (مثلاً ۱ تا ۱۰) به آن اختصاص میدهد.
- ارزیابی با در نظر گرفتن اطلاعات مرجع: در prompt مدل داور، زمینه اصلی یا پاسخ صحیح «طلایی» افزوده میشود و از مدل خواسته میشود متن تولیدشده را از نظر انطباق بررسی کند، برای مثال برای شناسایی توهمات[2].
اثربخشی و قابلیت مقایسه با ارزیابی انسانی
برای بررسی کیفیت خود رویکرد LLM-as-a-Judge، حکمهای آن با ارزیابیهای متخصصان انسانی مقایسه میشود. جامعترین تحلیل این روش توسط گروه LMSYS از UC Berkeley در سال ۲۰۲۳ در مقاله «Judging LLM-as-a-Judge» انجام شد. نویسندگان بهطور سیستماتیک تصمیمهای مدل GPT-4 (در نقش داور) را با ترجیحات انسانها در نمونه بزرگی از وظایف مکالمهای از benchmark امتیبنچ (MT-Bench) مقایسه کردند.
نتیجه اصلی پژوهش این بود: LLMهای قوی (مانند GPT-4) در نقش داور، تطابق ~۸۰٪ با ارزیابیهای انسانی نشان دادند که با سطح توافق میان خود انسانها قابل مقایسه است. به عبارت دیگر، در مواردی که دو متخصص انسانی با یکدیگر توافق داشتند، مدل داور GPT-4 در ۸۰٪ موارد همان تصمیم را میگرفت. این نتیجه در واقع ارزیابی LLM را به سطح «استاندارد انسانی» از نظر سازگاری رساند و کاربرد عملی آن را برای ارزیابیهای در مقیاس بزرگ نشان داد[2].
مزایای رویکرد
روش LLM-as-a-Judge در مقایسه با رویکردهای سنتی دارای مزایای مهمی است.
- قابلیت مقایسه با انسان: با تنظیم صحیح، ارزیابی LLM نتایجی نزدیک به قضاوت تخصصی انسانی ارائه میدهد که آن را به جایگزینی قابل اعتماد تبدیل میکند.
- مقیاسپذیری و سرعت: یک داور LLM بهدرستی تنظیمشده میتواند هزاران پاسخ را بهصورت شبانهروزی ارزیابی کند و نتایج را تقریباً فوری ارائه دهد که بهطور قابل توجهی سریعتر و ارزانتر از برچسبگذاری انسانی است.
- انعطافپذیری و قابلیت تنظیم: میتوان LLM را برای ارزیابی تقریباً هر جنبهای از متن آموزش داد — از دقت واقعی تا رنگ احساسی — فقط با تغییر توصیف متنی معیار در prompt.
- عدم وابستگی به نمونه مرجع: برخلاف معیارهایی مانند ROUGE یا BLEU، ارزیاب LLM نیازی به «پاسخ صحیح» از پیش تعیینشده برای مقایسه ندارد. میتواند بدون مرجع کار کند که برای وظایف مکالمهای باز ارزشمند است.
- تفسیرپذیری: میتوان از مدل داور درخواست توضیح تصمیمش را به شکل متن کرد که شفافیت بیشتری نسبت به «جعبه سیاه» معیارهای خودکار فراهم میکند[3].
محدودیتها و مشکلات روش
علیرغم موفقیتها، رویکرد LLM-as-a-Judge معایبی نیز دارد.
- قابلیت اطمینان ناقص: ارزیابیهای LLM باکیفیت هستند اما کامل نیستند. اگر دستورالعمل بهاندازه کافی واضح نباشد یا مدل با موردی پیشبینینشده روبرو شود، حکمش ممکن است نادرست یا ناسازگار باشد.
- خطر انحراف و تعصب (bias):
- اثر موقعیتی: مدل ممکن است ناخودآگاه پاسخی را که اول یا آخر در فهرست قرار دارد ترجیح دهد.
- انحراف به سوی پرحرفی: مدل تمایل دارد پاسخ طولانیتر و دقیقتر را بهتر بداند، حتی اگر صرفاً اطلاعات را تکرار کند.
- خودمحوری (self-enhancement bias): مدل داور ممکن است نمرات بالاتری به پاسخهایی بدهد که توسط خودش یا مدلی از همان خانواده تولید شدهاند (مثلاً GPT-4 پاسخهای GPT-3.5 را بالاتر ارزیابی میکند)[2].
- دشواری در ارزیابی حقایق و منطق: داور LLM گاهی اوقات مسائل ریاضی یا منطقی را حتی زمانی که خودش قادر به حل آنهاست، به اشتباه ارزیابی میکند. این اتفاق زمانی میافتد که مدل از خطای موجود در راهحلهای ارائهشده «آلوده» شده و وظیفه را بهصورت عینی نمیبیند.
- حریم خصوصی و امنیت داده: استفاده از APIهای شخص ثالث (مانند GPT-4) برای ارزیابی به معنای ارسال متون محرمانه به ارائهدهنده خارجی است که خطرات نشت اطلاعات را به همراه دارد.
برای کاهش این مشکلات، توسعهدهندگان از تکنیکهای مختلفی استفاده میکنند: تصادفیسازی ترتیب پاسخها، کالیبراسیون بر روی مجموعههایی با مشارکت انسان، و همچنین استفاده از استراتژیهای ترکیبی که در آنها داور LLM در کنار روشهای دیگر بهکار میرود.
رویکردهای جایگزین و ترکیبی
LLM-as-a-Judge اغلب در ترکیب با روشهای ارزیابی دیگر بهکار میرود.
- ارزیابی انسانی: «استاندارد طلایی» باقی میماند و برای کالیبراسیون و بررسی دورهای داوران LLM استفاده میشود.
- معیارهای خودکار: معیارهای کلاسیک (ROUGE، BLEU، BERTScore) همچنان برای وظایف با پاسخ مرجع مشخص مفید هستند.
- مدلهای ارزیاب تخصصی: آموزش مدلهای کوچک، سریع و ارزان بر روی دادههای ترجیحی برای انجام ارزیابیهای روتین، در حالی که داور LLM قدرتمند نقش «داور عالی» را برای موارد پیچیده بر عهده دارد (رویکرد trust or escalate).
پیوندها
- مقاله «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena» از LMSYS
- راهنمای جامع استفاده از LLM-as-a-Judge از Evidently AI
منابع
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model Is Not a General Substitute for GPT-4. arXiv:2403.02839.
- Jung, J. et al. (2024). Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement. arXiv:2407.18370.
- Shi, L. et al. (2024). Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge. arXiv:2406.07791.
- Wataoka, K. et al. (2024). Self-Preference Bias in LLM-as-a-Judge. arXiv:2410.21819.
- Chen, G. H. et al. (2024). Humans or LLMs as the Judge? A Study on Judgement Bias. EMNLP 2024.
- Li, X. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Wang, Y. et al. (2024). Evaluating Alignment and Vulnerabilities in LLMs-as-Judges. arXiv:2406.12624.
- Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.
- Wang, T. et al. (2025). Evaluating Scoring Bias in LLM-as-a-Judge. arXiv:2506.22316.
- Li, Y. et al. (2024). Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge. arXiv:2410.02736.
- Xu, Y. et al. (2024). Opportunities and Challenges of LLM-as-a-Judge. arXiv:2411.16594.
- Zhuang, S. et al. (2024). MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues. arXiv:2402.14762.
- Li, C. et al. (2025). RobustJudge: A Fully Automated Framework for Assessing the Robustness of LLM-as-a-Judge Systems. arXiv:2506.09443.
یادداشتها
- ↑ «LLM-as-a-judge: a complete guide to using LLMs for evaluations». Evidently AI. [۱]
- ↑ 2.0 2.1 2.2 2.3 Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv:2306.05685, 2023. [۲]
- ↑ Li, X. et al. «LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods». arXiv:2412.05579, 2024. [۳]