---
title: "LLM-as-a-Judge (FA)"
source: "https://systems-analysis.info/int/LLM-as-a-Judge_(FA)"
wiki: "systems-analysis.info/int"
article: "LLM-as-a-Judge_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 3549
wiki_created_at: 2026-09-06T23:22:29Z
wiki_modified_at: 2026-09-06T23:22:29Z
downloaded_at: 2026-09-07T22:57:33Z
---

# LLM-as-a-Judge (FA)

**LLM-as-a-Judge** (**LLM در نقش داور**) — رویکردی در یادگیری ماشین است که در آن یک مدل زبانی بزرگ (LLM) برای ارزیابی کیفیت متن تولیدشده توسط مدل هوش مصنوعی دیگری، بر اساس معیارهای از پیش تعیین‌شده، به‌کار می‌رود<sup>[\[1\]](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_note-evidentlyai_guide-1)</sup>. ایده اصلی این است که خود هوش مصنوعی نقش «داور» را بر عهده بگیرد و پاسخ‌ها را بر اساس پارامترهای مشخصی ارزیابی کند.

این روش از سال ۲۰۲۳ به‌عنوان جایگزینی عملی برای ارزیابی دستی پرهزینه، در وظایف باز تولید متن، محبوبیت یافت. معیارهای سنتی (مانند BLEU یا ROUGE) برای پاسخ‌های متنی آزاد مناسب نیستند و استفاده از ارزیاب‌های انسانی برای وظایف در مقیاس بزرگ امکان‌پذیر نیست. LLM-as-a-Judge این مشکل را حل می‌کند: به‌جای انسان، خود مدل زبانی کیفیت متن را ارزیابی می‌کند و پاسخ مورد بررسی به همراه دستورالعمل prompt حاوی معیارهای ارزیابی را دریافت می‌نماید<sup>[\[2\]](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_note-zheng2023_judging-2)</sup>.

## روش‌های ارزیابی با استفاده از LLM

رویکرد LLM-as-a-Judge در سناریوها و اشکال مختلف ارزیابی به‌کار می‌رود.

- **مقایسه زوجی** (*pairwise comparison*): رایج‌ترین روش است. مدل داور دو پاسخ (پاسخ الف، پاسخ ب) را برای یک درخواست یکسان دریافت می‌کند و باید تصمیم بگیرد کدام‌یک بر اساس معیارهای تعیین‌شده بهتر است، یا تساوی اعلام کند.
- **ارزیابی مستقیم بر اساس معیار**: ارزیاب LLM یک پاسخ تولیدشده را بررسی کرده و بر اساس ویژگی مشخصی (مثلاً «دقت»، «وضوح بیان»، «ادب») نمره‌ای در مقیاس عددی (مثلاً ۱ تا ۱۰) به آن اختصاص می‌دهد.
- **ارزیابی با در نظر گرفتن اطلاعات مرجع**: در prompt مدل داور، زمینه اصلی یا پاسخ صحیح «طلایی» افزوده می‌شود و از مدل خواسته می‌شود متن تولیدشده را از نظر انطباق بررسی کند، برای مثال برای شناسایی توهمات<sup>[\[2\]](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_note-zheng2023_judging-2)</sup>.

## اثربخشی و قابلیت مقایسه با ارزیابی انسانی

برای بررسی کیفیت خود رویکرد LLM-as-a-Judge، حکم‌های آن با ارزیابی‌های متخصصان انسانی مقایسه می‌شود. جامع‌ترین تحلیل این روش توسط گروه LMSYS از UC Berkeley در سال ۲۰۲۳ در مقاله «Judging LLM-as-a-Judge» انجام شد. نویسندگان به‌طور سیستماتیک تصمیم‌های مدل GPT-4 (در نقش داور) را با ترجیحات انسان‌ها در نمونه بزرگی از وظایف مکالمه‌ای از benchmark ام‌تی‌بنچ (MT-Bench) مقایسه کردند.

نتیجه اصلی پژوهش این بود: LLMهای قوی (مانند GPT-4) در نقش داور، **تطابق ~۸۰٪ با ارزیابی‌های انسانی** نشان دادند که با سطح توافق میان خود انسان‌ها قابل مقایسه است. به عبارت دیگر، در مواردی که دو متخصص انسانی با یکدیگر توافق داشتند، مدل داور GPT-4 در ۸۰٪ موارد همان تصمیم را می‌گرفت. این نتیجه در واقع ارزیابی LLM را به سطح «استاندارد انسانی» از نظر سازگاری رساند و کاربرد عملی آن را برای ارزیابی‌های در مقیاس بزرگ نشان داد<sup>[\[2\]](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_note-zheng2023_judging-2)</sup>.

## مزایای رویکرد

روش LLM-as-a-Judge در مقایسه با رویکردهای سنتی دارای مزایای مهمی است.

- **قابلیت مقایسه با انسان**: با تنظیم صحیح، ارزیابی LLM نتایجی نزدیک به قضاوت تخصصی انسانی ارائه می‌دهد که آن را به جایگزینی قابل اعتماد تبدیل می‌کند.
- **مقیاس‌پذیری و سرعت**: یک داور LLM به‌درستی تنظیم‌شده می‌تواند هزاران پاسخ را به‌صورت شبانه‌روزی ارزیابی کند و نتایج را تقریباً فوری ارائه دهد که به‌طور قابل توجهی سریع‌تر و ارزان‌تر از برچسب‌گذاری انسانی است.
- **انعطاف‌پذیری و قابلیت تنظیم**: می‌توان LLM را برای ارزیابی تقریباً هر جنبه‌ای از متن آموزش داد — از دقت واقعی تا رنگ احساسی — فقط با تغییر توصیف متنی معیار در prompt.
- **عدم وابستگی به نمونه مرجع**: برخلاف معیارهایی مانند ROUGE یا BLEU، ارزیاب LLM نیازی به «پاسخ صحیح» از پیش تعیین‌شده برای مقایسه ندارد. می‌تواند بدون مرجع کار کند که برای وظایف مکالمه‌ای باز ارزشمند است.
- **تفسیرپذیری**: می‌توان از مدل داور درخواست توضیح تصمیمش را به شکل متن کرد که شفافیت بیشتری نسبت به «جعبه سیاه» معیارهای خودکار فراهم می‌کند<sup>[\[3\]](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_note-survey_2024-3)</sup>.

## محدودیت‌ها و مشکلات روش

علی‌رغم موفقیت‌ها، رویکرد LLM-as-a-Judge معایبی نیز دارد.

- **قابلیت اطمینان ناقص**: ارزیابی‌های LLM باکیفیت هستند اما کامل نیستند. اگر دستورالعمل به‌اندازه کافی واضح نباشد یا مدل با موردی پیش‌بینی‌نشده روبرو شود، حکمش ممکن است نادرست یا ناسازگار باشد.
- **خطر انحراف و تعصب** (*bias*):
  - **اثر موقعیتی**: مدل ممکن است ناخودآگاه پاسخی را که اول یا آخر در فهرست قرار دارد ترجیح دهد.
  - **انحراف به سوی پرحرفی**: مدل تمایل دارد پاسخ طولانی‌تر و دقیق‌تر را بهتر بداند، حتی اگر صرفاً اطلاعات را تکرار کند.
  - **خودمحوری** (*self-enhancement bias*): مدل داور ممکن است نمرات بالاتری به پاسخ‌هایی بدهد که توسط خودش یا مدلی از همان خانواده تولید شده‌اند (مثلاً GPT-4 پاسخ‌های GPT-3.5 را بالاتر ارزیابی می‌کند)<sup>[\[2\]](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_note-zheng2023_judging-2)</sup>.

<!-- -->

- **دشواری در ارزیابی حقایق و منطق**: داور LLM گاهی اوقات مسائل ریاضی یا منطقی را حتی زمانی که خودش قادر به حل آن‌هاست، به اشتباه ارزیابی می‌کند. این اتفاق زمانی می‌افتد که مدل از خطای موجود در راه‌حل‌های ارائه‌شده «آلوده» شده و وظیفه را به‌صورت عینی نمی‌بیند.
- **حریم خصوصی و امنیت داده**: استفاده از APIهای شخص ثالث (مانند GPT-4) برای ارزیابی به معنای ارسال متون محرمانه به ارائه‌دهنده خارجی است که خطرات نشت اطلاعات را به همراه دارد.

برای کاهش این مشکلات، توسعه‌دهندگان از تکنیک‌های مختلفی استفاده می‌کنند: تصادفی‌سازی ترتیب پاسخ‌ها، کالیبراسیون بر روی مجموعه‌هایی با مشارکت انسان، و همچنین استفاده از استراتژی‌های ترکیبی که در آن‌ها داور LLM در کنار روش‌های دیگر به‌کار می‌رود.

## رویکردهای جایگزین و ترکیبی

LLM-as-a-Judge اغلب در ترکیب با روش‌های ارزیابی دیگر به‌کار می‌رود.

- **ارزیابی انسانی**: «استاندارد طلایی» باقی می‌ماند و برای کالیبراسیون و بررسی دوره‌ای داوران LLM استفاده می‌شود.
- **معیارهای خودکار**: معیارهای کلاسیک (ROUGE، BLEU، BERTScore) همچنان برای وظایف با پاسخ مرجع مشخص مفید هستند.
- **مدل‌های ارزیاب تخصصی**: آموزش مدل‌های کوچک، سریع و ارزان بر روی داده‌های ترجیحی برای انجام ارزیابی‌های روتین، در حالی که داور LLM قدرتمند نقش «داور عالی» را برای موارد پیچیده بر عهده دارد (رویکرد *trust or escalate*).

## پیوندها

- مقاله «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena» از LMSYS
- راهنمای جامع استفاده از LLM-as-a-Judge از Evidently AI

## منابع

- Zheng, L. et al. (2023). *Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena*. arXiv:2306.05685.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Huang, H. et al. (2024). *An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model Is Not a General Substitute for GPT-4*. arXiv:2403.02839.
- Jung, J. et al. (2024). *Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement*. arXiv:2407.18370.
- Shi, L. et al. (2024). *Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge*. arXiv:2406.07791.
- Wataoka, K. et al. (2024). *Self-Preference Bias in LLM-as-a-Judge*. arXiv:2410.21819.
- Chen, G. H. et al. (2024). *Humans or LLMs as the Judge? A Study on Judgement Bias*. EMNLP 2024.
- Li, X. et al. (2024). *LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods*. arXiv:2412.05579.
- Wang, Y. et al. (2024). *Evaluating Alignment and Vulnerabilities in LLMs-as-Judges*. arXiv:2406.12624.
- Li, S. et al. (2025). *LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge*. arXiv:2506.09443.
- Wang, T. et al. (2025). *Evaluating Scoring Bias in LLM-as-a-Judge*. arXiv:2506.22316.
- Li, Y. et al. (2024). *Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge*. arXiv:2410.02736.
- Xu, Y. et al. (2024). *Opportunities and Challenges of LLM-as-a-Judge*. arXiv:2411.16594.
- Zhuang, S. et al. (2024). *MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues*. arXiv:2402.14762.
- Li, C. et al. (2025). *RobustJudge: A Fully Automated Framework for Assessing the Robustness of LLM-as-a-Judge Systems*. arXiv:2506.09443.

## یادداشت‌ها

1.  <span id="cite_note-evidentlyai_guide-1">[↑](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_ref-evidentlyai_guide_1-0) «LLM-as-a-judge: a complete guide to using LLMs for evaluations». *Evidently AI*. <a href="https://www.evidentlyai.com/llm-guide/llm-as-a-judge" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-zheng2023_judging-2">↑ <sup>[2.0](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_ref-zheng2023_judging_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_ref-zheng2023_judging_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_ref-zheng2023_judging_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_ref-zheng2023_judging_2-3)</sup> Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv:2306.05685*, 2023. <a href="https://ar5iv.labs.arxiv.org/html/2306.05685" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-survey_2024-3">[↑](https://systems-analysis.info/int/LLM-as-a-Judge_(FA)#cite_ref-survey_2024_3-0) Li, X. et al. «LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods». *arXiv:2412.05579*, 2024. <a href="https://arxiv.org/abs/2412.05579" class="external autonumber" rel="nofollow">[۳]</a></span>
