---
title: "MAUVE (metric) (FA)"
source: "https://systems-analysis.info/int/MAUVE_(metric)_(FA)"
wiki: "systems-analysis.info/int"
article: "MAUVE_(metric)_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 3993
wiki_created_at: 2026-09-06T23:28:58Z
wiki_modified_at: 2026-09-06T23:28:58Z
downloaded_at: 2026-09-07T23:00:12Z
---

# MAUVE (metric) (FA)

**MAUVE** — یک معیار خودکار برای ارزیابی کیفیت متن تولیدشده توسط مدل‌های زبانی بزرگ مدرن است <sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>. این شاخص «شکاف» میان توزیع آماری متون تولیدشده توسط شبکه عصبی و توزیع متن انسانی را اندازه‌گیری می‌کند<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>. **MAUVE** برای وظایف تولید متن open-ended (مانند ادامه‌دادن متن) طراحی شده است، جایی که پاسخ صحیح و یکتایی وجود ندارد و مقایسه در سطح توزیع‌های متن انجام می‌شود، نه نمونه‌های منفرد<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>. این روش در سال ۲۰۲۱ توسط گروهی از پژوهشگران به رهبری Krishna Pillutla پیشنهاد شد و در کنفرانس NeurIPS 2021 ارائه گردید، جایی که جایزه **Outstanding Paper Award** را به خاطر نوآوری و تأثیر بالقوه‌اش دریافت کرد<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-IFML-2)[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>.

## روش‌شناسی ارزیابی

**MAUVE** از مفهوم **دیورژانس فرانتیرها** (به انگلیسی: divergence frontiers) از نظریه اطلاعات برای ارزیابی همزمان دو نوع خطای مدل مولد استفاده می‌کند<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>:

- انحراف از صحت (تولید متن «بی‌معنی»).
- کاهش تنوع (متن بیش از حد کلیشه‌ای).

ایده اصلی در مقایسه ویژگی‌های آماری توزیع خروجی‌های مدل با توزیع متون مرجع (انسانی) در طیفی از معیارها نهفته است. پیاده‌سازی این معیار بر نمایش متون به‌صورت embedding توسط یک مدل زبانی بزرگ پیش‌آموزش‌دیده و محاسبه واگرایی میان توزیع‌های به‌دست‌آمده در این فضای ویژگی متکی است<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-KrishnaP25GitHub-3)</sup>.

مراحل اصلی محاسبه MAUVE در ادامه آمده است:

### برداری‌سازی نمونه‌ها

هر دو مجموعه متن — تولیدشده توسط مدل و متون واقعی — با استفاده از یک مدل زبانی پیش‌آموزش‌دیده (مانند آخرین حالت پنهان GPT-2) به embedding تبدیل می‌شوند<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-KrishnaP25GitHub-3)</sup>. این نمایش، متون را به یک فضای ویژگی مشترک برای مقایسه بعدی منتقل می‌کند.

### گسسته‌سازی توزیع‌ها

embeddingهای به‌دست‌آمده خوشه‌بندی می‌شوند (مثلاً با روش k-means)، که منجر به کوانتیزاسیون فضای پیوسته ویژگی‌ها می‌گردد<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-KrishnaP25GitHub-3)</sup>. در نتیجه، توزیع‌های گسسته تقریبی **P** (متن انسانی) و **Q** (متن مدل) بر اساس خوشه‌ها شکل می‌گیرند.

### ساخت دیورژانس فرانتیر

واگرایی‌های میان توزیع‌های P و Q در نسبت‌های مختلف خطاهای نوع اول و دوم محاسبه می‌شوند<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>. در عمل، این به معنای ارزیابی چندین واگرایی اطلاعاتی (مانند دیورژانس Kullback-Leibler) برای مجموعه‌ای از مقادیر آستانه است که نشان‌دهنده مصالحه میان «دقت» و «فراخوانی» مدل می‌باشند. مجموعه این نقاط یک منحنی «تفاوت توزیع‌ها» (divergence curve) را تشکیل می‌دهد<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>.

### انتگرال‌گیری و نتیجه

منحنی به‌دست‌آمده انتگرال‌گیری می‌شود، یعنی سطح زیر منحنی واگرایی‌ها محاسبه می‌گردد. این شاخص انتگرالی همان مقدار **MAUVE** است — یک اسکالر که به‌صورت کمّی میزان نزدیکی توزیع متن مدل به متن انسانی را مشخص می‌کند<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>. **MAUVE score** نهایی در بازه ۰ تا ۱ نرمال‌سازی شده است، جایی که مقادیر نزدیک‌تر به ۱ با حداقل واگرایی متناظرند (متن مدل از نظر آماری به متن انسانی نزدیک است)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-KrishnaP25GitHub-3)</sup>.

## نتایج تجربی و ویژگی‌ها

نویسندگان MAUVE را روی تعدادی از وظایف باز تولید متن (ادامه‌دادن متن وب، مقالات خبری، داستان‌ها) آزمودند<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>. این معیار توانایی شناسایی الگوهای شناخته‌شده در کیفیت تولید را نشان داد. به‌ویژه، با افزایش اندازه مدل زبانی، مقدار MAUVE افزایش می‌یابد که منعکس‌کننده بهبود انسجام و صحت متن در مدل‌های بزرگ‌تر است<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-IFML-2)</sup>. برعکس، با افزایش طول قطعه تولیدشده، کاهش MAUVE مشاهده می‌شود، یعنی کیفیت ادامه‌های طولانی معمولاً از ادامه‌های کوتاه ضعیف‌تر است (مدل شروع به تکرار می‌کند یا از زمینه فاصله می‌گیرد)<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-IFML-2)</sup>. همچنین MAUVE تأثیر انتخاب الگوریتم تولید متن را تمییز می‌دهد: برای مثال، تغییر راهبرد نمونه‌گیری (دما، top-k/nucleus sampling و غیره) بر توزیع خروجی‌ها تأثیر می‌گذارد و در مقدار معیار بازتاب می‌یابد<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>.

یکی از ویژگی‌های مهم MAUVE همبستگی بالا با ارزیابی انسانی است. پژوهش‌ها نشان داده‌اند که مقادیر MAUVE **با ارزیابی‌های ذهنی کیفیت همبستگی قوی دارند** و از این نظر بر معیارهای پایه‌ای که پیش‌تر برای تولید متن باز به‌کار می‌رفتند برتری دارند<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-KrishnaP25GitHub-3)</sup>. به عبارت دیگر، مدل‌هایی با MAUVE بالاتر معمولاً توسط انسان‌ها به‌عنوان مولد متن معنادارتر و «انسان‌مانندتر» تلقی می‌شوند. در عین حال، MAUVE محدودیت‌های کمتری نسبت به معیارهای توزیعی ارزیابی پیشنهادشده قبلی دارد: روش به مدل‌های بزرگ و متون طولانی مقیاس می‌دهد، چندین جنبه از تفاوت‌ها را همزمان در نظر می‌گیرد، در حالی که بسیاری از شاخص‌های استاندارد تنها یک جنبه آماری را (یک نقطه روی منحنی دیورژانس) ثبت می‌کنند<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>. این رویکرد جامع امکان قضاوت کامل‌تری درباره کیفیت عملکرد مدل مولد را فراهم می‌کند.

## کاربرد و پژوهش‌های بعدی

اگرچه MAUVE در ابتدا برای مدل‌های متنی طراحی شد، رویکرد آن جهانی است. این روش با موفقیت برای انواع دیگری از داده‌های تولیدشده نیز به‌کار رفته است. برای مثال، در تولید تصویر (GANها، مدل‌های انتشار)، معیار MAUVE به‌طور مشابه تفاوت‌های مشخصه میان توزیع‌های تصاویر واقعی و مصنوعی را شناسایی می‌کند و به دقتی در سطح بهترین معیارهای موجود یا بالاتر از آن‌ها دست می‌یابد<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-IFML-2)</sup>. به‌طور بالقوه، MAUVE می‌تواند برای مودالیته‌های دیگر (صوت، موسیقی، ویدیو) نیز تطبیق داده شود، مشروط بر اینکه embeddingهای ویژگی معنایی مناسبی برای آن‌ها در دسترس باشد<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-KrishnaP25GitHub-3)</sup>.

این معیار در جامعه پژوهشی به‌طور گسترده‌ای پذیرفته شده است. نویسندگان یک پیاده‌سازی متن‌باز MAUVE به زبان Python منتشر کرده‌اند (از طریق PyPI در دسترس است و در کتابخانه HuggingFace Evaluate ادغام شده است) تا استفاده عملی را آسان‌تر کنند<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-KrishnaP25GitHub-3)</sup>. در سال ۲۰۲۳، مقاله گسترش‌یافته‌ای با عنوان «MAUVE Scores for Generative Models: Theory and Practice» منتشر شد که در آن ویژگی‌های نظری معیار، انواع مختلف محاسبه آن و توصیه‌هایی برای کاربرد روی متن و تصویر به‌تفصیل بررسی شده‌اند<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-IFML-2)</sup>. همچنین همزمان با مقاله اصلی، یک مقاله تکمیلی منتشر شد که مرزهای آماری و حجم نمونه لازم برای ارزیابی قابل اعتماد MAUVE را تعیین می‌کند<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>. توسعه این ایده‌ها نه‌تنها در بهبود کیفیت مدل‌های مولد کمک می‌کند، بلکه پایه‌ای برای ابزارهای تشخیص متن ماشینی فراهم می‌آورد: با کاهش شکاف میان متون تولیدشده توسط هوش مصنوعی و انسان، معیارهایی مانند MAUVE به درک بهتر عملکرد مدل‌ها و تمایز محتوای آن‌ها از محتوای انسانی کمک خواهند کرد<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_note-AllenSchoolNews-1)</sup>.

## محدودیت‌ها و توصیه‌ها

سازندگان MAUVE تأکید می‌کنند که در استفاده عملی، رعایت شرایط خاصی برای صحت ارزیابی ضروری است. اول اینکه، **حجم نمونه کافی** لازم است: برای ارزیابی پایدار معیار، به چند هزار نمونه از هر نوع نیاز است (در آزمایش‌های اصلی از ~۵۰۰۰ جمله استفاده شد). با نمونه‌های بسیار کوچک‌تر، MAUVE ممکن است کیفیت را بیش از واقع نشان دهد (سوگیری به‌سوی خوش‌بینی) و نتایج ناپایداری با پراکندگی بالا ارائه دهد. دوم اینکه، **تفسیر MAUVE ترجیحاً به‌صورت مقایسه‌ای** انجام شود. مقدار مطلق معیار به برخی ابرپارامترهای محاسبه وابسته است (مثلاً تعداد خوشه‌ها در کوانتیزاسیون)، بنابراین مقدار مستقیم MAUVE برای یک مدل کمتر آموزنده است. توصیه می‌شود MAUVE چند مدل یا روش تولید را با یکدیگر مقایسه کنید (با تنظیمات یکسان معیار) — در این صورت مقدار بالاتر به‌روشنی نشان‌دهنده کیفیت متن نزدیک‌تر به انسانی است. با رعایت این توصیه‌ها، MAUVE به‌عنوان ابزاری قابل اعتماد برای ارزیابی و مقایسه عینی مدل‌های مولد عمل می‌کند.

## پیوندها

- صفحه پروژه MAUVE

## یادداشت‌ها

1.  <span id="cite_note-AllenSchoolNews-1">↑ <sup>[1.00](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-AllenSchoolNews_1-12)</sup> «Allen School News \>\> Allen School and AI2 researchers paint the NeurIPS conference MAUVE and take home an Outstanding Paper Award». *Allen School News*. <a href="https://news.cs.washington.edu/2022/02/28/allen-school-and-ai2-researchers-paint-the-neurips-conference-mauve-and-take-home-an-outstanding-paper-award/" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-IFML-2">↑ <sup>[2.0](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-IFML_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-IFML_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-IFML_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-IFML_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-IFML_2-4)</sup> «MAUVE: Statistical Evaluation of LLMs and Generative AI \| Institute for Foundations of Machine Learning». *Institute for Foundations of Machine Learning*. <a href="https://www.ifml.institute/index.php/research/mauve-statistical-evaluation-llms-and-generative-ai" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-KrishnaP25GitHub-3">↑ <sup>[3.0](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-KrishnaP25GitHub_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-KrishnaP25GitHub_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-KrishnaP25GitHub_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-KrishnaP25GitHub_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-KrishnaP25GitHub_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-KrishnaP25GitHub_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/MAUVE_(metric)_(FA)#cite_ref-KrishnaP25GitHub_3-6)</sup> «MAUVE: Measuring the Gap Between Neural Text and Human Text — MAUVE». *MAUVE project page*. <a href="https://krishnap25.github.io/mauve/" class="external autonumber" rel="nofollow">[۳]</a></span>
