---
title: "MAUVE (metric) (BG)"
source: "https://systems-analysis.info/int/MAUVE_(metric)_(BG)"
wiki: "systems-analysis.info/int"
article: "MAUVE_(metric)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 3988
wiki_created_at: 2026-09-06T23:28:54Z
wiki_modified_at: 2026-09-06T23:28:54Z
downloaded_at: 2026-09-07T23:00:08Z
---

# MAUVE (metric) (BG)

**MAUVE** — това е автоматична метрика за оценка на качеството на текст, генериран от съвременни големи езикови модели <sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>. Този показател измерва „разривът" между статистическото разпределение на текстовете, създавани от невронната мрежа, и разпределението на човешкия текст<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>. **MAUVE** е предназначен за задачи от тип open-ended генерация (например продължение на текст), при които липсва единствен правилен отговор, а сравнението се осъществява на ниво разпределения на текстове, а не на отделни примери<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>. Методът е предложен през 2021 година от група изследователи начело с Кришна Пилутла (Krishna Pillutla) и е представен на конференцията NeurIPS 2021, където получи наградата **Outstanding Paper Award** за новаторство и потенциално въздействие<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-IFML-2)[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>.

## Методика на оценяване

**MAUVE** използва концепцията за **дивергентни фронтове** (англ. divergence frontiers) от теорията на информацията за едновременна оценка на два вида грешки на генеративния модел<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>:

- Отклонение от достоверността (генериране на „безсмислен" текст).
- Намаляване на разнообразието (прекалено шаблонен текст).

Идеята се състои в сравняване на статистическите свойства на разпределението на изходите на модела с разпределението на референтните (човешките) текстове по цял спектър от критерии. Реализацията на метриката се основава на представяне на текстовете под формата на embedding-и на голям предобучен езиков модел и изчисляване на разминаванията между получените разпределения в това признаково пространство<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-KrishnaP25GitHub-3)</sup>.

По-долу са представени основните етапи на изчисляване на MAUVE:

### Векторизация на извадките

Двете множества от текстове — генерираните от модела и реалните — се преобразуват в embedding-и с помощта на предобучен езиков модел (например последното скрито състояние на GPT-2)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-KrishnaP25GitHub-3)</sup>. Това представяне превежда текстовете в единно признаково пространство за последващо сравнение.

### Дискретизация на разпределенията

Получените embedding-и се клъстеризират (например чрез метода k-means), което води до квантуване на непрекъснатото признаково пространство<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-KrishnaP25GitHub-3)</sup>. В резултат се формират дискретни приближени разпределения **P** (човешки текст) и **Q** (текст на модела) по клъстери.

### Изграждане на дивергентния фронт

Изчисляват се дивергенциите между разпределенията P и Q при различни съотношения на грешки от първи и втори род<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>. Фактически това означава оценяване на няколко информационни разминавания (например дивергенции на Кулбак-Лайблер) за множество прагови стойности, характеризиращи компромиса между „точността" и „пълнотата" на модела. Наборът от такива точки образува крива на „различието на разпределенията" (divergence curve)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>.

### Интегриране и резултат

Получената крива се интегрира, тоест се изчислява лице под кривата на дивергенциите. Този интегрален показател е стойността на **MAUVE** — скалар, количествено характеризиращ степента на близост между разпределението на текста на модела и на човешкия текст<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>. Крайният **MAUVE score** е нормиран в диапазон от 0 до 1, като стойности по-близки до 1 съответстват на минимално разминаване (текстът на модела е статистически близък до човешкия)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-KrishnaP25GitHub-3)</sup>.

## Експериментални резултати и свойства

Авторите проверили MAUVE върху редица отворени задачи за генерация на текст (продължение на уеб текст, новинарски статии, разкази)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>. Метриката показа способност да разкрива известни закономерности в качеството на генерацията. По-специално, с увеличаването на размера на езиковия модел стойността на MAUVE нараства, което отразява подобряването на свързаността и достоверността на текста при по-големите модели<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-IFML-2)</sup>. Обратно, при увеличаване на дължината на генерирания фрагмент се наблюдава намаляване на MAUVE, тоест качеството на дългите продължения обикновено е по-лошо от това на късите (моделът започва да се повтаря или се отклонява от контекста)<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-IFML-2)</sup>. Също така MAUVE разграничава ефектите от избора на алгоритъм за генериране на текст: например промяната на стратегията за семплиране (температура, top-k/nucleus sampling и др.) влияе върху разпределението на изходите и се отразява в стойността на метриката<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>.

Важна характеристика на MAUVE е високата му съгласуваност с човешката оценка. В изследванията е показано, че стойностите на MAUVE **силно корелират със субективните оценки за качество**, надминавайки по тази корелация базовите метрики, използвани за отворена генерация на текст<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-KrishnaP25GitHub-3)</sup>. С други думи, моделите с по-висок MAUVE, като правило, се възприемат от хората като генериращи по-смислен и „подобен на човешкия" текст. При това MAUVE налага по-малко ограничения в сравнение с предложените по-рано разпределителни метрики за оценка: методът се мащабира до големи модели и дълги текстове, отчита едновременно няколко аспекта на различията, докато много стандартни показатели фиксират само един статистически аспект (една точка на дивергентната крива)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>. Такъв комплексен подход позволява по-пълно да се съди за качеството на работата на генеративния модел.

## Приложение и по-нататъшни изследвания

Макар MAUVE да е разработен първоначално за текстови модели, неговият подход е универсален. Методът е приложен успешно и към други типове генерирани данни. Например при генерацията на изображения (GAN-ове, дифузионни модели) метриката MAUVE по аналогичен начин разкрива характерните разлики между разпределенията на реалните и синтетичните изображения, достигайки точност на ниво на най-добрите съществуващи метрики или надминавайки ги<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-IFML-2)</sup>. Потенциално MAUVE може да бъде адаптиран и към други модалности (аудио, музика, видео) при условие, че за тях са налице семантично смислени embedding-и на признаци<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-KrishnaP25GitHub-3)</sup>.

Метриката получи широко разпространение в изследователската общност. Авторите са публикували отворена реализация на MAUVE на Python (достъпна чрез PyPI и интегрирана в библиотеката HuggingFace Evaluate) за удобство при практическото използване<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-KrishnaP25GitHub-3)</sup>. През 2023 година излезе разширена работа „MAUVE Scores for Generative Models: Theory and Practice", в която подробно са разгледани теоретичните свойства на метриката, различните варианти за нейното изчисляване и са дадени препоръки за приложението ѝ върху текст и изображения<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-IFML-2)</sup>. Успоредно с оригиналната статия е публикувана и спомагателна работа, установяваща статистическите граници и необходимия размер на извадката за надеждна оценка с MAUVE<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>. Развитието на тези идеи не само спомага за подобряване на качеството на генеративните модели, но и поставя основите за инструменти за разпознаване на машинен текст: с намаляването на разрива между текстовете, създавани от ИИ и от човека, метрики като MAUVE ще помогнат за по-доброто разбиране на работата на моделите и за разграничаване на тяхното съдържание от човешкото<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_note-AllenSchoolNews-1)</sup>.

## Ограничения и препоръки

Разработчиците на MAUVE подчертават, че при практическото използване е важно да се спазват определени условия за коректност на оценката. На първо място е необходим **достатъчен обем на извадката**: за устойчива оценка на метриката са необходими около няколко хиляди примера от всеки тип (в оригиналните експерименти са използвани по ~5000 изречения). При значително по-малки извадки MAUVE може да завишава качеството (изместване към оптимизъм) и да дава нестабилни резултати с висока дисперсия. На второ място, **MAUVE се препоръчва да се интерпретира в сравнителен план**. Абсолютната стойност на метриката зависи от някои хиперпараметри на изчислението (например броя на клъстерите при квантуването), поради което прякото значение на MAUVE за един модел е по-малко информативно. Препоръчва се сравняване на MAUVE на няколко модела или методи на генерация помежду им (при еднакви настройки на метриката) — тогава по-високата стойност еднозначно указва на по-близко до човешкото качество на текста. Следвайки тези препоръки, MAUVE служи като надежден инструмент за обективна оценка и сравнение на генеративни модели.

## Препратки

- Проектна страница на MAUVE

## Бележки

1.  <span id="cite_note-AllenSchoolNews-1">↑ <sup>[1.00](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-AllenSchoolNews_1-12)</sup> «Allen School News \>\> Allen School and AI2 researchers paint the NeurIPS conference MAUVE and take home an Outstanding Paper Award». *Allen School News*. <a href="https://news.cs.washington.edu/2022/02/28/allen-school-and-ai2-researchers-paint-the-neurips-conference-mauve-and-take-home-an-outstanding-paper-award/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-IFML-2">↑ <sup>[2.0](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-IFML_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-IFML_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-IFML_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-IFML_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-IFML_2-4)</sup> «MAUVE: Statistical Evaluation of LLMs and Generative AI \| Institute for Foundations of Machine Learning». *Institute for Foundations of Machine Learning*. <a href="https://www.ifml.institute/index.php/research/mauve-statistical-evaluation-llms-and-generative-ai" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-KrishnaP25GitHub-3">↑ <sup>[3.0](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-KrishnaP25GitHub_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-KrishnaP25GitHub_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-KrishnaP25GitHub_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-KrishnaP25GitHub_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-KrishnaP25GitHub_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-KrishnaP25GitHub_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/MAUVE_(metric)_(BG)#cite_ref-KrishnaP25GitHub_3-6)</sup> «MAUVE: Measuring the Gap Between Neural Text and Human Text — MAUVE». *MAUVE project page*. <a href="https://krishnap25.github.io/mauve/" class="external autonumber" rel="nofollow">[3]</a></span>
