---
title: "MAUVE (metric) (HU)"
source: "https://systems-analysis.info/int/MAUVE_(metric)_(HU)"
wiki: "systems-analysis.info/int"
article: "MAUVE_(metric)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 3996
wiki_created_at: 2026-09-06T23:29:00Z
wiki_modified_at: 2026-09-06T23:29:00Z
downloaded_at: 2026-09-07T23:00:13Z
---

# MAUVE (metric) (HU)

**MAUVE** — egy automatikus metrika a modern nagy nyelvi modellek által generált szöveg minőségének értékelésére <sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>. Ez a mutató a neurális hálózat által létrehozott szövegek statisztikai eloszlása és az emberi szöveg eloszlása közötti „szakadékot" méri<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>. A **MAUVE** nyílt végű generálási feladatokhoz készült (például szövegfolytatás), ahol nincs egyetlen helyes válasz, és az összehasonlítás a szövegeloszlások szintjén történik, nem pedig egyedi példányok alapján<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>. A módszert 2021-ben Krishna Pillutla vezette kutatócsoport javasolta, és a NeurIPS 2021 konferencián mutatták be, ahol újszerűsége és potenciális hatása miatt **Outstanding Paper Award** díjat kapott<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-IFML-2)[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>.

## Értékelési módszertan

A **MAUVE** az információelméletből származó **divergenciahatárok** (angolul: divergence frontiers) fogalmát alkalmazza a generatív modell két típusú hibájának egyidejű értékelésére<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>:

- Eltérés a hitelességtől (\\értelmetlen\\ szöveg generálása).
- A változatosság csökkenése (túlzottan sablonos szöveg).

Az ötlet lényege a modell kimeneti eloszlásának statisztikai tulajdonságait a referencia- (emberi) szövegek eloszlásával összehasonlítani szempontok egész skálája mentén. A metrika megvalósítása a szövegek egy nagy, előre tanított nyelvi modell embeddingjeivel való reprezentálásán, majd az így kapott eloszlások közötti eltérések kiszámításán alapul ebben a jellemzőtérben<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-KrishnaP25GitHub-3)</sup>.

Az alábbiakban a MAUVE kiszámításának főbb lépései szerepelnek:

### Minták vektorizálása

Mindkét szövegkészlet — a modell által generált és a valódi szövegek — embeddingekké alakítódnak egy előre tanított nyelvi modell segítségével (például a GPT-2 utolsó rejtett állapotával)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-KrishnaP25GitHub-3)</sup>. Ez a reprezentáció a szövegeket egy egységes jellemzőtérbe viszi át a további összehasonlítás céljából.

### Eloszlások diszkretizálása

A kapott embeddingeket klaszterezik (például k-közép módszerrel), ami a folytonos jellemzőtér kvantálásához vezet<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-KrishnaP25GitHub-3)</sup>. Ennek eredményeként diszkrét közelítő eloszlások jönnek létre: **P** (emberi szöveg) és **Q** (modell szövege) a klaszterek szerint.

### Divergenciahatár felépítése

Kiszámítják a P és Q eloszlások közötti divergenciákat az első és második típusú hibák különböző arányai mellett<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>. Ez gyakorlatilag több információs eltérés (például Kullback–Leibler-divergencia) értékelését jelenti számos küszöbértéken, amelyek a modell „pontossága" és „teljessége" közötti kompromisszumot jellemzik. Az ilyen pontok összessége alkotja az „eloszláskülönbség-görbét" (divergence curve)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>.

### Integrálás és eredmény

A kapott görbét integrálják, vagyis kiszámítják a divergenciagörbe alatti területet. Ez az integrális mutató maga a **MAUVE** értéke — egy skalár, amely számszerűen jellemzi a modell szövegeloszlásának és az emberi szövegeloszlásnak a közelségét<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>. A végső **MAUVE score** 0 és 1 közé van normálva, ahol az 1-hez közelebbi értékek minimális eltérést jeleznek (a modell szövege statisztikailag közel áll az emberihez)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-KrishnaP25GitHub-3)</sup>.

## Kísérleti eredmények és tulajdonságok

A szerzők a MAUVE-t számos nyílt végű szöveggenerálási feladaton tesztelték (webes szövegek, hírcikkek és novellák folytatása)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>. A metrika képesnek bizonyult a generálás minőségével kapcsolatos ismert összefüggések kimutatására. Különösen: a nyelvi modell méretének növekedésével a MAUVE értéke nő, ami a nagyobb modellek szövegének jobb koherenciáját és hitelességét tükrözi<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-IFML-2)</sup>. Ezzel szemben a generált szövegrész hosszának növekedésével a MAUVE csökken, vagyis a hosszú folytatások minősége általában gyengébb a rövidekénél (a modell ismételni kezd, vagy eltávolodik a kontextustól)<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-IFML-2)</sup>. A MAUVE a szöveggenerálási algoritmus megválasztásának hatásait is megkülönbözteti: például a mintavételi stratégia módosítása (hőmérséklet, top-k/nucleus sampling stb.) befolyásolja a kimenetek eloszlását, és ez tükröződik a metrika értékében<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>.

A MAUVE fontos jellemzője az emberi értékeléssel való magas egybeesés. Kutatások kimutatták, hogy a MAUVE értékei **erősen korrelálnak a minőség szubjektív megítélésével**, és ebben a korrelációban felülmúlják a nyílt végű szöveggeneráláshoz korábban alkalmazott alapmetrikákat<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-KrishnaP25GitHub-3)</sup>. Más szóval a magasabb MAUVE értékű modellek általában úgy tűnnek az embereknek, hogy értelmesebb és „emberszerűbb" szöveget generálnak. Emellett a MAUVE kevesebb megkötést támaszt, mint a korábban javasolt eloszlásalapú értékelési metrikák: a módszer skálázható nagy modellekre és hosszú szövegekre, egyszerre több különbségi szempontot vesz figyelembe, míg sok szabványos mutató csupán egyetlen statisztikai szempontot rögzít (a divergenciagörbe egyetlen pontját)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>. Ez az átfogó megközelítés teljesebb képet nyújt a generatív modell működésének minőségéről.

## Alkalmazás és további kutatások

Bár a MAUVE-t eredetileg szöveges modellekhez fejlesztették, megközelítése univerzális. A módszert sikerrel alkalmazták más típusú generált adatokra is. Például képgenerálás esetén (GAN-ok, diffúziós modellek) a MAUVE metrika hasonlóképpen azonosítja a valódi és szintetikus képek eloszlásai közötti jellegzetes különbségeket, elérve a legjobb létező metrikák szintjét vagy felülmúlva azokat<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-IFML-2)</sup>. A MAUVE potenciálisan más modalitásokhoz (hang, zene, videó) is adaptálható, feltéve, hogy azokhoz szemantikailag értelmes jellemző-embeddingek állnak rendelkezésre<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-KrishnaP25GitHub-3)</sup>.

A metrika széles körben elterjedt a kutatói közösségben. A szerzők kiadtak egy nyílt forráskódú Python-implementációt (elérhető PyPI-n és integrálva van a HuggingFace Evaluate könyvtárba) a kényelmes gyakorlati felhasználás érdekében<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-KrishnaP25GitHub-3)</sup>. 2023-ban megjelent a „MAUVE Scores for Generative Models: Theory and Practice" bővített tanulmány, amely részletesen tárgyalja a metrika elméleti tulajdonságait, különböző kiszámítási változatait, és ajánlásokat tartalmaz a szövegen és képeken való alkalmazásra<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-IFML-2)</sup>. Az eredeti cikkel párhuzamosan megjelent egy kiegészítő munka is, amely statisztikai határokat és a MAUVE megbízható értékeléséhez szükséges mintaméretet határozza meg<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>. Ezeknek az ötleteknek a fejlesztése nemcsak a generatív modellek minőségének javítását segíti elő, hanem alapot teremt a gépi szöveg felismerésének eszközeihez is: ahogy az MI által és az ember által létrehozott szövegek közötti szakadék szűkül, az olyan metrikák, mint a MAUVE, segítenek jobban megérteni a modellek működését és megkülönböztetni tartalmaikat az emberi szövegtől<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_note-AllenSchoolNews-1)</sup>.

## Korlátok és ajánlások

A MAUVE fejlesztői hangsúlyozzák, hogy a gyakorlati alkalmazás során bizonyos feltételek betartása szükséges az értékelés helyességéhez. Először is **elegendő mintaméret** szükséges: a metrika stabil értékeléséhez mindkét típusból néhány ezer példányra van szükség (az eredeti kísérletekben ~5000 mondatot használtak típusonként). Jóval kisebb minták esetén a MAUVE túlbecsülheti a minőséget (optimista irányban torzít), és magas varianciájú, instabil eredményeket adhat. Másodszor, **a MAUVE-t inkább összehasonlító módon érdemes értelmezni**. A metrika abszolút értéke bizonyos számítási hiperparaméterektől függ (például a kvantáláskor alkalmazott klaszterek számától), ezért egyetlen modell MAUVE értéke önmagában kevésbé informatív. Javasolt több modell vagy generálási módszer MAUVE értékét egymással összehasonlítani (azonos metrikabeállítások mellett) — ekkor a magasabb érték egyértelműen az emberi szövegminőséghez közelebb álló eredményt jelez. Ezeket az ajánlásokat követve a MAUVE megbízható eszközzé válik a generatív modellek objektív értékelésére és összehasonlítására.

## Hivatkozások

- A MAUVE projektoldala

## Megjegyzések

1.  <span id="cite_note-AllenSchoolNews-1">↑ <sup>[1.00](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-AllenSchoolNews_1-12)</sup> «Allen School News \>\> Allen School and AI2 researchers paint the NeurIPS conference MAUVE and take home an Outstanding Paper Award». *Allen School News*. <a href="https://news.cs.washington.edu/2022/02/28/allen-school-and-ai2-researchers-paint-the-neurips-conference-mauve-and-take-home-an-outstanding-paper-award/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-IFML-2">↑ <sup>[2.0](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-IFML_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-IFML_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-IFML_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-IFML_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-IFML_2-4)</sup> «MAUVE: Statistical Evaluation of LLMs and Generative AI \| Institute for Foundations of Machine Learning». *Institute for Foundations of Machine Learning*. <a href="https://www.ifml.institute/index.php/research/mauve-statistical-evaluation-llms-and-generative-ai" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-KrishnaP25GitHub-3">↑ <sup>[3.0](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-KrishnaP25GitHub_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-KrishnaP25GitHub_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-KrishnaP25GitHub_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-KrishnaP25GitHub_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-KrishnaP25GitHub_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-KrishnaP25GitHub_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/MAUVE_(metric)_(HU)#cite_ref-KrishnaP25GitHub_3-6)</sup> «MAUVE: Measuring the Gap Between Neural Text and Human Text — MAUVE». *MAUVE project page*. <a href="https://krishnap25.github.io/mauve/" class="external autonumber" rel="nofollow">[3]</a></span>
