---
title: "MAUVE (metric) (NL)"
source: "https://systems-analysis.info/int/MAUVE_(metric)_(NL)"
wiki: "systems-analysis.info/int"
article: "MAUVE_(metric)_(NL)"
language: "nl"
categories:
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 4000
wiki_created_at: 2026-09-06T23:29:04Z
wiki_modified_at: 2026-09-06T23:29:04Z
downloaded_at: 2026-09-07T23:00:15Z
---

# MAUVE (metric) (NL)

**MAUVE** — een automatische metriek voor het beoordelen van de kwaliteit van tekst die wordt gegenereerd door moderne grote taalmodellen <sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>. Deze maatstaf meet de «kloof» tussen de statistische verdeling van teksten die door een neuraal netwerk worden gegenereerd en de verdeling van menselijke tekst<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>. **MAUVE** is bedoeld voor open-ended generatietaken (bijvoorbeeld het voortzetten van tekst), waarbij er geen enkel correct antwoord bestaat, en waarbij de vergelijking plaatsvindt op het niveau van tekstverdelingen in plaats van afzonderlijke voorbeelden<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>. De methode werd in 2021 voorgesteld door een groep onderzoekers onder leiding van Krishna Pillutla en gepresenteerd op de conferentie NeurIPS 2021, waar het de **Outstanding Paper Award** ontving voor originaliteit en potentiële impact<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-IFML-2)[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>.

## Beoordelingsmethode

**MAUVE** maakt gebruik van het concept van **divergentiefronten** (Engels: divergence frontiers) uit de informatietheorie om tegelijkertijd twee soorten fouten van een generatief model te beoordelen<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>:

- Afwijking van geloofwaardigheid (generatie van «betekenisloze» tekst).
- Vermindering van diversiteit (overmatig sjabloonmatige tekst).

Het idee is gebaseerd op het vergelijken van de statistische eigenschappen van de uitvoerverdeling van het model met de verdeling van referentie- (menselijke) teksten over een breed spectrum van criteria. De implementatie van de metriek berust op de representatie van teksten als embeddings van een groot vooraf getraind taalmodel en het berekenen van de divergenties tussen de verkregen verdelingen in deze feature-ruimte<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-KrishnaP25GitHub-3)</sup>.

Hieronder volgen de belangrijkste stappen bij het berekenen van MAUVE:

### Vectorisatie van steekproeven

Beide verzamelingen teksten — door het model gegenereerde en echte — worden omgezet in embeddings met behulp van een vooraf getraind taalmodel (bijvoorbeeld de laatste verborgen toestand van GPT-2)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-KrishnaP25GitHub-3)</sup>. Deze representatie plaatst teksten in een gemeenschappelijke feature-ruimte voor verdere vergelijking.

### Discretisatie van verdelingen

De verkregen embeddings worden geclusterd (bijvoorbeeld met de k-means-methode), wat leidt tot kwantisering van de continue feature-ruimte<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-KrishnaP25GitHub-3)</sup>. Als resultaat worden discrete benaderde verdelingen **P** (menselijke tekst) en **Q** (modeltekst) over clusters gevormd.

### Opbouw van het divergentiefront

Divergencies tussen de verdelingen P en Q worden berekend bij verschillende verhoudingen van fouten van het eerste en tweede type<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>. Dit betekent in feite dat meerdere informatiedivergencies (bijvoorbeeld Kullback-Leibler-divergencies) worden berekend voor een reeks drempelwaarden die het compromis tussen «precisie» en «volledigheid» van het model karakteriseren. De verzameling van dergelijke punten vormt een «verdelingsverschil»-curve (divergence curve)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>.

### Integratie en resultaat

De verkregen curve wordt geïntegreerd, dat wil zeggen dat de oppervlakte onder de divergentiecurve wordt berekend. Deze integrale maatstaf is de waarde van **MAUVE** — een scalair getal dat kwantitatief de mate van overeenkomst van de verdeling van modeltekst met menselijke tekst beschrijft<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>. De uiteindelijke **MAUVE score** is genormaliseerd in het bereik van 0 tot 1, waarbij waarden dichter bij 1 overeenkomen met een minimale divergentie (de modeltekst is statistisch vergelijkbaar met menselijke tekst)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-KrishnaP25GitHub-3)</sup>.

## Experimentele resultaten en eigenschappen

De auteurs hebben MAUVE getest op een aantal open-ended tekstgeneratietaken (voortzetting van webtekst, nieuwsartikelen, verhalen)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>. De metriek toonde het vermogen om bekende patronen in de kwaliteit van generatie te identificeren. In het bijzonder neemt de MAUVE-waarde toe naarmate de grootte van het taalmodel toeneemt, wat de verbetering van de samenhang en geloofwaardigheid van de tekst bij grotere modellen weerspiegelt<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-IFML-2)</sup>. Omgekeerd is bij een toename van de lengte van het gegenereerde fragment een daling van MAUVE te zien, dat wil zeggen dat de kwaliteit van lange vervolgingen doorgaans slechter is dan die van korte (het model begint te herhalen of wijkt af van de context)<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-IFML-2)</sup>. Ook maakt MAUVE onderscheid tussen de effecten van de keuze van het algoritme voor tekstgeneratie: zo beïnvloedt de verandering van de sampling-strategie (temperatuur, top-k/nucleus sampling, enz.) de verdeling van de uitvoer en wordt dit weerspiegeld in de waarde van de metriek<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>.

Een belangrijke eigenschap van MAUVE is de hoge overeenstemming met menselijke beoordelingen. Onderzoeken tonen aan dat MAUVE-waarden **sterk correleren met subjectieve kwaliteitsbeoordelingen**, waarbij deze correlatie beter is dan die van basismeetwaarden die eerder voor open-ended tekstgeneratie werden gebruikt<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-KrishnaP25GitHub-3)</sup>. Met andere woorden: modellen met een hogere MAUVE-score worden door mensen over het algemeen ervaren als modellen die betekenisvollere en meer «mensachtige» tekst genereren. Daarbij legt MAUVE minder beperkingen op dan eerder voorgestelde verdelingsgebaseerde beoordelingsmetrieken: de methode schaalt naar grote modellen en lange teksten, houdt tegelijkertijd rekening met meerdere aspecten van verschillen, terwijl veel standaardmaatstaven slechts één statistisch aspect meten (één punt op de divergentiecurve)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>. Deze integrale aanpak maakt het mogelijk om de kwaliteit van het generatieve model vollediger te beoordelen.

## Toepassingen en vervolgonderzoek

Hoewel MAUVE oorspronkelijk is ontwikkeld voor tekstmodellen, is de aanpak universeel. De methode is ook met succes toegepast op andere typen gegenereerde gegevens. Zo identificeert de MAUVE-metriek voor het genereren van afbeeldingen (GAN's, diffusiemodellen) op vergelijkbare wijze de karakteristieke verschillen tussen verdelingen van echte en synthetische afbeeldingen, waarbij de nauwkeurigheid gelijk is aan of beter is dan die van de beste bestaande metrieken<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-IFML-2)</sup>. Potentieel kan MAUVE ook worden aangepast voor andere modaliteiten (audio, muziek, video), op voorwaarde dat semantisch zinvolle feature-embeddings beschikbaar zijn<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-KrishnaP25GitHub-3)</sup>.

De metriek heeft brede verspreiding gevonden in de onderzoeksgemeenschap. De auteurs hebben een open-source implementatie van MAUVE in Python uitgebracht (beschikbaar via PyPI en geïntegreerd in de HuggingFace Evaluate-bibliotheek) voor gemakkelijk praktisch gebruik<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-KrishnaP25GitHub-3)</sup>. In 2023 verscheen het uitgebreide werk «MAUVE Scores for Generative Models: Theory and Practice», waarin de theoretische eigenschappen van de metriek, verschillende varianten van de berekening ervan en aanbevelingen voor toepassing op tekst en afbeeldingen uitvoerig worden besproken<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-IFML-2)</sup>. Parallel aan het oorspronkelijke artikel werd ook een aanvullend werk gepubliceerd dat statistische grenzen en de benodigde steekproefgrootte voor een betrouwbare MAUVE-beoordeling vaststelt<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>. De verdere ontwikkeling van deze ideeën helpt niet alleen bij het verbeteren van de kwaliteit van generatieve modellen, maar legt ook de basis voor hulpmiddelen voor het herkennen van machinale tekst: naarmate de kloof tussen door AI en door mensen gecreëerde teksten kleiner wordt, helpen metrieken zoals MAUVE om de werking van modellen beter te begrijpen en hun inhoud van menselijke inhoud te onderscheiden<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_note-AllenSchoolNews-1)</sup>.

## Beperkingen en aanbevelingen

De ontwikkelaars van MAUVE benadrukken dat bij praktisch gebruik bepaalde voorwaarden in acht moeten worden genomen voor een correcte beoordeling. Ten eerste is een **voldoende steekproefomvang** nodig: voor een stabiele schatting van de metriek zijn ongeveer enkele duizenden voorbeelden van elk type vereist (in de originele experimenten werden ~5000 zinnen per categorie gebruikt). Bij aanzienlijk kleinere steekproeven kan MAUVE de kwaliteit overschatten (optimistische vertekening) en instabiele resultaten met een hoge variantie geven. Ten tweede verdient het de voorkeur om **MAUVE in vergelijkende zin te interpreteren**. De absolute waarde van de metriek is afhankelijk van bepaalde hyperparameters van de berekening (bijvoorbeeld het aantal clusters bij kwantisering), waardoor de directe MAUVE-waarde voor één model minder informatief is. Het wordt aanbevolen om de MAUVE-waarden van meerdere modellen of generatiemethoden onderling te vergelijken (bij identieke instellingen van de metriek) — dan duidt een hogere waarde ondubbelzinnig op een kwaliteit die dichter bij menselijke tekst ligt. Door deze aanbevelingen te volgen, dient MAUVE als een betrouwbaar instrument voor objectieve beoordeling en vergelijking van generatieve modellen.

## Verwijzingen

- Projectpagina MAUVE

## Noten

1.  <span id="cite_note-AllenSchoolNews-1">↑ <sup>[1.00](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-AllenSchoolNews_1-12)</sup> «Allen School News \>\> Allen School and AI2 researchers paint the NeurIPS conference MAUVE and take home an Outstanding Paper Award». *Allen School News*. <a href="https://news.cs.washington.edu/2022/02/28/allen-school-and-ai2-researchers-paint-the-neurips-conference-mauve-and-take-home-an-outstanding-paper-award/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-IFML-2">↑ <sup>[2.0](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-IFML_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-IFML_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-IFML_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-IFML_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-IFML_2-4)</sup> «MAUVE: Statistical Evaluation of LLMs and Generative AI \| Institute for Foundations of Machine Learning». *Institute for Foundations of Machine Learning*. <a href="https://www.ifml.institute/index.php/research/mauve-statistical-evaluation-llms-and-generative-ai" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-KrishnaP25GitHub-3">↑ <sup>[3.0](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-KrishnaP25GitHub_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-KrishnaP25GitHub_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-KrishnaP25GitHub_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-KrishnaP25GitHub_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-KrishnaP25GitHub_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-KrishnaP25GitHub_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/MAUVE_(metric)_(NL)#cite_ref-KrishnaP25GitHub_3-6)</sup> «MAUVE: Measuring the Gap Between Neural Text and Human Text — MAUVE». *MAUVE project page*. <a href="https://krishnap25.github.io/mauve/" class="external autonumber" rel="nofollow">[3]</a></span>
