---
title: "MAUVE (metric) (TL)"
source: "https://systems-analysis.info/int/MAUVE_(metric)_(TL)"
wiki: "systems-analysis.info/int"
article: "MAUVE_(metric)_(TL)"
language: "tl"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Tagalog"
revision_id: 4006
wiki_created_at: 2026-09-06T23:29:09Z
wiki_modified_at: 2026-09-06T23:29:09Z
downloaded_at: 2026-09-07T23:00:17Z
---

# MAUVE (metric) (TL)

**MAUVE** — ito ay isang awtomatikong sukatan para sa pagtatasa ng kalidad ng teksto na ginagawa ng mga modernong malalaking language model <sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>. Sinusukat ng tagapagpahiwatig na ito ang "agwat" sa pagitan ng istatistikal na distribusyon ng mga tekstong nilikha ng neural network at ng distribusyon ng tekstong gawa ng tao<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>. Ang **MAUVE** ay inilaan para sa mga gawaing open-ended na pagbuo ng teksto (halimbawa, pagpapatuloy ng teksto), kung saan walang iisang tamang sagot, at ang paghahambing ay isinasagawa sa antas ng mga distribusyon ng teksto, hindi sa antas ng mga indibidwal na halimbawa<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>. Ang pamamaraan ay iminungkahi noong 2021 ng isang grupo ng mga mananaliksik na pinamumunuan ni Krishna Pillutla at ipinakita sa kumperensya ng NeurIPS 2021, kung saan ito ay nakatanggap ng **Outstanding Paper Award** para sa pagiging bago at potensyal na impluwensya<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-IFML-2)[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>.

## Pamamaraan ng Pagtatasa

Gumagamit ang **MAUVE** ng konsepto ng **divergence frontiers** mula sa teorya ng impormasyon para sabay na tasahin ang dalawang uri ng pagkakamali ng generative model<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>:

- Paglihis mula sa katotohanan (pagbuo ng "walang kabuluhang" teksto).
- Pagbaba ng pagkakaiba-iba (labis na paulit-ulit na teksto).

Ang ideya ay ang paghahambing ng mga istatistikal na katangian ng distribusyon ng mga output ng modelo sa distribusyon ng mga reference (tao) na teksto sa isang buong espektro ng pamantayan. Ang pagpapatupad ng sukatan ay nakasalalay sa representasyon ng mga teksto bilang mga embedding ng isang malaking pre-trained na language model at sa pagkalkula ng mga pagkakaiba sa pagitan ng mga resultang distribusyon sa feature space na iyon<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-KrishnaP25GitHub-3)</sup>.

Sa ibaba ay ang mga pangunahing hakbang sa pagkalkula ng MAUVE:

### Vectorization ng mga Sample

Ang parehong hanay ng mga teksto — mga nabuong teksto ng modelo at mga tunay na teksto — ay kino-convert sa mga embedding gamit ang isang pre-trained na language model (halimbawa, ang huling nakatagong estado ng GPT-2)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-KrishnaP25GitHub-3)</sup>. Ang ganitong representasyon ay nagsasalin ng mga teksto sa isang pinag-isang feature space para sa kasunod na paghahambing.

### Discretization ng mga Distribusyon

Ang mga resultang embedding ay kina-cluster (halimbawa, gamit ang pamamaraan ng k-means), na humahantong sa quantization ng patuloy na feature space<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-KrishnaP25GitHub-3)</sup>. Bilang resulta, nabubuo ang mga discrete na tinatayang distribusyon ng **P** (tekstong gawa ng tao) at **Q** (tekstong gawa ng modelo) ayon sa mga cluster.

### Pagbuo ng Divergence Frontier

Kinokalkyula ang mga divergence sa pagitan ng mga distribusyon ng P at Q sa iba't ibang ratio ng mga pagkakamali ng unang uri at pangalawang uri<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>. Sa katunayan, nangangahulugan ito ng pagtatasa ng ilang mga impormasyon na pagkakaiba (halimbawa, mga Kullback-Leibler divergence) para sa maraming threshold na nagpapakilala ng kompromiso sa pagitan ng "katumpakan" at "kumpletong saklaw" ng modelo. Ang hanay ng mga puntong ito ay bumubuo ng kurba ng "pagkakaiba ng distribusyon" (divergence curve)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>.

### Integrasyon at Resulta

Ang resultang kurba ay ini-integrate, iyon ay, kinakalkula ang lugar sa ilalim ng kurba ng mga divergence. Ang integral na tagapagpahiwatig na ito ang siyang halaga ng **MAUVE** — isang scalar na dami na nagpapakilala ng antas ng pagkakatulad ng distribusyon ng tekstong gawa ng modelo sa tekstong gawa ng tao<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>. Ang panghuling **MAUVE score** ay na-normalize sa hanay mula 0 hanggang 1, kung saan ang mga halagang mas malapit sa 1 ay naaayon sa pinakamaliit na pagkakaiba (ang teksto ng modelo ay istatistikal na malapit sa tekstong gawa ng tao)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-KrishnaP25GitHub-3)</sup>.

## Mga Eksperimental na Resulta at Katangian

Sinubukan ng mga may-akda ang MAUVE sa ilang mga bukas na gawain ng pagbuo ng teksto (pagpapatuloy ng web na teksto, mga artikulo sa balita, mga kuwento)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>. Ipinakita ng sukatan ang kakayahan nitong tukuyin ang mga kilalang pattern ng kalidad ng pagbuo. Sa partikular, habang lumalaki ang sukat ng language model, tumataas ang halaga ng MAUVE, na sumasalamin sa pagpapabuti ng koherensya at katotohanan ng teksto sa mas malalaking modelo<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-IFML-2)</sup>. Sa kabaligtaran, habang tumataas ang haba ng binuong fragment, may pagbaba ng MAUVE, iyon ay, ang kalidad ng mahahabang pagpapatuloy ay karaniwang mas masahol kaysa sa mga maikling (nagsisimula ang modelo na mag-ulit o lumayo sa konteksto)<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-IFML-2)</sup>. Ginagawa ring pagkakaiba ng MAUVE ang mga epekto ng pagpili ng algorithm para sa pagbuo ng teksto: halimbawa, ang pagbabago ng istratehiya ng sampling (temperatura, top-k/nucleus sampling, atbp.) ay nakakaapekto sa distribusyon ng mga output at makikita sa halaga ng sukatan<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>.

Ang isang mahalagang katangian ng MAUVE ay ang mataas na konsistensya nito sa pagtatasa ng tao. Sa mga pananaliksik, ipinakita na ang mga halaga ng MAUVE ay **malakas na nagkokorrelate sa mga subjektibong pagtatasa ng kalidad**, na hihigit sa korelasyong ito kumpara sa mga baseline na sukatan na ginamit para sa bukas na pagbuo ng teksto<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-KrishnaP25GitHub-3)</sup>. Sa madaling salita, ang mga modelo na may mas mataas na MAUVE ay karaniwang pinaniniwalaan ng mga tao na bumubuo ng mas makabuluhan at "katulad ng tao" na teksto. Kasabay nito, ang MAUVE ay nagpapataw ng mas kaunting mga paghihigpit kaysa sa mga naunang iminungkahing distributional na sukatan ng pagtatasa: ang pamamaraan ay nasusukat sa malalaking modelo at mahahabang teksto, isinasaalang-alang ang ilang mga aspeto ng mga pagkakaiba nang sabay-sabay, samantalang maraming karaniwang tagapagpahiwatig ang nakaayos lamang sa isang istatistikal na aspeto (isang punto sa divergence curve)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>. Ang komprehensibong diskarteng ito ay nagbibigay-daan sa mas kumpletong pagtatasa ng kalidad ng gawain ng generative model.

## Aplikasyon at Karagdagang Pananaliksik

Kahit ang MAUVE ay orihinal na binuo para sa mga text model, ang kanyang diskarte ay unibersal. Matagumpay ding ginamit ang pamamaraan para sa iba pang uri ng nabuong datos. Halimbawa, para sa pagbuo ng mga larawan (mga GAN, mga diffusion model) ang sukatan ng MAUVE ay katulad na nagtatuklas ng mga katangiang pagkakaiba sa pagitan ng mga distribusyon ng mga tunay at synthetic na larawan, na nakakamit ng katumpakan sa antas ng pinakamahusay na mga kasalukuyang sukatan o hihigit pa sa kanila<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-IFML-2)</sup>. Maaari ring iakma ang MAUVE sa iba pang mga modalidad (audio, musika, video) sa kondisyon na ang mga semantikong makabuluhang feature embedding ay available para sa kanila<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-KrishnaP25GitHub-3)</sup>.

Ang sukatan ay nakapagtatamo ng malawak na pagtanggap sa komunidad ng mga mananaliksik. Naglabas ang mga may-akda ng bukas na implementasyon ng MAUVE sa Python (available sa pamamagitan ng PyPI at integrated sa library ng HuggingFace Evaluate) para sa kaginhawahan ng praktikal na paggamit<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-KrishnaP25GitHub-3)</sup>. Noong 2023, lumabas ang pinalawak na gawain na "MAUVE Scores for Generative Models: Theory and Practice", kung saan detalyadong tinalakay ang mga teoretikal na katangian ng sukatan, iba't ibang mga opsyon para sa pagkalkula nito at ibinigay ang mga rekomendasyon para sa paggamit sa teksto at mga larawan<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-IFML-2)</sup>. Gayundin, kasabay ng orihinal na artikulo ay nailathala ang isang katulong na gawain na nagtatatag ng mga istatistikal na hangganan at kinakailangang laki ng sample para sa maaasahang pagtatasa ng MAUVE<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>. Ang pagpapaunlad ng mga ideyang ito ay hindi lamang tumutulong sa pagpapabuti ng kalidad ng mga generative model, kundi nagtatakda rin ng pundasyon para sa mga tool sa pagkilala ng tekstong gawa ng makina: habang mababawasan ang agwat sa pagitan ng mga tekstong nilikha ng AI at ng tao, ang mga sukatan tulad ng MAUVE ay makakatulong na mas maunawaan ang gawain ng mga modelo at mapagkaiba ang kanilang nilalaman mula sa nilalaman ng tao<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_note-AllenSchoolNews-1)</sup>.

## Mga Limitasyon at Rekomendasyon

Binibigyang-diin ng mga developer ng MAUVE na sa praktikal na paggamit ay mahalaga na sumunod sa ilang mga kondisyon para sa kawastuhan ng pagtatasa. Una, kailangan ang **sapat na laki ng sample**: para sa matatag na pagtatasa ng sukatan, kailangan ng humigit-kumulang ilang libong halimbawa ng bawat uri (sa mga orihinal na eksperimento, humigit-kumulang ~5000 pangungusap ang ginamit bawat isa). Sa makabuluhang mas maliit na mga sample, maaaring mag-overestimate ang MAUVE ng kalidad (pagkiling patungo sa optimismo) at magbibigay ng hindi matatag na mga resulta na may mataas na variance. Pangalawa, **mas mainam na bigyang-kahulugan ang MAUVE sa paraan ng paghahambing**. Ang ganap na halaga ng sukatan ay nakasalalay sa ilang mga hyperparameter ng pagkalkula (halimbawa, ang bilang ng mga cluster sa quantization), kaya ang direktang halaga ng MAUVE para sa isang modelo ay hindi gaanong nagbibigay-impormasyon. Inirerekomenda na ihambing ang MAUVE ng ilang mga modelo o pamamaraan ng pagbuo sa isa't isa (sa parehong mga setting ng sukatan) — kung gayon ang mas mataas na halaga ay malinaw na nagpapahiwatig ng kalidad ng teksto na mas malapit sa gawa ng tao. Sa pagsunod sa mga rekomendasyon na ito, ang MAUVE ay nagsisilbing maaasahang kasangkapan para sa layunin na pagtatasa at paghahambing ng mga generative model.

## Mga Sanggunian

- Pahina ng Proyekto ng MAUVE

## Mga Tala

1.  <span id="cite_note-AllenSchoolNews-1">↑ <sup>[1.00](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-AllenSchoolNews_1-12)</sup> «Allen School News \>\> Allen School and AI2 researchers paint the NeurIPS conference MAUVE and take home an Outstanding Paper Award». *Allen School News*. <a href="https://news.cs.washington.edu/2022/02/28/allen-school-and-ai2-researchers-paint-the-neurips-conference-mauve-and-take-home-an-outstanding-paper-award/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-IFML-2">↑ <sup>[2.0](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-IFML_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-IFML_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-IFML_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-IFML_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-IFML_2-4)</sup> «MAUVE: Statistical Evaluation of LLMs and Generative AI \| Institute for Foundations of Machine Learning». *Institute for Foundations of Machine Learning*. <a href="https://www.ifml.institute/index.php/research/mauve-statistical-evaluation-llms-and-generative-ai" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-KrishnaP25GitHub-3">↑ <sup>[3.0](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-KrishnaP25GitHub_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-KrishnaP25GitHub_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-KrishnaP25GitHub_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-KrishnaP25GitHub_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-KrishnaP25GitHub_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-KrishnaP25GitHub_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/MAUVE_(metric)_(TL)#cite_ref-KrishnaP25GitHub_3-6)</sup> «MAUVE: Measuring the Gap Between Neural Text and Human Text — MAUVE». *MAUVE project page*. <a href="https://krishnap25.github.io/mauve/" class="external autonumber" rel="nofollow">[3]</a></span>
