---
title: "MAUVE (metric) (TH)"
source: "https://systems-analysis.info/int/MAUVE_(metric)_(TH)"
wiki: "systems-analysis.info/int"
article: "MAUVE_(metric)_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 4005
wiki_created_at: 2026-09-06T23:29:08Z
wiki_modified_at: 2026-09-06T23:29:08Z
downloaded_at: 2026-09-07T23:00:17Z
---

# MAUVE (metric) (TH)

**MAUVE** — คือเมตริกอัตโนมัติสำหรับประเมินคุณภาพข้อความที่สร้างโดยโมเดลภาษาขนาดใหญ่ในยุคปัจจุบัน <sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup> ตัวชี้วัดนี้วัด "ช่องว่าง" ระหว่างการกระจายทางสถิติของข้อความที่สร้างโดยโครงข่ายประสาทเทียมกับการกระจายของข้อความมนุษย์<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup> **MAUVE** ถูกออกแบบมาสำหรับงาน open-ended generation (เช่น การต่อเติมข้อความ) ซึ่งไม่มีคำตอบที่ถูกต้องเพียงคำตอบเดียว และการเปรียบเทียบดำเนินการในระดับการกระจายของข้อความ ไม่ใช่ในระดับตัวอย่างแต่ละชิ้น<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup> วิธีการนี้ถูกเสนอในปี 2021 โดยกลุ่มนักวิจัยนำโดย Krishna Pillutla และนำเสนอในการประชุม NeurIPS 2021 ซึ่งได้รับรางวัล **Outstanding Paper Award** สำหรับความแปลกใหม่และศักยภาพในการส่งผลกระทบ<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-IFML-2)[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup>

## วิธีการประเมิน

**MAUVE** ใช้แนวคิด **divergence frontiers** จากทฤษฎีสารสนเทศเพื่อประเมินข้อผิดพลาดสองประเภทของโมเดลสร้างข้อความพร้อมกัน<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup>:

- การเบี่ยงเบนจากความน่าเชื่อถือ (การสร้างข้อความ "ไร้ความหมาย")
- การลดลงของความหลากหลาย (ข้อความที่ซ้ำซากเกินไป)

แนวคิดคือการเปรียบเทียบคุณสมบัติทางสถิติของการกระจายผลลัพธ์ของโมเดลกับการกระจายของข้อความอ้างอิง (ของมนุษย์) ตามเกณฑ์หลายประการ การนำเมตริกไปใช้งานอาศัยการแทนข้อความในรูปแบบ embedding โดยโมเดลภาษาขนาดใหญ่ที่ผ่านการ fine-tuning มาแล้ว และการคำนวณความแตกต่างระหว่างการกระจายที่ได้ในปริภูมิคุณลักษณะนั้น<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-KrishnaP25GitHub-3)</sup>

ด้านล่างนี้คือขั้นตอนหลักของการคำนวณ MAUVE:

### การแปลงกลุ่มตัวอย่างเป็นเวกเตอร์

ข้อความทั้งสองชุด — ที่สร้างโดยโมเดลและข้อความจริง — จะถูกแปลงเป็น embedding โดยใช้โมเดลภาษาที่ผ่านการ pre-training มาแล้ว (เช่น hidden state สุดท้ายของ GPT-2)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-KrishnaP25GitHub-3)</sup> การแทนค่าในลักษณะนี้จะนำข้อความไปอยู่ในปริภูมิคุณลักษณะร่วมเพื่อการเปรียบเทียบในขั้นตอนต่อไป

### การทำให้การกระจายเป็นดิสครีต

embedding ที่ได้จะถูกจัดกลุ่ม (เช่น โดยวิธี k-means) ซึ่งนำไปสู่การทำ quantization ในปริภูมิคุณลักษณะแบบต่อเนื่อง<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-KrishnaP25GitHub-3)</sup> ผลลัพธ์คือการกระจายแบบดิสครีตโดยประมาณ **P** (ข้อความมนุษย์) และ **Q** (ข้อความโมเดล) ตามกลุ่ม

### การสร้าง divergence front

คำนวณค่าการแยกระหว่างการกระจาย P และ Q ที่อัตราส่วนข้อผิดพลาดประเภทที่หนึ่งและประเภทที่สองต่างกัน<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup> โดยแท้จริงแล้ว นี่หมายถึงการประเมินความแตกต่างทางสารสนเทศหลายค่า (เช่น KL-divergence) สำหรับค่าขีดเริ่มต้นหลายค่าที่แสดงถึงความสมดุลระหว่าง "ความแม่นยำ" และ "ความครอบคลุม" ของโมเดล ชุดของจุดเหล่านี้ก่อให้เกิดเส้นโค้ง divergence curve<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup>

### การอินทิเกรตและผลลัพธ์

เส้นโค้งที่ได้จะถูกอินทิเกรต นั่นคือคำนวณพื้นที่ใต้เส้นโค้งของค่าการแยก ตัวชี้วัดเชิงปริพันธ์นี้คือค่า **MAUVE** — สเกลาร์ที่วัดระดับความใกล้เคียงของการกระจายข้อความโมเดลกับข้อความมนุษย์เชิงปริมาณ<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup> **MAUVE score** สุดท้ายถูกนอร์มัลไลซ์ในช่วง 0 ถึง 1 โดยค่าที่ใกล้ 1 หมายถึงความแตกต่างน้อยที่สุด (ข้อความโมเดลมีความใกล้เคียงกับข้อความมนุษย์ทางสถิติ)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-KrishnaP25GitHub-3)</sup>

## ผลการทดลองและคุณสมบัติ

ผู้เขียนได้ทดสอบ MAUVE กับงาน open-ended text generation หลายงาน (การต่อเติมเนื้อหาเว็บ บทความข่าว และเรื่องสั้น)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup> เมตริกแสดงให้เห็นความสามารถในการตรวจจับรูปแบบที่ทราบของคุณภาพการสร้างข้อความ โดยเฉพาะอย่างยิ่ง เมื่อขนาดของโมเดลภาษาเพิ่มขึ้น ค่า MAUVE ก็เพิ่มขึ้นด้วย สะท้อนถึงการปรับปรุงความสอดคล้องและความน่าเชื่อถือของข้อความในโมเดลขนาดใหญ่กว่า<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-IFML-2)</sup> ในทางตรงกันข้าม เมื่อความยาวของข้อความที่สร้างเพิ่มขึ้น จะสังเกตเห็นการลดลงของ MAUVE นั่นคือคุณภาพของการต่อเติมแบบยาวมักต่ำกว่าแบบสั้น (โมเดลเริ่มซ้ำหรือเบี่ยงเบนจากบริบท)<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-IFML-2)</sup> นอกจากนี้ MAUVE ยังแยกแยะผลของการเลือกอัลกอริทึมสำหรับการสร้างข้อความได้: เช่น การเปลี่ยนกลยุทธ์การ sampling (อุณหภูมิ, top-k/nucleus sampling เป็นต้น) ส่งผลต่อการกระจายของผลลัพธ์และสะท้อนออกมาในค่าของเมตริก<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup>

คุณลักษณะสำคัญของ MAUVE คือความสอดคล้องสูงกับการประเมินของมนุษย์ การวิจัยแสดงให้เห็นว่าค่า MAUVE **มีความสัมพันธ์สูงกับคะแนนคุณภาพเชิงอัตวิสัย** โดยเหนือกว่าเมตริกพื้นฐานที่ใช้สำหรับ open-ended text generation ในด้านความสัมพันธ์นี้<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-KrishnaP25GitHub-3)</sup> กล่าวอีกนัยหนึ่ง โมเดลที่มี MAUVE สูงกว่ามักถูกมนุษย์รับรู้ว่าสร้างข้อความที่มีความหมายและ "คล้ายมนุษย์" มากกว่า ในขณะเดียวกัน MAUVE กำหนดข้อจำกัดน้อยกว่าเมตริกการประเมินเชิงการกระจายที่เสนอก่อนหน้า: วิธีการนี้ขยายขนาดได้กับโมเดลขนาดใหญ่และข้อความยาว คำนึงถึงแง่มุมความแตกต่างหลายประการพร้อมกัน ในขณะที่ตัวชี้วัดมาตรฐานจำนวนมากตรึงเพียงแง่มุมทางสถิติเดียว (จุดเดียวบน divergence curve)<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup> แนวทางที่ครอบคลุมเช่นนี้ช่วยให้สามารถตัดสินคุณภาพการทำงานของโมเดลสร้างข้อความได้อย่างครบถ้วนมากขึ้น

## การประยุกต์ใช้และการวิจัยในอนาคต

แม้ว่า MAUVE จะถูกพัฒนาขึ้นสำหรับโมเดลข้อความในตอนแรก แต่แนวทางของมันมีความเป็นสากล วิธีการนี้ถูกนำไปใช้กับข้อมูลประเภทอื่นที่สร้างขึ้นได้สำเร็จ ตัวอย่างเช่น สำหรับการสร้างภาพ (GAN, diffusion model) เมตริก MAUVE ก็ตรวจจับความแตกต่างที่เป็นลักษณะเฉพาะระหว่างการกระจายของภาพจริงและภาพสังเคราะห์ได้เช่นกัน โดยมีความแม่นยำอยู่ในระดับเมตริกที่ดีที่สุดที่มีอยู่หรือเหนือกว่า<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-IFML-2)</sup> MAUVE อาจถูกปรับใช้กับรูปแบบข้อมูลอื่นๆ ได้อีก (เสียง ดนตรี วิดีโอ) หากมี embedding คุณลักษณะที่มีความหมายเชิงความหมายสำหรับรูปแบบเหล่านั้น<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-KrishnaP25GitHub-3)</sup>

เมตริกนี้ได้รับการยอมรับอย่างแพร่หลายในชุมชนวิจัย ผู้เขียนได้เผยแพร่การนำ MAUVE ไปใช้งานแบบโอเพนซอร์สใน Python (เข้าถึงได้ผ่าน PyPI และผนวกรวมในไลบรารี HuggingFace Evaluate) เพื่อความสะดวกในการใช้งานจริง<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-KrishnaP25GitHub-3)</sup> ในปี 2023 ได้มีการเผยแพร่งานวิจัยที่ขยายความออกไปชื่อ "MAUVE Scores for Generative Models: Theory and Practice" ซึ่งวิเคราะห์คุณสมบัติทางทฤษฎีของเมตริกอย่างละเอียด ตัวแปรต่างๆ ในการคำนวณ และให้คำแนะนำในการประยุกต์ใช้กับข้อความและภาพ<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-IFML-2)</sup> นอกจากนี้ ยังมีการเผยแพร่งานวิจัยเสริมควบคู่กับบทความต้นฉบับ ซึ่งกำหนดขอบเขตทางสถิติและขนาดตัวอย่างที่จำเป็นสำหรับการประเมิน MAUVE ที่เชื่อถือได้<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup> การพัฒนาแนวคิดเหล่านี้ไม่เพียงแต่ช่วยในการปรับปรุงคุณภาพของโมเดลสร้างข้อความ แต่ยังวางรากฐานสำหรับเครื่องมือตรวจจับข้อความที่สร้างโดยเครื่อง: เมื่อช่องว่างระหว่างข้อความที่สร้างโดย AI และมนุษย์แคบลงเรื่อยๆ เมตริกอย่าง MAUVE จะช่วยให้เข้าใจการทำงานของโมเดลได้ดีขึ้นและแยกแยะเนื้อหาของโมเดลจากเนื้อหาของมนุษย์<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_note-AllenSchoolNews-1)</sup>

## ข้อจำกัดและคำแนะนำ

ผู้พัฒนา MAUVE เน้นย้ำว่าในการใช้งานจริงมีความสำคัญที่ต้องปฏิบัติตามเงื่อนไขบางประการเพื่อความถูกต้องของการประเมิน ประการแรก จำเป็นต้องมี **ขนาดตัวอย่างที่เพียงพอ**: สำหรับการประเมินเมตริกที่เสถียรต้องการตัวอย่างหลายพันรายการในแต่ละประเภท (ในการทดลองต้นฉบับใช้ประมาณ ~5,000 ประโยค) เมื่อใช้ตัวอย่างขนาดเล็กกว่านี้มาก MAUVE อาจประเมินคุณภาพสูงเกินไป (เอนเอียงไปในทิศทางแง่ดี) และให้ผลลัพธ์ที่ไม่เสถียรพร้อมความแปรปรวนสูง ประการที่สอง **ควรตีความ MAUVE ในแง่การเปรียบเทียบ** ค่าสัมบูรณ์ของเมตริกขึ้นอยู่กับพารามิเตอร์บางประการในการคำนวณ (เช่น จำนวนกลุ่มในการทำ quantization) ดังนั้นค่า MAUVE โดยตรงของโมเดลเดียวจึงให้ข้อมูลน้อยกว่า แนะนำให้เปรียบเทียบ MAUVE ของโมเดลหลายตัวหรือวิธีการสร้างข้อความหลายวิธีซึ่งกันและกัน (โดยใช้การตั้งค่าเมตริกเดียวกัน) — ในกรณีนั้น ค่าที่สูงกว่าจะบ่งชี้ถึงคุณภาพข้อความที่ใกล้เคียงกับมนุษย์มากกว่าอย่างชัดเจน เมื่อปฏิบัติตามคำแนะนำเหล่านี้ MAUVE จะทำหน้าที่เป็นเครื่องมือที่เชื่อถือได้สำหรับการประเมินและการเปรียบเทียบโมเดลสร้างข้อความอย่างเป็นกลาง

## ลิงก์

- หน้าโครงการ MAUVE

## หมายเหตุ

1.  <span id="cite_note-AllenSchoolNews-1">↑ <sup>[1.00](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-AllenSchoolNews_1-12)</sup> «Allen School News \>\> Allen School and AI2 researchers paint the NeurIPS conference MAUVE and take home an Outstanding Paper Award». *Allen School News*. <a href="https://news.cs.washington.edu/2022/02/28/allen-school-and-ai2-researchers-paint-the-neurips-conference-mauve-and-take-home-an-outstanding-paper-award/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-IFML-2">↑ <sup>[2.0](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-IFML_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-IFML_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-IFML_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-IFML_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-IFML_2-4)</sup> «MAUVE: Statistical Evaluation of LLMs and Generative AI \| Institute for Foundations of Machine Learning». *Institute for Foundations of Machine Learning*. <a href="https://www.ifml.institute/index.php/research/mauve-statistical-evaluation-llms-and-generative-ai" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-KrishnaP25GitHub-3">↑ <sup>[3.0](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-KrishnaP25GitHub_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-KrishnaP25GitHub_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-KrishnaP25GitHub_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-KrishnaP25GitHub_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-KrishnaP25GitHub_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-KrishnaP25GitHub_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/MAUVE_(metric)_(TH)#cite_ref-KrishnaP25GitHub_3-6)</sup> «MAUVE: Measuring the Gap Between Neural Text and Human Text — MAUVE». *MAUVE project page*. <a href="https://krishnap25.github.io/mauve/" class="external autonumber" rel="nofollow">[3]</a></span>
