---
title: "MAUVE (metric) (BN)"
source: "https://systems-analysis.info/int/MAUVE_(metric)_(BN)"
wiki: "systems-analysis.info/int"
article: "MAUVE_(metric)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 3989
wiki_created_at: 2026-09-06T23:28:54Z
wiki_modified_at: 2026-09-06T23:28:54Z
downloaded_at: 2026-09-07T23:00:09Z
---

# MAUVE (metric) (BN)

**MAUVE** — এটি একটি স্বয়ংক্রিয় মেট্রিক যা আধুনিক বৃহৎ ভাষা মডেল দ্বারা উৎপন্ন পাঠ্যের মান মূল্যায়নের জন্য ব্যবহৃত হয় <sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>। এই সূচকটি নিউরাল নেটওয়ার্ক দ্বারা তৈরি পাঠ্যের পরিসংখ্যানগত বিতরণ এবং মানব-রচিত পাঠ্যের বিতরণের মধ্যে "ব্যবধান" পরিমাপ করে<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>। **MAUVE** open-ended জেনারেশন কাজের জন্য (যেমন, পাঠ্য অব্যাহতি) প্রযোজ্য, যেখানে একমাত্র সঠিক উত্তর অনুপস্থিত এবং তুলনা পৃথক উদাহরণের পরিবর্তে পাঠ্যের বিতরণের স্তরে সম্পন্ন হয়<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>। পদ্ধতিটি ২০২১ সালে কৃষ্ণ পিল্লুটলা (Krishna Pillutla) নেতৃত্বাধীন গবেষকদের একটি দল দ্বারা প্রস্তাবিত হয়েছিল এবং NeurIPS 2021 সম্মেলনে উপস্থাপিত হয়েছিল, যেখানে এটি নতুনত্ব ও সম্ভাব্য প্রভাবের জন্য **Outstanding Paper Award** পুরস্কার লাভ করে<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-IFML-2)[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>।

## মূল্যায়ন পদ্ধতি

**MAUVE** জেনারেটিভ মডেলের দুই ধরনের ত্রুটির একযোগে মূল্যায়নের জন্য তথ্য তত্ত্ব থেকে **দিভারজেন্স ফ্রন্টিয়ার** (ইংরেজি: divergence frontiers) ধারণা ব্যবহার করে<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>:

- বিশ্বাসযোগ্যতা থেকে বিচ্যুতি ("অর্থহীন" পাঠ্য জেনারেশন)।
- বৈচিত্র্য হ্রাস (অতিরিক্ত ছাঁচযুক্ত পাঠ্য)।

ধারণাটি হলো মডেলের আউটপুট বিতরণের পরিসংখ্যানগত বৈশিষ্ট্যগুলিকে রেফারেন্স (মানব-রচিত) পাঠ্যের বিতরণের সাথে একাধিক মানদণ্ডের বর্ণালী জুড়ে তুলনা করা। মেট্রিকটির বাস্তবায়ন একটি বড় পূর্ব-প্রশিক্ষিত ভাষা মডেলের embedding আকারে পাঠ্য উপস্থাপনা এবং এই বৈশিষ্ট্য স্থানে প্রাপ্ত বিতরণের মধ্যে ভিন্নতা গণনার উপর নির্ভর করে<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-KrishnaP25GitHub-3)</sup>।

নিচে MAUVE গণনার মূল ধাপগুলি দেওয়া হলো:

### নমুনার ভেক্টরাইজেশন

মডেল দ্বারা উৎপন্ন এবং বাস্তব — উভয় পাঠ্যের সেটকে একটি পূর্ব-প্রশিক্ষিত ভাষা মডেল ব্যবহার করে embedding-এ রূপান্তরিত করা হয় (উদাহরণস্বরূপ, GPT-2-এর শেষ লুকানো অবস্থা)<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-KrishnaP25GitHub-3)</sup>। এই উপস্থাপনা পাঠ্যগুলিকে পরবর্তী তুলনার জন্য একক বৈশিষ্ট্য স্থানে স্থানান্তরিত করে।

### বিতরণের বিচ্ছিন্নকরণ

প্রাপ্ত embedding-গুলিকে ক্লাস্টার করা হয় (যেমন, k-means পদ্ধতিতে), যা ক্রমাগত বৈশিষ্ট্য স্থানের quantization-এর দিকে পরিচালিত করে<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-KrishnaP25GitHub-3)</sup>। ফলস্বরূপ, ক্লাস্টার জুড়ে বিচ্ছিন্ন আনুমানিক বিতরণ **P** (মানব-রচিত পাঠ্য) এবং **Q** (মডেলের পাঠ্য) গঠিত হয়।

### দিভারজেন্স ফ্রন্টিয়ার নির্মাণ

প্রথম এবং দ্বিতীয় ধরনের ত্রুটির বিভিন্ন অনুপাতে P এবং Q বিতরণের মধ্যে দিভারজেন্স গণনা করা হয়<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>। কার্যত, এর মানে হলো মডেলের "নির্ভুলতা" এবং "পূর্ণতার" মধ্যে আপোষ চিহ্নিত করে এমন একাধিক থ্রেশহোল্ড মানের জন্য বেশ কয়েকটি তথ্যগত ভিন্নতা (যেমন, কুলব্যাক-লাইবলার দিভারজেন্স) মূল্যায়ন করা। এই ধরনের বিন্দুগুলির সমষ্টি একটি "বিতরণ পার্থক্য" কার্ভ (divergence curve) গঠন করে<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>।

### ইন্টিগ্রেশন এবং ফলাফল

প্রাপ্ত কার্ভটি ইন্টিগ্রেট করা হয়, অর্থাৎ দিভারজেন্স কার্ভের নিচের ক্ষেত্রফল গণনা করা হয়। এই ইন্টিগ্রাল সূচকটিই হলো **MAUVE**-এর মান — একটি স্কেলার যা পরিমাণগতভাবে মডেলের পাঠ্য বিতরণ মানব বিতরণের কতটা কাছাকাছি তা চিহ্নিত করে<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>। চূড়ান্ত **MAUVE score** ০ থেকে ১ পরিসরে স্বাভাবিকীকৃত, যেখানে ১-এর কাছাকাছি মান ন্যূনতম ভিন্নতার (মডেলের পাঠ্য পরিসংখ্যানগতভাবে মানব পাঠ্যের কাছাকাছি) সাথে সামঞ্জস্যপূর্ণ<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-KrishnaP25GitHub-3)</sup>।

## পরীক্ষামূলক ফলাফল এবং বৈশিষ্ট্য

লেখকরা বেশ কিছু open-ended পাঠ্য জেনারেশন কাজে (ওয়েব পাঠ্য, সংবাদ নিবন্ধ, গল্পের অব্যাহতি) MAUVE পরীক্ষা করেছেন<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>। মেট্রিকটি জেনারেশন মানের পরিচিত নিয়মিততা সনাক্ত করার ক্ষমতা দেখিয়েছে। বিশেষত, ভাষা মডেলের আকার বৃদ্ধির সাথে সাথে MAUVE-এর মান বৃদ্ধি পায়, যা বড় মডেলে পাঠ্যের সংযোগ এবং বিশ্বাসযোগ্যতা উন্নতি প্রতিফলিত করে<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-IFML-2)</sup>। বিপরীতভাবে, উৎপন্ন অংশের দৈর্ঘ্য বৃদ্ধির সাথে সাথে MAUVE হ্রাস পায়, অর্থাৎ দীর্ঘ অব্যাহতির মান সাধারণত সংক্ষিপ্তগুলির চেয়ে খারাপ (মডেল পুনরাবৃত্তি শুরু করে বা প্রসঙ্গ থেকে সরে যায়)<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-IFML-2)</sup>। এছাড়াও MAUVE পাঠ্য জেনারেশন অ্যালগরিদম নির্বাচনের প্রভাব পার্থক্য করতে পারে: উদাহরণস্বরূপ, স্যাম্পলিং কৌশল পরিবর্তন (তাপমাত্রা, top-k/nucleus sampling ইত্যাদি) আউটপুট বিতরণকে প্রভাবিত করে এবং মেট্রিকের মানে প্রতিফলিত হয়<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>।

MAUVE-এর একটি গুরুত্বপূর্ণ বৈশিষ্ট্য হলো মানব মূল্যায়নের সাথে উচ্চ সামঞ্জস্য। গবেষণায় দেখা গেছে যে MAUVE-এর মান **বিষয়গত মান মূল্যায়নের সাথে দৃঢ়ভাবে সম্পর্কযুক্ত**, open-ended পাঠ্য জেনারেশনের জন্য ব্যবহৃত ভিত্তি মেট্রিকের তুলনায় এই সম্পর্কে শ্রেষ্ঠত্ব প্রদর্শন করে<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-KrishnaP25GitHub-3)</sup>। অন্য কথায়, উচ্চতর MAUVE সহ মডেলগুলি সাধারণত মানুষের কাছে আরও অর্থপূর্ণ এবং "মানব-সদৃশ" পাঠ্য তৈরি করে বলে বিবেচিত হয়। একই সাথে MAUVE পূর্বে প্রস্তাবিত বিতরণ মূল্যায়ন মেট্রিকের তুলনায় কম সীমাবদ্ধতা আরোপ করে: পদ্ধতিটি বড় মডেল এবং দীর্ঘ পাঠ্যে স্কেল করে, একযোগে বেশ কয়েকটি পার্থক্যের দিক বিবেচনা করে, যেখানে অনেক আদর্শ সূচক কেবল একটি পরিসংখ্যানগত দিক (দিভারজেন্স কার্ভের একটি বিন্দু) নির্ধারণ করে<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>। এই সমন্বিত পদ্ধতি জেনারেটিভ মডেলের কার্যক্ষমতা সম্পর্কে আরও সম্পূর্ণ রায় দিতে সহায়তা করে।

## প্রয়োগ এবং আরও গবেষণা

যদিও MAUVE মূলত পাঠ্য মডেলের জন্য তৈরি করা হয়েছিল, এর পদ্ধতি সর্বজনীন। পদ্ধতিটি সফলভাবে অন্যান্য ধরনের উৎপন্ন ডেটায়ও প্রয়োগ করা হয়েছে। উদাহরণস্বরূপ, ছবি জেনারেশনের জন্য (GAN, ডিফিউশন মডেল) MAUVE মেট্রিক একইভাবে বাস্তব এবং সিন্থেটিক ছবির বিতরণের মধ্যে বৈশিষ্ট্যগত পার্থক্য চিহ্নিত করে, বিদ্যমান সেরা মেট্রিকের স্তরে বা তার চেয়ে বেশি নির্ভুলতা অর্জন করে<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-IFML-2)</sup>। সম্ভাব্যভাবে MAUVE অন্যান্য মডালিটিতেও (অডিও, সংগীত, ভিডিও) অভিযোজিত হতে পারে, যদি সেগুলির জন্য অর্থগতভাবে অর্থবহ বৈশিষ্ট্য embedding উপলব্ধ থাকে<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-KrishnaP25GitHub-3)</sup>।

মেট্রিকটি গবেষণা সম্প্রদায়ে ব্যাপক প্রচার পেয়েছে। লেখকরা Python-এ MAUVE-এর একটি উন্মুক্ত বাস্তবায়ন প্রকাশ করেছেন (PyPI-এর মাধ্যমে উপলব্ধ এবং HuggingFace Evaluate লাইব্রেরিতে একীভূত) ব্যবহারিক ব্যবহারের সুবিধার জন্য<sup>[\[3\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-KrishnaP25GitHub-3)</sup>। ২০২৩ সালে "MAUVE Scores for Generative Models: Theory and Practice" শিরোনামে একটি বর্ধিত কাজ প্রকাশিত হয়েছিল, যেখানে মেট্রিকের তাত্ত্বিক বৈশিষ্ট্য, এর গণনার বিভিন্ন বিকল্প এবং পাঠ্য ও ছবিতে প্রয়োগের জন্য সুপারিশ বিস্তারিতভাবে আলোচনা করা হয়েছে<sup>[\[2\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-IFML-2)</sup>। এছাড়াও মূল নিবন্ধের সমান্তরালে একটি সহায়ক কাজ প্রকাশিত হয়েছিল যা MAUVE-এর নির্ভরযোগ্য মূল্যায়নের জন্য পরিসংখ্যানগত সীমা এবং প্রয়োজনীয় নমুনার আকার নির্ধারণ করে<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>। এই ধারণাগুলির বিকাশ কেবল জেনারেটিভ মডেলের মান উন্নয়নে সহায়তা করে না, বরং মেশিন-উৎপন্ন পাঠ্য সনাক্তকরণের সরঞ্জামগুলির ভিত্তিও স্থাপন করে: AI এবং মানব-রচিত পাঠ্যের মধ্যে ব্যবধান হ্রাস পাওয়ার সাথে সাথে MAUVE-এর মতো মেট্রিকগুলি মডেলের কাজ আরও ভালোভাবে বুঝতে এবং তাদের বিষয়বস্তু মানব-রচিত থেকে আলাদা করতে সহায়তা করবে<sup>[\[1\]](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_note-AllenSchoolNews-1)</sup>।

## সীমাবদ্ধতা এবং সুপারিশ

MAUVE-এর ডেভেলপাররা জোর দেন যে ব্যবহারিক প্রয়োগে মূল্যায়নের সঠিকতার জন্য নির্দিষ্ট শর্ত পালন করা গুরুত্বপূর্ণ। প্রথমত, **পর্যাপ্ত নমুনার আকার** প্রয়োজন: মেট্রিকের স্থিতিশীল মূল্যায়নের জন্য প্রতিটি ধরনের কয়েক হাজার উদাহরণ প্রয়োজন (মূল পরীক্ষায় প্রায় ~৫০০০ বাক্য ব্যবহার করা হয়েছিল)। উল্লেখযোগ্যভাবে ছোট নমুনায় MAUVE মান অতিরিক্ত মূল্যায়ন করতে পারে (আশাবাদের দিকে পক্ষপাত) এবং উচ্চ বিচ্ছুরণ সহ অস্থির ফলাফল দিতে পারে। দ্বিতীয়ত, **MAUVE তুলনামূলক দৃষ্টিকোণ থেকে ব্যাখ্যা করা বাঞ্ছনীয়**। মেট্রিকের পরম মান কিছু গণনা হাইপারপ্যারামিটারের উপর নির্ভর করে (উদাহরণস্বরূপ, quantization-এর সময় ক্লাস্টারের সংখ্যা), তাই একটি মডেলের জন্য MAUVE-এর সরাসরি মান কম তথ্যপ্রদ। একই মেট্রিক সেটিং সহ বেশ কয়েকটি মডেল বা জেনারেশন পদ্ধতির MAUVE তুলনা করার পরামর্শ দেওয়া হয় — তখন উচ্চতর মান স্পষ্টতই মানব পাঠ্যের মানের কাছাকাছি ইঙ্গিত দেয়। এই সুপারিশগুলি অনুসরণ করে, MAUVE জেনারেটিভ মডেলের উদ্দেশ্যমূলক মূল্যায়ন এবং তুলনার জন্য একটি নির্ভরযোগ্য সরঞ্জাম হিসেবে কাজ করে।

## সূত্র

- MAUVE প্রকল্প পৃষ্ঠা

## টীকা

1.  <span id="cite_note-AllenSchoolNews-1">↑ <sup>[1.00](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-AllenSchoolNews_1-12)</sup> «Allen School News \>\> Allen School and AI2 researchers paint the NeurIPS conference MAUVE and take home an Outstanding Paper Award». *Allen School News*. <a href="https://news.cs.washington.edu/2022/02/28/allen-school-and-ai2-researchers-paint-the-neurips-conference-mauve-and-take-home-an-outstanding-paper-award/" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-IFML-2">↑ <sup>[2.0](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-IFML_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-IFML_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-IFML_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-IFML_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-IFML_2-4)</sup> «MAUVE: Statistical Evaluation of LLMs and Generative AI \| Institute for Foundations of Machine Learning». *Institute for Foundations of Machine Learning*. <a href="https://www.ifml.institute/index.php/research/mauve-statistical-evaluation-llms-and-generative-ai" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-KrishnaP25GitHub-3">↑ <sup>[3.0](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-KrishnaP25GitHub_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-KrishnaP25GitHub_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-KrishnaP25GitHub_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-KrishnaP25GitHub_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-KrishnaP25GitHub_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-KrishnaP25GitHub_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/MAUVE_(metric)_(BN)#cite_ref-KrishnaP25GitHub_3-6)</sup> «MAUVE: Measuring the Gap Between Neural Text and Human Text — MAUVE». *MAUVE project page*. <a href="https://krishnap25.github.io/mauve/" class="external autonumber" rel="nofollow">[৩]</a></span>
