MAUVE (metric) (BG)
MAUVE — това е автоматична метрика за оценка на качеството на текст, генериран от съвременни големи езикови модели [1]. Този показател измерва „разривът" между статистическото разпределение на текстовете, създавани от невронната мрежа, и разпределението на човешкия текст[1]. MAUVE е предназначен за задачи от тип open-ended генерация (например продължение на текст), при които липсва единствен правилен отговор, а сравнението се осъществява на ниво разпределения на текстове, а не на отделни примери[1]. Методът е предложен през 2021 година от група изследователи начело с Кришна Пилутла (Krishna Pillutla) и е представен на конференцията NeurIPS 2021, където получи наградата Outstanding Paper Award за новаторство и потенциално въздействие[2][1].
Методика на оценяване
MAUVE използва концепцията за дивергентни фронтове (англ. divergence frontiers) от теорията на информацията за едновременна оценка на два вида грешки на генеративния модел[1]:
- Отклонение от достоверността (генериране на „безсмислен" текст).
- Намаляване на разнообразието (прекалено шаблонен текст).
Идеята се състои в сравняване на статистическите свойства на разпределението на изходите на модела с разпределението на референтните (човешките) текстове по цял спектър от критерии. Реализацията на метриката се основава на представяне на текстовете под формата на embedding-и на голям предобучен езиков модел и изчисляване на разминаванията между получените разпределения в това признаково пространство[3].
По-долу са представени основните етапи на изчисляване на MAUVE:
Векторизация на извадките
Двете множества от текстове — генерираните от модела и реалните — се преобразуват в embedding-и с помощта на предобучен езиков модел (например последното скрито състояние на GPT-2)[3]. Това представяне превежда текстовете в единно признаково пространство за последващо сравнение.
Дискретизация на разпределенията
Получените embedding-и се клъстеризират (например чрез метода k-means), което води до квантуване на непрекъснатото признаково пространство[3]. В резултат се формират дискретни приближени разпределения P (човешки текст) и Q (текст на модела) по клъстери.
Изграждане на дивергентния фронт
Изчисляват се дивергенциите между разпределенията P и Q при различни съотношения на грешки от първи и втори род[1]. Фактически това означава оценяване на няколко информационни разминавания (например дивергенции на Кулбак-Лайблер) за множество прагови стойности, характеризиращи компромиса между „точността" и „пълнотата" на модела. Наборът от такива точки образува крива на „различието на разпределенията" (divergence curve)[1].
Интегриране и резултат
Получената крива се интегрира, тоест се изчислява лице под кривата на дивергенциите. Този интегрален показател е стойността на MAUVE — скалар, количествено характеризиращ степента на близост между разпределението на текста на модела и на човешкия текст[1]. Крайният MAUVE score е нормиран в диапазон от 0 до 1, като стойности по-близки до 1 съответстват на минимално разминаване (текстът на модела е статистически близък до човешкия)[3].
Експериментални резултати и свойства
Авторите проверили MAUVE върху редица отворени задачи за генерация на текст (продължение на уеб текст, новинарски статии, разкази)[1]. Метриката показа способност да разкрива известни закономерности в качеството на генерацията. По-специално, с увеличаването на размера на езиковия модел стойността на MAUVE нараства, което отразява подобряването на свързаността и достоверността на текста при по-големите модели[2]. Обратно, при увеличаване на дължината на генерирания фрагмент се наблюдава намаляване на MAUVE, тоест качеството на дългите продължения обикновено е по-лошо от това на късите (моделът започва да се повтаря или се отклонява от контекста)[2]. Също така MAUVE разграничава ефектите от избора на алгоритъм за генериране на текст: например промяната на стратегията за семплиране (температура, top-k/nucleus sampling и др.) влияе върху разпределението на изходите и се отразява в стойността на метриката[1].
Важна характеристика на MAUVE е високата му съгласуваност с човешката оценка. В изследванията е показано, че стойностите на MAUVE силно корелират със субективните оценки за качество, надминавайки по тази корелация базовите метрики, използвани за отворена генерация на текст[3]. С други думи, моделите с по-висок MAUVE, като правило, се възприемат от хората като генериращи по-смислен и „подобен на човешкия" текст. При това MAUVE налага по-малко ограничения в сравнение с предложените по-рано разпределителни метрики за оценка: методът се мащабира до големи модели и дълги текстове, отчита едновременно няколко аспекта на различията, докато много стандартни показатели фиксират само един статистически аспект (една точка на дивергентната крива)[1]. Такъв комплексен подход позволява по-пълно да се съди за качеството на работата на генеративния модел.
Приложение и по-нататъшни изследвания
Макар MAUVE да е разработен първоначално за текстови модели, неговият подход е универсален. Методът е приложен успешно и към други типове генерирани данни. Например при генерацията на изображения (GAN-ове, дифузионни модели) метриката MAUVE по аналогичен начин разкрива характерните разлики между разпределенията на реалните и синтетичните изображения, достигайки точност на ниво на най-добрите съществуващи метрики или надминавайки ги[2]. Потенциално MAUVE може да бъде адаптиран и към други модалности (аудио, музика, видео) при условие, че за тях са налице семантично смислени embedding-и на признаци[3].
Метриката получи широко разпространение в изследователската общност. Авторите са публикували отворена реализация на MAUVE на Python (достъпна чрез PyPI и интегрирана в библиотеката HuggingFace Evaluate) за удобство при практическото използване[3]. През 2023 година излезе разширена работа „MAUVE Scores for Generative Models: Theory and Practice", в която подробно са разгледани теоретичните свойства на метриката, различните варианти за нейното изчисляване и са дадени препоръки за приложението ѝ върху текст и изображения[2]. Успоредно с оригиналната статия е публикувана и спомагателна работа, установяваща статистическите граници и необходимия размер на извадката за надеждна оценка с MAUVE[1]. Развитието на тези идеи не само спомага за подобряване на качеството на генеративните модели, но и поставя основите за инструменти за разпознаване на машинен текст: с намаляването на разрива между текстовете, създавани от ИИ и от човека, метрики като MAUVE ще помогнат за по-доброто разбиране на работата на моделите и за разграничаване на тяхното съдържание от човешкото[1].
Ограничения и препоръки
Разработчиците на MAUVE подчертават, че при практическото използване е важно да се спазват определени условия за коректност на оценката. На първо място е необходим достатъчен обем на извадката: за устойчива оценка на метриката са необходими около няколко хиляди примера от всеки тип (в оригиналните експерименти са използвани по ~5000 изречения). При значително по-малки извадки MAUVE може да завишава качеството (изместване към оптимизъм) и да дава нестабилни резултати с висока дисперсия. На второ място, MAUVE се препоръчва да се интерпретира в сравнителен план. Абсолютната стойност на метриката зависи от някои хиперпараметри на изчислението (например броя на клъстерите при квантуването), поради което прякото значение на MAUVE за един модел е по-малко информативно. Препоръчва се сравняване на MAUVE на няколко модела или методи на генерация помежду им (при еднакви настройки на метриката) — тогава по-високата стойност еднозначно указва на по-близко до човешкото качество на текста. Следвайки тези препоръки, MAUVE служи като надежден инструмент за обективна оценка и сравнение на генеративни модели.
Препратки
- Проектна страница на MAUVE
Бележки
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 «Allen School News >> Allen School and AI2 researchers paint the NeurIPS conference MAUVE and take home an Outstanding Paper Award». Allen School News. [1]
- ↑ 2.0 2.1 2.2 2.3 2.4 «MAUVE: Statistical Evaluation of LLMs and Generative AI | Institute for Foundations of Machine Learning». Institute for Foundations of Machine Learning. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 «MAUVE: Measuring the Gap Between Neural Text and Human Text — MAUVE». MAUVE project page. [3]