METEOR (metric) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

METEOR — това е название, използвано в областта на обработката на естествен език (NLP) за няколко свързани, но различни понятия. На първо място, това е известна автоматична метрика за оценка на качеството на машинния превод. Освен това, през 2024 година под същото название бяха представени два независими изследователски проекта, свързани с големи езикови модели (LLM): метод на еволюционно обучение и мултимодален езиков модел.

METEOR като метрика за оценка на качеството на превода

METEOR (съкр. от Metric for Evaluation of Translation with Explicit ORdering) — това е автоматична метрика за оценка на качеството на машинния превод, предложена през 2005 година от изследователите на Университета Карнеги Мелън Сатанджив Банерджи и Алон Лави[1]. Нейната цел беше да повиши съгласуваността на автоматичните оценки с човешките преценки, особено на ниво отделни изречения, като отстрани някои недостатъци на по-ранната метрика BLEU.

Ключови особености на метриката METEOR:

  • Отчитане на точност и пълнота: За разлика от BLEU, който е ориентиран само към точност (precision), METEOR изчислява хармонично средно между точността и пълнотата (recall), което позволява да се наказват преводите за пропускане на важни думи.
  • Гъвкаво съпоставяне на думи: METEOR използва лингвистични особености за съпоставяне на превода с еталона. Той отчита не само точни съвпадения, но и различни форми на думите (чрез stemming) и синоними (чрез WordNet).
  • Наказание за нарушаване на реда на думите: В метриката е въведено наказание, което санкционира неправилния ред на думите в превода-кандидат, дори ако всички думи съвпадат с еталона.

Тези подобрения позволяват на метриката METEOR значително по-добре да корелира с оценките на хората в сравнение с BLEU[2]. Метриката се прилага широко в изследванията на машинния превод, автоматичното резюмиране и оценката на надписи към изображения[3].

METEOR като метод за еволюционно обучение на LLM

През 2024 година група китайски изследователи представи метод под названието METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Този метод е предназначен за ефективно обучение на LLM, специализирани в тесни предметни домейни (например финанси, медицина), без необходимост от обучение на модела от нулата.

Авторите описват трифазна схема на „еволюция" на LLM:

  1. Дестилация на знания от силен модел към слаб (weak-to-strong data distillation): За генериране на обучаващ корпус се използва по-мощен модел-„учител" (например GPT-4). При това домейновият модел първо генерира план за решение, а силният модел създава отговор, следвайки този план. Това изравнява разпределението на знанията и позволява на целевия модел да ги усвои по-ефективно.
  2. Итеративно обучение с външна обратна връзка (guided iterative training): Обученият на първия етап модел самостоятелно решава задачи, а силният модел изпълнява ролята на „рефер", оценявайки отговорите и посочвайки грешките. Този рефлексивен цикъл развива у домейновия модел способност за самопроверка.
  3. Само-еволюция (self-evolution): Моделът продължава да се подобрява вече без външен куратор, използвайки натрупаните умения за генериране и коригиране на нови данни.

Този метод предлага практически подход към създаването на компактни и икономични LLM-експерти за конкретни отрасли[5].

METEOR като мултимодален модел LLM

Също през 2024 година екип от изследователи на KAIST представи голям мултимодален езиков модел под названието METEOR: Mamba-based Traversal of Rationales[6]. Моделът е предназначен за комплексно разбиране на визуална информация и генериране на отговори на визуални въпроси.

Ключова особеност на METEOR е използването на разгърнати разсъждения (rationales). Моделът не просто издава финален отговор, а генерира и се опира на скрита „верига от разсъждения" — последователно обяснение как да се стигне до този отговор, подобно на начина, по който би разсъждавал човек.

В архитектурата на METEOR е задействан специален модул на основата на модела Mamba — ефективна архитектура за обработка на много дълги последователности. Този модул кодира дълги вериги от разсъждения, които могат да включват описание на обекти върху изображението, техните пространствени отношения и стъпки за решаване на задачата[7].

Моделът беше успешно изпитан на сложни мултимодални benchmark-ове, като MME, AI2D (разбиране на диаграми) и MathVista (решаване на математически задачи във визуален контекст). Той показа високи резултати, без да изисква допълнителни външни модули за компютърно зрение, което говори за ефективното използване на собствените му параметри[7].

Бележки

  1. Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
  2. Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
  3. «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
  4. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
  5. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
  6. Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
  7. 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]