METEOR (metric) (BG)
METEOR — това е название, използвано в областта на обработката на естествен език (NLP) за няколко свързани, но различни понятия. На първо място, това е известна автоматична метрика за оценка на качеството на машинния превод. Освен това, през 2024 година под същото название бяха представени два независими изследователски проекта, свързани с големи езикови модели (LLM): метод на еволюционно обучение и мултимодален езиков модел.
METEOR като метрика за оценка на качеството на превода
METEOR (съкр. от Metric for Evaluation of Translation with Explicit ORdering) — това е автоматична метрика за оценка на качеството на машинния превод, предложена през 2005 година от изследователите на Университета Карнеги Мелън Сатанджив Банерджи и Алон Лави[1]. Нейната цел беше да повиши съгласуваността на автоматичните оценки с човешките преценки, особено на ниво отделни изречения, като отстрани някои недостатъци на по-ранната метрика BLEU.
Ключови особености на метриката METEOR:
- Отчитане на точност и пълнота: За разлика от BLEU, който е ориентиран само към точност (precision), METEOR изчислява хармонично средно между точността и пълнотата (recall), което позволява да се наказват преводите за пропускане на важни думи.
- Гъвкаво съпоставяне на думи: METEOR използва лингвистични особености за съпоставяне на превода с еталона. Той отчита не само точни съвпадения, но и различни форми на думите (чрез stemming) и синоними (чрез WordNet).
- Наказание за нарушаване на реда на думите: В метриката е въведено наказание, което санкционира неправилния ред на думите в превода-кандидат, дори ако всички думи съвпадат с еталона.
Тези подобрения позволяват на метриката METEOR значително по-добре да корелира с оценките на хората в сравнение с BLEU[2]. Метриката се прилага широко в изследванията на машинния превод, автоматичното резюмиране и оценката на надписи към изображения[3].
METEOR като метод за еволюционно обучение на LLM
През 2024 година група китайски изследователи представи метод под названието METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Този метод е предназначен за ефективно обучение на LLM, специализирани в тесни предметни домейни (например финанси, медицина), без необходимост от обучение на модела от нулата.
Авторите описват трифазна схема на „еволюция" на LLM:
- Дестилация на знания от силен модел към слаб (weak-to-strong data distillation): За генериране на обучаващ корпус се използва по-мощен модел-„учител" (например GPT-4). При това домейновият модел първо генерира план за решение, а силният модел създава отговор, следвайки този план. Това изравнява разпределението на знанията и позволява на целевия модел да ги усвои по-ефективно.
- Итеративно обучение с външна обратна връзка (guided iterative training): Обученият на първия етап модел самостоятелно решава задачи, а силният модел изпълнява ролята на „рефер", оценявайки отговорите и посочвайки грешките. Този рефлексивен цикъл развива у домейновия модел способност за самопроверка.
- Само-еволюция (self-evolution): Моделът продължава да се подобрява вече без външен куратор, използвайки натрупаните умения за генериране и коригиране на нови данни.
Този метод предлага практически подход към създаването на компактни и икономични LLM-експерти за конкретни отрасли[5].
METEOR като мултимодален модел LLM
Също през 2024 година екип от изследователи на KAIST представи голям мултимодален езиков модел под названието METEOR: Mamba-based Traversal of Rationales[6]. Моделът е предназначен за комплексно разбиране на визуална информация и генериране на отговори на визуални въпроси.
Ключова особеност на METEOR е използването на разгърнати разсъждения (rationales). Моделът не просто издава финален отговор, а генерира и се опира на скрита „верига от разсъждения" — последователно обяснение как да се стигне до този отговор, подобно на начина, по който би разсъждавал човек.
В архитектурата на METEOR е задействан специален модул на основата на модела Mamba — ефективна архитектура за обработка на много дълги последователности. Този модул кодира дълги вериги от разсъждения, които могат да включват описание на обекти върху изображението, техните пространствени отношения и стъпки за решаване на задачата[7].
Моделът беше успешно изпитан на сложни мултимодални benchmark-ове, като MME, AI2D (разбиране на диаграми) и MathVista (решаване на математически задачи във визуален контекст). Той показа високи резултати, без да изисква допълнителни външни модули за компютърно зрение, което говори за ефективното използване на собствените му параметри[7].
Бележки
- ↑ Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
- ↑ Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
- ↑ «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
- ↑ Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
- ↑ 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]