METEOR

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

METEOR — это название, используемое в области обработки естественного языка (NLP) для нескольких связанных, но различных понятий. Прежде всего, это известная автоматическая метрика для оценки качества машинного перевода. Кроме того, в 2024 году под этим же названием были представлены два независимых исследовательских проекта, связанных с большими языковыми моделями (LLM): метод эволюционного обучения и мультимодальная языковая модель.

METEOR как метрика оценки качества перевода

METEOR (сокр. от Metric for Evaluation of Translation with Explicit ORdering) — это автоматическая метрика для оценки качества машинного перевода, предложенная в 2005 году исследователями Университета Карнеги-Меллон Сатанживом Банерджи и Алоном Лави[1]. Её целью было повысить согласованность автоматических оценок с человеческими суждениями, особенно на уровне отдельных предложений, устранив некоторые недостатки более ранней метрики BLEU.

Ключевые особенности метрики METEOR:

  • Учёт точности и полноты: В отличие от BLEU, который ориентирован только на точность (precision), METEOR вычисляет гармоническое среднее между точностью и полнотой (recall), что позволяет наказывать переводы за пропуск важных слов.
  • Гибкое сопоставление слов: METEOR использует лингвистические особенности для сопоставления перевода с эталоном. Он учитывает не только точные совпадения, но и разные формы слов (с помощью стемминга) и синонимы (с помощью WordNet).
  • Штраф за нарушение порядка слов: В метрику введён штраф, который наказывает за неправильный порядок слов в переводе-кандидате, даже если все слова совпадают с эталоном.

Эти улучшения позволяют метрике METEOR значительно лучше коррелировать с оценками людей по сравнению с BLEU[2]. Метрика широко применяется в исследованиях машинного перевода, автоматического реферирования и оценке подписей к изображениям[3].

METEOR как метод эволюционного обучения LLM

В 2024 году группа китайских исследователей представила метод под названием METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Этот метод предназначен для эффективного обучения LLM, специализирующихся в узких предметных доменах (например, финансы, медицина), без необходимости тренировать модель с нуля.

Авторы описывают трёхфазную схему «эволюции» LLM:

  1. Перегонка знаний от сильной модели к слабой (weak-to-strong data distillation): Для генерации обучающего корпуса используется более мощная модель-«учитель» (например, GPT-4). При этом доменная модель сначала генерирует план решения, а сильная модель создаёт ответ, следуя этому плану. Это выравнивает распределение знаний и позволяет целевой модели эффективнее их усвоить.
  2. Итеративное обучение с внешней обратной связью (guided iterative training): Обученная на первом этапе модель самостоятельно решает задачи, а сильная модель выступает в роли «рефери», оценивая ответы и указывая на ошибки. Этот рефлексивный цикл развивает у доменной модели способность к самопроверке.
  3. Само-эволюция (self-evolution): Модель продолжает улучшаться уже без внешнего куратора, используя накопленные навыки для генерации и коррекции новых данных.

Этот метод предлагает практический подход к созданию компактных и экономичных LLM-экспертов для конкретных отраслей[5].

METEOR как мультимодальная модель LLM

Также в 2024 году команда исследователей из KAIST представила крупную мультимодальную языковую модель под названием METEOR: Mamba-based Traversal of Rationales[6]. Модель предназначена для комплексного понимания визуальной информации и генерации ответов на визуальные вопросы.

Ключевая особенность METEOR — использование развёрнутых рассуждений (rationales). Модель не просто выдаёт финальный ответ, а генерирует и опирается на скрытую «цепочку рассуждений» — последовательное пояснение, как прийти к этому ответу, подобно тому, как рассуждал бы человек.

В архитектуре METEOR задействован специальный модуль на основе модели Mamba — эффективной архитектуры для обработки очень длинных последовательностей. Этот модуль кодирует длинные цепочки рассуждений, которые могут включать описание объектов на изображении, их пространственные отношения и шаги для решения задачи[7].

Модель была успешно испытана на сложных мультимодальных бенчмарках, таких как MME, AI2D (понимание диаграмм) и MathVista (решение математических задач в визуальном контексте). Она показала высокие результаты, не требуя при этом дополнительных внешних модулей компьютерного зрения, что говорит об эффективном использовании собственных параметров[7].

См. также

Примечания

  1. Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
  2. Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
  3. «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
  4. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
  5. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
  6. Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
  7. 7,0 7,1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]