METEOR
METEOR — это название, используемое в области обработки естественного языка (NLP) для нескольких связанных, но различных понятий. Прежде всего, это известная автоматическая метрика для оценки качества машинного перевода. Кроме того, в 2024 году под этим же названием были представлены два независимых исследовательских проекта, связанных с большими языковыми моделями (LLM): метод эволюционного обучения и мультимодальная языковая модель.
METEOR как метрика оценки качества перевода
METEOR (сокр. от Metric for Evaluation of Translation with Explicit ORdering) — это автоматическая метрика для оценки качества машинного перевода, предложенная в 2005 году исследователями Университета Карнеги-Меллон Сатанживом Банерджи и Алоном Лави[1]. Её целью было повысить согласованность автоматических оценок с человеческими суждениями, особенно на уровне отдельных предложений, устранив некоторые недостатки более ранней метрики BLEU.
Ключевые особенности метрики METEOR:
- Учёт точности и полноты: В отличие от BLEU, который ориентирован только на точность (precision), METEOR вычисляет гармоническое среднее между точностью и полнотой (recall), что позволяет наказывать переводы за пропуск важных слов.
- Гибкое сопоставление слов: METEOR использует лингвистические особенности для сопоставления перевода с эталоном. Он учитывает не только точные совпадения, но и разные формы слов (с помощью стемминга) и синонимы (с помощью WordNet).
- Штраф за нарушение порядка слов: В метрику введён штраф, который наказывает за неправильный порядок слов в переводе-кандидате, даже если все слова совпадают с эталоном.
Эти улучшения позволяют метрике METEOR значительно лучше коррелировать с оценками людей по сравнению с BLEU[2]. Метрика широко применяется в исследованиях машинного перевода, автоматического реферирования и оценке подписей к изображениям[3].
METEOR как метод эволюционного обучения LLM
В 2024 году группа китайских исследователей представила метод под названием METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Этот метод предназначен для эффективного обучения LLM, специализирующихся в узких предметных доменах (например, финансы, медицина), без необходимости тренировать модель с нуля.
Авторы описывают трёхфазную схему «эволюции» LLM:
- Перегонка знаний от сильной модели к слабой (weak-to-strong data distillation): Для генерации обучающего корпуса используется более мощная модель-«учитель» (например, GPT-4). При этом доменная модель сначала генерирует план решения, а сильная модель создаёт ответ, следуя этому плану. Это выравнивает распределение знаний и позволяет целевой модели эффективнее их усвоить.
- Итеративное обучение с внешней обратной связью (guided iterative training): Обученная на первом этапе модель самостоятельно решает задачи, а сильная модель выступает в роли «рефери», оценивая ответы и указывая на ошибки. Этот рефлексивный цикл развивает у доменной модели способность к самопроверке.
- Само-эволюция (self-evolution): Модель продолжает улучшаться уже без внешнего куратора, используя накопленные навыки для генерации и коррекции новых данных.
Этот метод предлагает практический подход к созданию компактных и экономичных LLM-экспертов для конкретных отраслей[5].
METEOR как мультимодальная модель LLM
Также в 2024 году команда исследователей из KAIST представила крупную мультимодальную языковую модель под названием METEOR: Mamba-based Traversal of Rationales[6]. Модель предназначена для комплексного понимания визуальной информации и генерации ответов на визуальные вопросы.
Ключевая особенность METEOR — использование развёрнутых рассуждений (rationales). Модель не просто выдаёт финальный ответ, а генерирует и опирается на скрытую «цепочку рассуждений» — последовательное пояснение, как прийти к этому ответу, подобно тому, как рассуждал бы человек.
В архитектуре METEOR задействован специальный модуль на основе модели Mamba — эффективной архитектуры для обработки очень длинных последовательностей. Этот модуль кодирует длинные цепочки рассуждений, которые могут включать описание объектов на изображении, их пространственные отношения и шаги для решения задачи[7].
Модель была успешно испытана на сложных мультимодальных бенчмарках, таких как MME, AI2D (понимание диаграмм) и MathVista (решение математических задач в визуальном контексте). Она показала высокие результаты, не требуя при этом дополнительных внешних модулей компьютерного зрения, что говорит об эффективном использовании собственных параметров[7].
См. также
Примечания
- ↑ Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
- ↑ Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
- ↑ «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
- ↑ Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
- ↑ 7,0 7,1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]