METEOR (metric) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

METEOR — je název používaný v oblasti zpracování přirozeného jazyka (NLP) pro několik příbuzných, ale odlišných pojmů. Především jde o známou automatickou metriku pro hodnocení kvality strojového překladu. Kromě toho byly v roce 2024 pod stejným názvem představeny dva nezávislé výzkumné projekty související s velkými jazykovými modely (LLM): metoda evolučního učení a multimodální jazykový model.

METEOR jako metrika hodnocení kvality překladu

METEOR (zkr. z Metric for Evaluation of Translation with Explicit ORdering) — je automatická metrika pro hodnocení kvality strojového překladu, navržená v roce 2005 výzkumníky Univerzity Carnegie Mellon Satandzivem Banerdzím a Alonem Lavim[1]. Jejím cílem bylo zvýšit soulad automatických hodnocení s lidskými úsudky, zejména na úrovni jednotlivých vět, a odstranit některé nedostatky starší metriky BLEU.

Klíčové vlastnosti metriky METEOR:

  • Zohlednění přesnosti a úplnosti: Na rozdíl od BLEU, která se zaměřuje pouze na přesnost (precision), vypočítává METEOR harmonický průměr přesnosti a úplnosti (recall), což umožňuje penalizovat překlady za vynechání důležitých slov.
  • Flexibilní porovnávání slov: METEOR využívá lingvistické vlastnosti pro porovnávání překladu s referenčním textem. Zohledňuje nejen přesné shody, ale i různé tvary slov (pomocí stemmingu) a synonyma (pomocí WordNet).
  • Penalizace za porušení pořadí slov: Do metriky je zavedena penalizace, která postihuje nesprávné pořadí slov v překládaném kandidátovi, i když všechna slova odpovídají referenčnímu textu.

Tato vylepšení umožňují metrice METEOR výrazně lépe korelovat s hodnoceními lidí ve srovnání s BLEU[2]. Metrika je široce používána ve výzkumu strojového překladu, automatického sumarizování a hodnocení popisků obrázků[3].

METEOR jako metoda evolučního učení LLM

V roce 2024 skupina čínských výzkumníků představila metodu nazvanou METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Tato metoda je určena pro efektivní trénování LLM specializovaných na úzké předmětové domény (např. finance, medicína), aniž by bylo nutné trénovat model od základu.

Autoři popisují třífázové schéma „evoluce" LLM:

  1. Destilace znalostí od silného modelu ke slabému (weak-to-strong data distillation): Pro generování trénovacího korpusu se používá výkonnější model-„učitel" (např. GPT-4). Přitom doménový model nejprve vygeneruje plán řešení a silný model vytvoří odpověď podle tohoto plánu. To srovnává rozložení znalostí a umožňuje cílovému modelu je efektivněji vstřebat.
  2. Iterativní učení s externí zpětnou vazbou (guided iterative training): Model trénovaný v první fázi samostatně řeší úlohy, přičemž silný model vystupuje jako „rozhodčí", hodnotí odpovědi a poukazuje na chyby. Tento reflexivní cyklus rozvíjí u doménového modelu schopnost sebekontroly.
  3. Samoevoluce (self-evolution): Model se nadále zdokonaluje již bez externího kurátora, přičemž využívá nabyté dovednosti ke generování a opravě nových dat.

Tato metoda nabízí praktický přístup k vytváření kompaktních a úsporných LLM expertů pro konkrétní odvětví[5].

METEOR jako multimodální model LLM

Také v roce 2024 tým výzkumníků z KAIST představil velký multimodální jazykový model pojmenovaný METEOR: Mamba-based Traversal of Rationales[6]. Model je určen pro komplexní porozumění vizuálním informacím a generování odpovědí na vizuální otázky.

Klíčovou vlastností METEOR je využití rozvinutých zdůvodnění (rationales). Model pouze nevydává konečnou odpověď, ale generuje a opírá se o skrytý „řetězec zdůvodnění" — postupné vysvětlení, jak k této odpovědi dospět, podobně jako by uvažoval člověk.

V architektuře METEOR je použit speciální modul založený na modelu Mamba — efektivní architektuře pro zpracování velmi dlouhých sekvencí. Tento modul kóduje dlouhé řetězce zdůvodnění, které mohou zahrnovat popis objektů na obrázku, jejich prostorové vztahy a kroky k řešení úlohy[7].

Model byl úspěšně otestován na náročných multimodálních benchmarcích, jako jsou MME, AI2D (porozumění diagramům) a MathVista (řešení matematických úloh ve vizuálním kontextu). Dosáhl vysokých výsledků, aniž by vyžadoval dodatečné externí moduly počítačového vidění, což svědčí o efektivním využití vlastních parametrů[7].

Poznámky

  1. Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
  2. Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
  3. «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
  4. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
  5. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
  6. Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
  7. 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]