METEOR (metric) (CS)
METEOR — je název používaný v oblasti zpracování přirozeného jazyka (NLP) pro několik příbuzných, ale odlišných pojmů. Především jde o známou automatickou metriku pro hodnocení kvality strojového překladu. Kromě toho byly v roce 2024 pod stejným názvem představeny dva nezávislé výzkumné projekty související s velkými jazykovými modely (LLM): metoda evolučního učení a multimodální jazykový model.
METEOR jako metrika hodnocení kvality překladu
METEOR (zkr. z Metric for Evaluation of Translation with Explicit ORdering) — je automatická metrika pro hodnocení kvality strojového překladu, navržená v roce 2005 výzkumníky Univerzity Carnegie Mellon Satandzivem Banerdzím a Alonem Lavim[1]. Jejím cílem bylo zvýšit soulad automatických hodnocení s lidskými úsudky, zejména na úrovni jednotlivých vět, a odstranit některé nedostatky starší metriky BLEU.
Klíčové vlastnosti metriky METEOR:
- Zohlednění přesnosti a úplnosti: Na rozdíl od BLEU, která se zaměřuje pouze na přesnost (precision), vypočítává METEOR harmonický průměr přesnosti a úplnosti (recall), což umožňuje penalizovat překlady za vynechání důležitých slov.
- Flexibilní porovnávání slov: METEOR využívá lingvistické vlastnosti pro porovnávání překladu s referenčním textem. Zohledňuje nejen přesné shody, ale i různé tvary slov (pomocí stemmingu) a synonyma (pomocí WordNet).
- Penalizace za porušení pořadí slov: Do metriky je zavedena penalizace, která postihuje nesprávné pořadí slov v překládaném kandidátovi, i když všechna slova odpovídají referenčnímu textu.
Tato vylepšení umožňují metrice METEOR výrazně lépe korelovat s hodnoceními lidí ve srovnání s BLEU[2]. Metrika je široce používána ve výzkumu strojového překladu, automatického sumarizování a hodnocení popisků obrázků[3].
METEOR jako metoda evolučního učení LLM
V roce 2024 skupina čínských výzkumníků představila metodu nazvanou METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Tato metoda je určena pro efektivní trénování LLM specializovaných na úzké předmětové domény (např. finance, medicína), aniž by bylo nutné trénovat model od základu.
Autoři popisují třífázové schéma „evoluce" LLM:
- Destilace znalostí od silného modelu ke slabému (weak-to-strong data distillation): Pro generování trénovacího korpusu se používá výkonnější model-„učitel" (např. GPT-4). Přitom doménový model nejprve vygeneruje plán řešení a silný model vytvoří odpověď podle tohoto plánu. To srovnává rozložení znalostí a umožňuje cílovému modelu je efektivněji vstřebat.
- Iterativní učení s externí zpětnou vazbou (guided iterative training): Model trénovaný v první fázi samostatně řeší úlohy, přičemž silný model vystupuje jako „rozhodčí", hodnotí odpovědi a poukazuje na chyby. Tento reflexivní cyklus rozvíjí u doménového modelu schopnost sebekontroly.
- Samoevoluce (self-evolution): Model se nadále zdokonaluje již bez externího kurátora, přičemž využívá nabyté dovednosti ke generování a opravě nových dat.
Tato metoda nabízí praktický přístup k vytváření kompaktních a úsporných LLM expertů pro konkrétní odvětví[5].
METEOR jako multimodální model LLM
Také v roce 2024 tým výzkumníků z KAIST představil velký multimodální jazykový model pojmenovaný METEOR: Mamba-based Traversal of Rationales[6]. Model je určen pro komplexní porozumění vizuálním informacím a generování odpovědí na vizuální otázky.
Klíčovou vlastností METEOR je využití rozvinutých zdůvodnění (rationales). Model pouze nevydává konečnou odpověď, ale generuje a opírá se o skrytý „řetězec zdůvodnění" — postupné vysvětlení, jak k této odpovědi dospět, podobně jako by uvažoval člověk.
V architektuře METEOR je použit speciální modul založený na modelu Mamba — efektivní architektuře pro zpracování velmi dlouhých sekvencí. Tento modul kóduje dlouhé řetězce zdůvodnění, které mohou zahrnovat popis objektů na obrázku, jejich prostorové vztahy a kroky k řešení úlohy[7].
Model byl úspěšně otestován na náročných multimodálních benchmarcích, jako jsou MME, AI2D (porozumění diagramům) a MathVista (řešení matematických úloh ve vizuálním kontextu). Dosáhl vysokých výsledků, aniž by vyžadoval dodatečné externí moduly počítačového vidění, což svědčí o efektivním využití vlastních parametrů[7].
Poznámky
- ↑ Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
- ↑ Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
- ↑ «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
- ↑ Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
- ↑ 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]