METEOR (metric) (HU)
METEOR — ez az elnevezés a természetes nyelvfeldolgozás (NLP) területén több egymással összefüggő, de különböző fogalomra is vonatkozik. Mindenekelőtt ez egy jól ismert automatikus metrika a gépi fordítás minőségének értékelésére. Emellett 2024-ben ugyanezen a néven két egymástól független kutatási projekt is megjelent, amelyek a nagy nyelvi modellekhez (LLM) kapcsolódnak: egy evolúciós tanítási módszer és egy multimodális nyelvi modell.
METEOR mint fordításminőség-értékelési metrika
METEOR (röv. Metric for Evaluation of Translation with Explicit ORdering) — egy automatikus metrika a gépi fordítás minőségének értékelésére, amelyet 2005-ben a Carnegie Mellon Egyetem kutatói, Satandziv Banerdzsí és Alon Lavi javasoltak[1]. Célja az volt, hogy az automatikus értékelések jobban igazodjanak az emberi ítéletekhez, különösen az egyes mondatok szintjén, kiküszöbölve a korábbi BLEU metrika egyes hiányosságait.
A METEOR metrika legfontosabb jellemzői:
- Pontosság és teljesség figyelembevétele: A BLEU-val ellentétben, amely csak a pontosságra (precision) összpontosít, a METEOR a pontosság és a teljesség (recall) harmonikus közepét számítja, így bünteti azokat a fordításokat, amelyek fontos szavakat kihagynak.
- Rugalmas szóegyeztetés: A METEOR nyelvi sajátosságokat alkalmaz a fordítás és az etalon összevetésekor. Nemcsak a pontos egyezéseket veszi figyelembe, hanem a szavak különböző alakjait is (szótövezés segítségével), valamint a szinonimákat (WordNet segítségével).
- Szórendezési büntetés: A metrikában büntetés szerepel, amely a jelölti fordítás helytelen szórendjét bünteti, még akkor is, ha az összes szó egyezik az etalonnal.
Ezek a fejlesztések lehetővé teszik, hogy a METEOR metrika lényegesen jobban korreláljon az emberi értékelésekkel, mint a BLEU[2]. A metrikát széles körben alkalmazzák a gépi fordítás, az automatikus szövegkivonat-készítés és a képfeliratozás értékelésére irányuló kutatásokban[3].
METEOR mint LLM evolúciós tanítási módszer
2024-ben egy kínai kutatócsoport bemutatott egy METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth nevű módszert[4]. Ez a módszer szűk szakterületi doménekre (például pénzügy, orvostudomány) specializálódott LLM-ek hatékony betanítására szolgál, anélkül, hogy a modellt nulláról kellene tréningezni.
A szerzők az LLM-ek „evolúciójának" háromfázisú sémáját ismertetik:
- Tudásdesztilláció erős modellből gyengébe (weak-to-strong data distillation): A tanítókorpusz előállításához egy erősebb „tanár" modellt (például GPT-4) alkalmaznak. Eközben a doménmodell először megoldási tervet generál, az erős modell pedig e tervet követve állítja elő a választ. Ez kiegyenlíti a tudás eloszlását, és lehetővé teszi a célmodell számára, hogy hatékonyabban sajátítsa el azt.
- Iteratív tanítás külső visszajelzéssel (guided iterative training): Az első fázisban betanított modell önállóan old meg feladatokat, az erős modell pedig „bíróként" értékeli a válaszokat és jelzi a hibákat. Ez a reflexív ciklus kifejleszti a doménmodell önellenőrzési képességét.
- Önevolúció (self-evolution): A modell külső kurátor nélkül folytatja a fejlődést, a felhalmozott készségeket felhasználva új adatok generálásához és javításához.
Ez a módszer praktikus megközelítést kínál kompakt és gazdaságos, iparág-specifikus LLM-szakértők létrehozásához[5].
METEOR mint multimodális LLM modell
Szintén 2024-ben a KAIST kutatócsoportja bemutatott egy nagy multimodális nyelvi modellt METEOR: Mamba-based Traversal of Rationales néven[6]. A modell vizuális információk komplex megértésére és vizuális kérdésekre adott válaszok generálására készült.
A METEOR legfontosabb jellemzője a részletes érvelési láncok (rationales) alkalmazása. A modell nem csupán a végső választ adja meg, hanem generál és felhasznál egy rejtett „érvelési láncot" — egy lépésenkénti magyarázatot arról, hogyan jutott el a válaszhoz, ahhoz hasonlóan, ahogyan egy ember gondolkodik.
A METEOR architektúrájában egy speciális, a Mamba modellen alapuló modul kap szerepet — ez egy hatékony architektúra nagyon hosszú szekvenciák feldolgozására. Ez a modul kódolja a hosszú érvelési láncokat, amelyek tartalmazhatják a képen látható objektumok leírását, azok térbeli viszonyait és a feladat megoldásának lépéseit[7].
A modellt sikeresen tesztelték összetett multimodális benchmarkokon, mint például az MME, az AI2D (diagrammegértés) és a MathVista (matematikai feladatok megoldása vizuális kontextusban). Magas eredményeket ért el anélkül, hogy külső számítógépes látásmodulokra lett volna szükség, ami a saját paraméterek hatékony felhasználásáról tanúskodik[7].
Megjegyzések
- ↑ Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
- ↑ Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
- ↑ «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
- ↑ Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
- ↑ 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]