METEOR (metric) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

METEOR — ez az elnevezés a természetes nyelvfeldolgozás (NLP) területén több egymással összefüggő, de különböző fogalomra is vonatkozik. Mindenekelőtt ez egy jól ismert automatikus metrika a gépi fordítás minőségének értékelésére. Emellett 2024-ben ugyanezen a néven két egymástól független kutatási projekt is megjelent, amelyek a nagy nyelvi modellekhez (LLM) kapcsolódnak: egy evolúciós tanítási módszer és egy multimodális nyelvi modell.

METEOR mint fordításminőség-értékelési metrika

METEOR (röv. Metric for Evaluation of Translation with Explicit ORdering) — egy automatikus metrika a gépi fordítás minőségének értékelésére, amelyet 2005-ben a Carnegie Mellon Egyetem kutatói, Satandziv Banerdzsí és Alon Lavi javasoltak[1]. Célja az volt, hogy az automatikus értékelések jobban igazodjanak az emberi ítéletekhez, különösen az egyes mondatok szintjén, kiküszöbölve a korábbi BLEU metrika egyes hiányosságait.

A METEOR metrika legfontosabb jellemzői:

  • Pontosság és teljesség figyelembevétele: A BLEU-val ellentétben, amely csak a pontosságra (precision) összpontosít, a METEOR a pontosság és a teljesség (recall) harmonikus közepét számítja, így bünteti azokat a fordításokat, amelyek fontos szavakat kihagynak.
  • Rugalmas szóegyeztetés: A METEOR nyelvi sajátosságokat alkalmaz a fordítás és az etalon összevetésekor. Nemcsak a pontos egyezéseket veszi figyelembe, hanem a szavak különböző alakjait is (szótövezés segítségével), valamint a szinonimákat (WordNet segítségével).
  • Szórendezési büntetés: A metrikában büntetés szerepel, amely a jelölti fordítás helytelen szórendjét bünteti, még akkor is, ha az összes szó egyezik az etalonnal.

Ezek a fejlesztések lehetővé teszik, hogy a METEOR metrika lényegesen jobban korreláljon az emberi értékelésekkel, mint a BLEU[2]. A metrikát széles körben alkalmazzák a gépi fordítás, az automatikus szövegkivonat-készítés és a képfeliratozás értékelésére irányuló kutatásokban[3].

METEOR mint LLM evolúciós tanítási módszer

2024-ben egy kínai kutatócsoport bemutatott egy METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth nevű módszert[4]. Ez a módszer szűk szakterületi doménekre (például pénzügy, orvostudomány) specializálódott LLM-ek hatékony betanítására szolgál, anélkül, hogy a modellt nulláról kellene tréningezni.

A szerzők az LLM-ek „evolúciójának" háromfázisú sémáját ismertetik:

  1. Tudásdesztilláció erős modellből gyengébe (weak-to-strong data distillation): A tanítókorpusz előállításához egy erősebb „tanár" modellt (például GPT-4) alkalmaznak. Eközben a doménmodell először megoldási tervet generál, az erős modell pedig e tervet követve állítja elő a választ. Ez kiegyenlíti a tudás eloszlását, és lehetővé teszi a célmodell számára, hogy hatékonyabban sajátítsa el azt.
  2. Iteratív tanítás külső visszajelzéssel (guided iterative training): Az első fázisban betanított modell önállóan old meg feladatokat, az erős modell pedig „bíróként" értékeli a válaszokat és jelzi a hibákat. Ez a reflexív ciklus kifejleszti a doménmodell önellenőrzési képességét.
  3. Önevolúció (self-evolution): A modell külső kurátor nélkül folytatja a fejlődést, a felhalmozott készségeket felhasználva új adatok generálásához és javításához.

Ez a módszer praktikus megközelítést kínál kompakt és gazdaságos, iparág-specifikus LLM-szakértők létrehozásához[5].

METEOR mint multimodális LLM modell

Szintén 2024-ben a KAIST kutatócsoportja bemutatott egy nagy multimodális nyelvi modellt METEOR: Mamba-based Traversal of Rationales néven[6]. A modell vizuális információk komplex megértésére és vizuális kérdésekre adott válaszok generálására készült.

A METEOR legfontosabb jellemzője a részletes érvelési láncok (rationales) alkalmazása. A modell nem csupán a végső választ adja meg, hanem generál és felhasznál egy rejtett „érvelési láncot" — egy lépésenkénti magyarázatot arról, hogyan jutott el a válaszhoz, ahhoz hasonlóan, ahogyan egy ember gondolkodik.

A METEOR architektúrájában egy speciális, a Mamba modellen alapuló modul kap szerepet — ez egy hatékony architektúra nagyon hosszú szekvenciák feldolgozására. Ez a modul kódolja a hosszú érvelési láncokat, amelyek tartalmazhatják a képen látható objektumok leírását, azok térbeli viszonyait és a feladat megoldásának lépéseit[7].

A modellt sikeresen tesztelték összetett multimodális benchmarkokon, mint például az MME, az AI2D (diagrammegértés) és a MathVista (matematikai feladatok megoldása vizuális kontextusban). Magas eredményeket ért el anélkül, hogy külső számítógépes látásmodulokra lett volna szükség, ami a saját paraméterek hatékony felhasználásáról tanúskodik[7].

Megjegyzések

  1. Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
  2. Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
  3. «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
  4. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
  5. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
  6. Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
  7. 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]