METEOR (metric) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

METEOR — dit is een naam die wordt gebruikt op het gebied van Natural Language Processing (NLP) voor meerdere verwante maar verschillende begrippen. In de eerste plaats is het een bekende automatische metriek voor het beoordelen van de kwaliteit van machinale vertaling. Daarnaast werden in 2024 onder dezelfde naam twee onafhankelijke onderzoeksprojecten gepresenteerd die verband houden met grote taalmodellen (LLM): een methode voor evolutionair leren en een multimodaal taalmodel.

METEOR als metriek voor vertaalkwaliteitsbeoordeling

METEOR (afkorting van Metric for Evaluation of Translation with Explicit ORdering) — dit is een automatische metriek voor het beoordelen van de kwaliteit van machinale vertaling, voorgesteld in 2005 door onderzoekers van Carnegie Mellon University Satanjiw Banerjee en Alon Lavie[1]. Het doel was om de overeenstemming van automatische beoordelingen met menselijke oordelen te verbeteren, met name op het niveau van afzonderlijke zinnen, door enkele tekortkomingen van de eerdere metriek BLEU weg te nemen.

Belangrijkste kenmerken van de METEOR-metriek:

  • Rekening houden met precisie en volledigheid: In tegenstelling tot BLEU, dat alleen gericht is op precisie (precision), berekent METEOR het harmonisch gemiddelde van precisie en volledigheid (recall), waardoor vertalingen worden bestraft voor het weglaten van belangrijke woorden.
  • Flexibele woordkoppeling: METEOR maakt gebruik van taalkundige eigenschappen om de vertaling met de referentie te vergelijken. Er wordt niet alleen gekeken naar exacte overeenkomsten, maar ook naar verschillende woordvormen (via stemming) en synoniemen (via WordNet).
  • Straf voor verkeerde woordvolgorde: In de metriek is een straf ingebouwd die onjuiste woordvolgorde in de kandidaatvertaling bestraft, zelfs als alle woorden overeenkomen met de referentie.

Deze verbeteringen zorgen ervoor dat de METEOR-metriek aanzienlijk beter correleert met menselijke beoordelingen dan BLEU[2]. De metriek wordt veel toegepast in onderzoek naar machinale vertaling, automatische samenvatting en de beoordeling van bijschriften bij afbeeldingen[3].

METEOR als methode voor evolutionair leren van LLM

In 2024 presenteerde een groep Chinese onderzoekers een methode onder de naam METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Deze methode is bedoeld voor het efficiënt trainen van LLM's die gespecialiseerd zijn in smalle vakgebieden (zoals financiën en geneeskunde), zonder dat het model vanaf nul getraind hoeft te worden.

De auteurs beschrijven een driefasig schema van LLM-'evolutie':

  1. Kennisdestillatie van een sterk model naar een zwak model (weak-to-strong data distillation): Voor het genereren van het trainingskorpus wordt een krachtiger 'leraar'-model gebruikt (bijvoorbeeld GPT-4). Daarbij genereert het domeinmodel eerst een oplossingsplan, waarna het sterke model een antwoord opstelt dat dit plan volgt. Dit gelijkt de kennisdistributie en stelt het doelmodel in staat de kennis efficiënter op te nemen.
  2. Iteratief leren met externe feedback (guided iterative training): Het in de eerste fase getrainde model lost zelfstandig taken op, terwijl het sterke model fungeert als 'scheidsrechter' die antwoorden beoordeelt en fouten aanwijst. Deze reflectieve cyclus ontwikkelt bij het domeinmodel het vermogen tot zelfcontrole.
  3. Zelf-evolutie (self-evolution): Het model blijft verbeteren zonder externe begeleiding, waarbij het opgedane vaardigheden gebruikt om nieuwe gegevens te genereren en te corrigeren.

Deze methode biedt een praktische aanpak voor het creëren van compacte en kostenefficiënte LLM-experts voor specifieke sectoren[5].

METEOR als multimodaal LLM-model

Eveneens in 2024 presenteerde een onderzoeksteam van KAIST een groot multimodaal taalmodel onder de naam METEOR: Mamba-based Traversal of Rationales[6]. Het model is bedoeld voor uitgebreid begrip van visuele informatie en het genereren van antwoorden op visuele vragen.

Het belangrijkste kenmerk van METEOR is het gebruik van uitgebreide redeneerketens (rationales). Het model geeft niet simpelweg een eindantwoord, maar genereert en steunt op een verborgen 'redeneerketenreeks' — een stapsgewijze toelichting over hoe tot dat antwoord te komen, vergelijkbaar met de wijze waarop een mens zou redeneren.

In de architectuur van METEOR is een speciale module op basis van het Mamba-model opgenomen — een efficiënte architectuur voor de verwerking van zeer lange reeksen. Deze module codeert lange redeneerketens die beschrijvingen van objecten op een afbeelding, hun ruimtelijke relaties en stappen voor het oplossen van een taak kunnen bevatten[7].

Het model werd met succes getest op complexe multimodale benchmarks zoals MME, AI2D (begrip van diagrammen) en MathVista (oplossen van wiskundige vraagstukken in een visuele context). Het behaalde hoge resultaten zonder dat hiervoor aanvullende externe modules voor computervisie nodig waren, wat wijst op een efficiënt gebruik van de eigen parameters[7].

Noten

  1. Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
  2. Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
  3. «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
  4. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
  5. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
  6. Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
  7. 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]