METEOR (metric) (RO)
METEOR — este un nume utilizat în domeniul procesării limbajului natural (NLP) pentru mai multe concepte înrudite, dar distincte. În primul rând, este o metrică automată binecunoscută pentru evaluarea calității traducerii automate. În plus, în 2024, sub același nume au fost prezentate două proiecte de cercetare independente legate de modele lingvistice mari (LLM): o metodă de antrenament evolutiv și un model lingvistic multimodal.
METEOR ca metrică de evaluare a calității traducerii
METEOR (abrev. din Metric for Evaluation of Translation with Explicit ORdering) — este o metrică automată pentru evaluarea calității traducerii automate, propusă în 2005 de cercetătorii Universității Carnegie Mellon, Satanjeev Banerjee și Alon Lavie[1]. Scopul său era de a îmbunătăți concordanța evaluărilor automate cu judecățile umane, în special la nivelul propozițiilor individuale, eliminând unele deficiențe ale metricii BLEU.
Caracteristici cheie ale metricii METEOR:
- Luarea în considerare a preciziei și a exhaustivității: Spre deosebire de BLEU, care se axează exclusiv pe precizie (precision), METEOR calculează media armonică dintre precizie și exhaustivitate (recall), ceea ce permite penalizarea traducerilor pentru omiterea cuvintelor importante.
- Potrivire flexibilă a cuvintelor: METEOR utilizează caracteristici lingvistice pentru a alinia traducerea cu referința. Acesta ia în considerare nu doar corespondențele exacte, ci și diferite forme ale cuvintelor (prin stemming) și sinonime (prin WordNet).
- Penalizare pentru încălcarea ordinii cuvintelor: În metrică este introdusă o penalizare care sancționează ordinea incorectă a cuvintelor în traducerea candidat, chiar dacă toate cuvintele corespund referinței.
Aceste îmbunătățiri permit metricii METEOR să coreleze semnificativ mai bine cu evaluările umane în comparație cu BLEU[2]. Metrica este utilizată pe scară largă în cercetările privind traducerea automată, rezumarea automată și evaluarea descrierilor de imagini[3].
METEOR ca metodă de antrenament evolutiv al LLM
În 2024, un grup de cercetători chinezi a prezentat o metodă denumită METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Această metodă este destinată antrenamentului eficient al LLM specializate în domenii tematice înguste (de exemplu, finanțe, medicină), fără necesitatea de a antrena modelul de la zero.
Autorii descriu o schemă în trei faze de „evoluție" a LLM:
- Distilarea cunoștințelor de la un model puternic la unul slab (weak-to-strong data distillation): Pentru generarea corpusului de antrenament este utilizat un model mai puternic, denumit „profesor" (de exemplu, GPT-4). În același timp, modelul de domeniu generează mai întâi un plan de soluție, iar modelul puternic creează răspunsul urmând acest plan. Aceasta aliniază distribuția cunoștințelor și permite modelului țintă să le asimileze mai eficient.
- Antrenament iterativ cu feedback extern (guided iterative training): Modelul antrenat în prima fază rezolvă în mod independent sarcini, iar modelul puternic acționează ca „arbitru", evaluând răspunsurile și indicând erorile. Acest ciclu reflexiv dezvoltă la modelul de domeniu capacitatea de auto-verificare.
- Auto-evoluție (self-evolution): Modelul continuă să se îmbunătățească fără un curator extern, utilizând abilitățile acumulate pentru generarea și corectarea de noi date.
Această metodă oferă o abordare practică pentru crearea de experți LLM compacți și eficienți din punct de vedere economic, pentru sectoare specifice[5].
METEOR ca model LLM multimodal
Tot în 2024, o echipă de cercetători de la KAIST a prezentat un model lingvistic multimodal de mari dimensiuni denumit METEOR: Mamba-based Traversal of Rationales[6]. Modelul este destinat înțelegerii complexe a informațiilor vizuale și generării de răspunsuri la întrebări vizuale.
Caracteristica cheie a METEOR este utilizarea unor raționamente (rationales) detaliate. Modelul nu oferă pur și simplu un răspuns final, ci generează și se bazează pe un „lanț de raționamente" latent — o explicație secvențială a modului în care se ajunge la acel răspuns, similar modului în care ar raționa un om.
În arhitectura METEOR este utilizat un modul special bazat pe modelul Mamba — o arhitectură eficientă pentru procesarea secvențelor foarte lungi. Acest modul codifică lanțuri lungi de raționamente, care pot include descrierea obiectelor din imagine, relațiile lor spațiale și pașii pentru rezolvarea sarcinii[7].
Modelul a fost testat cu succes pe benchmark-uri multimodale complexe, precum MME, AI2D (înțelegerea diagramelor) și MathVista (rezolvarea problemelor matematice în context vizual). A obținut rezultate înalte fără a necesita module externe suplimentare de vedere computerizată, ceea ce indică o utilizare eficientă a propriilor parametri[7].
Note
- ↑ Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
- ↑ Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
- ↑ «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
- ↑ Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
- ↑ 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]