METEOR (metric) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

METEOR — זהו שם המשמש בתחום עיבוד שפה טבעית (NLP) למספר מושגים קשורים אך שונים. בראש ובראשונה, זוהי מדד אוטומטי מוכר להערכת איכות תרגום מכונה. בנוסף, בשנת 2024 הוצגו תחת אותו שם שני פרויקטי מחקר עצמאיים הקשורים למודלי שפה גדולים (LLM): שיטת למידה אבולוציונית ומודל שפה מולטי-מודאלי.

METEOR כמדד להערכת איכות תרגום

METEOR (ר"ת של Metric for Evaluation of Translation with Explicit ORdering) — הוא מדד אוטומטי להערכת איכות תרגום מכונה, שהוצע בשנת 2005 על ידי חוקרי אוניברסיטת קרנגי-מלון סטנג'יב בנרג'י ואלון לבי[1]. מטרתו הייתה לשפר את ההתאמה בין הציונים האוטומטיים לשיפוטים אנושיים, במיוחד ברמת המשפט הבודד, על ידי תיקון חלק מהחסרונות של המדד הקודם BLEU.

מאפיינים מרכזיים של מדד METEOR:

  • התחשבות בדיוק ובשלמות: בניגוד ל-BLEU, המתמקד רק בדיוק (precision), METEOR מחשב את הממוצע ההרמוני בין דיוק לשלמות (recall), מה שמאפשר להעניש תרגומים על השמטת מילים חשובות.
  • התאמת מילים גמישה: METEOR משתמש במאפיינים לשוניים כדי להתאים את התרגום לאמת המידה. הוא לוקח בחשבון לא רק התאמות מדויקות, אלא גם צורות שונות של מילים (באמצעות stemming) ומילים נרדפות (באמצעות WordNet).
  • קנס על שיבוש סדר המילים: המדד כולל קנס המעניש על סדר מילים שגוי בתרגום המועמד, גם כאשר כל המילים תואמות לאמת המידה.

שיפורים אלה מאפשרים למדד METEOR להתאם בצורה משמעותית יותר להערכות אנושיות בהשוואה ל-BLEU[2]. המדד נמצא בשימוש נרחב במחקרי תרגום מכונה, סיכום אוטומטי והערכת כיתובי תמונות[3].

METEOR כשיטת למידה אבולוציונית של LLM

בשנת 2024 הציגה קבוצת חוקרים סינים שיטה בשם METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. שיטה זו נועדה לאמן בצורה יעילה LLM המתמחים בתחומים ספציפיים (כגון פיננסים, רפואה), מבלי להיזקק לאימון המודל מאפס.

המחברים מתארים תכנית תלת-שלבית של «אבולוציה» של LLM:

  1. זיקוק ידע ממודל חזק למודל חלש (weak-to-strong data distillation): לשם יצירת קורפוס האימון נעשה שימוש במודל «מורה» חזק יותר (כגון GPT-4). במהלך תהליך זה, מודל התחום מייצר תחילה תוכנית פתרון, ואילו המודל החזק יוצר תשובה בהתאם לתוכנית זו. דבר זה מיישר את התפלגות הידע ומאפשר למודל היעד לקלוט אותו ביתר יעילות.
  2. אימון איטרטיבי עם משוב חיצוני (guided iterative training): המודל שאומן בשלב הראשון פותר משימות באופן עצמאי, ואילו המודל החזק משמש כ«שופט», מעריך את התשובות ומצביע על שגיאות. מחזור רפלקטיבי זה מפתח במודל התחום את היכולת לבדיקה עצמית.
  3. אבולוציה עצמית (self-evolution): המודל ממשיך להשתפר ללא מנחה חיצוני, תוך שימוש בכישורים שנצברו לשם יצירה ותיקון של נתונים חדשים.

שיטה זו מציעה גישה מעשית ליצירת LLM מומחים קומפקטיים וחסכוניים לתעשיות ספציפיות[5].

METEOR כמודל LLM מולטי-מודאלי

גם בשנת 2024 הציגה צוות חוקרים מ-KAIST מודל שפה מולטי-מודאלי גדול בשם METEOR: Mamba-based Traversal of Rationales[6]. המודל נועד להבנה מקיפה של מידע חזותי ולהפקת תשובות לשאלות חזותיות.

מאפיין מרכזי של METEOR הוא שימוש בנימוקים (rationales) מפורטים. המודל אינו מסתפק בהצגת תשובה סופית, אלא מייצר ומתבסס על «שרשרת נימוקים» סמויה — הסבר רציף כיצד להגיע לתשובה, בדומה לאופן שבו אדם היה מנמק.

בארכיטקטורת METEOR משולב מודול ייעודי המבוסס על המודל Mamba — ארכיטקטורה יעילה לעיבוד רצפים ארוכים מאוד. מודול זה מקודד שרשראות נימוקים ארוכות, שעשויות לכלול תיאור עצמים בתמונה, יחסים מרחביים ביניהם ושלבים לפתרון המשימה[7].

המודל נבחן בהצלחה על benchmark-ים מולטי-מודאליים מורכבים, כגון MME,‏ AI2D (הבנת דיאגרמות) ו-MathVista (פתרון בעיות מתמטיות בהקשר חזותי). הוא הציג תוצאות גבוהות, מבלי להצריך מודולים חיצוניים נוספים של ראייה ממוחשבת, מה שמעיד על ניצול יעיל של הפרמטרים הפנימיים שלו[7].

הערות

  1. Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
  2. Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
  3. «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
  4. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
  5. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
  6. Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
  7. 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]