BLEU (Bilingual Evaluation Understudy) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

BLEU (מאנגלית Bilingual Evaluation Understudy — «מעריך-ממלא-מקום דו-לשוני») — הוא אלגוריתם להערכה אוטומטית של איכות טקסט שתורגם על ידי מכונה. ההערכה מתבצעת על ידי השוואת תרגום-המועמד לאחד או יותר תרגומים אנושיים עיוניים (ייחוסיים)[1]. האיכות נקבעת לפי מידת הקרבה הלקסיקלית של התרגום המכוני לתרגום מקצועי. כפי שציינו המחברים, «ככל שהתרגום המכוני קרוב יותר לתרגומו של איש מקצוע אנושי, כך הוא טוב יותר»[2].

השיטה הוצעה בשנת 2002 על ידי קבוצת חוקרים מ-IBM בהנהגת קישור פפיני והפכה לאחת המדדים הראשונים שהראו מתאם גבוה עם הערכות מומחי תרגום. BLEU זכה לפופולריות מהירה הודות לפשטות החישוב, אי-התלות בשפה והתאמה טובה להערכה האנושית ברמת קורפוס הטקסטים[1].

מתודולוגיית חישוב BLEU

BLEU מעריך תרגום על ידי ספירת התאמות n-גרמות (רצפים של n מילים) בין תרגום-המועמד לתרגומי הייחוס.

1. דיוק n-גרמות מותאם

תחילה מחשבים עבור n-גרמות באורכים שונים (בדרך כלל מ-1 עד 4) את הדיוק שלהן (pn) — שיעור ה-n-גרמות מתרגום-המועמד המופיעות בתרגומי הייחוס[3]. כמות ההתאמות עבור כל n-גרמה מוגבלת למספר המרבי של הופעותיה בכל אחד מטקסטי הייחוס, כדי למנוע הגזמה בציון עקב חזרה על אותה מילה.

2. צבירה וממוצע גיאומטרי

כדי לקבל ציון אחיד, הדיוקים עבור 1-, 2-, 3- ו-4-גרמות נצברים באמצעות ממוצע גיאומטרי. הדבר נעשה כדי שדיוק נמוך עבור סוג אחד של n-גרמות (למשל 4-גרמות) ישפיע משמעותית על הציון הסופי, ויבטא איכות ירודה של ביטויים ארוכים. p1p2p3p44

3. עונש קצרוּת (Brevity Penalty)

כדי למנוע קבלת ציונים מנופחים בזכות תרגומים קצרים מדי אך מדויקים, BLEU מציג עונש קצרות (Brevity Penalty, BP). אם אורך תרגום-המועמד (c) קצר משמעותית מאורך תרגום הייחוס (r), ציון ה-BLEU הסופי מופחת. העונש מחושב לפי הנוסחה: BP={1if c>re1r/cif cr

4. נוסחת BLEU הסופית

ציון ה-BLEU הסופי מחושב כמכפלת עונש הקצרות בממוצע הגיאומטרי של דיוקי ה-n-גרמות[4]: BLEU=BPexp(n=1Nwnlogpn) כאשר N — האורך המרבי של n-גרמות (בדרך כלל 4), ו-wn — משקלים (בדרך כלל 1/N).

ערך ה-BLEU נמצא בטווח שבין 0 ל-1 (לרוב מוכפל ב-100 ומבוטא באחוזים). ככל שהתוצאה קרובה יותר ל-1 (100%), כך התרגום נחשב «קרוב יותר לתרגום אנושי».

שימוש וחשיבות

מאז פרסומו הפך מדד ה-BLEU לסטנדרט דה-פקטו להערכת מערכות תרגום מכונה (MT). הוא אפשר להתגבר על «צוואר הבקבוק» בפיתוח מערכות MT — משך הזמן והעלות הגבוהה של הערכה ידנית. המפתחים קיבלו את האפשרות למדוד במהירות את השפעת השינויים במודלים ולסנן בזריזות פתרונות כושלים[2].

BLEU מתאם היטב עם הערכות אנושיות ברמת הקורפוס כולו, אך אינו אמין להערכת משפטים בודדים[3]. לפיכך נעשה שימוש נרחב במדד בתחרויות MT סטנדרטיות (כגון NIST ו-WMT) להשוואת מערכות.

מגבלות וביקורת

חרף הפצתו הנרחבת, ל-BLEU יש מספר מגבלות מהותיות:

  • היעדר הערכה סמנטית: BLEU מודד אך ורק חפיפה שטחית של מילים ואינו מסוגל להעריך האם המשמעות של הטקסט המקורי הועברה נכונה. תרגום עשוי לקבל ציון גבוה, אך להיות שגוי מבחינה דקדוקית או לעוות את המשמעות[5].
  • התעלמות מנרדפים ופרפרזות: האלגוריתם מעניש תרגומים המשתמשים בנרדפים או בניסוחים שונים מאלו שבתרגום הייחוס, גם אם הם נכונים לחלוטין. שימוש במספר תרגומי ייחוס מקל, אך אינו פותר בעיה זו לגמרי.
  • רגישות לטוקניזציה: תוצאות ה-BLEU תלויות מאוד בדרך פיצול הטקסט לטוקנים. מימושים שונים של tokenizer עשויים להוביל לערכים שונים, ולהפוך את השוואת המודלים לבלתי תקינה. לפתרון בעיה זו הוצע הסטנדרט SacreBLEU, המאחד את חישוב המדד[1].
  • קושי ביישום לשפות מסוימות: BLEU עובד בצורה גרועה עם שפות שאין להן מפרידי מילים ברורים (כגון סינית או יפנית), ללא פילוח מוקדם.

חלופות וגישות עכשוויות

עם הזמן הוצעו מדדים אוטומטיים חדשים כדי להתגבר על חסרונות ה-BLEU:

  • METEOR: לוקח בחשבון התאמות נרדפים, stemming וסדר מילים.
  • ROUGE: משמש להערכת סיכום טקסטים, תוך התמקדות בשלמות (recall) ולא בדיוק.
  • Learned Metrics (מדדים נלמדים): גישות עכשוויות המשתמשות במודלי Machine Learning כדי לחשב קרבה סמנטית. מדדים כגון BLEURT ו-COMET מראים מתאם גבוה משמעותית עם הערכות אנושיות בהשוואה ל-BLEU הקלאסי[6].

בשנות ה-2020 איבד BLEU את מעמדו כסטנדרט בלתי-מעורער, ונסוג לטובת שיטות מדויקות יותר[7]. עם זאת, הוא נותר אבן דרך חשובה בהיסטוריה של הערכת MT וממשיך לשמש כנקודת ייחוס בסיסית למדידת ההתקדמות.

קישורים

  • מהי הערכת BLEU? — תיעוד Microsoft Azure

הערות

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]