BERTScore (metric) (HE)
BERTScore — היא מדד אוטומטי להערכת איכות טקסט שנוצר, המבוסס על מדידת דמיון סמנטי באמצעות embedding קונטקסטואלי ממודלי שפה מאומנים מראש, כגון BERT. המדד הוצע בשנת 2019 על ידי קבוצת חוקרים בראשות Tianyi Zhang בעבודה «BERTScore: Evaluating Text Generation with BERT»[1].
בשונה ממדדים מסורתיים כגון BLEU ו-ROUGE, המבוססים על התאמה מדויקת של n-gram, BERTScore מאפשר לזהות שקילות משמעותית גם כאשר המילים והניסוח שונים, תוך התחשבות במילים נרדפות ובפרפרזות[2].
שיטת החישוב
שיטת BERTScore מורכבת ממספר שלבים:
- קבלת embedding קונטקסטואלי: שני הטקסטים (הייחוסי והמיוצר) מפורקים ל-token ומועברים דרך מודל transformer מאומן מראש (לדוגמה, BERT או RoBERTa). עבור כל token מחולץ הייצוג הוקטורי הקונטקסטואלי שלו (embedding).
- חישוב דמיון קוסינוס: עבור כל זוגות ה-token משני הטקסטים מחושב דמיון הקוסינוס, ונוצרת מטריצת דמיון של token[3].
- חישוב דיוק, היקף ומדד F1: על בסיס מטריצת הדמיון, עבור כל token בטקסט המיוצר מאותר ה-token הדומה ביותר בטקסט הייחוסי, המאפשר לחשב דיוק (precision). באופן דומה, עבור כל token ייחוסי מאותר ה-token הקרוב ביותר בטקסט המיוצר, ומתקבל היקף (recall). הערך הסופי של BERTScore הוא מדד F₁ מאוזן המשלב דיוק והיקף:
המדד גמיש: ניתן לבחור מודלים מאומנים מראש שונים, לשקלל token לפי חשיבותם (באמצעות משקלי IDF) ולהמיר את הציונים לינארית לשיפור הפרשנות[3].
יישום ויעילות
BERTScore משמש להערכת איכות במשימות שונות של יצירת טקסט:
- תרגום מכונה: קולט שמירה על המשמעות גם אם מבנים תרגומיים שונים מהאמת הבסיסית.
- סיכום אוטומטי: מסוגל לקבוע שניסוחים שונים יכולים להעביר אותם עובדות מרכזיות, מה שהופך אותו לגמיש יותר מ-ROUGE.
- מערכות דיאלוג: עוזר למדוד את רלוונטיות התגובה על ידי השוואתה לאמת הבסיסית ברמת המשמעות.
הערכה נרחבת שערכו המחברים הראתה שמקדם המתאם של BERTScore עם הערכות אנושיות גבוה במידה ניכרת מזה של מדדים מסוג BLEU ו-ROUGE. בנוסף, המדד הפגין עמידות מוגברת למקרים מורכבים של פרפרזה[1].
יתרונות
- התחשבות בסמנטיקה: משווה טקסטים ברמת המשמעות, תוך התחשבות במילים נרדפות ובפרפרזות.
- מתאם גבוה עם בני אדם: ציוני BERTScore עולים בקנה אחד עם שיפוטי בני האדם על איכות הטקסט יותר ממדדים מסורתיים.
- אוניברסליות ויכולת העברה: המדד אינו קשור לשפה או משימה ספציפית — די לבחור מודל מאומן מראש מתאים.
- אין צורך באימון: BERTScore הוא מדד שאינו דורש אימון, בשונה ממדדים מורכבים יותר (לדוגמה, BLEURT) הדורשים אימון מקדים על קורפוסים של הערכות.
- שילוב מודלים מודרניים: מנצל את עוצמת ה-transformer לחילוץ מאפיינים קונטקסטואליים עמוקים.
מגבלות וביקורת
- עלויות חישוביות גבוהות: חישוב המבוסס על embedding דורש משאבים רבים הרבה יותר מספירת n-gram, ולעיתים קרובות דורש שימוש ב-GPU[2].
- תלות במודל: איכות ההערכה קשורה ישירות לאיכות המודל המאומן מראש. בחירת המודל והשכבה לחילוץ ה-embedding משפיעה על התוצאה, דבר העלול לגרום לבעיות של ניתן-לשחזור[4].
- העדר התחשבות בעובדות ובמבנה: BERTScore מתמקד בדמיון סמנטי מקומי ואינו מבטיח הבנת מבנה הטקסט או דיוק עובדתי. טקסט עם ביטויים מסודרים מחדש או שגיאות עובדתיות עלול לקבל ציון גבוה[3].
- פרשנות נמוכה: בשונה מ-BLEU/ROUGE, ציון BERTScore פחות שקוף, דבר המקשה על ניתוח שגיאות.
- הטיות חברתיות (bias): המדד יורש סטריאוטיפים והטיות הטמונים במודלים המאומנים מראש. מחקר משנת 2022 הראה שמדדים המבוססים על LLM (כולל BERTScore) מפגינים bias חברתי גבוה משמעותית ממדדים מסורתיים[5].
משמעות ותפקיד בהערכה
BERTScore מהווה צעד חשוב בפיתוח שיטות הערכת טקסט מיוצר, שכן הוא מאפשר להתחשב בשקילות משמעותית ולא רק בהתאמות לקסיקליות. למרות שאף מדד אוטומטי אינו מסוגל למדוד בצורה מושלמת את איכות הטקסט, BERTScore הוכיח את עצמו ככלי אמין המשלים גישות קלאסיות (כגון BLEU ו-ROUGE), ולא מחליף אותן לחלוטין.
בפועל, BERTScore משמש לעיתים קרובות בשילוב עם בדיקה ידנית של מומחים ומדדים נוספים, על מנת לקבל תמונה מלאה ועמוקה יותר של מידת ההצלחה של מודלים ביצירת טקסטים קוהרנטיים ובעלי התאמה משמעותית[2].
קישורים
- מאגר BERTScore הרשמי ב-GitHub
הערות
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]