---
title: "BLEU (Bilingual Evaluation Understudy) (HE)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(HE)"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 629
wiki_created_at: 2026-09-06T22:36:38Z
wiki_modified_at: 2026-09-06T22:36:38Z
downloaded_at: 2026-09-07T22:41:21Z
---

# BLEU (Bilingual Evaluation Understudy) (HE)

**BLEU** (מאנגלית *Bilingual Evaluation Understudy* — «מעריך-ממלא-מקום דו-לשוני») — הוא אלגוריתם להערכה אוטומטית של איכות טקסט שתורגם על ידי מכונה. ההערכה מתבצעת על ידי השוואת תרגום-המועמד לאחד או יותר תרגומים אנושיים עיוניים (ייחוסיים)<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-wiki_bleu-1)</sup>. האיכות נקבעת לפי מידת הקרבה הלקסיקלית של התרגום המכוני לתרגום מקצועי. כפי שציינו המחברים, «ככל שהתרגום המכוני קרוב יותר לתרגומו של איש מקצוע אנושי, כך הוא טוב יותר»<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-bleu_dvi-2)</sup>.

השיטה הוצעה בשנת 2002 על ידי קבוצת חוקרים מ-IBM בהנהגת **קישור פפיני** והפכה לאחת המדדים הראשונים שהראו מתאם גבוה עם הערכות מומחי תרגום. BLEU זכה לפופולריות מהירה הודות לפשטות החישוב, אי-התלות בשפה והתאמה טובה להערכה האנושית ברמת קורפוס הטקסטים<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-wiki_bleu-1)</sup>.

## מתודולוגיית חישוב BLEU

BLEU מעריך תרגום על ידי ספירת התאמות n-גרמות (רצפים של *n* מילים) בין תרגום-המועמד לתרגומי הייחוס.

### 1. דיוק n-גרמות מותאם

תחילה מחשבים עבור n-גרמות באורכים שונים (בדרך כלל מ-1 עד 4) את הדיוק שלהן ($p_{n}$) — שיעור ה-n-גרמות מתרגום-המועמד המופיעות בתרגומי הייחוס<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-mt_companion-3)</sup>. כמות ההתאמות עבור כל n-גרמה מוגבלת למספר המרבי של הופעותיה בכל אחד מטקסטי הייחוס, כדי למנוע הגזמה בציון עקב חזרה על אותה מילה.

### 2. צבירה וממוצע גיאומטרי

כדי לקבל ציון אחיד, הדיוקים עבור 1-, 2-, 3- ו-4-גרמות נצברים באמצעות ממוצע גיאומטרי. הדבר נעשה כדי שדיוק נמוך עבור סוג אחד של n-גרמות (למשל 4-גרמות) ישפיע משמעותית על הציון הסופי, ויבטא איכות ירודה של ביטויים ארוכים. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. עונש קצרוּת (Brevity Penalty)

כדי למנוע קבלת ציונים מנופחים בזכות תרגומים קצרים מדי אך מדויקים, BLEU מציג **עונש קצרות** (*Brevity Penalty*, BP). אם אורך תרגום-המועמד (c) קצר משמעותית מאורך תרגום הייחוס (r), ציון ה-BLEU הסופי מופחת. העונש מחושב לפי הנוסחה: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### 4. נוסחת BLEU הסופית

ציון ה-BLEU הסופי מחושב כמכפלת עונש הקצרות בממוצע הגיאומטרי של דיוקי ה-n-גרמות<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ כאשר N — האורך המרבי של n-גרמות (בדרך כלל 4), ו-$w_{n}$ — משקלים (בדרך כלל $1/N$).

ערך ה-BLEU נמצא בטווח שבין 0 ל-1 (לרוב מוכפל ב-100 ומבוטא באחוזים). ככל שהתוצאה קרובה יותר ל-1 (100%), כך התרגום נחשב «קרוב יותר לתרגום אנושי».

## שימוש וחשיבות

מאז פרסומו הפך מדד ה-BLEU לסטנדרט דה-פקטו להערכת מערכות תרגום מכונה (MT). הוא אפשר להתגבר על «צוואר הבקבוק» בפיתוח מערכות MT — משך הזמן והעלות הגבוהה של הערכה ידנית. המפתחים קיבלו את האפשרות למדוד במהירות את השפעת השינויים במודלים ולסנן בזריזות פתרונות כושלים<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-bleu_dvi-2)</sup>.

BLEU מתאם היטב עם הערכות אנושיות **ברמת הקורפוס** כולו, אך אינו אמין להערכת משפטים בודדים<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-mt_companion-3)</sup>. לפיכך נעשה שימוש נרחב במדד בתחרויות MT סטנדרטיות (כגון NIST ו-WMT) להשוואת מערכות.

## מגבלות וביקורת

חרף הפצתו הנרחבת, ל-BLEU יש מספר מגבלות מהותיות:

- **היעדר הערכה סמנטית**: BLEU מודד אך ורק חפיפה שטחית של מילים ואינו מסוגל להעריך האם **המשמעות** של הטקסט המקורי הועברה נכונה. תרגום עשוי לקבל ציון גבוה, אך להיות שגוי מבחינה דקדוקית או לעוות את המשמעות<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-deep_hub-5)</sup>.
- **התעלמות מנרדפים ופרפרזות**: האלגוריתם מעניש תרגומים המשתמשים בנרדפים או בניסוחים שונים מאלו שבתרגום הייחוס, גם אם הם נכונים לחלוטין. שימוש במספר תרגומי ייחוס מקל, אך אינו פותר בעיה זו לגמרי.
- **רגישות לטוקניזציה**: תוצאות ה-BLEU תלויות מאוד בדרך פיצול הטקסט לטוקנים. מימושים שונים של tokenizer עשויים להוביל לערכים שונים, ולהפוך את השוואת המודלים לבלתי תקינה. לפתרון בעיה זו הוצע הסטנדרט **SacreBLEU**, המאחד את חישוב המדד<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-wiki_bleu-1)</sup>.
- **קושי ביישום לשפות מסוימות**: BLEU עובד בצורה גרועה עם שפות שאין להן מפרידי מילים ברורים (כגון סינית או יפנית), ללא פילוח מוקדם.

## חלופות וגישות עכשוויות

עם הזמן הוצעו מדדים אוטומטיים חדשים כדי להתגבר על חסרונות ה-BLEU:

- **METEOR**: לוקח בחשבון התאמות נרדפים, stemming וסדר מילים.
- **ROUGE**: משמש להערכת סיכום טקסטים, תוך התמקדות בשלמות (recall) ולא בדיוק.
- **Learned Metrics (מדדים נלמדים)**: גישות עכשוויות המשתמשות במודלי Machine Learning כדי לחשב קרבה סמנטית. מדדים כגון **BLEURT** ו-**COMET** מראים מתאם גבוה משמעותית עם הערכות אנושיות בהשוואה ל-BLEU הקלאסי<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-bleurt-6)</sup>.

בשנות ה-2020 איבד BLEU את מעמדו כסטנדרט בלתי-מעורער, ונסוג לטובת שיטות מדויקות יותר<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_note-ai_mil_lexicon-7)</sup>. עם זאת, הוא נותר אבן דרך חשובה בהיסטוריה של הערכת MT וממשיך לשמש כנקודת ייחוס בסיסית למדידת ההתקדמות.

## קישורים

- מהי הערכת BLEU? — תיעוד Microsoft Azure

## הערות

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HE)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
