---
title: "BLEU (Bilingual Evaluation Understudy) (SV)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(SV)"
language: "sv"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Swedish"
revision_id: 639
wiki_created_at: 2026-09-06T22:36:46Z
wiki_modified_at: 2026-09-06T22:36:46Z
downloaded_at: 2026-09-07T22:41:25Z
---

# BLEU (Bilingual Evaluation Understudy) (SV)

**BLEU** (från eng. *Bilingual Evaluation Understudy* — "tvåspråkig vikariebedömare") — är en algoritm för automatisk kvalitetsbedömning av maskinöversatt text. Bedömningen sker genom att jämföra en kandidatöversättning med en eller flera referensöversättningar gjorda av människor<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-wiki_bleu-1)</sup>. Kvaliteten bestäms av graden av lexikal likhet mellan maskinöversättningen och den professionella översättningen. Som upphovsmännen konstaterade: "ju närmare maskinöversättningen är en professionell människoöversättning, desto bättre är den"<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-bleu_dvi-2)</sup>.

Metoden föreslogs år 2002 av en forskargrupp från IBM under ledning av **Kishore Papineni** och blev en av de första metrikerna som visade hög korrelation med bedömningar från expertöversättare. BLEU vann snabbt popularitet tack vare sin beräkningsenkelhet, språkoberoende och goda överensstämmelse med mänsklig bedömning på korpusnivå<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-wiki_bleu-1)</sup>.

## Beräkningsmetodik för BLEU

BLEU utvärderar en översättning genom att räkna n-gramsöverträffar (sekvenser av *n* ord) mellan kandidatöversättningen och referensöversättningarna.

### 1. Modifierad n-gramsprecision

Först beräknas precisionen ($p_{n}$) för n-gram av olika längd (vanligtvis 1 till 4) — andelen n-gram från kandidatöversättningen som förekommer i referensöversättningarna<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-mt_companion-3)</sup>. Antalet träffar för varje n-gram begränsas till det maximala antalet förekomster i någon av referenstexterna, för att undvika uppblåsta poäng vid upprepning av samma ord.

### 2. Aggregering och geometriskt medelvärde

För att erhålla ett enda mått aggregeras precisionen för 1-, 2-, 3- och 4-gram med hjälp av det geometriska medelvärdet. Detta görs för att låg precision för en typ av n-gram (t.ex. 4-gram) ska ha stor påverkan på slutpoängen och därigenom spegla dålig kvalitet på längre fraser. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. Straffavdrag för korthet (Brevity Penalty)

För att förhindra uppblåsta poäng från alltför korta men precisa översättningar inför BLEU ett **straffavdrag för korthet** (*Brevity Penalty*, BP). Om kandidatöversättningens längd (c) är väsentligt kortare än referensöversättningens längd (r) minskas det slutliga BLEU-poängen. Straffet beräknas enligt formeln: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### 4. Slutlig BLEU-formel

Den slutliga BLEU-poängen beräknas som produkten av straffavdraget för korthet och det geometriska medelvärdet av n-gramsprecisionerna<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ där N är den maximala n-gramslängden (vanligtvis 4) och $w_{n}$ är vikter (vanligtvis $1/N$).

BLEU-värdet ligger i intervallet 0 till 1 (multipliceras ofta med 100 och uttrycks i procent). Ju närmare resultatet är 1 (100 %), desto mer "människolikt" anses översättningen vara.

## Tillämpning och betydelse

Sedan publiceringen har BLEU-metriken blivit de facto-standard för utvärdering av maskinöversättningssystem (MÖ). Den möjliggjorde ett genombrott för MÖ-systemutvecklingen genom att undanröja "flaskhalsen" med tidskrävande och kostsam manuell utvärdering. Utvecklare fick möjlighet att snabbt mäta effekten av förändringar i modellerna och omedelbart gallra bort misslyckade lösningar<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-bleu_dvi-2)</sup>.

BLEU korrelerar väl med mänskliga bedömningar på **hela korpusens nivå**, men är opålitlig för bedömning av enskilda meningar<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-mt_companion-3)</sup>. Metriken användes därför flitigt i standardiserade MÖ-tävlingar (t.ex. NIST och WMT) för jämförelse av system.

## Begränsningar och kritik

Trots sin utbredda användning har BLEU ett antal väsentliga begränsningar:

- **Avsaknad av semantisk bedömning**: BLEU mäter enbart ytlig ordsöverträffning och kan inte bedöma huruvida **innebörden** i källtexten har återgivits korrekt. En översättning kan få högt poäng men vara grammatiskt felaktig eller förvränga betydelsen<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-deep_hub-5)</sup>.
- **Ignorering av synonymer och omformuleringar**: Algoritmen straffar översättningar som använder synonymer eller andra formuleringar än i referensen, även om de är fullt korrekta. Användning av flera referenser mildrar men löser inte detta problem helt.
- **Känslighet för tokenisering**: BLEU-resultat är starkt beroende av hur texten delas upp i tokens. Olika tokeniseringsimplementationer kan leda till olika värden, vilket gör modelljämförelser inkorrekta. För att lösa detta problem föreslogs standarden **SacreBLEU**, som unifierar beräkningen av metriken<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-wiki_bleu-1)</sup>.
- **Svårigheter med vissa språk**: BLEU fungerar dåligt för språk som saknar tydliga ordavgränsare (t.ex. kinesiska eller japanska) utan föregående segmentering.

## Alternativ och moderna metoder

Med tiden föreslogs nya automatiska metriker för att övervinna BLEU:s brister:

- **METEOR**: Tar hänsyn till synonymträffar, stemming och ordföljd.
- **ROUGE**: Används för utvärdering av textsammanfattning med fokus på fullständighet (recall) snarare än precision.
- **Inlärbara metriker (Learned Metrics)**: Moderna metoder som använder maskininlärningsmodeller för att beakta semantisk likhet. Metriker som **BLEURT** och **COMET** visar avsevärt högre korrelation med mänskliga bedömningar än klassisk BLEU<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-bleurt-6)</sup>.

Under 2020-talet förlorade BLEU sin status som ovillkorlig standard och ersattes av mer precisa metoder<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_note-ai_mil_lexicon-7)</sup>. Trots detta förblir det en viktig milstolpe i historien om MÖ-utvärdering och används fortsatt som baslinje vid mätning av framsteg.

## Källor

- Vad är BLEU-utvärdering? — Microsoft Azure-dokumentation

## Noter

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(SV)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
