---
title: "BERTScore (metric) (NL)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(NL)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(NL)"
language: "nl"
categories:
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 554
wiki_created_at: 2026-09-06T22:35:31Z
wiki_modified_at: 2026-09-06T22:35:31Z
downloaded_at: 2026-09-07T22:40:57Z
---

# BERTScore (metric) (NL)

**BERTScore** — dit is een automatische metriek voor het beoordelen van de kwaliteit van gegenereerde tekst, gebaseerd op het meten van semantische gelijkenis met behulp van contextuele embeddings uit voorgetrainde taalmodellen zoals BERT. De metriek werd in 2019 voorgesteld door een groep onderzoekers onder leiding van **Tianyi Zhang** in het artikel «BERTScore: Evaluating Text Generation with BERT»<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-bertscore_paper-1)</sup>.

In tegenstelling tot traditionele metrieken zoals BLEU en ROUGE, die gebaseerd zijn op exacte n-gram-overeenkomsten, stelt BERTScore in staat om betekenisequivalentie te detecteren zelfs wanneer de bewoordingen verschillen, doordat het rekening houdt met synoniemen en parafrasen<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-analytics_vidhya-2)</sup>.

## Berekeningsmethode

De BERTScore-methode bestaat uit een aantal stappen:

1.  **Verkrijgen van contextuele embeddings**: Beide teksten (de referentietekst en de gegenereerde tekst) worden opgesplitst in tokens en door een voorgetraind transformer-model (bijvoorbeeld BERT of RoBERTa) geleid. Voor elke token wordt de contextuele vectorrepresentatie (embedding) geëxtraheerd.
2.  **Berekening van de cosinus-gelijkenis**: Voor alle tokenparen uit de twee teksten wordt de cosinus-gelijkenis berekend, waarna een token-gelijkheidsmatrix wordt opgesteld<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-bertscore_explained-3)</sup>.
3.  **Berekening van precisie, recall en F1-maat**: Op basis van de gelijkheidsmatrix wordt voor elke token in de gegenereerde tekst de meest gelijkende token in de referentietekst gevonden, waarmee de **precisie** (*precision*) wordt berekend. Op vergelijkbare wijze wordt voor elke token van de referentie de dichtstbijzijnde token in de gegenereerde tekst gevonden, wat de **recall** oplevert. De uiteindelijke BERTScore-waarde is de gebalanceerde F₁-maat, die precisie en recall combineert:

<!-- -->

       RBERT=1|x|∑xi∈xmaxyj∈yxiTyj(Recall)
       PBERT=1|y|∑yj∈ymaxxi∈xxiTyj(Precision)
       FBERT=2PBERT⋅RBERTPBERT+RBERT

De metriek is flexibel: men kan verschillende voorgetrainde modellen kiezen, tokens wegen naar hun belang (met behulp van IDF-gewichten) en scores lineair transformeren voor een betere interpreteerbaarheid<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-bertscore_explained-3)</sup>.

## Toepassing en effectiviteit

BERTScore wordt toegepast voor kwaliteitsbeoordeling bij diverse tekst-generatietaken:

- **Machinaal vertalen**: Detecteert het behoud van betekenis, ook als de vertaalconstructies afwijken van de referentie.
- **Automatisch samenvatten**: In staat te bepalen dat verschillende formuleringen dezelfde kernfeiten kunnen overbrengen, waardoor het flexibeler is dan ROUGE.
- **Dialoogsystemen**: Helpt de relevantie van een antwoord te meten door het op betekenisniveau te vergelijken met een referentieantwoord.

Een grootschalige evaluatie door de auteurs toonde aan dat de correlatiecoëfficiënt van BERTScore met menselijke beoordelingen **aanzienlijk hoger** is dan die van metrieken als BLEU en ROUGE. Bovendien vertoonde de metriek een verhoogde robuustheid bij complexe parafraseringsgevallen<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-bertscore_paper-1)</sup>.

## Voordelen

- **Semantisch bewustzijn**: Vergelijkt teksten op betekenisniveau, rekening houdend met synoniemen en parafrasen.
- **Hoge correlatie met menselijk oordeel**: BERTScore-beoordelingen komen beter overeen met menselijke kwaliteitsoordelen over tekst dan traditionele metrieken.
- **Universaliteit en overdraagbaarheid**: De metriek is niet gebonden aan een specifieke taal of taak; het volstaat om het juiste voorgetrainde model te kiezen.
- **Geen trainingsnoodzaak**: BERTScore is een **niet-trainbare metriek**, in tegenstelling tot complexere metrieken (zoals BLEURT) die vooraf training op beoordelingscorpora vereisen.
- **Integratie van moderne modellen**: Maakt gebruik van de kracht van transformers voor het extraheren van diepe contextuele kenmerken.

## Beperkingen en kritiek

- **Hoge rekenkosten**: Berekening op basis van embeddings vergt aanzienlijk meer middelen dan het tellen van n-grammen en vereist vaak het gebruik van een GPU<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-analytics_vidhya-2)</sup>.
- **Modelafhankelijkheid**: De kwaliteit van de beoordeling hangt direct samen met de kwaliteit van het voorgetrainde model. De keuze van het model en de laag voor het extraheren van embeddings beïnvloedt het resultaat, wat reproduceerbaarheidsproblemen kan veroorzaken<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-theseus_fi-4)</sup>.
- **Geen rekening met feiten en structuur**: BERTScore richt zich op lokale semantische gelijkenis en garandeert geen begrip van tekststructuur of feitelijke nauwkeurigheid. Een tekst met omgezette zinsdelen of feitelijke fouten kan een hoge score behalen<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-bertscore_explained-3)</sup>.
- **Lage interpreteerbaarheid**: In tegenstelling tot BLEU/ROUGE is de BERTScore-waarde minder transparant, wat foutanalyse bemoeilijkt.
- **Sociale vooroordelen (bias)**: De metriek erft stereotypen en vooroordelen die zijn ingebakken in de voorgetrainde modellen. Een onderzoek uit 2022 toonde aan dat op LLM gebaseerde metrieken (inclusief BERTScore) aanzienlijk meer sociale bias vertonen dan traditionele metrieken<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-bertscore_unfair-5)</sup>.

## Betekenis en rol bij evaluatie

BERTScore vertegenwoordigt een belangrijke stap in de ontwikkeling van evaluatiemethoden voor gegenereerde tekst, omdat het in staat is betekenisequivalentie in aanmerking te nemen in plaats van uitsluitend lexicale overeenkomsten. Hoewel geen enkele automatische metriek de tekstkwaliteit perfect kan meten, heeft BERTScore zich bewezen als een betrouwbaar instrument dat klassieke benaderingen (zoals BLEU en ROUGE) aanvult in plaats van ze volledig te vervangen.

In de praktijk wordt BERTScore vaak gebruikt in combinatie met handmatige beoordeling door experts en andere metrieken, om een volledigere en diepgaandere indruk te krijgen van hoe succesvol modellen samenhangende en betekenisgetrouwe teksten genereren<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_note-analytics_vidhya-2)</sup>.

## Verwijzingen

- Officiële BERTScore-repository op GitHub

## Noten

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(NL)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
