---
title: "BERTScore (metric) (HU)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(HU)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 550
wiki_created_at: 2026-09-06T22:35:27Z
wiki_modified_at: 2026-09-06T22:35:27Z
downloaded_at: 2026-09-07T22:40:56Z
---

# BERTScore (metric) (HU)

**BERTScore** — egy automatikus metrika a generált szöveg minőségének értékelésére, amely szemantikai hasonlóságot mér előre betanított nyelvi modellek, például a BERT kontextuális embedding-jei segítségével. A metrikát 2019-ben javasolta **Tianyi Zhang** vezette kutatócsoport a „BERTScore: Evaluating Text Generation with BERT" című munkában<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-bertscore_paper-1)</sup>.

A hagyományos metrikákkal – például a BLEU-val és a ROUGE-zsal – ellentétben, amelyek az n-gramok pontos egyezésén alapulnak, a BERTScore képes felismerni a jelentésbeli egyenértékűséget akkor is, ha a szavak és a megfogalmazások eltérnek egymástól, figyelembe véve a szinonimákat és a parafrázisokat<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-analytics_vidhya-2)</sup>.

## Számítási módszertan

A BERTScore módszer több lépésből áll:

1.  **Kontextuális embedding-ek kinyerése**: Mindkét szöveget (a referenciát és a generáltat) tokenekre bontják, majd átvezetik egy előre betanított transformer modellen (például BERT-en vagy RoBERTa-n). Minden tokenhez kinyerik annak kontextuális vektoros reprezentációját (embedding-jét).
2.  **Koszinusz-hasonlóság kiszámítása**: A két szöveg összes tokenpárjára kiszámítják a koszinusz-hasonlóságot, és felépítik a tokenek hasonlósági mátrixát<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-bertscore_explained-3)</sup>.
3.  **Pontosság, fedés és F1-mérték kiszámítása**: A hasonlósági mátrix alapján a generált szöveg minden tokenjéhez megtalálják a referenciaszöveg leghasonlóbb tokenjét, amelyből kiszámítható a **pontosság** (*precision*). Hasonlóképpen, a referencia minden tokenjéhez megtalálják a generált szöveg legközelebbi tokenjét, ami megadja a **fedést** (*recall*). A BERTScore végső értéke a kiegyensúlyozott F₁-mérték, amely ötvözi a pontosságot és a fedést:

<!-- -->

       RextBERT=1|x|∑xi∈xmaxyj∈yxiTyj(extRecall)
       PextBERT=1|y|∑yj∈ymaxxi∈xxiTyj(extPrecision)
       FextBERT=2PextBERT⋅RextBERTPextBERT+RextBERT

A metrika rugalmas: különböző előre betanított modellek választhatók, a tokenek fontosságuk szerint súlyozhatók (IDF-súlyokkal), és az értékek lineárisan transzformálhatók a jobb értelmezhetőség érdekében<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-bertscore_explained-3)</sup>.

## Alkalmazás és hatékonyság

A BERTScore különféle szöveggenerálási feladatok minőségértékelésére alkalmazható:

- **Gépi fordítás**: Rögzíti a jelentésmegőrzést még akkor is, ha a fordítási szerkezetek eltérnek a referenciától.
- **Automatikus összefoglalás**: Képes felismerni, hogy különböző megfogalmazások ugyanazokat a kulcstényeket közvetíthetik, ami rugalmasabbá teszi a ROUGE-nál.
- **Párbeszédes rendszerek**: Segít mérni a válasz relevanciáját azáltal, hogy a referenciával hasonlítja össze szemantikai szinten.

A szerzők által végzett nagyszabású értékelés megmutatta, hogy a BERTScore és az emberi értékelések közötti korrelációs együttható **lényegesen magasabb**, mint a BLEU- és ROUGE-típusú metrikáké. Emellett a metrika fokozott ellenállóképességet mutatott az összetett parafrázisok esetén<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-bertscore_paper-1)</sup>.

## Előnyök

- **Szemantika figyelembevétele**: A szövegeket jelentés szintjén hasonlítja össze, figyelembe véve a szinonimákat és a parafrázisokat.
- **Magas korreláció az emberi értékeléssel**: A BERTScore értékelései jobban összhangban vannak az emberi szövegminőség-ítéletekkel, mint a hagyományos metrikák.
- **Univerzalitás és hordozhatóság**: A metrika nem kötődik meghatározott nyelvhez vagy feladathoz – elegendő a megfelelő előre betanított modellt kiválasztani.
- **Tanítás szükségtelensége**: A BERTScore egy **nem tanítható metrika**, szemben az összetettebb metrikákkal (például a BLEURT-tel), amelyek előzetes betanítást igényelnek értékelési korpuszokon.
- **Modern modellek integrálása**: A transformer-ek erejét használja fel mély kontextuális jellemzők kinyeréséhez.

## Korlátok és kritika

- **Magas számítási igény**: Az embedding-alapú számítás lényegesen több erőforrást igényel, mint az n-gramok megszámlálása, és gyakran GPU használatát teszi szükségessé<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-analytics_vidhya-2)</sup>.
- **Modellfüggőség**: Az értékelés minősége közvetlenül függ az előre betanított modell minőségétől. Az embedding-ek kinyeréséhez választott modell és réteg befolyásolja az eredményt, ami reprodukálhatósági problémákat okozhat<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-theseus_fi-4)</sup>.
- **Tények és struktúra figyelmen kívül hagyása**: A BERTScore a lokális szemantikai hasonlóságra összpontosít, és nem garantálja a szövegszerkezet vagy a ténybeli pontosság megértését. Egy felcserélt mondatokkal vagy ténybeli hibákkal teli szöveg magas pontszámot kaphat<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-bertscore_explained-3)</sup>.
- **Alacsony értelmezhetőség**: A BLEU/ROUGE-zsal ellentétben a BERTScore mutató kevésbé átlátható, ami megnehezíti a hibaelemzést.
- **Társadalmi torzítások (bias)**: A metrika örökli az előre betanított modellekbe ágyazott sztereotípiákat és torzításokat. Egy 2022-es kutatás megmutatta, hogy az LLM-alapú metrikák (köztük a BERTScore) lényegesen nagyobb társadalmi bias-t mutatnak, mint a hagyományos metrikák<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-bertscore_unfair-5)</sup>.

## Jelentőség és szerep az értékelésben

A BERTScore fontos lépést jelent a generált szöveg értékelési módszereinek fejlődésében, mivel lehetővé teszi a szemantikai egyenértékűség figyelembevételét, nem csupán a lexikai egyezések detektálását. Bár egyetlen automatikus metrika sem képes tökéletesen mérni a szöveg minőségét, a BERTScore megbízható eszköznek bizonyult, amely kiegészíti – nem pedig teljes mértékben felváltja – a klasszikus megközelítéseket (mint a BLEU és a ROUGE).

A gyakorlatban a BERTScore-t gyakran alkalmazzák kézi szakértői értékeléssel és más metrikákkal együtt, hogy teljesebb és mélyebb képet kapjanak arról, mennyire sikeresen generálnak a modellek összefüggő és szemantikailag helyes szövegeket<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_note-analytics_vidhya-2)</sup>.

## Hivatkozások

- A BERTScore hivatalos GitHub-repozitóriuma

## Megjegyzések

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(HU)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
