---
title: "Neural Text Degeneration (HU)"
source: "https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)"
wiki: "systems-analysis.info/int"
article: "Neural_Text_Degeneration_(HU)"
language: "hu"
categories:
  - "Category:Core LLM concepts"
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4876
wiki_created_at: 2026-09-06T23:41:18Z
wiki_modified_at: 2026-09-06T23:41:18Z
downloaded_at: 2026-09-07T23:05:26Z
---

# Neural Text Degeneration (HU)

**Neurális szövegdegeneráció**, más néven **szöveg elfajulása neurális generáció során** (ang. *Neural Text Degeneration*), — a neurális nyelvi modellek szöveggenerálási patológiáinak egy osztálya, amelynek során a kimenet természetellenessé válik: túlzottan ismétlődővé, sablonosá, tartalomszegénnyé, vagy elveszti koherenciáját. A fogalom széles körben elterjedt Ari Holtzman és szerzőtársai *The Curious Case of Neural Text Degeneration* (2019; ICLR 2020) munkája után, amelyben kimutatták, hogy a közvetlen valószínűség-maximalizáláson alapuló dekódolási stratégiák nyílt szöveggenerálási feladatoknál gyakran gyenge minőségű eredményt adnak.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

## Egyszerű magyarázat

**A neurális szövegdegeneráció** azt a jelenséget jelenti, amikor a modell **formálisan folytatja a szöveget**, de ezt a természetes beszéd szempontjából rosszul teszi.

Ez általában így néz ki:

- a modell elkezdi ismételni ugyanazokat a szavakat vagy kifejezéseket;
- a szöveg túlságosan sablonosá és „élettelenné" válik;
- a válasz elveszti szemantikai koherenciáját;
- a folytatásba véletlenszerű vagy szerencsétlen szavak kerülnek.

**Más szóval,** a modell vagy túlságosan *„óvatossá\\* válik, és mindig ugyanazt választja, vagy éppen ellenkezőleg, túl sok szabadságot kap, és gyenge, zajos folytatásokat kezd előállítani. Mindkét esetben a szöveg elveszíti a természetes emberi beszédre való hasonlóságát.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

## A kutatás története

A problémát Holtzman és szerzőtársai 2019-ben részletesen megfogalmazták nyílt szöveggenerálás kapcsán — elsősorban történetek, szabad folytatások és dialógusválaszok esetén. A szerzők megmutatták, hogy a valószínűség-maximalizálásra orientált dekódolási módszerek, mint a **mohó keresés** (*greedy search*) és a **sugárkeresés** (*beam search*), nyílt feladatoknál gyakran természetellenes, ismétlődő és tartalomszegény sorozatokhoz vezetnek.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Ugyanabban a munkában kimutatták, hogy az ellentétes megközelítés — a **tiszta sztochasztikus mintavételezés** csonkítás nélkül — szintén problematikus, mivel a modell a valószínűségi eloszlás „megbízhatatlan farkából" is választhat tokeneket. Ez rontja a koherenciát és növeli a véletlenszerű, rosszul illeszkedő folytatások kockázatát.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Későbbi munkák pontosították és kibővítették ezt a magyarázatot. Különösen Finlayson és szerzőtársai javasoltak elméleti értelmezést arra vonatkozóan, hogy a csonkítási módszerek (pl. Top-p) miért segítenek csökkenteni a szövegdegenerációt: a farok csonkítása lehetővé teszi az olyan tokenek elkerülését, amelyekre a modell különösen megbízhatatlan.<sup>[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

Meister és szerzőtársai a degeneráció problémáját emellett a lokális tipikusság megsértésével hozták összefüggésbe: az emberi szöveg általában igyekszik a várható feltételes entrópiához közeli információtartalmat fenntartani, nem csupán maximalizálni a következő token valószínűségét.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

## Fő megnyilvánulások

A neurális szövegdegeneráció nemcsak nyilvánvaló ismétlések formájában nyilvánulhat meg, hanem rejtettebb formákban is: a szemantikai elszegényedéstől a koherencia fokozatos bomlásáig. Ilyen szövegek kifelé gyakran nyelvtanilag helyesek maradnak, azonban észrevehetően eltérnek a természetes emberi beszédtől változatosságban, informatívságban és a gondolatmenet fejlődésének stabilitásában.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

### Ismétlések és hurokba kerülés

A legismertebb forma — **tokenek, kifejezések vagy egész szintaktikai szerkezetek ismétlése**. A szöveg „körbe-körbe jár", szinte azonos folytatásokat adva újra és újra.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Az ilyen elfajulás különböző szinteken nyilvánulhat meg:

- egyedi szavak ismétléseként;
- ugyanazon kifejezés kényszeres újratermelésként;
- ugyanahhoz a gondolathoz való ciklikus visszatérésként;
- ugyanazon szintaktikai séma minimális változtatásokkal történő többszöri másolásaként.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Különösen jellemző, hogy az ismétlések gyakran **önfenntartókká** válnak: az egyszer létrejött szerkezet erősíteni kezdi önmagát, mivel a modell továbbra is a már generált fragmentumra támaszkodik, és azt kissé módosított formában újra reprodukálja. Ennek eredményeként a szöveg látszólag előre haladhat, de valójában tartalmilag fejlődni megszűnik.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

### Sablonosság és a tartalom elszegényedése

Még ha nincsenek is nyilvánvaló hurkok, a modell túlságosan kiszámítható és tartalomszegény szöveget produkálhat. Az ilyen kimenet nyelvtanilag helyes marad, de közhelyessé, egyhangúvá és információban szegénnyé válik.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

A degeneráció e formájában a szöveg „helyesnek" tűnik, de túlzottan biztonságos és átlagos benyomást kelt. A modell a leginkább várt szavakat és fordulatokat részesíti előnyben, aminek következtében:

- csökken a szókincsbeli változatosság;
- ugyanazok a nyelvi sablonok ismétlődnek sűrűbben;
- eltűnnek a kevésbé nyilvánvaló, de tartalmasabb megfogalmazások;
- a szöveg formájában simábbá, de jelentésében szegényebbé válik.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

Éppen ezért a degeneráció nem mindig nyilvánvaló hibának tűnik: néha **túlságosan kiszámítható, „egyenletes" és üres szövegként** nyilvánul meg, amely formálisan helyesen íródott, de alig ad új információt.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

### Koherenciavesztés

Túlzott véletlenszerűség vagy az eloszlás farkának gyenge kontrollja esetén a generálás megőrizheti a lokális nyelvtani helyességet, de elveszítheti az általános szemantikai összefüggést: nem illő szavak, váratlan témaváltások és logikai törések kerülhetnek a szövegbe.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Ilyen helyzetben a szomszédos mondatok külön-külön elfogadhatóknak tűnhetnek, azonban közöttük gyengülnek az ok-okozati, tematikai és logikai kapcsolatok. Ez abban nyilvánul meg, hogy:

- a mondat nyelvtanilag helyes, de rosszul kapcsolódik az előzőhöz;
- a gondolat hirtelen irányt vált egyértelmű átmenet nélkül;
- lokálisan elfogadható, de kontextuálisan nem illő folytatások jelennek meg a szövegben;
- az érvelés általános menete lazává és bizonytalanná válik.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Más szóval, a modell megőrizheti az egyes mondatok szintjén a **lokális simaságot**, de elveszítheti az egész bekezdés vagy hosszú válasz szintjén a **globális koherenciát**.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

### Szemantikai sodródás

A degeneráció egy másik formája — a **jelentés fokozatos eltolódása**, amelynek során a szöveg nem omlík össze azonnal, hanem lassan távolodik az eredeti témától, feladattól vagy elbeszélési vonaltól.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

A nyilvánvaló inkoherenciával ellentétben itt a degradáció fokozatosan fejlődik:

- a modell releváns válasszal kezd;
- majd egyre általánosabb vagy lazán kapcsolódó részleteket ad hozzá;
- ezt követően az eredeti téma elmosódik;
- végül a szöveg formálisan folyékony maradhat, de már rosszul felel meg az eredeti kérésre.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Az ilyen sodródás különösen feltűnő hosszú generálás esetén: a modell nem szükségszerűen kerül hurokba, de lépésről lépésre elveszíti a tematikai fegyelmet, és a folytatás megszűnik valóban releváns lenni.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

### Az informatívság csökkenése

A degeneráció nemcsak ismétlésekben fejezhető ki, hanem abban is, hogy a szöveg megszűnik új információt hozzáadni. A modell tovább ír, azonban a kimenet szemantikai „sűrűsége" csökken, és a folytatás tartalmilag üressé válik.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

Az ilyen szövegben a szavak és mondatok továbbra is gyűlnek, de a szemantikai előrehaladás lelassul. Az új mondatok:

- újrafogalmazzák a már elmondottakat;
- minimális mennyiségű új tényt adnak hozzá;
- a konkrétumokat általános szavakra cserélik;
- fenntartják a szöveg terjedelmét a tartalom arányos növekedése nélkül.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

Ez különösen fontos, mivel az ilyen jellegű degradáció kevésbé feltűnőnek tűnhet, mint a nyilvánvaló ismétlések: a szöveg „normálisnak" látszik, de figyelmesebb olvasáskor kiderül, hogy alapvetően ugyanazt a gondolatot ismétli különböző szavakkal.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

### Rejtett degeneráció nyilvánvaló hibák nélkül

Nem minden neurális degeneráció tűnik durva meghibásodásnak. Egyes esetekben a szöveg nem tartalmaz nyilvánvaló hurkokat, éles logikai töréseket vagy szembeötlő „zajt\\, mégis észrevehetően eltér a természetes emberi írástól.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

Ez a rejtett forma az alábbiak kombinációjaként nyilvánul meg:

- túlzott kiszámíthatóság;
- a mondatok egyforma ritmusa;
- biztonságos, de gyenge megfogalmazások;
- a meglepetés, az árnyalatok és a szemantikai mélység hiánya.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

Éppen ezért a neurális szövegdegeneráció nem korlátozódik pusztán a hurokba kerülésre. Tünetek szélesebb spektrumát fogja át — a nyilvánvaló ismétlésektől a finom szemantikai elszegényedésig, amelynek során a szöveg formálisan helyes marad, de elveszíti változatosságát, kifejezőerejét és tartalmi értékét.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

## Okok

### Az edzés és a dekódolás közötti eltérés

A nyelvi modellek általában a következő token valószínűségi eloszlás szerinti előrejelzésére tanulnak. Azonban szöveggenerálásnál a szöveget gyakran nem ebből az eloszlásból mintavételezéssel nyerik ki, hanem olyan eljárásokkal, amelyek minden lépésben vagy az egész sorozaton **szigorúan maximalizálják a valószínűséget**. A tanítási célok és a dekódolási szabályok közötti ez az eltérés az elfajulás egyik kulcsos oka a nyílt feladatoknál.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

### Az eloszlás „megbízhatatlan farka\\

Másrészt a mintavételezés teljes szabadsága szintén káros lehet. Még a nagyon kis valószínűségű tokeneknek is általában nullától eltérő valószínűségük van, és közöttük sok gyenge, zajos vagy rosszul illeszkedő változat található. Ha a modell az ilyen farokból választ tokent, a folytatás minősége drasztikusan romlhat.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

### A lokális tipikusság megsértése

Meister és szerzőtársai a degenerációt azzal hozzák összefüggésbe, hogy a természetes szöveg általában a várható feltételes entrópiához közeli információtartalmat tart fenn. Ha a dekódolás rendszeresen eltávolodik ettől a „tipikusságtól\\, a szöveg vagy túlságosan közhelyessé, vagy túlságosan zajossá válhat.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

## Kapcsolat a dekódolási módszerekkel

A neurális szövegdegeneráció szorosan összefügg nemcsak a nyelvi modell minőségével, hanem azzal is, **hogyan pontosan** választják ki a következő tokent a valószínűségi eloszlásból. Ugyanaz a valószínűségi készlet észrevehetően eltérő eredményt adhat a dekódolási stratégiától függően: egyes módszerek fokozzák az ismétléseket és a sablonosságot, mások növelik a változatosságot, de kockáztatják a koherencia elvesztését, megint mások a két szélsőség közötti kompromisszumot próbálják megőrizni.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

### Mohó keresés és beam search

A mohó keresés és a sugárkeresés különösen hajlamos az ismétlésekre és a sablonosságra nyílt generálási feladatokban, mivel szisztematikusan a legvalószínűbb folytatásokat részesíti előnyben.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

A **mohó keresés** esetén a modell minden lépésben a legtöbb valószínűségű egyetlen tokent választja. Ez a megközelítés jól működik ott, ahol a feladatnak viszonylag szűk helyes válaszkészlete van, azonban szabad generálásban a szöveget gyakran túlságosan kiszámíthatóvá teszi. A modell újra és újra a leginkább „biztonságos\\ folytatásokat választja, aminek következtében:

- erősödik a már választott szerkezetek ismétlésére való hajlam;
- csökken a megfogalmazások változatossága;
- a szöveg sablonosabbá és tartalomban szegényebbé válik.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

A **sugárkeresés** (beam search) részben kiszélesíti a keresési teret, mivel egyszerre több legvalószínűbb hipotézist követ. Azonban nyílt szöveges feladatokban ez nem mindig óv meg a degenerációtól. Éppen ellenkezőleg, a valószínűség-maximalizálásra való általános orientáció miatt ez is szisztematikusan előnyben részesíthet túlságosan „helyes\\, de kevéssé természetes folytatásokat, növelve a kockázatát:

- az egyhangúságnak;
- az ismétlődésnek;
- a túlzottan sima, de tartalomszegény szövegnek.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Más szóval azok a módszerek, amelyek túlságosan következetesen a legvalószínűbb folytatást választják, gyakran nyernek a lokális kiszámíthatóságban, de veszítenek a hosszú generálás természetességében.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

### Tiszta mintavételezés

A nem szigorúan korlátozott mintavételezés növeli a változatosságot, de további szűrők nélkül az eloszlás farkából sűrűbben vesz fel gyenge tokeneket, ami ronthatja a szöveg koherenciáját.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

A **tiszta mintavételezés** során a következő tokent véletlenszerűen választják a modell teljes valószínűségi eloszlása szerint. A mohó kereséssel vagy a beam search-csel ellentétben ez a megközelítés több szabadságot ad a modellnek, és segít elkerülni a túl korai „beragadást\\ ugyanabba a sablonba.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Ennek a szabadságnak azonban van egy másik oldala. Még ha sok token valószínűsége nagyon kicsi is, általában nullától eltérő esélyük van arra, hogy kiválasszák őket. Emiatt a modell az eloszlás „farkából\\ vehet fel folytatásokat, ahol sűrűbben fordulnak elő:

- véletlenszerű és kontextuálisan gyenge szavak;
- rosszul illeszkedő folytatások;
- lokálisan elfogadható, de a szöveg általános koherenciáját rontó tokenek.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Ennek eredményeként a tiszta mintavételezés gyakran csökkenti a sablonosságot, de egyúttal kevésbé stabilissá teszi a szöveget: változatos maradhat, de lazábbá, következetlenebbé vagy szemantikailag instabilabbá válik.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

### Az eloszlás csonkítási módszerei

Az eloszlás csonkítási módszerei — mindenekelőtt a Top-p és a Top-k — a degeneráció csökkentésének praktikus módjaként javasoltak. Korlátozzák az elfogadható tokenek halmazát, és ezáltal csökkentik a sikertelen folytatások valószínűségét.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

E módszerek általános logikája abban áll, hogy nem engedik a modellnek, hogy a következő tokent az egész szótárból válassza. Ehelyett csak az eloszlás leghihetőbb részét veszi figyelembe:

- a **Top-k** csak a legtöbb valószínűségű tokenek rögzített számát hagyja meg;
- a **Top-p** az tokenek dinamikus „magját\\ hagyja meg, amelyek összesített valószínűsége elér egy megadott küszöbértéket.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Ez a korlátozás csökkenti annak kockázatát, hogy a modell a megbízhatatlan farokból választ túlságosan gyenge folytatást, de ugyanakkor nem kényszeríti arra, hogy minden alkalommal csak egyetlen „legjobb\\ változatot vegyen. Ennek köszönhetően a csonkítási módszerek gyakran köztes megoldásnak bizonyulnak két szélsőség között:

- a túlságosan merev maximalizálás;
- a túlságosan szabad és zajos mintavételezés között.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Később Finlayson és szerzőtársai szigorúbb elméleti értelmezést javasoltak erre a hatékonyságra. Megmutatják, hogy a truncation-módszerek segítenek eldobni azokat a tokeneket, amelyek nagyobb valószínűséggel megbízhatatlanok a szöveg valódi eloszlásának szempontjából. Ezért a csonkítás nemcsak mérnöki heurisztikai eljárásnak tekinthető, hanem a következő token kiválasztásakor a szisztematikus hibák valószínűségének csökkentési módjaként is.<sup>[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

### Modern stratégiák

A későbbi módszerek, mint a **locally typical sampling**, a degeneratív ismétlések csökkentésére törekednek, miközben megőrzik a generálás minőségét.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup> Hasonlóképpen, a **contrastive search** olyan módszerként javasolták, amely növeli a változatosságot a szöveg koherenciájának feláldozása nélkül.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-contrastive2022-4)</sup>

Ezek a módszerek azt az elképzelést fejlesztik tovább, hogy a probléma nemcsak abban rejlik, **hány** tokent kell megtartani, hanem abban is, hogy **pontosan melyik** tokeneket érdemes jó jelöltnek tekinteni.

A **locally typical sampling** nem csupán a magas valószínűségre, hanem a token információtartalmának a várható feltételes entrópiához való közelségére orientálódik. Ez lehetővé teszi olyan helyzetek csökkentését, amikor a modell:

- túlságosan közhelyes és „üres\\ folytatásokat választ;
- degeneratív ismétlésekbe kerül;
- nyilvánvaló hurkok nélkül is túlságosan kiszámíthatóvá válik.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

A **contrastive search** eltérő logikát alkalmaz: arra törekszik, hogy olyan folytatásokat válasszon, amelyek egyszerre maradnak hihetők, és nem túlságosan hasonlítanak a már generált kontextushoz. Ennek köszönhetően csökken annak valószínűsége, hogy a modell ugyanazokat a szerkezeteket erősítse csak azért, mert lokálisan nagyon valószínűek.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-contrastive2022-4)</sup>

A klasszikus dekódolási stratégiákhoz képest ezek a módszerek nem csupán korlátozni próbálják a választást, hanem magát a kiválasztási kritériumot teszik érzékenyebbé a hosszú generálás minőségére — vagyis arra, hogy a szöveg több mondaton vagy bekezdésen át tartalmas, változatos és koherens marad-e.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-contrastive2022-4)</sup>

### Függőség a dekódolási módtól

A neurális degeneráció és a dekódolás közötti kapcsolat nem vezethető vissza a „jó\\ és „rossz\\ módszerek egyszerű szembeállítására. Ugyanaz az algoritmus eltérően viselkedhet attól függően, hogy milyen szigorúan vagy szabadon korlátozza az eloszlást minden egyes lépésben.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Általánosan három módot lehet megkülönböztetni:

- **túlságosan merev választás** — a modell szinte mindig a legvalószínűbb tokeneket veszi, ami erősíti a sablonosságot és az ismétléseket;
- **túlságosan szabad választás** — a modell túlságosan széleskörű hozzáférést kap a gyenge folytatásokhoz, ami növeli az inkoherencia kockázatát;
- **mérsékelten korlátozott választás** — a modell megőrzi a változatosságot, de az eloszlás elegendően megbízható részén belül marad.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

Éppen ezért a neurális degenerációt gyakran nemcsak a modell minőségének, hanem a **nem megfelelő dekódolási módnak** is következményeként kezelik: túlságosan merevnek, túlságosan engedékenynek, vagy az adott generálási feladathoz rosszul illeszkedőnek.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

**Egyszerűbben szólva,** az elfajulás leggyakrabban két szélsőségen lép fel: amikor a modell vagy túlságosan mereven csak a legvalószínűbb szavakat választja, vagy éppen ellenkezőleg, túl sok szabadságot kap, és véletlenszerű gyenge folytatásokat kezd húzni. A legstabilabb stratégiák általában ezek között a szélső módok között helyezkednek el.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

## Enyhítési módszerek

Bár a neurális szövegdegeneráció teljes kiküszöbölésének nincs univerzális módja, a gyakorlatban számos módszert fejlesztettek ki, amelyek lehetővé teszik legjellemzőbb megnyilvánulásainak — mindenekelőtt az ismétléseknek, a sablonosságnak, a koherenciavesztésnek és az eloszlás „zajos\\ farkának befogásának — jelentős csökkentését. Ezek a módszerek abban különböznek egymástól, **hogyan pontosan** korlátozzák a következő token kiválasztását: egyesek egyszerűen elvágják a gyenge változatokat, mások finomabban veszik figyelembe az eloszlás alakját, megint mások közvetlenül próbálják egyensúlyba hozni a koherenciát és a változatosságot.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shi2024-5)</sup>

### Az eloszlás csonkítása

A neurális degeneráció elleni leggyakoribb módszer — a következő token kiválasztásának korlátozása nem az egész szótárra, hanem csak a leghihetőbb részére. Ezen alapul a Top-p és a Top-k.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

E módszerek alapgondolata abban áll, hogy a modell nem választhat szabadon az összes lehetséges token közül, mivel az eloszlás jelentős része a „megbízhatatlan farokban\\ van, ahol gyenge, zajos vagy rosszul illeszkedő változatok halmozódnak fel. A csonkítás lehetővé teszi a kiválasztási tér **mesterséges szűkítését**, és ezáltal csökkenti annak valószínűségét, hogy a generálás hirtelen inkoherenciába csúszik vagy bomlásnak indul.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

A gyakorlatban két legismertebb sémát alkalmaznak:

- **Top-k** — csak a legtöbb valószínűségű tokenek rögzített számát hagyja meg;
- **Top-p** (*nucleus sampling*) — az tokenek dinamikus „magját\\ hagyja meg, amelyek összesített valószínűsége elér egy megadott $p$ küszöbértéket.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Általános értelmük egy: nem hagyni, hogy a modell túl sok gyenge folytatás közül választhasson. Eközben a Top-p általában rugalmasabbnak tekinthető, mivel az elfogadható halmaz mérete lépésről lépésre változik az eloszlás aktuális alakjától függően.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup>

Finlayson és szerzőtársai szigorúbb értelmezést javasoltak arra vonatkozóan, hogy a truncation-módszerek miért működnek gyakran: a csonkítás segít eldobni azokat a tokeneket, amelyek esetleg nem tartoznak a szöveg „valódi\\ eloszlásának tartományába, vagyis a modell szempontjából különösen megbízhatatlanok. Ezért az ilyen módszerek nemcsak mechanikusan „vágják le a farkat\\, hanem ténylegesen csökkentik a szisztematikus hibák valószínűségét a token kiválasztásának lépésében.<sup>[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

**Egyszerűbben szólva,** az eloszlás csonkítása segít a modellnek abban, hogy ne menjen túl messzire a gyenge és véletlenszerű változatok tartományába. Ennek köszönhetően a szöveg sűrűbben marad koherensebb, természetesebb és kevésbé hajlamos a degenerációra.

### Adaptívabb mintavételezési módszerek

A locally typical sampling, az η-mintavételezés és a rokon megközelítések nem csupán „levágni a farkat\\ próbálják, hanem figyelembe veszik az eloszlás alakját és a generálás jelenlegi lépésének információs szerkezetét.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

Az egyszerű csonkítástól eltérően az ilyen módszerek nem csupán azt igyekeznek figyelembe venni, hogy **mennyire valószínű** a token, hanem azt is, hogy **mennyire tipikus** az adott kontextusban. Ez azért fontos, mert a degeneráció nemcsak a túlságosan gyenge tokenek miatt lép fel, hanem a túlságosan „biztonságos\\ és közhelyes folytatások túlzott preferenciája miatt is.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

Például a **locally typical sampling** a token információtartalmának a várható feltételes entrópiához való közelségére orientálódik. Más szóval nem csupán a legvalószínűbb szavakat igyekszik kiválasztani, hanem azokat, amelyek jobban megfelelnek a kontextus szempontjából az informatívság „normális\\ szintjének. Ez lehetővé teszi a csökkentését:

- a degeneratív ismétléseknek;
- a túlzott sablonosságnak;
- a szöveg szemantikai elszegényedésének az általános koherencia megőrzése mellett.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

Hasonló logikát alkalmaznak más adaptív módszerek is: az egyszerű rögzített elvágás helyett az eloszlás aktuális állapotához alkalmazkodnak. Ennek köszönhetően a modell kevésbé hajlamos két szélsőségbe esni:

- vagy túlságosan kiszámíthatóvá és „lapossá\\ válni;
- vagy túlságosan gyenge és zajos folytatásokat befogni.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)</sup>

Az ilyen módszerek általában nehezebbek értelmezésben és beállításban, mint a Top-k vagy a Top-p, azonban jobban megbirkózhatnak a degeneráció finom formáival, ahol a probléma nem a nyilvánvaló inkoherenciában, hanem az informatívság elvesztésében és a nyelvi sablonok ismétlődésében rejlik.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-meister2023-3)[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shi2024-5)</sup>

**Egyszerűbben szólva,** az adaptívabb módszerek nemcsak a gyenge szavakat igyekeznek eltávolítani, hanem azokat a folytatásokat megtartani, amelyek az aktuális kontextushoz értelemben és „természetességben\\ jobban illenek.

### Contrastive search

A contrastive search és a rokon módszerek egyszerre igyekeznek fenntartani a koherenciát és a változatosságot, csökkentve azokat az ismétléseket, amelyek a strictly maximization-based dekódolásnál gyakran fellépnek.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-contrastive2022-4)</sup>

A contrastive megközelítés lényege abban áll, hogy nem csupán a következő token valószínűségére támaszkodik. Ehelyett a jelölt kiválasztása két követelmény kompromisszumaként épül fel:

- a folytatásnak elégségesen hihetőnek kell lennie;
- a folytatásnak nem szabad túlságosan hasonlítania a már generált kontextushoz, és ezáltal nem erősíthet ismétlést.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-contrastive2022-4)</sup>

Ennek köszönhetően a contrastive search éppen azokat a folytatásokat igyekszik elnyomni, amelyek formálisan nagyon valószínűnek tűnnek, de a gyakorlatban hurokba kerüléshez, sablonossághoz vagy túlzottan egyhangú generáláshoz vezetnek. A tiszta mintavételezéssel ellentétben ez a megközelítés nem a véletlenszerűséget vezeti be a degeneráció elleni küzdelem fő mechanizmusaként, hanem célirányosan igyekszik **elegendően valószínű, de kevésbé degeneratív** folytatásokat kiválasztani.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-contrastive2022-4)</sup>

Az ilyen módszerek azért különösen fontosak, mert a klasszikus maximization-based stratégiák gyakran magas lokális bizonyosságot adnak, de ezért a szöveg természetességével fizetnek. A contrastive search igyekszik megőrizni a determinisztikus választás erős oldalait — a koherenciát és a stabilitást — miközben egyidejűleg csökkenti az ismétléseket és az egyhangúságot.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-contrastive2022-4)</sup>

**Egyszerűbben szólva,** a contrastive search nem csupán azért vesz fel folytatást, mert az a legvalószínűbb. Emellett „bünteti\\ a túlságosan egyhangú változatokat, hogy a szöveg ne kerüljön hurokba és ne váljon túlságosan sablonosává.

### A stratégia illesztése a feladathoz

Későbbi kutatások hangsúlyozzák, hogy nincs univerzális módszer: egy adott dekódolási stratégia hatékonysága a feladat típusától, a modell méretétől, az összehangolástól és más tényezőktől függ. Ami jól működik dialógusgenerálásnál vagy esszéknél, az rosszabbul működhet kódban, matematikában vagy más determinisztikus tartományokban.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shi2024-5)</sup>

Ez azt jelenti, hogy a neurális degeneráció elleni küzdelem nemcsak a „legjobb\\ algoritmus kiválasztása, hanem **a módszer és a feladattípus összevetése** is. Nyílt generálásban (történetek, dialógusok, hosszú válaszok) a mintavételezési módszerek és a rugalmasabb kiválasztási sémák gyakran segítenek megőrizni a változatosságot és a természetességet. Szigorúbb és determinisztikusabb feladatokban — például programozásban, matematikában vagy egyértelmű helyes választ igénylő feladatokban — a túlságosan agresszív sztochasztika éppen ellenkezőleg ronthatja az eredmény minőségét.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shi2024-5)</sup>

Shi és szerzőtársai szintén megmutatják, hogy a végeredményt nemcsak maga a dekódolási stratégia befolyásolja, hanem:

- a modell mérete;
- összehangolásának foka;
- a hiperparaméterekre való érzékenység;
- a telepítési környezet és az inferencia korlátai.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shi2024-5)</sup>

Ebből fontos praktikus következtetés adódik: ugyanaz a módszer erősnek tűnhet az egyik konfigurációban, és észrevehetően gyengébbnek — egy másikban. Ezért a neurális degeneráció enyhítése a gyakorlatban szinte mindig paraméterek hangolását és az adott feladatosztályon való tesztelést igényli, nem pedig egyetlen „univerzális\\ receptre való támaszkodást.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shi2024-5)</sup>

**Egyszerűbben szólva,** a jó dekódolási módszer attól függ, hogy a modell pontosan mit csinál. Szabad szövegnél az egyik módszerek működnek jobban, kódnál, matematikánál és más pontos feladatoknál — mások.

### Módszerek kombinálása

A gyakorlatban az enyhítési módszereket nem ritkán nem izoláltan, hanem egymással kombinálva alkalmazzák. Például az eloszlás csonkítása hőmérséklettel együtt alkalmazható, a bonyolultabb stratégiák pedig kiegészítő token-kiválasztási korlátokkal kombinálhatók.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shi2024-5)</sup>

Az ilyen kombinációk értelme abban áll, hogy felosztják a funkciókat:

- az egyik mechanizmus meghatározza az általános változatossági szintet;
- egy másik korlátozza a „zajos\\ farkat;
- egy harmadik csökkenti az ismétlések vagy a sablonosság kockázatát.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-contrastive2022-4)</sup>

Azonban az egyidejűleg hangolható mechanizmusok számának növelése bonyolultabbá teszi a modell viselkedésének felügyeletét. Ezért a bonyolultabb séma nem mindig jelent jobb minőségű eredményt: a nyereség gyakran attól függ, mennyire jól vannak beállítva a hiperparaméterek, és mennyire felel meg az adott kombináció a feladatnak.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shi2024-5)</sup>

**Más szóval,** a neurális degeneráció enyhítése leggyakrabban nem egyetlen „mágikus\\ módszeren alapul, hanem több korlát gondos kombinációján, amelyek mindegyike a probléma saját részét szünteti meg.

## Nem tévesztendő össze a model collapse-szal

A neurális szövegdegenerációt Holtzman és szerzőtársai értelmében nem szabad összekeverni a **model collapse** jelenséggel — egy külön jelenséggel, amelyet a modellek szintetikus adatokon való rekurzív tanításával kapcsolatos munkák vizsgálnak.

Az első esetben elsősorban a szöveg degenerációjáról van szó **a generálás szakaszán** (inference), amikor a nem megfelelő dekódolási stratégia ismétlésekhez, sablonossághoz vagy koherenciavesztéshez vezet.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)</sup> A másodikban — a modell degradációjáról **a tanítás szakaszán**, amikor a modell által generált adatok elkezdenek „beszennyezni\\ a következő generációs modellek tanítókészletét, ami ritka eseményeket eltűnéséhez és az eloszlás szűküléséhez vezethet.<sup>[\[6\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shumailov2024-6)</sup>

Ezek a jelenségek tematikailag kapcsolódnak egymáshoz, mivel mindkettő a neurális szöveg minőségének romlásával foglalkozik, azonban az irodalomban általában különböző problémákként tárgyalják őket: az egyik a dekódoláshoz, a másik az adatokhoz és a tanításhoz tartozik.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[6\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shumailov2024-6)</sup>

## Jelentősége a nagy nyelvi modellek számára

A nagy nyelvi modellek korszakában a neurális degeneráció problémája nem tűnt el, hanem a kis szöveggenerátorok területéről áthelyeződött a hatalmasabb rendszerek viselkedésének irányítási területére. Bár a modern LLM-ek általában jobban összehangoltak és ritkábban esnek durva ismétlési hurkokba, a dekódolási stratégia megválasztása továbbra is észrevehetően befolyásolja a kimenet természetességét, változatosságát és stabilitását.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-shi2024-5)</sup>

Emiatt a neurális szövegdegenerációt nem a korai nyelvi modellek szűk hibájaként, hanem a praktikus generálás alapvető problémájaként kezelik: a jó valószínűségi modellezés önmagában nem garantál jó szöveget az inferencia szakaszán.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_note-finlayson2024-2)</sup>

## Lásd még

- Top-p mintavételezés
- Top-k mintavételezés
- Hőmérséklet
- Nagy nyelvi modellek

## Irodalom

- Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019; megjelent: ICLR 2020). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751.
- Finlayson, M., Hewitt, J., Koller, A., Swayamdipta, S., & Sabharwal, A. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693.
- Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. TACL 2023.
- Shi, C., Yang, H., Cai, D., Zhang, Z., Wang, Y., Yang, Y., & Lam, W. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. EMNLP 2024.
- Su, Y., Lan, T., Wang, Y., Yogatama, D., Kong, L., & Collier, N. (2022). *A Contrastive Framework for Neural Text Generation*. arXiv:2202.06417.
- Shumailov, I. et al. (2024). *AI models collapse when trained on recursively generated data*. Nature 2024.

## Megjegyzések

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1.00](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-holtzman2019_1-47)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-finlayson2024-2">↑ <sup>[2.00](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-finlayson2024_2-11)</sup> Finlayson, M., Hewitt, J., Koller, A., Swayamdipta, S., & Sabharwal, A. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693. <a href="https://arxiv.org/abs/2310.01693" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-meister2023-3">↑ <sup>[3.00](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-15)</sup> <sup>[3.16](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-16)</sup> <sup>[3.17](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-17)</sup> <sup>[3.18](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-18)</sup> <sup>[3.19](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-meister2023_3-19)</sup> Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. *Transactions of the Association for Computational Linguistics*, 11. <a href="https://aclanthology.org/2023.tacl-1.7/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-contrastive2022-4">↑ <sup>[4.0](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-contrastive2022_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-contrastive2022_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-contrastive2022_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-contrastive2022_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-contrastive2022_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-contrastive2022_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-contrastive2022_4-6)</sup> <sup>[4.7](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-contrastive2022_4-7)</sup> Su, Y., Lan, T., Wang, Y., Yogatama, D., Kong, L., & Collier, N. (2022). *A Contrastive Framework for Neural Text Generation*. arXiv:2202.06417. <a href="https://arxiv.org/abs/2202.06417" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-shi2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shi2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shi2024_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shi2024_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shi2024_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shi2024_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shi2024_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shi2024_5-6)</sup> <sup>[5.7](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shi2024_5-7)</sup> <sup>[5.8](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shi2024_5-8)</sup> Shi, C., Yang, H., Cai, D., Zhang, Z., Wang, Y., Yang, Y., & Lam, W. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. EMNLP 2024. <a href="https://aclanthology.org/2024.emnlp-main.489/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-shumailov2024-6">↑ <sup>[6.0](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shumailov2024_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Neural_Text_Degeneration_(HU)#cite_ref-shumailov2024_6-1)</sup> Shumailov, I. et al. (2024). *AI models collapse when trained on recursively generated data*. *Nature*. <a href="https://pmc.ncbi.nlm.nih.gov/articles/PMC11269175/" class="external autonumber" rel="nofollow">[6]</a></span>
