---
title: "Neural Text Degeneration — انحطاط عصبی متن"
source: "https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86"
wiki: "systems-analysis.info/int"
article: "Neural_Text_Degeneration_—_انحطاط_عصبی_متن"
language: "fa"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 4886
wiki_created_at: 2026-09-06T23:41:26Z
wiki_modified_at: 2026-09-06T23:41:26Z
downloaded_at: 2026-09-07T23:05:31Z
---

# Neural Text Degeneration — انحطاط عصبی متن

**انحطاط عصبی متن**، همچنین **انحطاط متن در تولید عصبی** (انگلیسی: *Neural Text Degeneration*)، دسته‌ای از آسیب‌شناسی‌های تولید متن در مدل‌های زبانی عصبی است که در آن خروجی غیرطبیعی می‌شود: بیش از حد تکراری، قالبی، کم‌محتوا یا انسجام خود را از دست می‌دهد. این اصطلاح پس از مقاله آری هولتزمن و همکاران با عنوان *The Curious Case of Neural Text Degeneration* (2019؛ ICLR 2020) گسترش یافت، که در آن نشان داده شد راهبردهای رمزگشایی مبتنی بر بیشینه‌سازی مستقیم احتمال، در وظایف تولید متن آزاد اغلب نتایج نامطلوبی به بار می‌آورند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

## توضیح ساده

**انحطاط عصبی متن** وضعیتی است که در آن مدل **به صورت ظاهری متن را ادامه می‌دهد**، اما این کار را از منظر گفتار طبیعی به شیوه‌ای نادرست انجام می‌دهد.

معمولاً این پدیده به شکل زیر بروز می‌کند:

- مدل شروع به تکرار کلمات یا عبارات یکسان می‌کند؛
- متن بیش از حد قالبی و «بی‌جان» می‌شود؛
- پاسخ انسجام معنایی خود را از دست می‌دهد؛
- کلمات تصادفی یا نامناسب در ادامه متن ظاهر می‌شوند.

**به عبارت دیگر،** مدل یا بیش از حد *«محتاط»* می‌شود و همواره یک گزینه را انتخاب می‌کند، یا برعکس، آزادی بیش از حد می‌یابد و شروع به کشیدن ادامه‌های ضعیف و پر از نویز می‌کند. در هر دو حالت، متن دیگر شبیه گفتار طبیعی انسانی نیست.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

## تاریخچه مطالعه

این مسئله به تفصیل توسط هولتزمن و همکاران در سال 2019 بر اساس تولید متن آزاد — به‌ویژه داستان‌ها، ادامه‌های آزاد و پاسخ‌های مکالماتی — صورت‌بندی شد. نویسندگان نشان دادند که روش‌های رمزگشایی مبتنی بر بیشینه‌سازی احتمال، مانند **جستجوی حریصانه** (*greedy search*) و **جستجوی پرتویی** (*beam search*)، در وظایف آزاد اغلب به دنباله‌هایی غیرطبیعی، تکراری و کم‌محتوا منجر می‌شوند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

در همان مقاله نشان داده شد که رویکرد مخالف — **نمونه‌برداری تصادفی خالص** بدون کوتاه‌سازی — نیز مشکل‌دار است، زیرا مدل ممکن است token‌ها را از «دنباله غیرقابل اعتماد» توزیع احتمال انتخاب کند. این امر انسجام را کاهش می‌دهد و خطر ادامه‌های تصادفی و ناهماهنگ را افزایش می‌دهد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

مطالعات بعدی این توضیح را دقیق‌تر و گسترش دادند. به‌ویژه، Finlayson و همکاران تفسیر نظری‌ای ارائه دادند که چرا روش‌های کوتاه‌سازی (مانند Top-p) اغلب به کاهش انحطاط متن کمک می‌کنند: کوتاه کردن دنباله اجازه می‌دهد از token‌هایی که مدل برای آن‌ها به‌ویژه غیرقابل اعتماد است پرهیز شود.<sup>[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

Meister و همکاران همچنین مسئله انحطاط را به نقض ویژگی محلی مرتبط دانستند: متن انسانی معمولاً تلاش می‌کند محتوای اطلاعاتی نزدیک به آنتروپی شرطی مورد انتظار را حفظ کند، نه اینکه صرفاً احتمال هر token بعدی را بیشینه کند.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

## تجلیات اصلی

انحطاط عصبی متن ممکن است نه تنها به شکل تکرارهای آشکار، بلکه در اشکال پنهان‌تری نیز ظاهر شود: از فقر معنایی تا فروپاشی تدریجی انسجام. از نظر ظاهری، چنین متن‌هایی اغلب از نظر دستوری صحیح باقی می‌مانند، اما از نظر تنوع، اطلاع‌رسانی و پایداری توسعه اندیشه به‌طور قابل توجهی با گفتار طبیعی انسانی تفاوت دارند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

### تکرار و حلقه‌زدن

شناخته‌شده‌ترین شکل — **تکرار token‌ها، عبارات یا ساختارهای نحوی کامل** است. متن شروع به «چرخیدن در دایره» می‌کند و ادامه‌های تقریباً یکسان را بارها اضافه می‌کند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

چنین انحطاطی می‌تواند در سطوح مختلف بروز کند:

- به صورت تکرار کلمات منفرد؛
- به صورت بازتولید وسواس‌گونه یک عبارت؛
- به صورت بازگشت چرخه‌ای به یک اندیشه؛
- به صورت کپی‌برداری مکرر از یک طرح نحوی با تغییرات جزئی.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

به‌ویژه مشخصه است که تکرارها اغلب **خودپایدار** می‌شوند: ساختاری که یک‌بار ظاهر می‌شود شروع به تقویت خود می‌کند، زیرا مدل به بخش از پیش تولیدشده متکی می‌شود و آن را با تغییراتی جزئی دوباره بازتولید می‌کند. در نتیجه، متن ممکن است ظاهر پیشرفت داشته باشد، اما در واقع از نظر محتوایی توسعه نمی‌یابد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

### قالبی بودن و فقر محتوا

حتی اگر چرخه‌های آشکاری وجود نداشته باشد، مدل ممکن است متنی بیش از حد قابل پیش‌بینی و کم‌محتوا تولید کند. چنین خروجی‌ای از نظر دستوری صحیح است، اما بی‌ارزش، یکنواخت و از نظر محتوای اطلاعاتی فقیر می‌شود.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

در این شکل از انحطاط، متن معمولاً «درست» به نظر می‌رسد، اما تصویر بیش از حد محتاط و میانگین می‌دهد. مدل محتمل‌ترین کلمات و عبارات را ترجیح می‌دهد، به همین دلیل:

- تنوع واژگانی کاهش می‌یابد؛
- الگوهای زبانی یکسان بیشتر تکرار می‌شوند؛
- فرمول‌بندی‌های کمتر آشکار اما پرمحتواتر ناپدید می‌شوند؛
- متن از نظر شکل ظاهری صیقلی‌تر اما از نظر معنا فقیرتر می‌شود.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

از همین رو است که انحطاط همیشه به شکل خطای آشکار ظاهر نمی‌شود: گاهی به صورت **متنی بیش از حد قابل پیش‌بینی، «یکنواخت» و خالی** نمایان می‌شود که از نظر ظاهری درست نوشته شده است، اما تقریباً هیچ اطلاعات جدیدی ارائه نمی‌دهد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

### از دست دادن انسجام

در صورت تصادفی بودن بیش از حد یا کنترل ضعیف بر دنباله توزیع، تولید ممکن است صحت دستوری محلی را حفظ کند اما انسجام معنایی کلی را از دست بدهد: کلمات نامناسب، گذارهای موضوعی غیرمنتظره و شکاف‌های منطقی در متن ظاهر می‌شوند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

در چنین وضعیتی، عبارات مجاور ممکن است به‌تنهایی قابل قبول به نظر برسند، اما روابط علّی، موضوعی و منطقی بین آن‌ها ضعیف می‌شود. این به صورت زیر تجلی می‌یابد:

- جمله از نظر دستوری صحیح است، اما ارتباط ضعیفی با جمله قبلی دارد؛
- اندیشه ناگهان بدون گذار واضح تغییر جهت می‌دهد؛
- ادامه‌هایی در متن ظاهر می‌شوند که از نظر محلی قابل قبول اما از نظر زمینه‌ای نامناسب هستند؛
- جریان کلی استدلال سست و ناپایدار می‌شود.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

به عبارت دیگر، مدل ممکن است **صافی محلی** را در سطح عبارات فردی حفظ کند، اما **انسجام جهانی** را در سطح کل پاراگراف یا پاسخ طولانی از دست بدهد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

### رانش معنایی

شکل دیگری از انحطاط — **انحراف تدریجی معنا** است که در آن متن یکباره فرونمی‌پاشد، بلکه به آرامی از موضوع، وظیفه یا خط روایی اصلی دور می‌شود.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

برخلاف بی‌انسجامی آشکار، در اینجا تدهور به تدریج رخ می‌دهد:

- مدل با پاسخی مرتبط آغاز می‌کند؛
- سپس جزئیات کلی‌تر یا ضعیف‌تری اضافه می‌کند؛
- پس از آن، موضوع اصلی مبهم می‌شود؛
- در پایان، متن ممکن است از نظر ظاهری روان بماند اما به درخواست اولیه پاسخ ضعیفی دهد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

چنین رانشی به‌ویژه در تولید طولانی مشهود است: مدل لزوماً به حلقه نمی‌افتد، اما گام به گام انضباط موضوعی را از دست می‌دهد و ادامه دیگر واقعاً مرتبط نمی‌ماند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

### کاهش اطلاع‌رسانی

انحطاط می‌تواند نه تنها در قالب تکرار، بلکه به این شکل نیز بروز کند که متن دیگر اطلاعات جدیدی اضافه نمی‌کند. مدل به نوشتن ادامه می‌دهد، اما «تراکم» معنایی خروجی کاهش می‌یابد و ادامه از نظر محتوا خالی می‌شود.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

در چنین متنی، کلمات و جملات انباشته می‌شوند، اما پیشرفت معنایی کند می‌شود. عبارات جدید:

- آنچه قبلاً گفته شده را بازصورت‌بندی می‌کنند؛
- حداقل تعداد حقایق جدید اضافه می‌کنند؛
- مشخصات را با کلمات کلی جایگزین می‌کنند؛
- حجم متن را بدون رشد مقایسه‌پذیر محتوا حفظ می‌کنند.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

این به‌ویژه مهم است، زیرا چنین تدهوری ممکن است کمتر از تکرارهای آشکار به چشم بیاید: متن «طبیعی» به نظر می‌رسد، اما با خواندن دقیق مشخص می‌شود که اساساً یک اندیشه را با کلمات مختلف تکرار می‌کند.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

### انحطاط پنهان بدون خرابی آشکار

همه انحطاط‌های عصبی به شکل خرابی آشکار نیستند. در برخی موارد، متن حاوی چرخه‌های آشکار، شکاف‌های منطقی تند یا «نویز» واضح نیست، اما همچنان به‌طور قابل توجهی از نوشتار طبیعی انسانی منحرف می‌شود.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

این شکل پنهان به صورت ترکیبی از موارد زیر ظاهر می‌شود:

- قابل پیش‌بینی بودن بیش از حد؛
- ریتم یکنواخت عبارات؛
- فرمول‌بندی‌های محتاط اما ضعیف؛
- فقدان غافلگیری، ظرافت و عمق معنایی.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

از همین رو است که انحطاط عصبی متن تنها به حلقه‌زدن خلاصه نمی‌شود. این پدیده طیف گسترده‌تری از علائم را در بر می‌گیرد — از تکرارهای آشکار تا فقر معنایی ظریف که در آن متن از نظر ظاهری درست می‌ماند، اما تنوع، بیانگری و ارزش محتوایی خود را از دست می‌دهد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

## علل

### عدم تطابق بین آموزش و رمزگشایی

مدل‌های زبانی معمولاً برای پیش‌بینی token بعدی با توزیع احتمال آموزش می‌بینند. اما در هنگام تولید، متن اغلب نه به‌عنوان نمونه‌برداری از این توزیع، بلکه با روش‌هایی استخراج می‌شود که **احتمال را در هر گام یا در کل دنباله به‌طور سخت‌گیرانه بیشینه می‌کنند**. این تفاوت بین اهداف آموزش و قوانین رمزگشایی یکی از دلایل اصلی انحطاط در وظایف آزاد است.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

### «دنباله غیرقابل اعتماد» توزیع

از سوی دیگر، آزادی کامل نمونه‌برداری نیز می‌تواند مضر باشد. حتی token‌های بسیار کم‌احتمال معمولاً احتمال غیرصفر دارند، و در میان آن‌ها گزینه‌های ضعیف، پر از نویز یا ناهماهنگ زیادی وجود دارد. اگر مدل token‌ای را از چنین دنباله‌ای انتخاب کند، کیفیت ادامه ممکن است به شدت کاهش یابد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

### نقض ویژگی محلی

Meister و همکاران انحطاط را با این موضوع مرتبط می‌دانند که متن طبیعی معمولاً محتوای اطلاعاتی نزدیک به آنتروپی شرطی مورد انتظار را حفظ می‌کند. وقتی رمزگشایی به‌طور منظم از این «ویژگی» فاصله می‌گیرد، متن ممکن است یا بیش از حد بی‌ارزش، یا بیش از حد پر از نویز شود.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

## ارتباط با روش‌های رمزگشایی

انحطاط عصبی متن نه تنها با کیفیت خود مدل زبانی، بلکه با این موضوع نیز ارتباط تنگاتنگی دارد که **دقیقاً چگونه** token بعدی از توزیع احتمال آن انتخاب می‌شود. همان مجموعه احتمالات بسته به راهبرد رمزگشایی می‌تواند نتایج کاملاً متفاوتی بدهد: برخی روش‌ها تکرار و قالبی بودن را تقویت می‌کنند، برخی دیگر تنوع را افزایش می‌دهند اما خطر از دست دادن انسجام را دارند، و برخی دیگر تلاش می‌کنند تعادلی بین این دو افراط حفظ کنند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

### جستجوی حریصانه و beam search

جستجوی حریصانه و جستجوی پرتویی به‌ویژه در وظایف تولید آزاد مستعد تکرار و قالبی شدن هستند، زیرا به‌طور منظم محتمل‌ترین ادامه‌ها را ترجیح می‌دهند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

در مورد **جستجوی حریصانه**، مدل در هر گام یک token با بیشترین احتمال انتخاب می‌کند. این رویکرد در جایی که وظیفه مجموعه نسبتاً محدودی از پاسخ‌های صحیح دارد خوب عمل می‌کند، اما در تولید آزاد اغلب متن را بیش از حد قابل پیش‌بینی می‌کند. مدل بارها «ایمن‌ترین» ادامه‌ها را انتخاب می‌کند، به همین دلیل:

- تمایل به تکرار ساختارهای از پیش انتخاب‌شده تقویت می‌شود؛
- تنوع فرمول‌بندی‌ها کاهش می‌یابد؛
- متن قالبی‌تر و از نظر محتوا فقیرتر می‌شود.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

**جستجوی پرتویی** (beam search) فضای جستجو را تا حدی گسترش می‌دهد، زیرا چندین فرضیه با بیشترین احتمال را همزمان ردیابی می‌کند. اما در وظایف متن آزاد، این همیشه از انحطاط جلوگیری نمی‌کند. برعکس، به دلیل جهت‌گیری کلی به سمت بیشینه‌سازی احتمال، ممکن است به‌طور منظم ادامه‌هایی را ترجیح دهد که بیش از حد «درست» اما کم طبیعی هستند، که خطر موارد زیر را افزایش می‌دهد:

- یکنواختی؛
- تکرارپذیری؛
- متن بیش از حد روان اما کم‌محتوا.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

به عبارت دیگر، روش‌هایی که محتمل‌ترین ادامه را بیش از حد پیوسته انتخاب می‌کنند، اغلب در قابل پیش‌بینی بودن محلی برنده می‌شوند، اما در طبیعی بودن تولید طولانی بازنده هستند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

### نمونه‌برداری خالص

نمونه‌برداری بدون محدودیت سخت‌گیرانه تنوع را افزایش می‌دهد، اما بدون فیلترهای اضافی بیشتر token‌های ضعیف را از دنباله توزیع می‌گیرد، که ممکن است انسجام متن را کاهش دهد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

در **نمونه‌برداری خالص**، token بعدی به‌صورت تصادفی و بر اساس توزیع احتمال کامل مدل انتخاب می‌شود. برخلاف جستجوی حریصانه یا beam search، این رویکرد به مدل آزادی بیشتری می‌دهد و به اجتناب از «گیر کردن» زودهنگام در یک الگو کمک می‌کند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

اما این آزادی روی دیگری هم دارد. حتی اگر احتمال بسیاری از token‌ها بسیار کم باشد، معمولاً همچنان شانس غیرصفری برای انتخاب شدن دارند. به همین دلیل، مدل ممکن است ادامه‌هایی از «دنباله» توزیع را بگیرد، که در آن بیشتر یافت می‌شوند:

- کلمات تصادفی و از نظر زمینه‌ای ضعیف؛
- ادامه‌های ناهماهنگ؛
- token‌هایی که از نظر محلی قابل قبول اما انسجام کلی متن را کاهش می‌دهند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

در نتیجه، نمونه‌برداری خالص اغلب قالبی بودن را کاهش می‌دهد، اما همزمان متن را کمتر پایدار می‌کند: ممکن است متنوع بماند، اما سست‌تر، ناپیوسته‌تر یا از نظر معنایی ناپایدارتر می‌شود.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

### روش‌های کوتاه‌سازی توزیع

روش‌های کوتاه‌سازی توزیع — به‌ویژه Top-p و Top-k — به‌عنوان راهی عملی برای کاهش انحطاط پیشنهاد شدند. این روش‌ها مجموعه token‌های قابل قبول را محدود می‌کنند و بدین ترتیب احتمال ادامه‌های ناموفق را کاهش می‌دهند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

منطق کلی این روش‌ها این است که به مدل اجازه داده نشود token بعدی را از کل واژگان انتخاب کند. در عوض، تنها قابل اعتمادترین بخش توزیع در نظر گرفته می‌شود:

- **Top-k** تعداد ثابتی از محتمل‌ترین token‌ها را نگه می‌دارد؛
- **Top-p** «هسته» پویایی از token‌ها را نگه می‌دارد که احتمال تجمعی آن‌ها به آستانه مشخصی می‌رسد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

چنین محدودیتی خطر انتخاب ادامه‌ای بیش از حد ضعیف از دنباله غیرقابل اعتماد را کاهش می‌دهد، اما مدل را مجبور نمی‌کند هر بار تنها یک گزینه «بهترین» را انتخاب کند. به این دلیل، روش‌های کوتاه‌سازی اغلب راه‌حل میانه‌ای بین دو افراط هستند:

- بیشینه‌سازی بیش از حد سخت‌گیرانه؛
- نمونه‌برداری بیش از حد آزاد و پر از نویز.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

بعداً Finlayson و همکاران تفسیر نظری دقیق‌تری از این اثربخشی ارائه دادند. آن‌ها نشان می‌دهند که روش‌های truncation به کنار گذاشتن token‌هایی کمک می‌کنند که با احتمال بیشتری از منظر توزیع واقعی متن غیرقابل اعتماد هستند. بنابراین کوتاه‌سازی را می‌توان نه تنها به‌عنوان یک تکنیک مهندسی ابتکاری، بلکه به‌عنوان روشی برای کاهش احتمال خطاهای منظم در هنگام انتخاب token بعدی در نظر گرفت.<sup>[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

### راهبردهای مدرن

روش‌های بعدی، مانند **locally typical sampling**، تلاش می‌کنند تکرارهای مخرب را کاهش دهند و در عین حال کیفیت تولید را حفظ کنند.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup> به همین ترتیب، **contrastive search** به‌عنوان راهی برای افزایش تنوع بدون فدا کردن انسجام متن پیشنهاد شد.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-contrastive2022-4)</sup>

این روش‌ها ایده‌ای را توسعه می‌دهند که مسئله نه تنها در این است که **چند** token نگه داشته شود، بلکه در این است که **کدام** token‌ها باید کاندیداهای خوب محسوب شوند.

**Locally typical sampling** نه فقط بر احتمال بالا، بلکه بر نزدیکی محتوای اطلاعاتی token به آنتروپی شرطی مورد انتظار تمرکز می‌کند. این امر کاهش وضعیت‌هایی را ممکن می‌سازد که در آن مدل:

- ادامه‌های بیش از حد بی‌ارزش و «خالی» انتخاب می‌کند؛
- در تکرارهای مخرب گیر می‌کند؛
- حتی بدون چرخه‌های آشکار بیش از حد قابل پیش‌بینی می‌شود.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

**Contrastive search** از منطق متفاوتی استفاده می‌کند: تلاش می‌کند ادامه‌هایی را انتخاب کند که همزمان قابل قبول باقی بمانند و بیش از حد شبیه زمینه از پیش تولیدشده نباشند. به این دلیل، احتمال کاهش می‌یابد که مدل همان ساختارها را تقویت کند صرفاً به این دلیل که از نظر محلی بسیار محتمل هستند.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-contrastive2022-4)</sup>

در مقایسه با راهبردهای decoding کلاسیک، این روش‌ها سعی نمی‌کنند صرفاً انتخاب را محدود کنند، بلکه خود معیار انتخاب را به کیفیت تولید طولانی حساس‌تر می‌کنند — یعنی به اینکه آیا متن در طول چند جمله یا پاراگراف محتوادار، متنوع و منسجم باقی خواهد ماند.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-contrastive2022-4)</sup>

### وابستگی به حالت رمزگشایی

ارتباط بین انحطاط عصبی و رمزگشایی به مقابله «روش‌های خوب» و «روش‌های بد» خلاصه نمی‌شود. همان الگوریتم ممکن است بسته به اینکه چقدر سخت‌گیرانه یا آزادانه توزیع را در هر گام محدود می‌کند، رفتارهای متفاوتی داشته باشد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

به‌طور کلی می‌توان سه حالت تشخیص داد:

- **انتخاب بیش از حد سخت‌گیرانه** — مدل تقریباً همیشه محتمل‌ترین token‌ها را می‌گیرد، که قالبی بودن و تکرار را تقویت می‌کند؛
- **انتخاب بیش از حد آزاد** — مدل دسترسی بیش از حد گسترده به ادامه‌های ضعیف دارد، که خطر بی‌انسجامی را افزایش می‌دهد؛
- **انتخاب با محدودیت معتدل** — مدل تنوع را حفظ می‌کند، اما در محدوده قابل اعتماد توزیع باقی می‌ماند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

از همین روست که انحطاط عصبی اغلب نه تنها به‌عنوان پیامد کیفیت خود مدل، بلکه به‌عنوان پیامد **حالت رمزگشایی نامناسب** در نظر گرفته می‌شود: بیش از حد سخت‌گیرانه، بیش از حد آزاد، یا به خوبی با وظیفه تولید خاص هماهنگ نشده.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

**به بیانی ساده‌تر،** انحطاط بیشتر در دو افراط رخ می‌دهد: وقتی مدل یا بیش از حد سخت‌گیرانه تنها محتمل‌ترین کلمات را انتخاب می‌کند، یا برعکس، آزادی بیش از حد می‌یابد و شروع به کشیدن ادامه‌های تصادفی ضعیف می‌کند. پایدارترین راهبردها معمولاً بین این دو حالت افراطی قرار دارند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

## روش‌های کاهش

اگرچه روشی جهانی برای حذف کامل انحطاط عصبی متن وجود ندارد، در عمل تعدادی از روش‌ها توسعه یافته‌اند که به کاهش قابل توجه شایع‌ترین تجلیات آن — به‌ویژه تکرارها، قالبی بودن، از دست دادن انسجام و گرفتن «دنباله پر از نویز» توزیع — کمک می‌کنند. این روش‌ها از نظر اینکه **دقیقاً چگونه** انتخاب token بعدی را محدود می‌کنند با یکدیگر تفاوت دارند: برخی صرفاً گزینه‌های ضعیف را حذف می‌کنند، برخی دیگر شکل توزیع را ظریف‌تر در نظر می‌گیرند، و برخی دیگر سعی می‌کنند مستقیماً بین انسجام و تنوع تعادل برقرار کنند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shi2024-5)</sup>

### کوتاه‌سازی توزیع

رایج‌ترین روش مبارزه با انحطاط عصبی — محدود کردن انتخاب token بعدی نه به کل واژگان، بلکه تنها به قابل اعتمادترین بخش آن است. Top-p و Top-k بر همین اصل استوار هستند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

ایده اصلی این روش‌ها این است که مدل نباید آزادانه از میان تمام token‌های ممکن انتخاب کند، زیرا بخش قابل توجهی از توزیع در «دنباله غیرقابل اعتماد» است که در آن گزینه‌های ضعیف، پر از نویز یا ناهماهنگ انباشته می‌شوند. کوتاه‌سازی امکان **محدود کردن مصنوعی فضای انتخاب** را فراهم می‌کند و بدین ترتیب احتمال اینکه تولید ناگهان به سمت بی‌انسجامی برود یا شروع به فروپاشی کند را کاهش می‌دهد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

در عمل، دو طرح شناخته‌شده استفاده می‌شود:

- **Top-k** — تنها تعداد ثابتی از محتمل‌ترین token‌ها را نگه می‌دارد؛
- **Top-p** (*nucleus sampling*) — «هسته» پویایی از token‌ها را نگه می‌دارد که احتمال تجمعی آن‌ها به آستانه مشخص $p$ می‌رسد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

مفهوم مشترک آن‌ها یکی است: به مدل اجازه داده نشود از تعداد بیش از حد زیادی از ادامه‌های ضعیف انتخاب کند. در این میان، Top-p معمولاً انعطاف‌پذیرتر در نظر گرفته می‌شود، زیرا اندازه مجموعه قابل قبول از گام به گام بسته به شکل فعلی توزیع تغییر می‌کند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup>

Finlayson و همکاران تفسیر دقیق‌تری از اینکه چرا روش‌های truncation اغلب کار می‌کنند ارائه دادند: کوتاه‌سازی به کنار گذاشتن token‌هایی کمک می‌کند که ممکن است به پشتیبانی توزیع «واقعی» متن تعلق نداشته باشند، یعنی از منظر مدل به‌ویژه غیرقابل اعتماد هستند. بنابراین چنین روش‌هایی نه تنها «دنباله را به‌طور مکانیکی قطع می‌کنند»، بلکه در واقع احتمال خطاهای منظم در مرحله انتخاب token را کاهش می‌دهند.<sup>[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

**به بیانی ساده‌تر،** کوتاه‌سازی توزیع به مدل کمک می‌کند خیلی دور در حوزه گزینه‌های ضعیف و تصادفی نرود. به این دلیل، متن بیشتر اوقات منسجم‌تر، طبیعی‌تر و کمتر مستعد انحطاط می‌ماند.

### روش‌های نمونه‌برداری تطبیقی‌تر

Locally typical sampling، η-سمپلینگ و رویکردهای مرتبط سعی می‌کنند نه فقط «دنباله را قطع کنند»، بلکه شکل توزیع و ساختار اطلاعاتی گام فعلی تولید را در نظر بگیرند.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

برخلاف کوتاه‌سازی ساده، چنین روش‌هایی سعی می‌کنند نه تنها به این توجه کنند که token **چقدر محتمل است**، بلکه به اینکه **چقدر برای زمینه داده‌شده معمول است**. این مهم است، زیرا انحطاط نه تنها از token‌های بیش از حد ضعیف، بلکه از ترجیح بیش از حد ادامه‌های بیش از حد «ایمن» و بی‌ارزش نیز ناشی می‌شود.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

به‌عنوان مثال، **locally typical sampling** بر نزدیکی محتوای اطلاعاتی token به آنتروپی شرطی مورد انتظار تمرکز می‌کند. به عبارت دیگر، سعی می‌کند نه فقط محتمل‌ترین کلمات را انتخاب کند، بلکه آن‌هایی را که بهتر با سطح «عادی» اطلاع‌رسانی برای زمینه داده‌شده مطابقت دارند. این امر کاهش موارد زیر را ممکن می‌سازد:

- تکرارهای مخرب؛
- قالبی بودن بیش از حد؛
- فقر معنایی متن با حفظ انسجام کلی.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

روش‌های تطبیقی دیگر نیز از منطق مشابهی استفاده می‌کنند: به جای قطع ثابت ساده، سعی می‌کنند با وضعیت فعلی توزیع تنظیم شوند. به این دلیل، مدل کمتر مستعد دو افراط است:

- یا بیش از حد قابل پیش‌بینی و «تخت» شدن؛
- یا گرفتن ادامه‌های بیش از حد ضعیف و پر از نویز.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)</sup>

چنین روش‌هایی معمولاً در تفسیر و تنظیم پیچیده‌تر از Top-k یا Top-p هستند، اما ممکن است با اشکال ظریف‌تر انحطاط بهتر کنار بیایند، جایی که مسئله نه در بی‌انسجامی آشکار، بلکه در از دست دادن اطلاع‌رسانی و تکرار الگوهای زبانی است.<sup>[\[3\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-meister2023-3)[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shi2024-5)</sup>

**به بیانی ساده‌تر،** روش‌های تطبیقی‌تر سعی می‌کنند نه فقط کلمات ضعیف را حذف کنند، بلکه ادامه‌هایی را نگه دارند که از نظر معنا و «طبیعی بودن» برای زمینه فعلی بهتر مناسب هستند.

### Contrastive search

Contrastive search و روش‌های مرتبط سعی می‌کنند همزمان انسجام و تنوع را حفظ کنند و تکرارهایی را که اغلب در decoding مبتنی بر بیشینه‌سازی سخت‌گیرانه رخ می‌دهد کاهش دهند.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-contrastive2022-4)</sup>

ایده رویکرد contrastive این است که نه فقط بر احتمال token بعدی تکیه کند. در عوض، انتخاب کاندیدا به‌عنوان مصالحه‌ای بین دو الزام ساخته می‌شود:

- ادامه باید به اندازه کافی قابل قبول باشد؛
- ادامه نباید بیش از حد شبیه زمینه از پیش تولیدشده باشد و بدین ترتیب تکرار را تقویت کند.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-contrastive2022-4)</sup>

به این دلیل، contrastive search سعی می‌کند دقیقاً آن ادامه‌هایی را سرکوب کند که از نظر ظاهری بسیار محتمل به نظر می‌رسند، اما در عمل به حلقه‌زدن، قالبی بودن یا تولید بیش از حد یکنواخت منجر می‌شوند. برخلاف نمونه‌برداری خالص، این رویکرد تصادف را به‌عنوان مکانیزم اصلی مبارزه با انحطاط معرفی نمی‌کند، بلکه سعی می‌کند به‌طور هدفمند **ادامه‌های به اندازه کافی محتمل اما کمتر مخرب** را انتخاب کند.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-contrastive2022-4)</sup>

چنین روش‌هایی به‌ویژه مهم هستند زیرا راهبردهای کلاسیک مبتنی بر بیشینه‌سازی اغلب اطمینان محلی بالایی می‌دهند، اما به قیمت طبیعی بودن متن. Contrastive search سعی می‌کند نقاط قوت انتخاب قطعی — انسجام و پایداری — را حفظ کند و در عین حال تکرارها و یکنواختی را کاهش دهد.<sup>[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-contrastive2022-4)</sup>

**به بیانی ساده‌تر،** contrastive search سعی می‌کند ادامه‌ای را صرفاً به این دلیل که بیشترین احتمال را دارد انتخاب نکند. گزینه‌های بیش از حد یکنواخت را «جریمه» می‌کند تا متن به حلقه نیفتد و بیش از حد قالبی نشود.

### تطبیق راهبرد با وظیفه

تحقیقات بعدی تأکید می‌کنند که روشی جهانی وجود ندارد: اثربخشی یک راهبرد decoding خاص به نوع وظیفه، اندازه مدل، alignment و عوامل دیگر بستگی دارد. آنچه برای تولید مکالماتی یا مقاله‌نویسی خوب کار می‌کند، ممکن است در کد، ریاضیات یا سایر حوزه‌های قطعی کمتر کار کند.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shi2024-5)</sup>

این بدان معناست که مبارزه با انحطاط عصبی — نه فقط انتخاب «بهترین» الگوریتم، بلکه **تطبیق روش با نوع وظیفه** نیز هست. در تولید آزاد (داستان‌ها، مکالمات، پاسخ‌های طولانی)، روش‌های نمونه‌برداری و طرح‌های انتخاب انعطاف‌پذیرتر اغلب به حفظ تنوع و طبیعی بودن کمک می‌کنند. در وظایف سخت‌گیرانه‌تر و قطعی‌تر — به‌عنوان مثال، در برنامه‌نویسی، ریاضیات یا وظایف با پاسخ صحیح یکتا — تصادفی بودن بیش از حد تهاجمی، برعکس، ممکن است کیفیت نتیجه را کاهش دهد.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shi2024-5)</sup>

Shi و همکاران همچنین نشان می‌دهند که نتیجه نهایی نه تنها تحت تأثیر خود راهبرد رمزگشایی، بلکه تحت تأثیر موارد زیر نیز قرار می‌گیرد:

- اندازه مدل؛
- درجه alignment آن؛
- حساسیت به هایپرپارامترها؛
- محیط استقرار و محدودیت‌های inference.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shi2024-5)</sup>

از این امر نتیجه‌گیری عملی مهمی حاصل می‌شود: همان روش می‌تواند در یک پیکربندی قوی به نظر برسد و در پیکربندی دیگری به‌طور قابل توجهی ضعیف‌تر باشد. بنابراین کاهش انحطاط عصبی در عمل تقریباً همیشه نیاز به تنظیم پارامترها و آزمایش روی دسته خاصی از وظایف دارد، نه اتکا به یک «دستورالعمل جهانی».<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shi2024-5)</sup>

**به بیانی ساده‌تر،** روش رمزگشایی خوب به کاری که مدل انجام می‌دهد بستگی دارد. برای متن آزاد، برخی روش‌ها بهتر کار می‌کنند، و برای کد، ریاضیات و سایر وظایف دقیق — روش‌های دیگر.

### ترکیب روش‌ها

در عمل، روش‌های کاهش اغلب نه به‌صورت مجزا، بلکه در ترکیب با یکدیگر استفاده می‌شوند. به‌عنوان مثال، کوتاه‌سازی توزیع ممکن است با دما همراه شود، و راهبردهای پیچیده‌تر ممکن است با محدودیت‌های اضافی بر انتخاب token ترکیب شوند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shi2024-5)</sup>

مفهوم چنین ترکیب‌هایی این است که وظایف را تقسیم کنند:

- یک مکانیزم سطح کلی تنوع را تعیین می‌کند؛
- مکانیزم دیگر «دنباله پر از نویز» را محدود می‌کند؛
- مکانیزم سوم خطر تکرار یا قالبی بودن را کاهش می‌دهد.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[4\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-contrastive2022-4)</sup>

اما افزایش تعداد مکانیزم‌های هم‌زمان قابل تنظیم، کنترل رفتار مدل را پیچیده‌تر می‌کند. بنابراین طرح پیچیده‌تر همیشه به معنای نتیجه با کیفیت‌تر نیست: سود اغلب به خوبی تنظیم شدن هایپرپارامترها و تطابق ترکیب خاص با وظیفه بستگی دارد.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shi2024-5)</sup>

**به عبارت دیگر،** کاهش انحطاط عصبی اغلب نه بر یک روش «جادویی»، بلکه بر ترکیب دقیقی از چندین محدودیت بنا می‌شود که هر کدام بخشی از مسئله را برطرف می‌کنند.

## نباید با model collapse اشتباه گرفته شود

انحطاط عصبی متن به معنای Holtzman و همکاران نباید با **model collapse** — پدیده جداگانه‌ای که در مطالعات مربوط به آموزش بازگشتی مدل‌ها بر داده‌های مصنوعی بررسی می‌شود — اشتباه گرفته شود.

در حالت اول، سخن اساساً از انحطاط متن **در مرحله تولید** (inference) است، که در آن راهبرد رمزگشایی نامناسب منجر به تکرارها، قالبی بودن یا از دست دادن انسجام می‌شود.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)</sup> در حالت دوم — از تدهور مدل **در مرحله آموزش** است، که در آن داده‌های تولیدشده توسط مدل شروع به «آلوده کردن» مجموعه آموزشی نسل بعدی مدل‌ها می‌کنند، که می‌تواند به ناپدید شدن رویدادهای نادر و تنگ‌تر شدن توزیع منجر شود.<sup>[\[6\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shumailov2024-6)</sup>

این پدیده‌ها از نظر موضوعی مرتبط هستند، زیرا هر دو به کاهش کیفیت متن عصبی مربوط می‌شوند، اما در ادبیات معمولاً به‌عنوان مسائل جداگانه در نظر گرفته می‌شوند: یکی به رمزگشایی، و دیگری به داده‌ها و آموزش مربوط است.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[6\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shumailov2024-6)</sup>

## اهمیت برای مدل‌های زبانی بزرگ

در عصر مدل‌های زبانی بزرگ، مسئله انحطاط عصبی ناپدید نشده، بلکه از حوزه مولدهای متن کوچک به حوزه مدیریت رفتار سیستم‌های قدرتمندتر جابجا شده است. اگرچه LLM‌های مدرن معمولاً بهتر aligned هستند و کمتر در حلقه‌های آشکار تکرار می‌افتند، انتخاب راهبرد decoding همچنان به‌طور قابل توجهی بر طبیعی بودن، تنوع و پایداری خروجی تأثیر می‌گذارد.<sup>[\[5\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-shi2024-5)</sup>

به همین دلیل، انحطاط عصبی متن نه به‌عنوان نقص محدود مدل‌های زبانی اولیه، بلکه به‌عنوان مسئله‌ای بنیادی در تولید عملی در نظر گرفته می‌شود: مدل‌سازی احتمالاتی خوب به‌تنهایی متن خوب در مرحله inference را تضمین نمی‌کند.<sup>[\[1\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_note-finlayson2024-2)</sup>

## همچنین ببینید

- Top-p سمپلینگ
- Top-k سمپلینگ
- دما
- مدل‌های زبانی بزرگ

## منابع

- Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019؛ منتشرشده در ICLR 2020). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751.
- Finlayson, M., Hewitt, J., Koller, A., Swayamdipta, S., & Sabharwal, A. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693.
- Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. TACL 2023.
- Shi, C., Yang, H., Cai, D., Zhang, Z., Wang, Y., Yang, Y., & Lam, W. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. EMNLP 2024.
- Su, Y., Lan, T., Wang, Y., Yogatama, D., Kong, L., & Collier, N. (2022). *A Contrastive Framework for Neural Text Generation*. arXiv:2202.06417.
- Shumailov, I. et al. (2024). *AI models collapse when trained on recursively generated data*. Nature 2024.

## یادداشت‌ها

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1.00](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-holtzman2019_1-47)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-finlayson2024-2">↑ <sup>[2.00](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-finlayson2024_2-11)</sup> Finlayson, M., Hewitt, J., Koller, A., Swayamdipta, S., & Sabharwal, A. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693. <a href="https://arxiv.org/abs/2310.01693" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-meister2023-3">↑ <sup>[3.00](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-15)</sup> <sup>[3.16](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-16)</sup> <sup>[3.17](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-17)</sup> <sup>[3.18](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-18)</sup> <sup>[3.19](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-meister2023_3-19)</sup> Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. *Transactions of the Association for Computational Linguistics*, 11. <a href="https://aclanthology.org/2023.tacl-1.7/" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-contrastive2022-4">↑ <sup>[4.0](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-contrastive2022_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-contrastive2022_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-contrastive2022_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-contrastive2022_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-contrastive2022_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-contrastive2022_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-contrastive2022_4-6)</sup> <sup>[4.7](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-contrastive2022_4-7)</sup> Su, Y., Lan, T., Wang, Y., Yogatama, D., Kong, L., & Collier, N. (2022). *A Contrastive Framework for Neural Text Generation*. arXiv:2202.06417. <a href="https://arxiv.org/abs/2202.06417" class="external autonumber" rel="nofollow">[۴]</a></span>
5.  <span id="cite_note-shi2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shi2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shi2024_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shi2024_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shi2024_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shi2024_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shi2024_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shi2024_5-6)</sup> <sup>[5.7](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shi2024_5-7)</sup> <sup>[5.8](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shi2024_5-8)</sup> Shi, C., Yang, H., Cai, D., Zhang, Z., Wang, Y., Yang, Y., & Lam, W. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. EMNLP 2024. <a href="https://aclanthology.org/2024.emnlp-main.489/" class="external autonumber" rel="nofollow">[۵]</a></span>
6.  <span id="cite_note-shumailov2024-6">↑ <sup>[6.0](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shumailov2024_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Neural_Text_Degeneration_%E2%80%94_%D8%A7%D9%86%D8%AD%D8%B7%D8%A7%D8%B7_%D8%B9%D8%B5%D8%A8%DB%8C_%D9%85%D8%AA%D9%86#cite_ref-shumailov2024_6-1)</sup> Shumailov, I. et al. (2024). *AI models collapse when trained on recursively generated data*. *Nature*. <a href="https://pmc.ncbi.nlm.nih.gov/articles/PMC11269175/" class="external autonumber" rel="nofollow">[۶]</a></span>
