---
title: "T5 (Text-to-Text Transfer Transformer) (DE)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7812
wiki_created_at: 2026-09-07T01:07:22Z
wiki_modified_at: 2026-09-07T01:07:22Z
downloaded_at: 2026-09-07T23:20:54Z
---

# T5 (Text-to-Text Transfer Transformer) (DE)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) ist eine Familie von großen Sprachmodellen, die von Forschern bei Google AI entwickelt und 2019 vorgestellt wurde<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-raffel2020-1)</sup>. Die Schlüsselinnovation von T5 ist ein einheitliches **„Text-zu-Text“**-Framework, das jede Aufgabe der Verarbeitung natürlicher Sprache (NLP) als ein Problem der Umwandlung einer Textsequenz in eine andere betrachtet. Dies ermöglichte die Verwendung eines einzigen Modells, einer einzigen Verlustfunktion und eines einzigen Trainingsverfahrens für eine breite Palette von Aufgaben wie Übersetzung, Zusammenfassung, Beantwortung von Fragen und Klassifizierung<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-google-blog-t5-2)</sup>.

Das Modell basiert auf der Standard-Architektur eines Transformer-Modells mit „Encoder-Decoder“-Struktur, was es von reinen Encoder-Modellen wie BERT und reinen Decoder-Modellen wie GPT unterscheidet. Die Arbeit an T5 war als eine groß angelegte empirische Studie konzipiert, um verschiedene Transfer-Learning-Methoden im NLP systematisch zu untersuchen und zu vergleichen, anstatt eine grundlegend neue Methode zu entwickeln<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-raffel2020-1)</sup>.

## Das „Text-zu-Text“-Paradigma

Die zentrale Idee von T5 ist, dass alle Aufgaben in einem einheitlichen Format formuliert werden. Das Modell erhält Text als Eingabe und generiert ebenfalls Text als Ausgabe. Damit das Modell die ihm gestellten Aufgaben unterscheiden kann, wird der Eingabesequenz ein spezieller textueller **Anweisungs-Präfix** (*instruction prefix*) hinzugefügt<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-google-blog-t5-2)</sup>.

- **Übersetzung**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **Sentiment-Klassifikation**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **Zusammenfassung**: \`summarize: \[langer Artikeltext\]\` → \`\[kurze Zusammenfassung\]\`

Dieser Ansatz vereinfacht die Anwendung des Modells radikal, da er die Notwendigkeit beseitigt, für jede einzelne Aufgabe spezifische „Köpfe“ (*task-specific heads*) zu entwickeln, was für Architekturen wie BERT charakteristisch war<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-dhiwise-t5-3)</sup>.

## Architektur und Skalierung

### Encoder-Decoder-Architektur

T5 verwendet eine Standard-Transformer-Architektur, die aus zwei Teilen besteht<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-raffel2020-1)</sup>:

- **Encoder**: Verarbeitet die gesamte Eingabesequenz auf einmal und erzeugt eine reichhaltige kontextualisierte Darstellung. Wie bei BERT ist der Encoder von T5 **bidirektional**.
- **Decoder**: Generiert den Ausgabetext Token für Token (autoregressiv) unter Verwendung der vom Encoder erhaltenen Darstellung.

Diese hybride Struktur ermöglicht es T5, sowohl Aufgaben des Sprachverständnisses als auch Aufgaben der Textgenerierung effizient zu lösen<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-gfg-t5-4)</sup>.

### Wesentliche Verbesserungen

Die Architektur von T5 enthält mehrere Änderungen im Vergleich zum ursprünglichen Transformer-Modell:

- **Relative Positionseinbettungen**: Anstelle von absoluten sinusförmigen Einbettungen verwendet T5 eine vereinfachte, aber effektive Form der relativen Positionscodierung, bei der den Attention-Logits ein lernbarer skalarer Bias hinzugefügt wird, der nur vom relativen Abstand zwischen den Tokens abhängt<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-raffel2020-1)</sup>.
- **Modifizierte Schichtnormalisierung (Layer Norm)**: Die Normalisierung wird außerhalb der Residuenverbindung (*residual connection*) platziert, und der additive Bias wird entfernt, um die Trainingsstabilität zu erhöhen.

### Modellgrößen

In der ursprünglichen Arbeit wurde das Modell in mehreren Konfigurationen mit unterschiedlicher Parameteranzahl vorgestellt, was eine systematische Untersuchung des Einflusses der Skalierung ermöglichte<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 Millionen Parameter
- **T5-Base**: ~220 Millionen Parameter
- **T5-Large**: ~770 Millionen Parameter
- **T5-3B**: ~3 Milliarden Parameter
- **T5-11B**: ~11 Milliarden Parameter

Die Studie zeigte, dass die Vergrößerung des Modells eine der zuverlässigsten Methoden zur Steigerung seiner Leistung ist<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-raffel2020-1)</sup>.

## Vortraining: C4-Datensatz und die Span-Corruption-Aufgabe

### Die Span-Corruption-Aufgabe

Für das Pre-Training von T5 wurde eine Denoising-Aufgabe (Entrauschung) gewählt, genauer gesagt eine spezielle Variante namens **Span Corruption** (Beschädigung von Abschnitten)<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-t5-wikipedia-6)</sup>. Die Methode funktioniert wie folgt:

1.  Im Eingabetext werden zufällig 15 % der Tokens maskiert.
2.  Im Gegensatz zur MLM-Methode in BERT, bei der einzelne Tokens maskiert werden, werden bei T5 ganze zusammenhängende Abschnitte (*spans*) maskiert.
3.  Jeder beschädigte Abschnitt wird durch ein einziges, eindeutiges Maskierungs-Token ersetzt (z. B. \`\<X\>\`, \`\<Y\>\`).
4.  Das Modell wird darauf trainiert, am Ausgang eine Sequenz der entfernten Abschnitte, getrennt durch die entsprechenden Masken, zu generieren.

Dieser Ansatz zwingt das Modell, ganze Textsequenzen vorherzusagen, was sich als effektivere Pre-Training-Aufgabe erwies als die einfache Sprachmodellierung<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-raffel2020-1)</sup>.

### Der C4-Datensatz (Colossal Clean Crawled Corpus)

Um das Potenzial des Transfer-Learnings auszuschöpfen, erstellten die Forscher einen riesigen und qualitativ hochwertig bereinigten Textdatensatz namens **C4** mit einem Umfang von etwa 750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-google-blog-t5-2)</sup>. Er wurde durch eine umfassende Bereinigung und Filterung des öffentlich zugänglichen Web-Korpus **Common Crawl** gewonnen<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-c4-dataset-pwc-7)</sup>. Der Bereinigungsprozess umfasste die Entfernung von Duplikaten, Fülltexten („Lorem ipsum“), unvollständigen Sätzen sowie die Filterung von anstößiger Sprache<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-dodge2021-doc-c4-8)</sup>.

### Kritik am C4-Datensatz

Trotz des erklärten Ziels, einen „sauberen“ Korpus zu schaffen, wurde der Filterprozess von C4 wegen systematischer Verzerrungen (Bias) kritisiert. Studien zeigten, dass der Filter für anstößige Sprache überproportional Texte entfernte, die mit LGBTQ+-Communitys in Verbindung stehen, sowie Texte in afroamerikanischem Englisch (AAE)<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-dodge2021-doc-c4-8)</sup>. Darüber hinaus wurde im Datensatz eine erhebliche Menge an beleidigendem und urheberrechtlich geschütztem Material gefunden. Diese Probleme verdeutlichen die Schwierigkeit, objektiv „hochwertige“ Datensätze zu erstellen, und wie technische Filterentscheidungen zu unbeabsichtigten sozialen Verzerrungen führen können.

## Ergebnisse und Leistung

Zum Zeitpunkt seiner Veröffentlichung setzte T5 neue Maßstäbe (*State-of-the-Art*) bei zahlreichen Benchmarks, darunter **GLUE**, **SuperGLUE**, **SQuAD** und Aufgaben zur Textzusammenfassung<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-google-blog-t5-2)</sup>. Insbesondere erreichte das **T5-11B**-Modell bei **SuperGLUE** ein Ergebnis, das dem menschlichen Niveau nahekommt, und demonstrierte damit seine Fähigkeit, Aufgaben zu bewältigen, die komplexes logisches Schließen erfordern<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-reddit-superglue-t5-9)</sup>. Diese Ergebnisse bestätigten die zentrale Hypothese der Studie: Die Kombination aus einem einheitlichen Framework, großer Skalierung und einem hochwertigen Datensatz ist eine äußerst leistungsfähige Strategie, um Spitzenresultate im NLP zu erzielen.

## Entwicklung und Varianten von T5

Der T5-Ansatz diente als Grundlage für eine Vielzahl nachfolgender Modelle:

- **mT5**: Eine mehrsprachige Version von T5, die auf dem **mC4**-Korpus trainiert wurde, der **101 Sprachen** abdeckt<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: Eine experimentelle Version, die vollständig auf Tokenisierung verzichtet und direkt mit **rohen UTF-8-Bytes** arbeitet. Dies macht sie robust gegenüber Tippfehlern und ermöglicht die Verarbeitung jeder Sprache „out of the box“<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: Eine skalierbare Version von T5, die die **Mixture-of-Experts (MoE)**-Architektur einführte, was es ermöglichte, die Anzahl der Parameter auf Billionen zu erhöhen, während der Rechenaufwand vertretbar blieb<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: Dies ist keine neue Architektur, sondern ein Standard-T5-Modell, das einer zusätzlichen Feinabstimmung (*Instruction Tuning*) auf Hunderten von als Anweisungen formulierten Aufgaben unterzogen wurde. Dies verbesserte seine Fähigkeit zur Generalisierung auf neue, ungesehene Aufgaben im **Zero-Shot**-Modus (ohne Beispiele) erheblich<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-chung2022-flan-13)</sup>.
- **UL2**: Ein Modell, das die Ideen von T5 weiterentwickelt und ein neues Pre-Training-Ziel namens **Mixture of Denoisers** verwendet, das verschiedene Textmaskierungsschemata kombiniert, um die Vielseitigkeit zu verbessern<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_note-tay2022-ul2-14)</sup>.

## Weblinks

- <a href="https://github.com/google-research/text-to-text-transfer-transformer" class="external text" rel="nofollow">Offizielles T5-Repository auf GitHub</a>
- <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external text" rel="nofollow">Blogbeitrag von Google Research über die T5-Studie</a>

## Literatur

- Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. <a href="https://arxiv.org/abs/2010.11934" class="external text" rel="nofollow">arXiv:2010.11934</a>.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. <a href="https://arxiv.org/abs/2104.08758" class="external text" rel="nofollow">arXiv:2104.08758</a>.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. <a href="https://arxiv.org/abs/2108.08877" class="external text" rel="nofollow">arXiv:2108.08877</a>.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. <a href="https://arxiv.org/abs/2112.07916" class="external text" rel="nofollow">arXiv:2112.07916</a>.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. <a href="https://arxiv.org/abs/2105.13626" class="external text" rel="nofollow">arXiv:2105.13626</a>.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. <a href="https://arxiv.org/abs/2205.05131" class="external text" rel="nofollow">arXiv:2205.05131</a>.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. <a href="https://arxiv.org/abs/2210.11416" class="external text" rel="nofollow">arXiv:2210.11416</a>.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. <a href="https://arxiv.org/abs/2301.13688" class="external text" rel="nofollow">arXiv:2301.13688</a>.

## Einzelnachweise

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. „Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer“. *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-google-blog-t5_2-3)</sup> „Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer“. *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-dhiwise-t5_3-0) „A Detailed Look At Google's T5 Model in NLP“. *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-gfg-t5_4-0) „T5 (Text-to-Text Transfer Transformer)“. *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-huggingface-t5-doc_5-0) „T5“. *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-t5-wikipedia_6-0) „T5 (language model)“. In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-c4-dataset-pwc_7-0) „C4 Dataset“. *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. „Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus“. *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-reddit-superglue-t5_9-0) „Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline“. *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. „mT5: A massively multilingual pre-trained text-to-text transformer“. *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. „ByT5: Towards a token-free future with pre-trained byte-to-byte models“. *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. „Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity“. *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. „Scaling Instruction-Finetuned Language Models“. *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(DE)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. „UL2: Unifying Language Learning Paradigms“. *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
