T5 (Text-to-Text Transfer Transformer) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

T5 (Text-to-Text Transfer Transformer) — a nagy nyelvi modellek egy családja, amelyet a Google AI kutatói fejlesztettek ki és 2019-ben mutattak be[1]. A T5 kulcsinnovációja az egységesített „text-to-text" keretrendszer, amely a természetes nyelvfeldolgozás (NLP) bármely feladatát egy szöveges szekvencia másikká való átalakításának problémájaként kezeli. Ez lehetővé tette egyetlen modell, veszteségfüggvény és tanítási eljárás alkalmazását feladatok széles körére, mint például a fordítás, összefoglalás, kérdés-válasz és osztályozás[2].

A modell a transformer szabványos „enkóder-dekóder" architektúráján alapul, ami megkülönbözteti a csak enkóderből álló BERT-típusú és a csak dekóderből álló GPT-típusú modellektől. A T5 fejlesztését átfogó empirikus kutatásként tervezték, amelynek célja a transzfer tanulás különböző módszereinek szisztematikus vizsgálata és összehasonlítása volt az NLP területén, nem pedig alapvetően új módszer létrehozása[1].

A „Text-to-Text" paradigma

A T5 központi gondolata, hogy minden feladatot egységes formátumban fogalmaz meg. A modell szöveget kap bemenetként, és szöveget állít elő kimenetként. Annak érdekében, hogy a modell meg tudja különböztetni az eléje tárt feladatokat, a bemeneti szekvenciához egy speciális szöveges prefixum-utasítás adódik hozzá[2].

  • Fordítás: `translate English to German: That is good.` → `Das ist gut.`
  • Hangulatelemzés (osztályozás): `sst2 sentence: a very exciting film.` → `positive`
  • Összefoglalás: `summarize: [hosszú cikk szövege]` → `[rövid összefoglaló]`

Ez a megközelítés gyökeresen leegyszerűsíti a modell alkalmazásának folyamatát, szükségtelenné téve az egyes feladatokhoz tartozó külön „fejek" (task-specific heads) kifejlesztését, ami a BERT-szerű architektúrákra volt jellemző[3].

Architektúra és skálázás

Enkóder-dekóder architektúra

A T5 a transformer szabványos architektúráját alkalmazza, amely két részből áll[1]:

  • Enkóder: A teljes bemeneti szekvenciát egyszerre dolgozza fel, gazdag, kontextualizált reprezentációt hozva létre. A BERT-hez hasonlóan a T5 enkódere kétirányú.
  • Dekóder: A kimeneti szöveget token-ről tokenre (autoregresszívan) állítja elő, az enkódertől kapott reprezentációt felhasználva.

Ez a hibrid struktúra lehetővé teszi a T5 számára, hogy hatékonyan kezelje mind a nyelvmegértési, mind a szöveggenerálási feladatokat[4].

Főbb fejlesztések

A T5 architektúrája az eredeti transformer modellhez képest több módosítást tartalmaz:

  • Relatív pozicionális embedding-ek: Az abszolút szinuszoid embedding-ek helyett a T5 a pozíciókódolás egy egyszerűsített, de hatékony relatív formáját alkalmazza, ahol az attention logitokhoz egy tanulható skaláris eltolás (bias) adódik hozzá, amely csak a tokenek közötti relatív távolságtól függ[1].
  • Módosított rétegnormalizáció (Layer Norm): A normalizáció a reziduális kapcsolaton (residual connection) kívülre kerül, és az additív eltolást (bias) eltávolítják belőle a tanítási stabilitás növelése érdekében.

A modell méretei

Az eredeti munkában a modellt több konfigurációban mutatták be, amelyek a paraméterek számában különböznek egymástól, lehetővé téve a skálázás hatásának szisztematikus vizsgálatát[5]:

  • T5-Small: ~60 millió paraméter
  • T5-Base: ~220 millió paraméter
  • T5-Large: ~770 millió paraméter
  • T5-3B: ~3 milliárd paraméter
  • T5-11B: ~11 milliárd paraméter

A kutatás megmutatta, hogy a modell méretének növelése az egyik legmegbízhatóbb módja a teljesítmény javításának[1].

Előtanítás: a C4 dataset és a Span Corruption feladat

A Span Corruption feladat

A T5 előtanításához zajszűrési (denoising) feladatot választottak, mégpedig annak egy speciális változatát, amelyet töredéksérítésnek (span corruption) neveznek[6]. A módszer a következőképpen működik:

  1. A bemeneti szövegben véletlenszerűen a tokenek 15%-a maszkolásra kerül.
  2. A BERT MLM módszerével ellentétben, ahol egyes tokeneket maszkolnak, a T5-ben teljes összefüggő töredékeket (spans) maszkolnak.
  3. Minden sérített töredéket egy egyedi maszk-tokennel helyettesítenek (például `<X>`, `<Y>`).
  4. A modell azt tanulja meg, hogy kimenetként az eltávolított töredékek sorozatát állítsa elő, amelyeket a megfelelő maszkok választanak el egymástól.

Ez a megközelítés arra kényszeríti a modellt, hogy teljes szövegszekvenciákat jósoljon meg, ami hatékonyabb előtanítási feladatnak bizonyult az egyszerű nyelvi modellezésnél[1].

A C4 dataset (Colossal Clean Crawled Corpus)

A transzfer tanulás potenciáljának kiaknázásához a kutatók egy hatalmas és minőségileg megtisztított szöveges adathalmazt hoztak létre, a C4-et, amelynek mérete körülbelül 750 GB[2]. Ezt a nyilvánosan elérhető Common Crawl webkorpusz nagyszabású megtisztításával és szűrésével állították elő[7]. A tisztítási folyamat magában foglalta a duplikátumok, a sablonszövegek (,,Lorem ipsum"), a hiányos mondatok eltávolítását, valamint a trágár szókincs kiszűrését[8].

A C4 dataset kritikája

Annak ellenére, hogy a cél egy „tiszta" korpusz létrehozása volt, a C4 szűrési folyamata szisztematikus torzítások miatt kritikát kapott. Kutatások kimutatták, hogy a trágárságszűrő aránytalanul nagy mértékben távolított el LMBTQ+ közösségekhez kapcsolódó szövegeket, valamint az afroamerikai angol (AAE) nyelvváltozaton írt szövegeket[8]. Ezen kívül az adathalmazban jelentős mennyiségű sértő és szerzői joggal védett tartalmat fedeztek fel. Ezek a problémák jól illusztrálják az objektívan „minőségi" adathalmazok létrehozásának nehézségét, és azt, hogy a technikai szűrési döntések hogyan vezethetnek nem szándékolt társadalmi torzításokhoz.

Eredmények és teljesítmény

A megjelenés idején a T5 új teljesítményrekordokat (state-of-the-art) állított fel számos benchmark-on, köztük a GLUE, SuperGLUE, SQuAD és összefoglalási feladatokon[2]. A T5-11B modell a SuperGLUE-n az emberi szinthez közeli eredményt ért el, bizonyítva, hogy képes összetett logikai következtetést igénylő feladatokat megoldani[9]. Ezek az eredmények megerősítették a kutatás központi hipotézisét: az egységesített keretrendszer, a nagy méret és a minőségi adathalmaz kombinációja rendkívül hatékony stratégia az NLP-ben élvonalbeli eredmények elérésére.

A T5 fejlődése és változatai

A T5 megközelítése számos későbbi modell alapjává vált:

  • mT5: A T5 többnyelvű változata, amelyet a 101 nyelvet lefedő mC4 korpuszon tanítottak[10].
  • ByT5: Egy kísérleti változat, amely teljesen lemond a tokenizálásról, és közvetlenül nyers UTF-8 bájtokkal dolgozik. Ez ellenállóvá teszi az elgépelésekkel szemben, és lehetővé teszi bármely nyelv „dobozból kivéve" való feldolgozását[11].
  • Switch Transformer: A T5 skálázható változata, amely bevezette a Mixture-of-Experts (MoE) architektúrát, ami lehetővé tette a paraméterek számának billiónyira növelését, miközben az számítási költségek elfogadható szinten maradtak[12].
  • FLAN-T5: Ez nem új architektúra, hanem a szabványos T5, amely egy további finomhangolási (fine-tuning) fázison ment keresztül, ahol százával dolgoztak fel utasítások formájában megfogalmazott feladatokat (instruction tuning). Ez jelentősen javította a modell képességét az új, korábban nem látott feladatokra való általánosításra zero-shot módban (példák nélkül)[13].
  • UL2: Egy T5 ötleteit továbbfejlesztő modell, amely egy Mixture of Denoisers nevű új előtanítási célfüggvényt alkalmaz, kombinálva a szövegmaszkolás különböző sémáit az általánosíthatóság javítása érdekében[14].

Hivatkozások

  • A T5 hivatalos GitHub-adattára
  • A Google Research blogbejegyzése a T5 kutatásról

Irodalom

  • Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  • Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
  • Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
  • Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
  • Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
  • Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
  • Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
  • Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
  • Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
  • Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.

Megjegyzések

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [1]
  2. 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [2]
  3. «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [3]
  4. «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [4]
  5. «T5». Hugging Face Transformers Documentation. [5]
  6. «T5 (language model)». In Wikipedia. [6]
  7. «C4 Dataset». Papers With Code. [7]
  8. 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [8]
  9. «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [9]
  10. Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [10]
  11. Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [11]
  12. Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [12]
  13. Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [13]
  14. Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [14]