T5 (Text-to-Text Transfer Transformer) (HU)
T5 (Text-to-Text Transfer Transformer) — a nagy nyelvi modellek egy családja, amelyet a Google AI kutatói fejlesztettek ki és 2019-ben mutattak be[1]. A T5 kulcsinnovációja az egységesített „text-to-text" keretrendszer, amely a természetes nyelvfeldolgozás (NLP) bármely feladatát egy szöveges szekvencia másikká való átalakításának problémájaként kezeli. Ez lehetővé tette egyetlen modell, veszteségfüggvény és tanítási eljárás alkalmazását feladatok széles körére, mint például a fordítás, összefoglalás, kérdés-válasz és osztályozás[2].
A modell a transformer szabványos „enkóder-dekóder" architektúráján alapul, ami megkülönbözteti a csak enkóderből álló BERT-típusú és a csak dekóderből álló GPT-típusú modellektől. A T5 fejlesztését átfogó empirikus kutatásként tervezték, amelynek célja a transzfer tanulás különböző módszereinek szisztematikus vizsgálata és összehasonlítása volt az NLP területén, nem pedig alapvetően új módszer létrehozása[1].
A „Text-to-Text" paradigma
A T5 központi gondolata, hogy minden feladatot egységes formátumban fogalmaz meg. A modell szöveget kap bemenetként, és szöveget állít elő kimenetként. Annak érdekében, hogy a modell meg tudja különböztetni az eléje tárt feladatokat, a bemeneti szekvenciához egy speciális szöveges prefixum-utasítás adódik hozzá[2].
- Fordítás: `translate English to German: That is good.` → `Das ist gut.`
- Hangulatelemzés (osztályozás): `sst2 sentence: a very exciting film.` → `positive`
- Összefoglalás: `summarize: [hosszú cikk szövege]` → `[rövid összefoglaló]`
Ez a megközelítés gyökeresen leegyszerűsíti a modell alkalmazásának folyamatát, szükségtelenné téve az egyes feladatokhoz tartozó külön „fejek" (task-specific heads) kifejlesztését, ami a BERT-szerű architektúrákra volt jellemző[3].
Architektúra és skálázás
Enkóder-dekóder architektúra
A T5 a transformer szabványos architektúráját alkalmazza, amely két részből áll[1]:
- Enkóder: A teljes bemeneti szekvenciát egyszerre dolgozza fel, gazdag, kontextualizált reprezentációt hozva létre. A BERT-hez hasonlóan a T5 enkódere kétirányú.
- Dekóder: A kimeneti szöveget token-ről tokenre (autoregresszívan) állítja elő, az enkódertől kapott reprezentációt felhasználva.
Ez a hibrid struktúra lehetővé teszi a T5 számára, hogy hatékonyan kezelje mind a nyelvmegértési, mind a szöveggenerálási feladatokat[4].
Főbb fejlesztések
A T5 architektúrája az eredeti transformer modellhez képest több módosítást tartalmaz:
- Relatív pozicionális embedding-ek: Az abszolút szinuszoid embedding-ek helyett a T5 a pozíciókódolás egy egyszerűsített, de hatékony relatív formáját alkalmazza, ahol az attention logitokhoz egy tanulható skaláris eltolás (bias) adódik hozzá, amely csak a tokenek közötti relatív távolságtól függ[1].
- Módosított rétegnormalizáció (Layer Norm): A normalizáció a reziduális kapcsolaton (residual connection) kívülre kerül, és az additív eltolást (bias) eltávolítják belőle a tanítási stabilitás növelése érdekében.
A modell méretei
Az eredeti munkában a modellt több konfigurációban mutatták be, amelyek a paraméterek számában különböznek egymástól, lehetővé téve a skálázás hatásának szisztematikus vizsgálatát[5]:
- T5-Small: ~60 millió paraméter
- T5-Base: ~220 millió paraméter
- T5-Large: ~770 millió paraméter
- T5-3B: ~3 milliárd paraméter
- T5-11B: ~11 milliárd paraméter
A kutatás megmutatta, hogy a modell méretének növelése az egyik legmegbízhatóbb módja a teljesítmény javításának[1].
Előtanítás: a C4 dataset és a Span Corruption feladat
A Span Corruption feladat
A T5 előtanításához zajszűrési (denoising) feladatot választottak, mégpedig annak egy speciális változatát, amelyet töredéksérítésnek (span corruption) neveznek[6]. A módszer a következőképpen működik:
- A bemeneti szövegben véletlenszerűen a tokenek 15%-a maszkolásra kerül.
- A BERT MLM módszerével ellentétben, ahol egyes tokeneket maszkolnak, a T5-ben teljes összefüggő töredékeket (spans) maszkolnak.
- Minden sérített töredéket egy egyedi maszk-tokennel helyettesítenek (például `<X>`, `<Y>`).
- A modell azt tanulja meg, hogy kimenetként az eltávolított töredékek sorozatát állítsa elő, amelyeket a megfelelő maszkok választanak el egymástól.
Ez a megközelítés arra kényszeríti a modellt, hogy teljes szövegszekvenciákat jósoljon meg, ami hatékonyabb előtanítási feladatnak bizonyult az egyszerű nyelvi modellezésnél[1].
A C4 dataset (Colossal Clean Crawled Corpus)
A transzfer tanulás potenciáljának kiaknázásához a kutatók egy hatalmas és minőségileg megtisztított szöveges adathalmazt hoztak létre, a C4-et, amelynek mérete körülbelül 750 GB[2]. Ezt a nyilvánosan elérhető Common Crawl webkorpusz nagyszabású megtisztításával és szűrésével állították elő[7]. A tisztítási folyamat magában foglalta a duplikátumok, a sablonszövegek (,,Lorem ipsum"), a hiányos mondatok eltávolítását, valamint a trágár szókincs kiszűrését[8].
A C4 dataset kritikája
Annak ellenére, hogy a cél egy „tiszta" korpusz létrehozása volt, a C4 szűrési folyamata szisztematikus torzítások miatt kritikát kapott. Kutatások kimutatták, hogy a trágárságszűrő aránytalanul nagy mértékben távolított el LMBTQ+ közösségekhez kapcsolódó szövegeket, valamint az afroamerikai angol (AAE) nyelvváltozaton írt szövegeket[8]. Ezen kívül az adathalmazban jelentős mennyiségű sértő és szerzői joggal védett tartalmat fedeztek fel. Ezek a problémák jól illusztrálják az objektívan „minőségi" adathalmazok létrehozásának nehézségét, és azt, hogy a technikai szűrési döntések hogyan vezethetnek nem szándékolt társadalmi torzításokhoz.
Eredmények és teljesítmény
A megjelenés idején a T5 új teljesítményrekordokat (state-of-the-art) állított fel számos benchmark-on, köztük a GLUE, SuperGLUE, SQuAD és összefoglalási feladatokon[2]. A T5-11B modell a SuperGLUE-n az emberi szinthez közeli eredményt ért el, bizonyítva, hogy képes összetett logikai következtetést igénylő feladatokat megoldani[9]. Ezek az eredmények megerősítették a kutatás központi hipotézisét: az egységesített keretrendszer, a nagy méret és a minőségi adathalmaz kombinációja rendkívül hatékony stratégia az NLP-ben élvonalbeli eredmények elérésére.
A T5 fejlődése és változatai
A T5 megközelítése számos későbbi modell alapjává vált:
- mT5: A T5 többnyelvű változata, amelyet a 101 nyelvet lefedő mC4 korpuszon tanítottak[10].
- ByT5: Egy kísérleti változat, amely teljesen lemond a tokenizálásról, és közvetlenül nyers UTF-8 bájtokkal dolgozik. Ez ellenállóvá teszi az elgépelésekkel szemben, és lehetővé teszi bármely nyelv „dobozból kivéve" való feldolgozását[11].
- Switch Transformer: A T5 skálázható változata, amely bevezette a Mixture-of-Experts (MoE) architektúrát, ami lehetővé tette a paraméterek számának billiónyira növelését, miközben az számítási költségek elfogadható szinten maradtak[12].
- FLAN-T5: Ez nem új architektúra, hanem a szabványos T5, amely egy további finomhangolási (fine-tuning) fázison ment keresztül, ahol százával dolgoztak fel utasítások formájában megfogalmazott feladatokat (instruction tuning). Ez jelentősen javította a modell képességét az új, korábban nem látott feladatokra való általánosításra zero-shot módban (példák nélkül)[13].
- UL2: Egy T5 ötleteit továbbfejlesztő modell, amely egy Mixture of Denoisers nevű új előtanítási célfüggvényt alkalmaz, kombinálva a szövegmaszkolás különböző sémáit az általánosíthatóság javítása érdekében[14].
Hivatkozások
- A T5 hivatalos GitHub-adattára
- A Google Research blogbejegyzése a T5 kutatásról
Irodalom
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
- Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
- Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
- Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
- Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
- Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
- Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
- Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
- Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.
Megjegyzések
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [1]
- ↑ 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [2]
- ↑ «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [3]
- ↑ «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [4]
- ↑ «T5». Hugging Face Transformers Documentation. [5]
- ↑ «T5 (language model)». In Wikipedia. [6]
- ↑ «C4 Dataset». Papers With Code. [7]
- ↑ 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [8]
- ↑ «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [9]
- ↑ Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [10]
- ↑ Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [11]
- ↑ Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [12]
- ↑ Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [13]
- ↑ Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [14]