Decoder-only models (architecture) (PL)
Modele tylko-dekodera (ang. Decoder-Only Models) — to dominująca klasa architektur dużych modeli językowych (LLM), opartych wyłącznie na dekodującej części (dekoderze) architektury Transformer. Modele te specjalizują się w zadaniach generowania tekstu i stanowią podstawę większości współczesnych chatbotów oraz asystentów AI.
Flagową serią, która spopularyzowała to podejście, jest seria modeli GPT firmy OpenAI.
Koncepcja i architektura
Główna idea modeli tylko-dekodera polega na autoregresyjnym generowaniu sekwencji. Oznacza to, że model przewiduje kolejny token na podstawie wszystkich poprzednich tokenów, które zostały wcześniej wygenerowane. Wejściowy prompt (zapytanie użytkownika) oraz już wygenerowany tekst traktowane są jako jedna sekwencja, którą model kontynuuje.
Architektonicznie model stanowi stos złożony z identycznych warstw dekodera. Każda warstwa, w odróżnieniu od enkodera lub pełnego dekodera, zawiera tylko dwie główne podwarstwy:
- Maskowana wielogłowicowa samouwaga (Masked Multi-Head Self-Attention): To kluczowy mechanizm zapewniający właściwość autoregresji. Podczas przetwarzania sekwencji specjalna maska kauzalna (causal mask) uniemożliwia każdemu tokenowi „patrzenie" na kolejne tokeny. W ten sposób predykcja dla pozycji zależy wyłącznie od tokenów na pozycjach .
- W pełni połączona sieć neuronowa (Feed-Forward Network): Stosuje nieliniową transformację do reprezentacji każdego tokenu.
W modelach tylko-dekodera brak jest mechanizmu uwagi krzyżowej (cross-attention), ponieważ nie istnieje enkoder, na który można by „zwracać uwagę\".
Zadania wstępnego uczenia
Modele tylko-dekodera są uczone na jednym, lecz bardzo potężnym zadaniu samo-nadzorowanym:
Kauzalne modelowanie językowe (Causal Language Modeling, CLM)
- Zasada działania: Model jest uczony przewidywania kolejnego tokenu w sekwencji. Na każdym kroku uczenia otrzymuje na wejściu fragment tekstu i powinien wygenerować rozkład prawdopodobieństwa dla kolejnego tokenu.
- Cel: Maksymalizacja prawdopodobieństwa poprawnego kolejnego tokenu na ogromnych zbiorach danych tekstowych. To pozornie proste zadanie zmusza model do uczenia się gramatyki, składni, faktów o świecie oraz złożonych wzorców językowych.
Zastosowania
Dzięki swojej autoregresyjnej naturze modele tylko-dekodera doskonale nadają się do wszelkich zadań wymagających generowania tekstu:
- Swobodne generowanie tekstu: Pisanie artykułów, wierszy, scenariuszy itp.
- Systemy dialogowe i chatboty: Odpowiadanie na pytania użytkowników w konwersacyjnym stylu.
- Sumaryzacja: Tworzenie streszczeń długich tekstów.
- Tłumaczenie maszynowe: Choć do tego celu często stosuje się modele enkoder-dekoder, modele tylko-dekodera również mogą radzić sobie z tłumaczeniem, jeśli zadanie zostało sformułowane w prompcie (np. „Przetłumacz z angielskiego na polski: …\").
- Generowanie kodu: Tworzenie kodu na podstawie opisu tekstowego.
- Uczenie w kontekście (In-context learning): Dzięki skali duże modele-dekodery wykazują zdolność do rozwiązywania nowych zadań po otrzymaniu zaledwie kilku przykładów (few-shot) lub nawet bez żadnych (zero-shot) bezpośrednio w prompcie, bez konieczności fine-tuningu.
Główne modele i ich ewolucja
- Seria GPT (2018–obecnie): Pionierzy i popularyzatorzy podejścia. GPT-1 wykazał skuteczność wstępnego uczenia, GPT-2 zademonstrował potęgę skalowania, a GPT-3 — pojawienie się zdolności few-shot. ChatGPT i GPT-4 uczyniły tę architekturę standardem dla asystentów AI.
- LLaMA (2023–obecnie): Seria otwartych modeli firmy Meta, która zdemokratyzowała dostęp do potężnych LLM i zapoczątkowała falę innowacji w społeczności.
- Claude (2023–obecnie): Rodzina modeli firmy Anthropic, skupiona na bezpieczeństwie i sterowalności za pomocą Constitutional AI.
- PaLM i Gemini (2022–obecnie): Flagowe modele Google. Gemini jest również natywnie multimodalnym modelem tylko-dekodera.
Porównanie z innymi architekturami
| Architektura | Główne zadanie | Kierunek kontekstu | Typowe modele |
|---|---|---|---|
| Tylko-dekoder | Generowanie tekstu | Jednokierunkowe (od lewej do prawej) | GPT, LLaMA, Claude, Gemini |
| Tylko-enkoder | Rozumienie tekstu | Dwukierunkowe | BERT, RoBERTa |
| Enkoder-dekoder | Przekształcanie sekwencji w sekwencję | Dwukierunkowe (enkoder) + Jednokierunkowe (dekoder) | T5, BART, oryginalny Transformer |
Zobacz też
- GPT