Decoder-only models (architecture) (BG)
Модели само-декодер (англ. Decoder-Only Models) — това е доминиращият клас архитектури на големи езикови модели (LLM), базирани изключително на декодиращата част (декодера) на архитектурата Transformer. Тези модели са специализирани в задачи за генериране на текст и са в основата на повечето съвременни чат-ботове и AI-асистенти.
Флагманската серия, популяризирала този подход, е серията модели GPT на OpenAI.
Концепция и архитектура
Основната идея на моделите само-декодер се състои в авторегресивното генериране на последователности. Това означава, че моделът предсказва следващия token, въз основа на всички предишни token-и, генерирани до момента. Входният prompt (заявката на потребителя) и вече генерираният текст се разглеждат като единна последователност, която моделът продължава.
Архитектурно моделът представлява стек от идентични слоя на декодера. Всеки слой, за разлика от енкодера или пълния декодер, съдържа само два основни подслоя:
- Маскирано многоглаво самовнимание (Masked Multi-Head Self-Attention): Това е ключовият механизъм, осигуряващ авторегресивното свойство. По време на обработката на последователността специална каузална маска (causal mask) не позволява на всеки token да „гледа" към следващите token-и. По този начин предсказването за позиция зависи единствено от token-ите на позиции .
- Напълно свързана невронна мрежа (Feed-Forward Network): Прилага нелинейна трансформация към представянето на всеки token.
В моделите само-декодер липсва механизъм за кръстосано внимание (cross-attention), тъй като няма енкодер, към който да се „насочва внимание".
Задачи за предварително обучение
Моделите само-декодер се обучават върху една, но изключително мощна самоконтролирана задача:
Каузално езиково моделиране (Causal Language Modeling, CLM)
- Принцип на работа: Моделът се обучава да предсказва следващия token в последователността. На всяка стъпка от обучението той получава на вход фрагмент от текст и трябва да генерира разпределение на вероятностите за следващия token.
- Цел: Максимизиране на вероятността за правилния следващ token върху огромни обеми текстови данни. Тази, на пръв поглед проста, задача принуждава модела да изучава граматика, синтаксис, факти за света и сложни закономерности на езика.
Приложение
Благодарение на своята авторегресивна природа, моделите само-декодер са идеално подходящи за всякакви задачи, изискващи генериране на текст:
- Свободно генериране на текст: Писане на статии, стихове, сценарии и т.н.
- Диалогови системи и чат-ботове: Отговори на въпроси на потребителите в разговорен стил.
- Обобщаване: Създаване на резюме на дълги текстове.
- Машинен превод: Въпреки че за тази цел често се използват модели енкодер-декодер, моделите само-декодер също могат да се справят с превода, ако задачата е формулирана в prompt-а (например „Преведи от английски на български: …").
- Писане на код: Генериране на код по текстово описание.
- Обучение в контекст (In-context learning): Благодарение на мащаба си, големите модели-декодери демонстрират способността да решават нови задачи, след като са получили само няколко примера (few-shot) или дори без такива (zero-shot) директно в prompt-а, без необходимост от допълнително обучение (fine-tuning).
Основни модели и тяхната еволюция
- Серия GPT (2018 — до днес): Пионери и популяризатори на подхода. GPT-1 показа ефективността на предобучението, GPT-2 демонстрира мощта на мащабирането, а GPT-3 — появата на few-shot способности. ChatGPT и GPT-4 превърнаха тази архитектура в стандарт за AI-асистенти.
- LLaMA (2023 — до днес): Серия отворени модели от Meta, която демократизира достъпа до мощни LLM и стимулира вълна от иновации в общността.
- Claude (2023 — до днес): Семейство модели от Anthropic, фокусирано върху безопасността и управляемостта чрез Constitutional AI.
- PaLM и Gemini (2022 — до днес): Флагманските модели на Google. Gemini е също така нативно мултимодален модел само-декодер.
Сравнение с други архитектури
| Архитектура | Основна задача | Посока на контекста | Типични модели |
|---|---|---|---|
| Само-декодер | Генериране на текст | Еднопосочно (отляво надясно) | GPT, LLaMA, Claude, Gemini |
| Само-енкодер | Разбиране на текст | Двупосочно | BERT, RoBERTa |
| Енкодер-декодер | Трансформиране на последователност в последователност | Двупосочно (енкодер) + Еднопосочно (декодер) | T5, BART, оригинален Transformer |
Вижте също
- GPT