Decoder-only models (architecture) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Модели само-декодер (англ. Decoder-Only Models) — това е доминиращият клас архитектури на големи езикови модели (LLM), базирани изключително на декодиращата част (декодера) на архитектурата Transformer. Тези модели са специализирани в задачи за генериране на текст и са в основата на повечето съвременни чат-ботове и AI-асистенти.

Флагманската серия, популяризирала този подход, е серията модели GPT на OpenAI.

Концепция и архитектура

Основната идея на моделите само-декодер се състои в авторегресивното генериране на последователности. Това означава, че моделът предсказва следващия token, въз основа на всички предишни token-и, генерирани до момента. Входният prompt (заявката на потребителя) и вече генерираният текст се разглеждат като единна последователност, която моделът продължава.

Архитектурно моделът представлява стек от N идентични слоя на декодера. Всеки слой, за разлика от енкодера или пълния декодер, съдържа само два основни подслоя:

  1. Маскирано многоглаво самовнимание (Masked Multi-Head Self-Attention): Това е ключовият механизъм, осигуряващ авторегресивното свойство. По време на обработката на последователността специална каузална маска (causal mask) не позволява на всеки token да „гледа" към следващите token-и. По този начин предсказването за позиция i зависи единствено от token-ите на позиции <i.
  2. Напълно свързана невронна мрежа (Feed-Forward Network): Прилага нелинейна трансформация към представянето на всеки token.

В моделите само-декодер липсва механизъм за кръстосано внимание (cross-attention), тъй като няма енкодер, към който да се „насочва внимание".

Задачи за предварително обучение

Моделите само-декодер се обучават върху една, но изключително мощна самоконтролирана задача:

Каузално езиково моделиране (Causal Language Modeling, CLM)

  • Принцип на работа: Моделът се обучава да предсказва следващия token в последователността. На всяка стъпка от обучението той получава на вход фрагмент от текст и трябва да генерира разпределение на вероятностите за следващия token.
  • Цел: Максимизиране на вероятността за правилния следващ token върху огромни обеми текстови данни. Тази, на пръв поглед проста, задача принуждава модела да изучава граматика, синтаксис, факти за света и сложни закономерности на езика.

Приложение

Благодарение на своята авторегресивна природа, моделите само-декодер са идеално подходящи за всякакви задачи, изискващи генериране на текст:

  • Свободно генериране на текст: Писане на статии, стихове, сценарии и т.н.
  • Диалогови системи и чат-ботове: Отговори на въпроси на потребителите в разговорен стил.
  • Обобщаване: Създаване на резюме на дълги текстове.
  • Машинен превод: Въпреки че за тази цел често се използват модели енкодер-декодер, моделите само-декодер също могат да се справят с превода, ако задачата е формулирана в prompt-а (например „Преведи от английски на български: …").
  • Писане на код: Генериране на код по текстово описание.
  • Обучение в контекст (In-context learning): Благодарение на мащаба си, големите модели-декодери демонстрират способността да решават нови задачи, след като са получили само няколко примера (few-shot) или дори без такива (zero-shot) директно в prompt-а, без необходимост от допълнително обучение (fine-tuning).

Основни модели и тяхната еволюция

  • Серия GPT (2018 — до днес): Пионери и популяризатори на подхода. GPT-1 показа ефективността на предобучението, GPT-2 демонстрира мощта на мащабирането, а GPT-3 — появата на few-shot способности. ChatGPT и GPT-4 превърнаха тази архитектура в стандарт за AI-асистенти.
  • LLaMA (2023 — до днес): Серия отворени модели от Meta, която демократизира достъпа до мощни LLM и стимулира вълна от иновации в общността.
  • Claude (2023 — до днес): Семейство модели от Anthropic, фокусирано върху безопасността и управляемостта чрез Constitutional AI.
  • PaLM и Gemini (2022 — до днес): Флагманските модели на Google. Gemini е също така нативно мултимодален модел само-декодер.

Сравнение с други архитектури

Сравнение на ключови архитектури на базата на Transformer
Архитектура Основна задача Посока на контекста Типични модели
Само-декодер Генериране на текст Еднопосочно (отляво надясно) GPT, LLaMA, Claude, Gemini
Само-енкодер Разбиране на текст Двупосочно BERT, RoBERTa
Енкодер-декодер Трансформиране на последователност в последователност Двупосочно (енкодер) + Еднопосочно (декодер) T5, BART, оригинален Transformer

Вижте също

  • GPT