Decoder-only models (architecture) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Mga modelong decoder lamang (Ingles: Decoder-Only Models) — ito ang nangingibabaw na klase ng mga arkitektura ng malalaking language model (LLM), na nakabatay nang eksklusibo sa bahaging nagde-decode (decoder) ng arkitektura ng Transformer. Ang mga modelong ito ay espesyalista sa mga gawaing pagbuo ng teksto at siyang pundasyon ng karamihan sa mga modernong chat-bot at AI assistant.

Ang linya ng modelo na nagpalaganap ng diskarteng ito ay ang seryeng GPT mula sa OpenAI.

Konsepto at Arkitektura

Ang pangunahing ideya ng mga modelong decoder lamang ay ang autoregressive na pagbuo ng mga pagkakasunud-sunod. Ibig sabihin, hinuhulaan ng modelo ang susunod na token batay sa lahat ng naunang token na nabuo na. Ang input na prompt (kahilingan ng gumagamit) at ang tekstong nabuo na ay itinuturing na isang pinag-isang pagkakasunud-sunod na tinutuloy ng modelo.

Sa aspetong arkitektura, ang modelo ay isang tumpok ng N magkaparehong decoder layer. Ang bawat layer, kumpara sa encoder o sa buong decoder, ay naglalaman lamang ng dalawang pangunahing sub-layer:

  1. Masked Multi-Head Self-Attention (Nakatakpang Multi-Ulong Sariling Pansin): Ito ang pangunahing mekanismo na tinitiyak ang katangiang autoregressive. Sa panahon ng pagpoproseso ng pagkakasunud-sunod, ang espesyal na causal mask ay pumipigil sa bawat token na "tumingin" sa mga kasunod na token. Kaya naman, ang hulaan para sa posisyon i ay nakasalalay lamang sa mga token sa mga posisyon <i.
  2. Feed-Forward Network (Ganap na Konektadong Neural Network): Inilalapat ang hindi linear na pagbabago sa representasyon ng bawat token.

Sa mga modelong decoder lamang, wala ang mekanismo ng cross-attention, dahil wala namang encoder na maaaring "bigyang-pansin".

Mga Gawain sa Paunang Pagsasanay

Ang mga modelong decoder lamang ay sinasamahan ng isang, ngunit napakalakas na self-supervised na gawain:

Causal Language Modeling (CLM) - Causal na Pagmomolde ng Wika

  • Paraan ng pagtatrabaho: Sinasamahan ang modelo na hulaan ang susunod na token sa isang pagkakasunud-sunod. Sa bawat hakbang ng pagsasanay, tumatanggap ito ng isang bahagi ng teksto bilang input at dapat itong bumuo ng distribusyon ng probabilidad para sa susunod na token.
  • Layunin: Palakihin ang probabilidad ng tamang susunod na token sa napakalaking dami ng tekstong datos. Ang gawaing ito, na tila simple sa unang tingin, ay pinipilit ang modelo na aralin ang gramatika, syntax, mga katotohanang pangmundo, at masisalimuot na mga pattern ng wika.

Paggamit

Sa kanilang likas na autoregressive na katangian, ang mga modelong decoder lamang ay perpekto para sa anumang gawaing nangangailangan ng pagbuo ng teksto:

  • Malayang pagbuo ng teksto: Pagsulat ng mga artikulo, tula, screenplay, atbp.
  • Mga diyalogo at chat-bot: Pagsagot sa mga tanong ng gumagamit sa estilo ng pakikipag-usap.
  • Summarization (Pagbubuod): Paglikha ng maikling nilalaman mula sa mahabang mga teksto.
  • Makinaryang pagsasalin: Kahit na ang mga modelong encoder-decoder ay madalas na ginagamit para dito, kaya rin ng mga modelong decoder lamang ang pagsalin kapag ang gawain ay naipahayag sa prompt (halimbawa, "Isalin mula Ingles patungong Tagalog: ...").
  • Pagsulat ng code: Pagbuo ng code batay sa tekstong paglalarawan.
  • In-context learning (Pag-aaral sa loob ng konteksto): Dahil sa kanilang laki, ipinapakita ng malalaking decoder model ang kakayahang resolbahin ang mga bagong gawain sa pamamagitan lamang ng ilang halimbawa (few-shot) o kahit wala (zero-shot) direkta sa prompt, nang hindi na kailangang mag-fine-tuning.

Mga Pangunahing Modelo at ang Kanilang Ebolusyon

  • Serye ng GPT (2018-kasalukuyan): Mga pioneer at nagpalaganap ng diskarte. Ipinakita ng GPT-1 ang bisa ng paunang pagsasanay, ipinamalas ng GPT-2 ang kapangyarihan ng scaling, at ng GPT-3 — ang paglitaw ng few-shot na kakayahan. Ginawa ng ChatGPT at GPT-4 ang arkitekturang ito bilang pamantayan para sa mga AI assistant.
  • LLaMA (2023-kasalukuyan): Serye ng bukas na mga modelo mula sa Meta, na nagpalaganap ng access sa makapangyarihang LLM at nagpasigla ng alon ng inobasyon sa komunidad.
  • Claude (2023-kasalukuyan): Pamilya ng mga modelo mula sa Anthropic, nakatuon sa kaligtasan at pamamahala sa pamamagitan ng Constitutional AI.
  • PaLM at Gemini (2022-kasalukuyan): Mga flagship na modelo ng Google. Ang Gemini ay isa ring natively multimodal na modelong decoder lamang.

Paghahambing sa Iba Pang Arkitektura

Paghahambing ng mga pangunahing arkitektura batay sa Transformer
Arkitektura Pangunahing Gawain Direksyon ng Konteksto Mga Tipikal na Modelo
Decoder lamang Pagbuo ng teksto Isang direksyon (kaliwa patungong kanan) GPT, LLaMA, Claude, Gemini
Encoder lamang Pag-unawa sa teksto Dalawang direksyon BERT, RoBERTa
Encoder-decoder Pagbabago ng pagkakasunud-sunod sa pagkakasunud-sunod Dalawang direksyon (encoder) + Isang direksyon (decoder) T5, BART, orihinal na Transformer

Tingnan din

  • GPT