Decoder-only models (architecture) (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

Model hanya-dekoder (Ingg. Decoder-Only Models) — adalah kelas arsitektur dominan dari model bahasa besar (LLM) yang didasarkan secara eksklusif pada bagian dekoder dari arsitektur Transformer. Model-model ini mengkhususkan diri pada tugas generasi teks dan menjadi fondasi bagi sebagian besar chatbot dan asisten AI modern.

Jajaran model yang mempopulerkan pendekatan ini adalah seri model GPT dari OpenAI.

Konsep dan Arsitektur

Gagasan utama model hanya-dekoder terletak pada generasi autoregresif dari sekuens. Artinya, model memprediksi token berikutnya berdasarkan semua token sebelumnya yang telah dihasilkan. Prompt masukan (permintaan pengguna) dan teks yang sudah dihasilkan diperlakukan sebagai satu sekuens tunggal yang dilanjutkan oleh model.

Secara arsitektural, model terdiri dari tumpukan N lapisan dekoder yang identik. Setiap lapisan, berbeda dari enkoder atau dekoder penuh, hanya mengandung dua sub-lapisan utama:

  1. Masked Multi-Head Self-Attention (Perhatian-diri multi-kepala bertopeng): Ini adalah mekanisme kunci yang memastikan sifat autoregresif. Selama pemrosesan sekuens, kausal mask (causal mask) khusus mencegah setiap token untuk "melihat" token-token berikutnya. Dengan demikian, prediksi untuk posisi i hanya bergantung pada token-token di posisi <i.
  2. Feed-Forward Network (Jaringan saraf terhubung penuh): Menerapkan transformasi nonlinier pada representasi setiap token.

Dalam model hanya-dekoder tidak terdapat mekanisme cross-attention (perhatian silang), karena tidak ada enkoder yang dapat "diperhatikan".

Tugas Pra-pelatihan

Model hanya-dekoder dilatih pada satu tugas yang sangat kuat berbasis pembelajaran mandiri:

Causal Language Modeling - Pemodelan Bahasa Kausal (CLM)

  • Prinsip kerja: Model dilatih untuk memprediksi token berikutnya dalam sebuah sekuens. Pada setiap langkah pelatihan, model menerima fragmen teks sebagai masukan dan harus menghasilkan distribusi probabilitas untuk token berikutnya.
  • Tujuan: Memaksimalkan probabilitas token berikutnya yang benar pada volume data teks yang sangat besar. Tugas yang tampak sederhana ini memaksa model untuk mempelajari tata bahasa, sintaksis, fakta tentang dunia, dan pola bahasa yang kompleks.

Penerapan

Berkat sifat autoregresifnya, model hanya-dekoder sangat cocok untuk berbagai tugas yang memerlukan generasi teks:

  • Generasi teks bebas: Penulisan artikel, puisi, skenario, dan lain-lain.
  • Sistem dialog dan chatbot: Menjawab pertanyaan pengguna dalam gaya percakapan.
  • Sumarisasi: Membuat ringkasan dari teks-teks panjang.
  • Terjemahan mesin: Meskipun model enkoder-dekoder sering digunakan untuk ini, model hanya-dekoder juga dapat menangani terjemahan apabila tugas dirumuskan dalam prompt (misalnya, "Terjemahkan dari bahasa Inggris ke bahasa Indonesia: ...").
  • Penulisan kode: Menghasilkan kode berdasarkan deskripsi teks.
  • In-context learning - Pembelajaran dalam konteks: Berkat skalanya, model-model dekoder besar menunjukkan kemampuan untuk menyelesaikan tugas-tugas baru hanya dengan beberapa contoh (few-shot) atau bahkan tanpa contoh sama sekali (zero-shot) langsung di dalam prompt, tanpa memerlukan fine-tuning.

Model-model Utama dan Evolusinya

  • Seri GPT (2018–sekarang): Pelopor dan popularisator pendekatan ini. GPT-1 menunjukkan efektivitas pra-pelatihan, GPT-2 mendemonstrasikan kekuatan penskalaan, dan GPT-3 — munculnya kemampuan few-shot. ChatGPT dan GPT-4 menjadikan arsitektur ini standar bagi asisten AI.
  • LLaMA (2023–sekarang): Seri model terbuka dari Meta yang mendemokratisasi akses ke LLM yang kuat dan mendorong gelombang inovasi di komunitas.
  • Claude (2023–sekarang): Keluarga model dari Anthropic, berfokus pada keamanan dan keterkendaliaan melalui Constitutional AI.
  • PaLM dan Gemini (2022–sekarang): Model unggulan Google. Gemini juga merupakan model hanya-dekoder yang secara native bersifat multimodal.

Perbandingan dengan Arsitektur Lainnya

Perbandingan arsitektur utama berbasis Transformer
Arsitektur Tugas Utama Arah Konteks Model Tipikal
Hanya-dekoder Generasi teks Satu arah (kiri ke kanan) GPT, LLaMA, Claude, Gemini
Hanya-enkoder Pemahaman teks Dua arah BERT, RoBERTa
Enkoder-dekoder Transformasi sekuens ke sekuens Dua arah (enkoder) + Satu arah (dekoder) T5, BART, Transformer orisinal

Lihat Juga

  • GPT