Pre-training of large language models (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

Pra-pelatihan Large Language Model (LLM) — merupakan tahap fundamental dalam pembuatan Large Language Model modern, yang terdiri dari pelatihan model pada kumpulan teks tidak berlabel yang sangat besar dan beragam. Proses ini memungkinkan model untuk menyerap pola bahasa umum, pengetahuan tentang dunia, dan hubungan semantik, sehingga membentuk apa yang disebut model fondasi (foundation model), yang kemudian dapat diadaptasi untuk menyelesaikan tugas-tugas tertentu.

Apa itu pra-pelatihan?

Pra-pelatihan (pre-training) merupakan fase awal pelatihan, di mana LLM dilatih pada dataset teks berskala besar menggunakan metode self-supervised learning. Ini berarti sinyal pelatihan (label) dihasilkan dari data itu sendiri, tanpa memerlukan anotasi manual oleh manusia.

Tujuan utama tahap ini adalah memprediksi bagian teks yang tersembunyi atau yang akan datang. Bergantung pada arsitektur, dua tugas utama digunakan:

  • Causal Language Modeling (CLM): Model belajar memprediksi kata (token) berikutnya dalam urutan berdasarkan semua kata sebelumnya. Pendekatan ini mendasari model generatif seperti GPT.
  • Masked Language Modeling (MLM): Model belajar memulihkan kata-kata yang secara acak "disamarkan" (disembunyikan) dalam teks, menggunakan konteks dua arah di sekitarnya (kata di kiri dan kanan). Metode ini digunakan dalam model seperti BERT.

Berkat tugas-tugas ini, model terpaksa mempelajari sintaksis, semantik, dan pengetahuan faktual tentang dunia agar dapat membuat prediksi dengan berhasil.

Data untuk pra-pelatihan

Efektivitas pra-pelatihan sangat bergantung pada kualitas dan keberagaman data pelatihan. Sumber-sumber utama yang digunakan adalah sebagai berikut:

  • Halaman web: Dataset seperti Common Crawl dan C4 menyediakan spektrum topik, gaya, dan bahasa yang luas, merepresentasikan "rekaman" internet.
  • Buku: Korpus seperti BookCorpus dan The Pile menyediakan teks terstruktur dan kohesif, berguna untuk memahami ketergantungan jangka panjang dan narasi.
  • Data percakapan: Data dari forum (misalnya Reddit) dan media sosial, yang membantu model menguasai bahasa informal dan pola dialog.
  • Data khusus: Artikel ilmiah (dari arXiv), kode program (dari GitHub dan The Stack), atau teks multibahasa untuk meningkatkan kemampuan spesifik model.

Contoh distribusi data

Model yang berbeda menggunakan perbandingan sumber yang berbeda, yang memengaruhi kemampuan akhir mereka:

  • GPT-3 (175 miliar parameter):** 16% buku, 84% halaman web.
  • PaLM (540 miliar parameter):** 5% buku, 14% halaman web, 50% data percakapan, 31% lainnya.
  • LLaMA (65 miliar parameter):** 5% buku, 2% halaman web, 87% data percakapan.

Distribusi ini menunjukkan bahwa pemilihan data merupakan keputusan strategis yang bervariasi tergantung pada tujuan model.

Korpus yang sering digunakan

Dataset yang sering digunakan untuk pra-pelatihan LLM
Korpus Ukuran Sumber Pembaruan terakhir
BookCorpus 5GB Buku Des-2015
Gutenberg - Buku Des-2021
C4 800GB Common Crawl Apr-2019
CC-Stories-R 31GB Common Crawl Sep-2019
CC-NEWS 78GB Common Crawl Feb-2019
REALNEWS 120GB Common Crawl Apr-2019
OpenWebText 38GB Tautan Reddit Mar-2023
Pushshift.io 2TB Tautan Reddit Mar-2023
Wikipedia 21GB Wikipedia Mar-2023
The Pile 800GB Lainnya Des-2020
ROOTS 1.6TB Lainnya Jun-2022

Teknik pelatihan

Pra-pelatihan LLM membutuhkan sumber daya komputasi yang signifikan. Teknik-teknik berikut digunakan untuk mengelola proses ini:

  • Pelatihan terdistribusi: Penggunaan beberapa GPU atau TPU untuk pemrosesan paralel.
  • Mixed Precision: Penggunaan format numerik dengan presisi lebih rendah (misalnya, 16-bit alih-alih 32-bit) untuk mempercepat komputasi dan mengurangi penggunaan memori.
  • Gradient Checkpointing: Teknik untuk menghemat memori dengan menghitung ulang, bukan menyimpan beberapa aktivasi perantara.
  • Model Parallelism: Mendistribusikan model itu sendiri ke beberapa perangkat.

Pelatihan model seperti GPT-3 dapat memakan waktu beberapa bulan pada ribuan GPU.

Hukum penskalaan

Penelitian seperti karya OpenAI (Kaplan et al., 2020) menunjukkan bahwa performa model bahasa meningkat secara prediktabel seiring bertambahnya tiga faktor:

  • Ukuran model (jumlah parameter).
  • Volume data.
  • Sumber daya komputasi.

Ketergantungan empiris ini, yang dikenal sebagai hukum penskalaan, berfungsi sebagai panduan bagi para pengembang dalam merancang dan melatih model yang lebih besar dan lebih kuat, sehingga memungkinkan alokasi anggaran komputasi secara optimal.

Tantangan dan pencapaian

  • Penskalaan: Pencapaian utama pra-pelatihan adalah kemampuan untuk menyeimbangkan ukuran model, data, dan komputasi guna mencapai performa optimal.
  • Kualitas data: Memastikan kebersihan, keberagaman, dan ketiadaan bias dalam data pelatihan merupakan tantangan utama.
  • Efisiensi: Pengembangan metode untuk mengurangi biaya komputasi, seperti pra-pelatihan berkelanjutan atau arsitektur yang lebih efisien.
  • Multibahasa: Pembuatan model yang mampu memproses beberapa bahasa secara efektif memerlukan pemilihan dan penyeimbangan data yang cermat.

Lihat juga

  • Large Language Model
  • BERT
  • GPT