Encoder-only models (TR)
Yalnızca kodlayıcı modeller (İng. Encoder-Only Models) — büyük dil modellerinin (LLM) yalnızca Transformer mimarisinin kodlayıcı (encoder) bölümünü kullanan bir mimari sınıfıdır. Dekoder kullanan ya da tam encoder-decoder mimarisine sahip modellerden farklı olarak, bu modeller doğal dil anlama (Natural Language Understanding, NLU) görevlerinde uzmanlaşmıştır.
Bu yaklaşımın öncüsü ve amiral gemisi modeli, 2018 yılında Google tarafından geliştirilen BERT (Bidirectional Encoder Representations from Transformers) modelidir.
Kavram ve Mimari
Yalnızca kodlayıcı modellerin temel fikri, giriş dizisindeki her token için derin, bağlamlaştırılmış temsiller (embedding) oluşturmaktır. Transformer'daki öz-dikkat (self-attention) mekanizması sayesinde her token, dizideki tüm diğer tokenları "görebilir" ve bunlarla etkileşime girebilir; bu da modelin zengin bir bağlamı kavramasını sağlar.
Temel özellik çift yönlülüktür: her tokenın temsili, aynı anda hem sol hem de sağ bağlam esas alınarak oluşturulur. Bu durum, onları yapıları gereği tek yönlü olan otoregresif yalnızca-dekodер modellerinden (GPT gibi) köklü biçimde ayırmaktadır.
Mimari açıdan model, özdeş encoder katmanından oluşan bir yığındır. Her katman iki temel alt katmandan meydana gelir:
- Çok Başlıklı Öz-Dikkat (Multi-Head Self-Attention): Her token için bağlamlaştırılmış bir temsil hesaplar.
- İleri Beslemeli Sinir Ağı (Feed-Forward Network): Her token temsiline doğrusal olmayan bir dönüşüm uygular.
Çıkışta model, giriş dizisiyle aynı uzunlukta bir vektör dizisi üretir; her vektör, ilgili giriş tokenının zengin bir temsilidir.
Ön Eğitim Görevleri
Modelin dili çift yönlü bir bağlamda anlamasını sağlamak amacıyla özel öz-denetimli ön eğitim görevleri kullanılır:
Maskeli Dil Modellemesi (Masked Language Modeling, MLM)
Bu, yalnızca kodlayıcı modeller için temel ve en önemli görevdir; ilk olarak BERT'te tanıtılmıştır.
- Çalışma prensibi: Giriş dizisindeki tokenların küçük bir yüzdesi (genellikle %15) rastgele gizlenir (maskelenir). Modelin görevi, çevreleyen çift yönlü bağlamı kullanarak bu maskelenmiş tokenların özgün değerlerini tahmin etmektir.
- Amaç: Bu görev, modeli kelimeler arasındaki derin anlamsal ve sözdizimsel ilişkileri öğrenmeye zorlar.
Sonraki Cümle Tahmini (Next Sentence Prediction, NSP)
Bu görev (yine orijinal BERT'ten) modele cümleler arasındaki ilişkileri anlamayı öğretmek amacıyla geliştirilmiştir.
- Çalışma prensibi: Modele bir cümle çifti verilir ve ikinci cümlenin özgün metinde birincinin mantıksal devamı olup olmadığını belirlemesi beklenir.
- Güncel durum: Daha sonra yapılan araştırmalar (örneğin RoBERTa modelinde) NSP'nin MLM'den daha az etkili olduğunu ortaya koymuş; bu görev çoğunlukla başka görevlerle değiştirilmiş ya da tamamen kaldırılmıştır.
Kullanım Alanları
Yalnızca kodlayıcı modeller, otoregresif bir dekodere sahip olmadıklarından serbest biçimde metin üretmeye uygun değildir. Güçleri metin analizi ve anlama konusunda yatmaktadır. Modelin çıkış vektör temsilleri, geniş bir NLU görevi yelpazesini çözmek için kullanılır:
- Metin sınıflandırma: Duygu analizi veya konu belirleme gibi görevlerde, her dizinin başına eklenen özel `[CLS]` tokenının temsili kullanılır. Bu tokenın son vektörü, tüm dizi hakkındaki bilgiyi bir araya toplar.
- Token sınıflandırma: Adlandırılmış varlık tanıma (NER) veya sözcük türü etiketleme (POS-tagging) gibi görevlerde her bir tokenın vektör temsilleri kullanılır.
- Soru Yanıtlama (Question Answering): Yanıtın verilen metinden bir parça olduğu görevlerde (extractive QA), model yanıtın başlangıç ve bitiş tokenlarını tahmin etmek üzere eğitilir.
- Embedding elde etme: Encoder modeller, yüksek kaliteli cümle veya belge embedding'leri elde etmek amacıyla evrensel metin kodlayıcıları olarak sıkça kullanılır; bu embedding'ler daha sonra arama sistemlerinde veya anlamsal benzerlik görevlerinde kullanılabilir.
Temel Modeller ve Evrimi
- BERT (2018): Mimarinin öncüsü; pek çok NLP benchmark'ında yeni rekorlar kırmıştır.
- RoBERTa (2019): «Sağlam biçimde optimize edilmiş BERT». BERT'in performansının, daha fazla veri üzerinde daha uzun süre eğitim yapılarak ve NSP görevi kaldırılarak önemli ölçüde artırılabileceğini göstermiştir.
- ALBERT (2019): «A Lite BERT». Embedding faktörizasyonu ve katmanlar arası parametre paylaşımı teknikleri sayesinde çok daha az parametreye sahip bir modeldir.
- DistilBERT (2019): Bilgi damıtma (knowledge distillation) yöntemiyle oluşturulmuş, daha hızlı ve hafif olan, ancak orijinalin performansının büyük bölümünü koruyan küçültülmüş bir BERT sürümüdür.
- ELECTRA (2020): Daha verimli bir ön eğitim görevi olan replaced token detection'ı tanıtmıştır; bu görevde model, küçük bir üretici model tarafından oluşturulan "sahte" tokenları özgün tokenlardan ayırt etmeyi öğrenir.
- DeBERTa (2020): Token içeriklerini ve göreli konumlarını ayrı ayrı kodlayan «ayrıştırılmış dikkat» (disentangled attention) mekanizmasını tanıtmıştır.
Ayrıca bakınız
- BERT