BERT (language model) (TR)
BERT (Bidirectional Encoder Representations from Transformers, transformerlardan elde edilen çift yönlü kodlayıcı temsilleri) — doğal dil anlama için Google araştırmacıları tarafından geliştirilen ve 2018 yılında tanıtılan büyük bir dil modelidir (LLM). BERT, geniş bir görev yelpazesinde eşi görülmemiş bir performans sergileyerek ve «ön eğitim + ince ayar» (pre-train & fine-tune) paradigmasını sektörde standart olarak yerleştirerek doğal dil işleme (NLP) alanında yeni bir çağın başlangıcını simgeledi.
BERT'in temel yeniliği, modelin ağın tüm katmanlarında bir kelimenin bağlamını aynı anda hem soldan hem de sağdan dikkate almasını sağlayan derin çift yönlü mimarisidir. Bu, yeni bir ön eğitim görevi olan Masked Language Modeling (MLM) ile gerçekleştirilir.
Namelendirme ve Çalışma Prensibi
BERT kısaltması Bidirectional Encoder Representations from Transformers ifadesinin baş harflerinden oluşur.
- Bidirectional (Çift Yönlü): Modelin temel özelliğini belirtir — bir kelimenin bağlamını her iki yönde (soldan sağa ve sağdan sola) aynı anda işleyebilme yeteneği. Yalnızca önceki bağlamı görebilen tek yönlü modellerin (GPT gibi) aksine, BERT tüm diziyi bir bütün olarak görerek kelimenin anlamını daha derin ve doğru biçimde kavramasını sağlar.
- Encoder (Kodlayıcı): BERT'in Transformer mimarisinin yalnızca kodlayıcı bölümünü kullandığını ifade eder. Kodlayıcının görevi, giriş metin dizisini okumak ve her token için zengin bağlamsal bir temsil (vektör) oluşturmaktır. BERT, kod çözücü modeller gibi serbest formda metin üretmek için tasarlanmamıştır.
- Representations (Temsiller): Model, sözcükler ve cümleler için yüksek kaliteli sayısal temsiller (vektörler veya embedding'ler) oluşturmayı öğrenir; bu temsiller daha sonra çeşitli NLP görevlerini çözmek için kullanılabilir.
- from Transformers: Modelin mimarisinin tamamen Transformer'a dayandığını belirtir.
Yaratılış Tarihi
BERT'in geliştirilmesi, NLP alanındaki birkaç önemli atılımın sonucudur:
- Bağlamsal embedding'ler: Word2vec ve GloVe gibi modeller, bağlamı dikkate almaksızın sözcükler için statik vektörler oluşturuyordu. ELMo modeli (2018), çift yönlü LSTM ağları kullanarak bağlama bağlı temsiller üreterek bir adım öne geçti; ancak bu çift yönlülük «yüzeysel» kalmaktaydı (iki tek yönlü modelin birleştirilmesi).
- Transfer öğrenimi ve GPT: 2018 yılının ortasında OpenAI, GPT modelini tanıttı; bu model, büyük bir transformer modelinin etiketlenmemiş veriler üzerinde ön eğitiminin ardından belirli görevlerde ince ayar (fine-tuning) yapılmasının ne kadar etkili olduğunu kanıtladı. Ancak GPT kesinlikle tek yönlüydü (soldan sağa), bu da tam bağlam anlayışı gerektiren görevlerdeki yeteneklerini sınırlandırıyordu.
Bu sınırlılıkların farkında olan Jacob Devlin liderliğindeki Google araştırmacıları, gerçek anlamda derin çift yönlü bir model oluşturmak amacıyla BERT'i geliştirdi. BERT hakkındaki makale Ekim 2018'de arXiv'de yayımlandı; kod ve ön eğitimli modeller kamuya açık hale getirildi ve bu durum bilim dünyasında büyük bir ilgi patlamasına neden oldu. BERT, GLUE ve SQuAD dahil 11 temel NLP benchmark'ında rekor kırdı ve tek bir evrensel modelin birçok göreve kolaylıkla uyarlanabilmesi nedeniyle NLP için «ImageNet anı» olarak nitelendirildi.
Mimari
BERT tamamen Transformer mimarisinin kodlayıcı (encoder) bölümüne dayanır. Birbirinin üzerine yığılmış birkaç özdeş katmandan oluşur. İki temel sürümü mevcuttur:
- BERT-Base: 12 katman, 12 dikkat başlığı, gizli durum boyutu 768, toplam parametre sayısı ~110 milyon.
- BERT-Large: 24 katman, 16 dikkat başlığı, gizli durum boyutu 1024, toplam parametre sayısı ~340 milyon.
Her katman iki temel alt katman içerir:
- Çok Başlıklı Öz-Dikkat Mekanizması (Multi-Head Self-Attention): Giriş dizisindeki her token'ın, kendi bağlamsal anlamını belirlemek için diğer tüm token'lara «dikkat etmesini» ve önemlerini ağırlıklandırmasını sağlar.
- Tam Bağlantılı Sinir Ağı (Feed-Forward Network): Her token'a ayrı ayrı uygulanır.
Giriş Verisi
BERT'in doğru çalışması için giriş verisinin özel biçimde biçimlendirilmesi gerekir. Giriş olarak verilen token dizisi her zaman özel bir token olan `[CLS]` (classification) ile başlar; bu token tüm metnin sınıflandırılması gereken görevlerde kullanılır. Giriş olarak bir cümle çifti verildiğinde (örneğin soru-cevap sistemlerinde), cümleler `[SEP]` (separator) token'ı ile ayrılır.
Girişte her token'ın nihai temsili üç embedding'in toplamından oluşur:
- Token embedding: Sözcük dağarcığındaki belirli bir token'a karşılık gelen vektör (BERT, WordPiece tokenizasyonu kullanır).
- Segment embedding: Token'ın hangi cümleye (birinci mi ikinci mi) ait olduğunu belirtir.
- Konum embedding'i: Token'ın dizideki konumunu belirtir; çünkü Transformer mimarisi kendi başına sözcüklerin sırasını dikkate almaz.
Ön Eğitim Görevleri
Derin çift yönlülüğü sağlamak için BERT, aynı anda iki benzersiz görev üzerinde eğitilir.
Masked Language Modeling (MLM)
Bu, BERT'in temel yeniliğidir. Standart dil modellerinde olduğu gibi bir sonraki kelimeyi tahmin etmek yerine, BERT cümledeki rastgele «maskelenmiş» kelimeleri tahmin eder. Süreç şu şekilde işler:
- Giriş dizisinden rastgele olarak %15 token seçilir.
- Bu %15'in içinden:
- %80'i özel `[MASK]` token'ı ile değiştirilir.
- %10'u sözcük dağarcığından rastgele bir token ile değiştirilir.
- %10'u değiştirilmeden bırakılır.
- Modelin görevi, bu %15 token'ın orijinal değerlerini çevreleyen (sol ve sağ) bağlama dayanarak tahmin etmektir.
Bu şema, modeli sözcükler arasındaki derin anlamsal ve sözdizimsel bağlantıları öğrenmeye zorlar ve gerçek anlamda çift yönlü olmasını sağlar.
Next Sentence Prediction (NSP)
Bu görev, BERT'e soru-cevap sistemleri veya metinsel çıkarım analizi (NLI) gibi görevler için kritik öneme sahip olan cümleler arası ilişkileri anlamayı öğretmek amacıyla tasarlanmıştır. Modele bir cümle çifti (A ve B) verilir ve B cümlesinin A cümlesinin mantıksal devamı olup olmadığını tahmin etmesi beklenir.
- Vakaların %50'sinde B, kaynak metindeki gerçekten bir sonraki cümledir.
- Vakaların %50'sinde B, külliyattan başka bir yerden alınan rastgele bir cümledir.
Sonraki araştırmalar (örneğin RoBERTa modelinde), NSP görevinin MLM'den daha az önemli olduğunu ve daha verimli eğitim şemaları lehine bundan vazgeçilebileceğini göstermiştir; ancak orijinal BERT'te önemli bir rol oynamaktaydı.
Uygulama ve İnce Ayar (Fine-Tuning)
BERT'in gücü, transfer öğrenimi paradigmasında yatmaktadır. Büyük külliyatlar (Wikipedia + BooksCorpus) üzerinde yapılan kapsamlı ve maliyetli ön eğitimin ardından, ön eğitimli model belirli bir uygulama görevi için kolayca ve hızla ince ayar (fine-tune) yapılabilir.
İnce ayar süreci genellikle şu şekilde işler: 1. Ön eğitimli BERT mimarisine, göreve özgü küçük ve eğitilmemiş bir katman eklenir (örneğin duygu analizi için bir sınıflandırıcı). 2. Tüm model (BERT ağırlıkları ve yeni katman dahil), o göreve ait küçük ve etiketlenmiş bir veri kümesi üzerinde eğitilir.
BERT'in uyarlandığı görev örnekleri:
- Metin sınıflandırması (duygu analizi, spam filtreleri): `[CLS]` token'ının çıkışına bir sınıflandırıcı eklenir.
- Soru-cevap sistemleri (örneğin SQuAD): Model, verilen metindeki cevabın başlangıç ve bitiş token'larını tahmin etmeyi öğrenir.
- Adlandırılmış varlık tanıma (NER): Her token'ın çıkışına, o token'ın bir isim, kuruluş, tarih vb. parçası olup olmadığını belirleyen bir sınıflandırıcı eklenir.
Varyantlar ve Türev Modeller
BERT'in başarısı, onun fikirlerine dayanan bir model ailesinin ortaya çıkmasına yol açtı:
- RoBERTa (Facebook AI): «Sağlam biçimde optimize edilmiş BERT». Yeni bir mimari değil, daha çok BERT'in daha dikkatli ve uzun süreli eğitiminin ürünüdür: daha fazla veri, NSP görevi olmaksızın ve dinamik maskeleme ile. RoBERTa, orijinal BERT'in «yetersiz eğitildiğini» ortaya koydu ve tüm temel benchmark'larda onu geride bıraktı.
- DistilBERT (Hugging Face): Bilgi damıtma tekniği kullanılarak oluşturulmuş, BERT'in küçültülmüş bir versiyonu. DistilBERT, %40 daha küçük, %60 daha hızlı olup BERT performansının %97'sini korur; bu da onu üretim ortamında ve kısıtlı kaynaklara sahip cihazlarda kullanım için ideal kılar.
- ALBERT (A Lite BERT, Google): Parametre sayısını azaltmak amacıyla optimize edilmiş bir versiyon. İki temel teknik kullanır: embedding faktorizasyonu ve katmanlar arası parametre paylaşımı (cross-layer parameter sharing). Bu, çok daha az parametreyle çok daha büyük modeller oluşturmayı mümkün kılar.
- mBERT (Multilingual BERT): Aynı anda 104 dil üzerinde ön eğitim yapılmış BERT versiyonu. Diller arası bilgi aktarımı konusunda şaşırtıcı bir yetenek sergilemiştir.
- Alan-spesifik modeller: BioBERT (biyomedikal), SciBERT (bilimsel metinler) ve FinBERT (finans) gibi belirli alanların verisi üzerinde ince ayar yapılmış çok sayıda model.
- ModernBERT (2024-2025): Answer.AI ve LightOn şirketlerinden yeni nesil BERT benzeri modeller; RoPE (Rotary Position Embeddings) ve daha uzun bağlam desteği (8192 token'a kadar) gibi modern mimari iyileştirmeleri içerirken BERT'in temel ilkelerini korur.
Diğer Modellerle Karşılaştırma
| Model | Geliştirici | Mimari | Bağlam Yönü | Temel Görev |
|---|---|---|---|---|
| BERT | Encoder | Çift yönlü | Metin anlama, sınıflandırma, bilgi çıkarma | |
| GPT | OpenAI | Decoder | Tek yönlü (soldan sağa) | Metin üretimi, dizi tamamlama |
| XLNet | Google / CMU | Otoregresif (permütasyon) | Çift yönlü (teoride) | Metin anlama (MLM'e alternatif) |
| T5 | Encoder-Decoder | Çift yönlü (encoder) + Tek yönlü (decoder) | Evrensel «metinden metne» dönüşüm |
Etki
BERT, NLP alanında gerçek bir devrim yarattı ve pek çok sonraki gelişmenin temelini attı:
- «Ön eğitim + ince ayar» paradigmasını NLP'de baskın yaklaşım olarak yerleştirdi.
- Dil anlama için derin çift yönlü bağlamın önemini kanıtladı.
- Araştırmacıların ve geliştiricilerin her görev için sıfırdan karmaşık mimariler oluşturmasına gerek kalmadığından, yüksek performanslı NLP sistemleri oluşturmanın giriş engelini düşürdü.
- Google Arama'ya entegre edildi; bu, arama motorunun tüm tarihi boyunca gerçekleştirilen en büyük güncellemelerden biri oldu ve modelin pratik faydasını açıkça ortaya koydu.
- Türev modellerin, araçların ve araştırmaların («BERTology») oluşturduğu bir ekosistemi ortaya çıkardı ve yapay zeka alanının en çok atıf alan çalışmalarından biri haline geldi.
GPT-3 ve GPT-4 gibi daha yeni ve büyük modeller pek çok benchmark'ta (özellikle üretken görevlerde) BERT'i geride bırakmış olsa da, BERT ve varyantları derin metin anlama gerektiren görevler için hâlâ güçlü ve yaygın biçimde kullanılan araçlar olmaya devam etmektedir.
Dış bağlantılar
- GitHub'da BERT'in resmi deposu
- Google AI blogunda BERT duyurusu
- The Illustrated BERT — BERT mimarisinin görsel açıklaması
Kaynakça
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Peters, M. E. et al. (2018). Deep Contextualized Word Representations. arXiv:1802.05365.
- Liu, Y. et al. (2019). RoBERTa: A Robustly Optimized BERT Pretraining Approach. arXiv:1907.11692.
- Lan, Z. et al. (2020). ALBERT: A Lite BERT for Self-supervised Learning of Language Representations. arXiv:1909.11942.
- Sanh, V. et al. (2020). DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter. arXiv:1910.01108.
- Yang, Z. et al. (2019). XLNet: Generalized Autoregressive Pretraining for Language Understanding. arXiv:1906.08237.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
- Lee, J. et al. (2020). BioBERT: a pre-trained biomedical language representation model for biomedical text mining. arXiv:1901.08746.
- Warner, B. et al. (2024). Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference. arXiv:2412.13663.