---
title: "Encoder (Transformer) (TR)"
source: "https://systems-analysis.info/int/Encoder_(Transformer)_(TR)"
wiki: "systems-analysis.info/int"
article: "Encoder_(Transformer)_(TR)"
language: "tr"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 1958
wiki_created_at: 2026-09-06T22:56:34Z
wiki_modified_at: 2026-09-06T22:56:34Z
downloaded_at: 2026-09-07T22:48:40Z
---

# Encoder (Transformer) (TR)

**Enkoder** (İng. Encoder, kodlayıcı) — makine öğrenmesi ve derin öğrenmede, temel görevi giriş veri dizisini (örneğin metin veya görüntü) zengin bir sayısal temsile dönüştürmek olan sinir ağı bileşenidir; bu temsil genellikle **gizli durum**, **bağlam vektörü** veya **embedding** olarak adlandırılır. Bu temsil, giriş verilerinin temel özelliklerini ve anlambilimini, daha ileri işleme için uygun bir biçimde yakalar.

Daha geniş anlamda, bilgi teorisinde enkoder — bilgiyi bir formattan diğerine dönüştüren, çoğunlukla sıkıştırma veya iletim amacıyla kullanılan herhangi bir cihaz veya algoritmadır.

## Kavram ve Amaç

Sinir ağlarında enkoderin temel amacı, giriş verilerinden yararlı özellikler çıkarmak ve bunları sabit uzunluklu yoğun bir vektörde "kodlamak"tır. Bu süreç, doğrusal olmayan boyut indirgemenin bir biçimi olarak değerlendirilebilir: yüksek boyutlu ve seyrek giriş verileri (örneğin, one-hot vektörlerle temsil edilen metin), düşük boyutlu ancak bilgi açısından zengin bir vektör uzayına (gizil uzay) dönüştürülür.

Bu kodlanmış vektör daha sonra şu amaçlarla kullanılabilir:

- **Dekoder** tarafından yeni bir dizi üretmek için (örneğin makine çevirisinde).
- **Sınıflandırıcı** tarafından analiz görevlerini çözmek için (örneğin metin duygu analizi).
- Tüm giriş bağlamının anlaşılmasını gerektiren görevler için.

## Farklı Mimarilerde Enkoder

### Otoenkoderde Enkoder

Klasik örneklerden biri **otoenkoder** mimarisidir. İki bölümden oluşur:

1.  **Enkoder:** Giriş verilerini daha küçük boyutlu bir gizli temsile (gizil kod) sıkıştırır.
2.  **Dekoder:** Bu sıkıştırılmış temsili kullanarak orijinal verileri yeniden oluşturmaya çalışır.

Bu tür bir ağı yeniden yapılandırma hatasını en aza indirecek şekilde eğiterek enkoder, verilerden en önemli özellikleri çıkarmayı öğrenir.

### Tekrarlayan Sinir Ağlarında Enkoder (RNN/LSTM)

Transformer mimarisinin ortaya çıkmasından önce, dizi işleme görevlerindeki (seq2seq) enkoderleri tekrarlayan sinir ağlarına (RNN) veya bunların geliştirilmiş bir çeşidi olan LSTM'ye dayanıyordu.

- **Çalışma prensibi:** RNN enkoderi giriş dizisini token token işler. Her adımda, mevcut token ve önceki durum hakkındaki bilgileri birleştirerek **gizli durumunu** günceller. Tüm dizi işlendikten sonra elde edilen son gizli durum, tüm giriş dizisinin anlamını kodlayan bir vektör olarak değerlendirilir. Bu vektöre çoğunlukla **bağlam vektörü** veya "düşünce vektörü" (thought vector) denir.

### Transformer Mimarisinde Enkoder

Doğal dil işlemedeki devrim, **Transformer** mimarisine dayalı enkoderin ortaya çıkmasıyla yaşandı. RNN'den farklı olarak, dizinin tüm tokenlarını paralel olarak işler.

Transformer enkoderi, ($N$) özdeş katmanlardan oluşan bir yığından meydana gelir. Her katmanın iki temel alt katmanı vardır:

1.  **Çok Başlı Öz-Dikkat (Multi-Head Self-Attention):** Bu mekanizma, giriş dizisindeki her tokenın diğer tüm tokenlara "dikkat etmesini" ve kendi bağlamsal temsilini oluşturmak için bunların önemini ağırlıklandırmasını sağlar. Bu, modelin konumlarından bağımsız olarak kelimeler arasındaki karmaşık bağımlılıkları yakalamasına olanak tanır.
2.  **Tam Bağlantılı Sinir Ağı (Feed-Forward Network):** Her tokenın temsiline ayrı ayrı uygulanarak daha ileri doğrusal olmayan dönüşüm gerçekleştirilir.

Transformer enkoderi ile RNN enkoderi arasındaki temel fark, Transformer enkoderin çıkışta tek bir bağlam vektörü değil, **bağlamsal vektörlerden oluşan bir dizi** — her giriş tokeni için bir tane — üretmesidir. Bu vektörlerin her biri, kendi tokenı hakkındaki bilgiyi tüm dizi bağlamında içerir.

## Enkoder Tabanlı Model Türleri

### Enkoder-Dekoder Modelleri

Bu, makine çevirisi veya özetleme gibi dizi-dizi (seq2seq) dönüşüm görevleri için klasik bir mimaridir.

- **Çalışma prensibi:** Enkoder tüm giriş dizisini (örneğin kaynak dildeki cümleyi) işler. Çıkış temsilleri daha sonra dekodere aktarılır; dekoder bunları kullanarak çıkış dizisini (hedef dildeki cümleyi) otoregresif olarak üretir. Dekoder, özel bir **çapraz dikkat (cross-attention)** mekanizması aracılığıyla enkoderin çıkışına "bakar".
- **Örnekler:** Orijinal Transformer, T5, BART.

### Yalnızca Enkoder Modelleri (Encoder-Only)

Bu modeller, yalnızca Transformer enkoder yığınını kullanır.

- **Çalışma prensibi:** Tüm giriş metninin bağlamının derinlemesine anlaşılmasını gerektiren görevler için tasarlanmıştır. Öz-dikkat mekanizmasının çift yönlü yapısı sayesinde her token için zengin bağlamsal temsiller oluştururlar.
- **Uygulama alanları:** Şunlar gibi dil analizi ve anlama (NLU) görevleri için idealdir:
  - Metin sınıflandırması (örneğin duygu analizi).
  - Adlandırılmış varlık tanıma (NER).
  - Soru yanıtlama (Question Answering), cevabın metinden bir parça olduğu durumlarda.
- **Örnek:** BERT ve türevleri (RoBERTa, ALBERT).

## Dekoder ile İlişkisi

Enkoder-dekoder mimarisinde enkoder ve dekoder tamamlayıcı roller üstlenir:

- **Enkoder**, giriş dizisini **anlamaktan** sorumludur.
- **Dekoder**, çıkış dizisini **üretmekten** sorumludur.

Aralarındaki temel bağlantı unsuru, dekoderin içindeki **çapraz dikkat (cross-attention)** mekanizmasıdır. Her üretim adımında dekoder, halihazırda üretilmiş çıkış dizisi bölümüne dayanarak bir sorgu (Query) oluşturur ve bunu, enkoderin çıkış temsillerine (anahtar ve değer — Key ve Value olarak hizmet eder) "dikkat etmek" için kullanır. Bu, dekoderin bir sonraki tokeni üretmek için giriş dizisinin en ilgili bölümlerine odaklanmasına olanak tanır.

## Ayrıca bakınız

- BERT

## Kaynakça

- Hinton, G. E.; Salakhutdinov, R. R. (2006). *Reducing the Dimensionality of Data with Neural Networks*. *Science*. DOI:10.1126/science.1127647.
- Cho, K. et al. (2014). *Learning Phrase Representations using RNN Encoder–Decoder for Statistical Machine Translation*. arXiv:1406.1078.
- Sutskever, I.; Vinyals, O.; Le, Q. V. (2014). *Sequence to Sequence Learning with Neural Networks*. arXiv:1409.3215.
- Bahdanau, D.; Cho, K.; Bengio, Y. (2015). *Neural Machine Translation by Jointly Learning to Align and Translate*. arXiv:1409.0473.
- Kingma, D. P.; Welling, M. (2014). *Auto-Encoding Variational Bayes*. arXiv:1312.6114.
- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Devlin, J. et al. (2019). *BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Dai, Z. et al. (2019). *Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context*. arXiv:1901.02860.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Brown, T. B. et al. (2020). *Language Models Are Few-Shot Learners*. arXiv:2005.14165.
- Dosovitskiy, A. et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
