---
title: "Encoder-only models (TL)"
source: "https://systems-analysis.info/int/Encoder-only_models_(TL)"
wiki: "systems-analysis.info/int"
article: "Encoder-only_models_(TL)"
language: "tl"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Tagalog"
revision_id: 1923
wiki_created_at: 2026-09-06T22:56:05Z
wiki_modified_at: 2026-09-06T22:56:05Z
downloaded_at: 2026-09-07T22:48:31Z
---

# Encoder-only models (TL)

**Mga modelong encoder lamang** (Ingles: Encoder-Only Models) — isang klase ng mga arkitektura ng malalaking modelo ng wika (LLM), batay nang eksklusibo sa **bahaging nagko-code** (encoder) ng arkitektura ng **Transformer**. Hindi tulad ng mga modelong gumagamit ng decoder o buong arkitekturang encoder-decoder, ang mga modelong ito ay nag-iespesyalisa sa mga gawaing **pag-unawa sa natural na wika (Natural Language Understanding, NLU)**.

Ang nangunguna at pioneer ng pamamaraang ito ay ang **BERT** (Bidirectional Encoder Representations from Transformers), na binuo ng Google noong 2018.

## Konsepto at arkitektura

Ang pangunahing ideya ng mga modelong encoder lamang ay ang paglikha ng malalim na **kontekstualisadong representasyon** (embeddings) para sa bawat token sa input na pagkakasunud-sunod. Salamat sa mekanismo ng **self-attention** sa Transformer, ang bawat token ay maaaring "makita" at makipag-ugnayan sa lahat ng iba pang token sa pagkakasunud-sunod, na nagbibigay-daan sa modelo na makuha ang mayamang konteksto.

Ang pangunahing katangian ay ang **bidireksyonalidad**: ang representasyon ng bawat token ay nabubuo batay sa parehong kaliwa at kanang konteksto nang sabay-sabay. Ito ay radikal na nagpapaiba sa kanila mula sa mga autoregressive na modelong decoder lamang (tulad ng GPT), na sa kalikasan nila ay unidireksyonal.

Arkitekturalmente, ang modelo ay isang stack ng $N$ magkaparehong mga layer ng encoder. Ang bawat layer ay binubuo ng dalawang pangunahing sublayer:

1.  **Multi-Head Self-Attention:** Nagkokomputa ng kontekstualisadong representasyon para sa bawat token.
2.  **Feed-Forward Network:** Naglalapat ng di-linear na pagbabago sa bawat representasyon ng token.

Sa output, ang modelo ay nagge-generate ng pagkakasunud-sunod ng mga vector na may parehong haba ng input na pagkakasunud-sunod, kung saan ang bawat vector ay isang mayamang representasyon ng kaukulang input na token.

## Mga gawain sa pre-training

Upang turuan ang modelo na maunawaan ang wika sa bidireksyonal na konteksto, ginagamit ang mga espesyal na self-supervised na gawain sa pre-training:

### Masked Language Modeling, MLM

Ito ang pangunahin at pinakamahalagang gawain para sa mga modelong encoder lamang, na unang ipinakilala sa BERT.

- **Prinsipyo ng pagtatrabaho:** Mula sa input na pagkakasunud-sunod, isang maliit na porsyento ng mga token (karaniwang 15%) ay random na itinatago (nime-mask). Ang gawain ng modelo ay hulaan ang mga orihinal na halaga ng mga nakatakip na token na ito, gamit ang bidireksyonal na kontekstong nakapaligid sa kanila.
- **Layunin:** Ang gawaing ito ay nagpipilit sa modelo na pag-aralan ang malalim na semantiko at sintaktikong ugnayan sa pagitan ng mga salita.

### Next Sentence Prediction, NSP

Ang gawaing ito (mula rin sa orihinal na BERT) ay binuo upang turuan ang modelo na maunawaan ang mga relasyon sa pagitan ng mga pangungusap.

- **Prinsipyo ng pagtatrabaho:** Binibigyan ng modelo ang isang pares ng mga pangungusap, at kailangan nitong tukuyin kung ang pangalawang pangungusap ay lohikal na pagpapatuloy ng una sa orihinal na teksto.
- **Katayuan:** Kalaunan, ipinakita ng mga pananaliksik (halimbawa, sa modelong RoBERTa) na ang NSP ay hindi gaanong epektibo kaysa sa MLM, at madalas itong pinapalitan ng iba pang mga gawain o inaaalis nang buo.

## Paglalapat

Ang mga modelong encoder lamang ay hindi inilaan para sa malayang paggawa ng teksto, dahil wala silang autoregressive na decoder. Ang kanilang lakas ay nasa pagsusuri at pag-unawa sa teksto. Ang mga output na vector na representasyon ng modelo ay ginagamit upang malutas ang malawak na hanay ng mga gawaing NLU:

- **Klasipikasyon ng teksto:** Para sa mga gawaing tulad ng pagsusuri ng tono o pagtukoy ng paksa, ginagamit ang representasyon ng espesyal na token na \`\[CLS\]\`, na idinaragdag sa simula ng bawat pagkakasunud-sunod. Ang panghuling vector nito ay nag-aaggrega ng impormasyon tungkol sa buong pagkakasunud-sunod.
- **Klasipikasyon ng token:** Para sa mga gawaing tulad ng pagkilala sa mga pinangalanang entity (NER) o pag-tatak ng bahagi ng pananalita (POS-tagging), ginagamit ang mga vector na representasyon ng bawat indibidwal na token.
- **Pagsagot sa mga tanong (Question Answering):** Sa mga gawaing kung saan ang sagot ay isang fragment mula sa ibinigay na teksto (extractive QA), ang modelo ay sinasamahan upang hulaan ang simula at pagtatapos na mga token ng sagot.
- **Pagkuha ng mga embedding:** Ang mga modelong encoder ay madalas na ginagamit bilang mga unibersal na tagacode ng teksto upang makakuha ng mataas na kalidad na mga embedding ng mga pangungusap o dokumento, na maaaring gamitin sa mga search engine o para sa mga gawaing semantic na pagkakatulad.

## Mga pangunahing modelo at ang kanilang ebolusyon

- **BERT** (2018): Pioneer ng arkitektura, na nagtakda ng mga bagong rekord sa maraming benchmark ng NLP.
- **RoBERTa** (2019): "Matatag na na-optimize na BERT". Ipinakita na ang pagganap ng BERT ay maaaring mapabuti nang malaki sa pamamagitan ng mas matagal na pagsasanay sa mas malaking dami ng data at pag-abandona sa gawain ng NSP.
- **ALBERT** (2019): "A Lite BERT". Isang modelo na may mas maliit na bilang ng mga parameter salamat sa mga teknik ng factorization ng embedding at cross-layer na pagbabahagi ng parameter.
- **DistilBERT** (2019): Isang pinaikling bersyon ng BERT, na nilikha gamit ang knowledge distillation, na mas mabilis at mas magaan, ngunit napapanatili ang karamihan ng pagganap ng orihinal.
- **ELECTRA** (2020): Nagpakilala ng mas epektibong gawain sa pre-training — **replaced token detection**, kung saan ang modelo ay natututo na makilala ang mga orihinal na token mula sa mga "peke" na na-generate ng isang maliit na modelo-generator.
- **DeBERTa** (2020): Nagpakilala ng mekanismo ng "disentangled attention", na hiwalay na nagko-code ng nilalaman at relatibong posisyon ng mga token.

## Tingnan din

- BERT
