---
title: "Encoder-only models (Modelos somente-encoder)"
source: "https://systems-analysis.info/int/Encoder-only_models_(Modelos_somente-encoder)"
wiki: "systems-analysis.info/int"
article: "Encoder-only_models_(Modelos_somente-encoder)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 1917
wiki_created_at: 2026-09-06T22:56:00Z
wiki_modified_at: 2026-09-06T22:56:00Z
downloaded_at: 2026-09-07T22:48:29Z
---

# Encoder-only models (Modelos somente-encoder)

**Modelos somente-encoder** (em inglês: Encoder-Only Models) — são uma classe de arquiteturas de grandes modelos de linguagem (LLMs), baseadas exclusivamente na parte de **codificação** (encoder) da arquitetura **[Transformer](https://systems-analysis.info/int/Arquitetura_Transformer "Arquitetura Transformer")**. Diferentemente dos modelos que utilizam um decoder ou uma arquitetura encoder-decoder completa, esses modelos são especializados em tarefas de **compreensão de linguagem natural (Natural Language Understanding, NLU)**.

O modelo emblemático e pioneiro desta abordagem é o **BERT** (Bidirectional Encoder Representations from Transformers), desenvolvido pelo Google em 2018.

## Conceito e arquitetura

A ideia principal dos modelos somente-encoder é criar **representações contextualizadas** profundas (embeddings) para cada token na sequência de entrada. Graças ao mecanismo de **autoatenção (self-attention)** no Transformer, cada token pode “ver” e interagir com todos os outros tokens na sequência, o que permite ao modelo capturar um contexto rico.

A característica-chave é a **bidirecionalidade**: a representação de cada token é formada com base nos contextos esquerdo e direito simultaneamente. Isso os distingue radicalmente dos modelos autorregressivos somente-decoder (como o GPT), que são, por natureza, unidirecionais.

Arquiteturalmente, o modelo consiste em uma pilha de $N$ camadas de encoder idênticas. Cada camada é composta por duas subcamadas principais:

1.  **Autoatenção de Múltiplas Cabeças (Multi-Head Self-Attention):** Calcula a representação contextualizada para cada token.
2.  **Rede neural feed-forward (Feed-Forward Network):** Aplica uma transformação não linear a cada representação de token.

Na saída, o modelo gera uma sequência de vetores do mesmo comprimento da sequência de entrada, onde cada vetor é uma representação rica do token de entrada correspondente.

## Tarefas de pré-treinamento

Para ensinar o modelo a entender a linguagem em um contexto bidirecional, são utilizadas tarefas especiais de pré-treinamento autosupervisionado:

### Modelagem de linguagem mascarada (Masked Language Modeling, MLM)

Esta é a tarefa principal e mais importante para modelos somente-encoder, introduzida pela primeira vez no BERT.

- **Princípio de funcionamento:** Uma pequena porcentagem de tokens (geralmente 15%) da sequência de entrada é ocultada (mascarada) aleatoriamente. A tarefa do modelo é prever os valores originais desses tokens mascarados, usando o contexto bidirecional ao seu redor.
- **Objetivo:** Esta tarefa força o modelo a aprender relações semânticas e sintáticas profundas entre as palavras.

### Previsão da próxima sentença (Next Sentence Prediction, NSP)

Esta tarefa (também do BERT original) foi desenvolvida para ensinar o modelo a entender as relações entre as sentenças.

- **Princípio de funcionamento:** O modelo recebe um par de sentenças e deve determinar se a segunda sentença é uma continuação lógica da primeira no texto original.
- **Status:** Pesquisas posteriores (por exemplo, no modelo RoBERTa) mostraram que a NSP é menos eficaz que a MLM, e muitas vezes é substituída por outras tarefas ou completamente removida.

## Aplicações

Modelos somente-encoder não são projetados para gerar texto de forma livre, pois não possuem um decoder autorregressivo. Sua força reside na análise e compreensão de texto. As representações vetoriais de saída do modelo são usadas para resolver uma ampla gama de tarefas de NLU:

- **Classificação de texto:** Para tarefas como análise de sentimento ou classificação de tópicos, utiliza-se a representação do token especial \`\[CLS\]\`, que é adicionado no início de cada sequência. Seu vetor final agrega informações sobre toda a sequência.
- **Classificação de tokens:** Para tarefas como reconhecimento de entidade nomeada (NER) ou etiquetagem de classes gramaticais (POS-tagging), são utilizadas as representações vetoriais de cada token individual.
- **Respostas a perguntas (Question Answering):** Em tarefas onde a resposta é um trecho do texto fornecido (extractive QA), o modelo é treinado para prever os tokens inicial e final da resposta.
- **Obtenção de embeddings:** Modelos encoder são frequentemente usados como codificadores de texto universais para obter embeddings de alta qualidade de sentenças ou documentos, que podem ser usados em sistemas de busca ou para tarefas de similaridade semântica.

## Principais modelos e sua evolução

- **BERT** (2018): O pioneiro da arquitetura, que estabeleceu novos recordes em diversos benchmarks de PLN.
- **RoBERTa** (2019): “Um BERT robustamente otimizado”. Demonstrou que o desempenho do BERT poderia ser significativamente melhorado com um treinamento mais longo, com mais dados e a remoção da tarefa NSP.
- **ALBERT** (2019): “A Lite BERT”. Um modelo com um número significativamente menor de parâmetros, graças a técnicas como fatorização de embeddings e compartilhamento de parâmetros entre camadas.
- **DistilBERT** (2019): Uma versão menor do BERT, criada por meio de destilação de conhecimento, que é mais rápida e leve, mas mantém a maior parte do desempenho do original.
- **ELECTRA** (2020): Introduziu uma tarefa de pré-treinamento mais eficiente — **detecção de token substituído (replaced token detection)**, na qual o modelo aprende a distinguir tokens originais de tokens “falsos” gerados por um pequeno modelo gerador.
- **DeBERTa** (2020): Introduziu o mecanismo de “atenção desemaranhada” (disentangled attention), que codifica separadamente o conteúdo e as posições relativas dos tokens.

## Ver também

- BERT
