---
title: "Encoder-only models (Modelos solo con codificador)"
source: "https://systems-analysis.info/int/Encoder-only_models_(Modelos_solo_con_codificador)"
wiki: "systems-analysis.info/int"
article: "Encoder-only_models_(Modelos_solo_con_codificador)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 1916
wiki_created_at: 2026-09-06T22:55:59Z
wiki_modified_at: 2026-09-06T22:55:59Z
downloaded_at: 2026-09-07T22:48:29Z
---

# Encoder-only models (Modelos solo con codificador)

**Modelos solo-codificador** (en inglés, *Encoder-Only Models*) son una clase de arquitecturas de grandes modelos de lenguaje (LLM) basadas exclusivamente en la parte del **codificador** (encoder) de la arquitectura **Transformer**. A diferencia de los modelos que utilizan un decodificador o la arquitectura completa de codificador-decodificador, estos modelos se especializan en tareas de **comprensión del lenguaje natural (Natural Language Understanding, NLU)**.

El modelo insignia y pionero de este enfoque es **BERT** (Bidirectional Encoder Representations from Transformers), desarrollado por Google en 2018.

## Concepto y arquitectura

La idea principal de los modelos solo-codificador es crear **representaciones contextualizadas** (embeddings) profundas para cada token en la secuencia de entrada. Gracias al mecanismo de **autoatención (self-attention)** en el Transformer, cada token puede "ver" e interactuar con todos los demás tokens de la secuencia, lo que permite al modelo capturar un contexto rico.

Una característica clave es la **bidireccionalidad**: la representación de cada token se forma a partir del contexto tanto izquierdo como derecho simultáneamente. Esto los diferencia fundamentalmente de los modelos autorregresivos solo-decodificador (como GPT), que son unidireccionales por naturaleza.

Arquitectónicamente, el modelo es una pila de $N$ capas de codificador idénticas. Cada capa consta de dos subcapas principales:

1.  **Autoatención de múltiples cabezales (Multi-Head Self-Attention):** Calcula la representación contextualizada para cada token.
2.  **Red neuronal de avance (Feed-Forward Network):** Aplica una transformación no lineal a la representación de cada token.

En la salida, el modelo genera una secuencia de vectores de la misma longitud que la secuencia de entrada, donde cada vector es una representación rica del token de entrada correspondiente.

## Tareas de preentrenamiento

Para enseñar al modelo a comprender el lenguaje en un contexto bidireccional, se utilizan tareas especiales de preentrenamiento autosupervisado:

### Modelado de lenguaje enmascarado (Masked Language Modeling, MLM)

Esta es la tarea principal y más importante para los modelos solo-codificador, presentada por primera vez en BERT.

- **Principio de funcionamiento:** Un pequeño porcentaje de los tokens de la secuencia de entrada (generalmente el 15%) se oculta (enmascara) aleatoriamente. La tarea del modelo es predecir los valores originales de estos tokens enmascarados utilizando el contexto bidireccional que los rodea.
- **Objetivo:** Esta tarea obliga al modelo a aprender profundas relaciones semánticas y sintácticas entre las palabras.

### Predicción de la siguiente oración (Next Sentence Prediction, NSP)

Esta tarea (también del BERT original) fue diseñada para enseñar al modelo a comprender las relaciones entre oraciones.

- **Principio de funcionamiento:** Al modelo se le presenta un par de oraciones y debe determinar si la segunda oración es una continuación lógica de la primera en el texto original.
- **Estado:** Investigaciones posteriores (por ejemplo, en el modelo RoBERTa) demostraron que la NSP es menos efectiva que el MLM, y a menudo se reemplaza por otras tareas o se elimina por completo.

## Aplicaciones

Los modelos solo-codificador no están diseñados para la generación de texto de formato libre, ya que carecen de un decodificador autorregresivo. Su fortaleza radica en el análisis y la comprensión del texto. Las representaciones vectoriales de salida del modelo se utilizan para resolver una amplia gama de tareas de NLU:

- **Clasificación de texto:** Para tareas como el análisis de sentimientos o la clasificación de temas, se utiliza la representación del token especial \`\[CLS\]\`, que se añade al principio de cada secuencia. Su vector final agrega información sobre toda la secuencia.
- **Clasificación de tokens:** Para tareas como el reconocimiento de entidades nombradas (NER) o el etiquetado de partes del discurso (POS-tagging), se utilizan las representaciones vectoriales de cada token individual.
- **Respuesta a preguntas (Question Answering):** En tareas donde la respuesta es un fragmento del texto proporcionado (QA extractivo), el modelo aprende a predecir los tokens de inicio y fin de la respuesta.
- **Obtención de embeddings:** Los modelos de codificador se utilizan a menudo como codificadores de texto universales para obtener embeddings de alta calidad de oraciones o documentos, que luego pueden ser utilizados en motores de búsqueda o para tareas de similitud semántica.

## Modelos principales y su evolución

- **BERT** (2018): El pionero de la arquitectura, que estableció nuevos récords en numerosos benchmarks de NLP.
- **RoBERTa** (2019): "Un BERT robustamente optimizado". Demostró que el rendimiento de BERT podía mejorarse significativamente mediante un entrenamiento más prolongado con más datos y la eliminación de la tarea NSP.
- **ALBERT** (2019): "A Lite BERT". Un modelo con un número significativamente menor de parámetros gracias a técnicas como la factorización de embeddings y el uso compartido de parámetros entre capas.
- **DistilBERT** (2019): Una versión reducida de BERT creada mediante la destilación de conocimiento, que es más rápida y ligera pero conserva la mayor parte del rendimiento del original.
- **ELECTRA** (2020): Introdujo una tarea de preentrenamiento más eficiente: la **detección de tokens reemplazados (replaced token detection)**, donde el modelo aprende a distinguir entre los tokens originales y los "falsos" generados por un pequeño modelo generador.
- **DeBERTa** (2020): Introdujo un mecanismo de "atención desagregada" (disentangled attention), que codifica por separado el contenido y las posiciones relativas de los tokens.

## Véase también

- [BERT](https://systems-analysis.info/int/BERT_(modelo_de_lenguaje) "BERT (modelo de lenguaje)")
