---
title: "Encoder (Transformador) (ES)"
source: "https://systems-analysis.info/int/Encoder_(Transformador)_(ES)"
wiki: "systems-analysis.info/int"
article: "Encoder_(Transformador)_(ES)"
language: "es"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 1937
wiki_created_at: 2026-09-06T22:56:17Z
wiki_modified_at: 2026-09-06T22:56:17Z
downloaded_at: 2026-09-07T22:48:34Z
---

# Encoder (Transformador) (ES)

**Encoder** (del inglés *Encoder*, codificador) — en el aprendizaje automático y el aprendizaje profundo, es un componente de una red neuronal cuya tarea principal es transformar una secuencia de datos de entrada (por ejemplo, texto o una imagen) en una representación numérica rica, comúnmente denominada **estado oculto**, **vector de contexto** o **embedding**. Esta representación captura las características clave y la semántica de los datos de entrada en un formato conveniente para su posterior procesamiento.

En un sentido más amplio, en la teoría de la información, un encoder es cualquier dispositivo o algoritmo que convierte información de un formato a otro, a menudo con el propósito de compresión o transmisión.

## Concepto y propósito

El objetivo principal de un encoder en redes neuronales es extraer características útiles de los datos de entrada y "codificarlas" en un vector denso de longitud fija. Este proceso puede considerarse como una forma de reducción de dimensionalidad no lineal, donde los datos de entrada de alta dimensionalidad y dispersos (por ejemplo, texto representado por vectores one-hot) se transforman en un espacio vectorial de baja dimensionalidad pero rico en información (espacio latente).

Este vector codificado puede ser utilizado por:

- Un **Decoder** para generar una nueva secuencia (por ejemplo, en la traducción automática).
- Un **Clasificador** para resolver tareas de análisis (por ejemplo, determinar el sentimiento de un texto).
- Para tareas que requieren la comprensión del contexto de entrada completo.

## El encoder en diferentes arquitecturas

### Encoder en un autoencoder

Uno de los ejemplos clásicos es la arquitectura de **autoencoder**. Consiste en dos partes:

1.  **Encoder:** Comprime los datos de entrada en una representación oculta de menor dimensionalidad (código latente).
2.  **Decoder:** Intenta reconstruir los datos originales a partir de esta representación comprimida.

Al entrenar dicha red para minimizar el error de reconstrucción, el encoder aprende a extraer las características más importantes de los datos.

### Encoder en redes neuronales recurrentes (RNN/LSTM)

Antes de la llegada de la arquitectura Transformer, los encoders en tareas de procesamiento de secuencias (seq2seq) se basaban en redes neuronales recurrentes (RNN) o su variante mejorada, LSTM.

- **Principio de funcionamiento:** Un encoder RNN procesa la secuencia de entrada token por token. En cada paso, actualiza su **estado oculto**, incorporando información sobre el token actual y el estado anterior. El estado oculto final, obtenido después de procesar toda la secuencia, se considera un vector que codifica el significado de toda la secuencia de entrada. A este vector se le suele llamar **vector de contexto** o "vector de pensamiento" (thought vector).

### Encoder en la arquitectura Transformer

La revolución en el procesamiento del lenguaje natural está asociada con la aparición del encoder basado en la arquitectura **Transformer**. A diferencia de las RNN, procesa todos los tokens de la secuencia en paralelo.

El encoder de un Transformer consta de una pila ($N$) de capas idénticas. Cada capa tiene dos subcapas principales:

1.  **Autoatención de múltiples cabezales (Multi-Head Self-Attention):** Este mecanismo permite que cada token en la secuencia de entrada "preste atención" a todos los demás tokens y pondere su importancia para formar su propia representación contextual. Esto permite al modelo capturar dependencias complejas entre palabras, independientemente de su posición.
2.  **Red neuronal prealimentada (Feed-Forward Network):** Se aplica a la representación de cada token por separado para una posterior transformación no lineal.

La diferencia clave entre un encoder Transformer y un encoder RNN es que no produce un único vector de contexto, sino una **secuencia de vectores contextualizados**, uno para cada token de entrada. Cada uno de estos vectores contiene información sobre su token en el contexto de toda la secuencia.

## Tipos de modelos basados en encoders

### Modelos encoder-decoder

Esta es la arquitectura clásica para tareas de secuencia a secuencia (seq2seq), como la traducción automática o el resumen de textos.

- **Principio de funcionamiento:** El encoder procesa toda la secuencia de entrada (por ejemplo, una oración en el idioma de origen). Sus representaciones de salida se transmiten al decoder, que las utiliza para generar de forma autorregresiva la secuencia de salida (la oración en el idioma de destino). El decoder "observa" la salida del encoder mediante un mecanismo especial llamado **atención cruzada (cross-attention)**.
- **Ejemplos:** El Transformer original, T5, BART.

### Modelos de solo encoder (Encoder-Only)

Estos modelos utilizan exclusivamente la pila de encoders de un Transformer.

- **Principio de funcionamiento:** Están diseñados para tareas que requieren una comprensión profunda del contexto de todo el texto de entrada. Gracias a la naturaleza bidireccional del mecanismo de autoatención, crean representaciones contextuales ricas para cada token.
- **Aplicaciones:** Son ideales para tareas de análisis y comprensión del lenguaje natural (NLU), tales como:
  - Clasificación de texto (por ejemplo, análisis de sentimiento).
  - Reconocimiento de entidades nombradas (NER).
  - Respuesta a preguntas (Question Answering), donde la respuesta es un fragmento del texto.
- **Ejemplo:** BERT y sus derivados (RoBERTa, ALBERT).

## Relación con el decoder

En la arquitectura encoder-decoder, el encoder y el decoder desempeñan roles complementarios:

- El **Encoder** es responsable de la **comprensión** de la secuencia de entrada.
- El **Decoder** es responsable de la **generación** de la secuencia de salida.

El vínculo clave entre ellos es el mecanismo de **atención cruzada (cross-attention)** dentro del decoder. En cada paso de la generación, el decoder forma una consulta (Query) basada en la parte ya generada de la secuencia de salida y la utiliza para "prestar atención" a las representaciones de salida del encoder (que sirven como claves y valores, Key y Value). Esto permite al decoder centrarse en las partes más relevantes de la secuencia de entrada para generar el siguiente token.

## Véase también

- [BERT](https://systems-analysis.info/int/BERT_(modelo_de_lenguaje) "BERT (modelo de lenguaje)")

## Bibliografía

- Hinton, G. E.; Salakhutdinov, R. R. (2006). *Reducing the Dimensionality of Data with Neural Networks*. *Science*. <a href="https://www.science.org/doi/10.1126/science.1127647" class="external text" rel="nofollow">DOI:10.1126/science.1127647</a>.
- Cho, K. et al. (2014). *Learning Phrase Representations using RNN Encoder–Decoder for Statistical Machine Translation*. <a href="https://arxiv.org/abs/1406.1078" class="external text" rel="nofollow">arXiv:1406.1078</a>.
- Sutskever, I.; Vinyals, O.; Le, Q. V. (2014). *Sequence to Sequence Learning with Neural Networks*. <a href="https://arxiv.org/abs/1409.3215" class="external text" rel="nofollow">arXiv:1409.3215</a>.
- Bahdanau, D.; Cho, K.; Bengio, Y. (2015). *Neural Machine Translation by Jointly Learning to Align and Translate*. <a href="https://arxiv.org/abs/1409.0473" class="external text" rel="nofollow">arXiv:1409.0473</a>.
- Kingma, D. P.; Welling, M. (2014). *Auto-Encoding Variational Bayes*. <a href="https://arxiv.org/abs/1312.6114" class="external text" rel="nofollow">arXiv:1312.6114</a>.
- Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Devlin, J. et al. (2019). *BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>.
- Dai, Z. et al. (2019). *Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context*. <a href="https://arxiv.org/abs/1901.02860" class="external text" rel="nofollow">arXiv:1901.02860</a>.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Brown, T. B. et al. (2020). *Language Models Are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Dosovitskiy, A. et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. <a href="https://arxiv.org/abs/2010.11929" class="external text" rel="nofollow">arXiv:2010.11929</a>.
