---
title: "Arquitectura Transformer"
source: "https://systems-analysis.info/int/Arquitectura_Transformer"
wiki: "systems-analysis.info/int"
article: "Arquitectura_Transformer"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 443
wiki_created_at: 2026-09-06T22:33:50Z
wiki_modified_at: 2026-09-06T22:33:50Z
downloaded_at: 2026-09-07T22:40:08Z
---

# Arquitectura Transformer

**La arquitectura Transformer** es una arquitectura de red neuronal presentada en 2017 por investigadores de Google en el artículo «Attention Is All You Need»<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>. Revolucionó el campo del procesamiento del lenguaje natural (PLN) y se convirtió en la base de la mayoría de los [grandes modelos de lenguaje](https://systems-analysis.info/int/Grandes_modelos_de_lenguaje "Grandes modelos de lenguaje") (LLM) modernos, como BERT, GPT y Gemini. La innovación clave del Transformer es el mecanismo de **autoatención (self‑attention)**, que permite al modelo ponderar la importancia de diferentes partes de los datos de entrada y procesar secuencias en paralelo, abandonando la recurrencia característica de las RNN y LSTM.

## Contexto histórico y antecedentes

Hasta 2017, las arquitecturas dominantes para el procesamiento de datos secuenciales, como el texto, eran las redes neuronales recurrentes (RNN) y su variante mejorada, las redes de memoria a corto y largo plazo (LSTM).

### Problemas de las RNN/LSTM abordados por el Transformer

- **Limitaciones del procesamiento secuencial:** Las RNN y LSTM procesan los datos token por token, lo que impide el paralelismo dentro de la secuencia y ralentiza el entrenamiento con grandes volúmenes de datos.
- **Problema de desvanecimiento y explosión de gradientes:** En secuencias largas, los gradientes propagados hacia atrás a través de muchos pasos pueden disminuir o crecer exponencialmente, lo que dificulta el aprendizaje de dependencias a largo plazo.
- **Dependencias a largo plazo:** La información del inicio de una secuencia puede perderse hacia el final.

El enfoque del Transformer es un **abandono total de la recurrencia** en favor del mecanismo de atención. Proporciona una **longitud de ruta de dependencia constante** entre cualquier posición ($O(1)$), lo que facilita el modelado de dependencias a larga distancia, aunque la implementación básica de la autoatención tiene una **complejidad computacional cuadrática** con respecto a la longitud de la secuencia ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-tay2020-2)</sup>. El problema del desvanecimiento/explosión de gradientes no «desaparece», sino que se **mitiga** mediante conexiones residuales, LayerNorm y el régimen de entrenamiento; en implementaciones modernas, a menudo se utiliza la variante **Pre‑LayerNorm (Pre‑LN)** por ser más estable durante el entrenamiento<sup>[\[3\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-xiong2020-3)</sup>.

## Arquitectura y componentes clave

La arquitectura original del Transformer consta de dos partes principales: el **codificador (encoder)** y el **decodificador (decoder)**. Ambos componentes son pilas de capas idénticas ($N = 6$ en el artículo original)<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>.

- **Estructura de una capa del codificador:** (1) autoatención multicabeza (MHA), (2) una red neuronal *feed-forward* posicional (FFN); cada subcapa está rodeada por una conexión residual y LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>.
- **Estructura de una capa del decodificador:** (1) autoatención **enmascarada** (una máscara causal impide el acceso a posiciones futuras), (2) **atención cruzada (cross-attention)** a las salidas del codificador, (3) FFN, también con conexiones residuales y LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>.

### Mecanismo de atención y autoatención (Self-Attention)

El mecanismo de atención calcula una suma ponderada de los vectores de valor (Value), donde los pesos se determinan por el grado de compatibilidad de las claves (Key) con las consultas (Query). En el Transformer se utiliza la **atención de producto escalar escalado (Scaled Dot-Product Attention)**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

Donde $d_{k}$ es la dimensionalidad de las claves/consultas; la división por $\sqrt{d_{k}}$ evita la saturación de la función softmax<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>. Cuando $Q$, $K$ y $V$ se generan a partir de la misma secuencia, el mecanismo se denomina **autoatención (self-attention)**.

### Atención multicabeza (Multi-Head Attention)

En lugar de un único conjunto de matrices $(W_{Q},W_{K},W_{V})$, se utilizan $h$ «cabezas» de atención en paralelo, cada una de las cuales proyecta $Q,K,V$ en subespacios de menor dimensión, calcula la atención de forma independiente, y luego los resultados se concatenan y se proyectan de nuevo<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{donde~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**Variantes para acelerar la inferencia:**

- **MQA (Multi‑Query Attention):** todas las cabezas comparten una única clave/valor → se reduce significativamente el volumen y el tráfico de la caché KV durante la decodificación<sup>[\[4\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** un compromiso entre MHA y MQA, donde varios grupos de cabezas comparten K/V; la calidad es similar a la de MHA con la velocidad de MQA<sup>[\[5\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-ainslie2023-5)</sup>.

### Codificación posicional (Positional Encoding)

Dado que la autoatención es invariante al orden de los tokens, se añaden **codificaciones posicionales** a los embeddings de entrada.

- **Codificaciones sinusoidales originales** (PE) de<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **Variantes relativas/rotatorias modernas:**
  - **RoPE (Rotary Position Embeddings)** codifica los desplazamientos relativos mediante la rotación de los vectores $Q$/$K$; se utiliza en varios LLM modernos<sup>[\[6\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-su2021-6)</sup>.
  - **ALiBi** introduce una penalización lineal en las puntuaciones de atención, lo que mejora la extrapolación a longitudes mayores que las vistas durante el entrenamiento<sup>[\[7\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-press2021-7)</sup>.

### Redes *feed-forward* posicionales, conexiones residuales y normalización

Cada capa del codificador y decodificador, además de la atención, contiene una **red neuronal *feed-forward* posicional (FFN)**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

Alrededor de cada subcapa se utilizan **conexiones residuales (residual connections)** y **normalización de capa (Layer Normalization)**: ${LayerNorm}(x + {Sublayer}(x))$. En la versión original se aplicaba la variante **Post-LN**<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>; en los LLM modernos, se suele utilizar **Pre-LN** para una mayor estabilidad en el entrenamiento y una menor dependencia de un largo período de calentamiento (warm-up)<sup>[\[3\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-xiong2020-3)</sup>.

## Evolución y variantes modernas

Los métodos anteriores, basados en redes neuronales recurrentes (RNN) y sus variantes avanzadas como LSTM, procesaban el texto de forma secuencial, un token a la vez. Aunque este enfoque se correspondía intuitivamente con la estructura del lenguaje, creaba una limitación significativa: dificultaba los cálculos en paralelo y complicaba la detección de dependencias entre elementos distantes en el texto. En 2017, un grupo de investigadores de Google presentó un artículo titulado «Attention Is All You Need». En él, describieron una nueva arquitectura: el «Transformer». Este modelo fue el primero en abandonar por completo el uso de redes neuronales recurrentes, sustituyéndolas por un mecanismo de «atención» (attention). La principal innovación fue que el mecanismo de atención permitía al Transformer evaluar la importancia de cada palabra en la secuencia de entrada para generar la palabra correspondiente en la salida. Al mismo tiempo, el modelo podía procesar todas las palabras simultáneamente. Esta capacidad de procesamiento en paralelo hizo posible entrenar modelos mucho más grandes con enormes cantidades de datos. Como resultado, surgieron los grandes modelos de lenguaje (LLM) modernos.

La arquitectura Transformer ha servido de base para numerosos modelos, que pueden clasificarse convencionalmente en tres categorías.

### 1. Modelos de solo codificador (Encoder‑only)

- **Ejemplo:** BERT (y RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-devlin2019-8)</sup>.
- **Principio:** preentrenamiento en la tarea de **modelado de lenguaje enmascarado (MLM)** con contexto bidireccional.
- **Aplicación:** tareas de comprensión (clasificación, NER, etc.).

### 2. Modelos de solo decodificador (Decoder‑only)

- **Ejemplo:** la serie GPT (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-llama2023-11)</sup>, Claude.
- **Principio:** **modelado de lenguaje causal (CLM)**, es decir, la predicción del siguiente token; se aplica una máscara causal a la atención<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>.
- **Aplicación:** generación de texto, diálogos, código.

### 3. Modelos de codificador-decodificador (Encoder‑decoder)

- **Ejemplo:** el Transformer original, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-raffel2019-12)</sup>.
- **Principio:** el codificador construye una representación de la entrada, y el decodificador genera la salida utilizando atención cruzada (cross-attention) sobre las características del codificador<sup>[\[1\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-vaswani2017-1)</sup>.
- **Aplicación:** tareas seq2seq (traducción, resumen, etc.).

### 4. Arquitecturas multimodales y alternativas

- **Vision Transformer (ViT)**: una adaptación para imágenes (dividiéndolas en parches)<sup>[\[13\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer**: un modelo jerárquico con *ventanas desplazadas (shifted windows)*<sup>[\[14\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-liu2021-swin-14)</sup>.
- **Alternativas para secuencias largas:**
  - **Mamba**: modelos de espacio de estados selectivos (SSM) con complejidad lineal<sup>[\[15\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV**: una arquitectura similar a una RNN con entrenamiento paralelizable y complejidad de inferencia lineal<sup>[\[16\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-peng2023-rwkv-16)</sup>.
  - **Híbridos** (por ejemplo, **Jamba**): alternan bloques de Transformer y Mamba; a veces se complementan con MoE<sup>[\[17\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-lieber2024-jamba-17)</sup>.

## Técnicas de entrenamiento y optimización

La eficacia del Transformer está estrechamente ligada a las técnicas de entrenamiento y a la infraestructura.

- **Estrategias de preentrenamiento:** CLM y MLM; también objetivos contrastivos y de eliminación de ruido (denoising) (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-raffel2019-12)</sup>.
- **Técnicas de ajuste fino (Fine‑tuning):**
  - **Ajuste fino completo** de todos los parámetros.
  - **Ajuste fino eficiente en parámetros (PEFT):** **LoRA** introduce adaptadores de bajo rango mientras mantiene congelados los pesos del modelo base<sup>[\[18\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-hu2021-lora-18)</sup>.
- **Alineación del comportamiento:** **RLHF** (aprendizaje por refuerzo a partir de retroalimentación humana)<sup>[\[19\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-ouyang2022-rlhf-19)</sup>.
- **Optimizaciones de sistema para la inferencia:** **PagedAttention/vLLM** aumenta el rendimiento (throughput) del servicio mediante una gestión paginada de la caché KV; es especialmente útil para secuencias largas y lotes grandes<sup>[\[20\]](https://systems-analysis.info/int/Arquitectura_Transformer#cite_note-kwon2023-vllm-20)</sup>.

## Enlaces externos

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external text" rel="nofollow">The Illustrated Transformer — una explicación visual de la arquitectura Transformer</a>

## Bibliografía

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. <a href="https://arxiv.org/abs/2010.11929" class="external text" rel="nofollow">arXiv:2010.11929</a>.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. <a href="https://arxiv.org/abs/2103.14030" class="external text" rel="nofollow">arXiv:2103.14030</a>.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. <a href="https://arxiv.org/abs/2009.06732" class="external text" rel="nofollow">arXiv:2009.06732</a>.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. <a href="https://arxiv.org/abs/2002.04745" class="external text" rel="nofollow">arXiv:2002.04745</a>.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. <a href="https://arxiv.org/abs/2108.12409" class="external text" rel="nofollow">arXiv:2108.12409</a>.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). <a href="https://arxiv.org/abs/1911.02150" class="external text" rel="nofollow">arXiv:1911.02150</a>.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). <a href="https://arxiv.org/abs/2309.06180" class="external text" rel="nofollow">arXiv:2309.06180</a>.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external text" rel="nofollow">arXiv:2312.00752</a>.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. <a href="https://arxiv.org/abs/2305.13048" class="external text" rel="nofollow">arXiv:2305.13048</a>.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external text" rel="nofollow">arXiv:2403.19887</a>.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. <a href="https://arxiv.org/abs/2106.09685" class="external text" rel="nofollow">arXiv:2106.09685</a>.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. <a href="https://openreview.net/forum?id=TG8KACxEON" class="external text" rel="nofollow">OpenReview</a>.

## Referencias

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Arquitectura_Transformer#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
