---
title: "Grandes modelos de lenguaje"
source: "https://systems-analysis.info/int/Grandes_modelos_de_lenguaje"
wiki: "systems-analysis.info/int"
article: "Grandes_modelos_de_lenguaje"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 2711
wiki_created_at: 2026-09-06T23:09:52Z
wiki_modified_at: 2026-09-06T23:09:52Z
downloaded_at: 2026-09-07T22:52:52Z
---

# Grandes modelos de lenguaje

**Un gran modelo de lenguaje** (del inglés *large language model*, LLM) es un tipo de modelo de aprendizaje automático implementado con una red neuronal profunda que tiene un gran número de parámetros (generalmente miles de millones o más) y está entrenado en grandes volúmenes de datos de texto. En este contexto, «grande» se refiere tanto a la escala de los parámetros como al volumen del corpus de entrenamiento, que en los sistemas modernos alcanza varios petabytes y billones de tokens. Los modelos LLM se entrenan principalmente mediante un método auto-supervisado o semi-supervisado (*self-/semi-supervised*), prediciendo el siguiente token en una secuencia y aprendiendo así los patrones estadísticos del lenguaje. El aumento de parámetros, datos y pasos computacionales conduce a una mejora predecible en la calidad, como lo confirman las *leyes de escalado*.

Desde la aparición de BERT (2017) y especialmente de GPT-3 (2020), el enfoque de los LLM ha llegado a dominar el procesamiento del lenguaje natural. Los modelos modernos (GPT-4o, Claude 3, Gemini 1.5, LLaMA 3, etc.) son capaces de escribir textos y código de programación, traducir, resumir, responder preguntas y construir cadenas de razonamiento sin necesidad de un ajuste especializado; las versiones multimodales analizan imágenes, sonido y video. La adaptación a una tarea aplicada se realiza mediante el ajuste fino (*fine-tuning*) o la ingeniería de prompts (*prompt engineering*, *in-context learning*). Junto con sus logros, los LLM heredan los sesgos y errores de los datos originales, son propensos a las «alucinaciones» y requieren grandes recursos computacionales, por lo que la investigación actual se centra en el alineamiento del comportamiento, el filtrado de corpus y las arquitecturas energéticamente eficientes.

## Arquitectura

En los LLM modernos, casi siempre se utiliza la arquitectura **Transformer** (**transformador**) — una red con un mecanismo de autoatención (*self-attention*). El modelo Transformer fue propuesto por primera vez en el artículo «Attention is All You Need» por desarrolladores de Google en 2017.

La arquitectura **Transformer** es un esquema de red neuronal básico para trabajar con secuencias, que incluye dos módulos lógicos: el **codificador** (que codifica la entrada) y el **decodificador** (que genera la salida). La entrada es una secuencia, de la cual se crea una representación vectorial (*embedding*), se le suma un vector de codificación posicional, y luego el conjunto de elementos, sin tener en cuenta su orden en la secuencia, se introduce en el componente codificador (procesamiento en paralelo). Posteriormente, el componente decodificador recibe parte de esta secuencia y la salida del codificador. Como resultado, se obtiene una nueva secuencia de salida.

El componente codificador del Transformer consta de varias capas de codificación idénticas; el componente decodificador está estructurado de manera similar. El Transformer en sí es una secuencia de modelos de atención que transforman la secuencia original de vectores en una nueva secuencia donde cada elemento tiene en cuenta el contexto de los demás. El codificador genera representaciones latentes de los datos de entrada, conservando información sobre las interrelaciones entre los elementos. El decodificador, basándose en estas representaciones latentes, crea una nueva secuencia de *embeddings* para los tokens de salida. Luego, a partir de estos *embeddings*, el modelo de lenguaje genera los elementos de salida finales.

Dado que los Transformers se desarrollaron originalmente para tareas como la traducción automática, su arquitectura incluye un **codificador** (que procesa el texto de entrada, como la oración original) y un **decodificador** (que genera la salida, como la traducción). Sin embargo, en muchos modelos de lenguaje se utiliza únicamente la parte del decodificador, que opera en modo autorregresivo.

Los Transformers se emplean en tres configuraciones principales, cada una de las cuales utiliza el codificador y el decodificador de manera diferente y está orientada a su propio conjunto de tareas:

- **Transformers codificadores** (*bidireccionales*) aprenden a reconstruir fragmentos de texto ocultados intencionadamente, por lo que son muy adecuados para tareas de «comprensión» como la clasificación, la extracción de hechos y la búsqueda semántica.
- **Transformers decodificadores** (*autorregresivos*) se optimizan para predecir el siguiente token y se utilizan en tareas que requieren una salida secuencial, como los agentes conversacionales, la autocompletación de código y la generación creativa.
- **Esquemas completos «codificador + decodificador»** combinan ambos enfoques: el codificador construye una representación de todo el texto de entrada, y el decodificador, basándose en ella, genera el resultado de forma incremental. Esta configuración es la más eficaz para la traducción automática, la sumarización y los sistemas de pregunta-respuesta.

### Tokenización

La **tokenización** es una etapa inicial clave en el procesamiento de texto en los grandes modelos de lenguaje. En esta etapa, una cadena continua de caracteres se divide en unidades individuales: los tokens. La tokenización realiza la tarea de transformar una secuencia de caracteres en una secuencia de elementos estructurados que permiten el funcionamiento eficiente de la red neuronal.

Desde un punto de vista lingüístico, la tokenización podría corresponder en cierta medida al proceso de identificar las unidades mínimas del lenguaje que tienen un significado independiente o una carga funcional, como palabras, morfemas o fragmentos de ellos. Sin embargo, a menudo un token es simplemente una secuencia de caracteres que aparece con frecuencia estadística, por lo que es importante no sobrestimar el significado lingüístico de *todos* los tokens. Dependiendo del esquema elegido, un token puede ser: una palabra completa, una subpalabra, un carácter individual o una etiqueta de servicio (por ejemplo, marcadores de inicio y fin de secuencia).

La tokenización permite:

- limitar el tamaño del vocabulario a una escala manejable;
- procesar correctamente palabras raras y nuevas;
- asegurar un mapeo unívoco del texto a una secuencia de identificadores numéricos.

Para dividir el texto se utilizan algoritmos de subpalabras, de los cuales los más comunes son **Byte Pair Encoding (BPE)**, **WordPiece** y **UnigramLM**. Cada uno de ellos construye un vocabulario a partir de los fragmentos más frecuentes del corpus y lo utiliza para segmentar secuencialmente cualquier texto de entrada.

Después de la etapa de tokenización, cada unidad de texto — token — se convierte en una representación numérica comprensible para la red neuronal. Este proceso incluye varios pasos consecutivos:

- *Conversión de tokens en identificadores*: Cada token se asocia con un índice numérico único basado en un vocabulario de tokens previamente construido. Los tokens de texto se reemplazan por sus identificadores numéricos únicos (ID). Cada ID es el número del token en un vocabulario predefinido, lo que permite a la red neuronal trabajar con números en lugar de palabras.
- *Conversión de identificadores en embeddings*: Para cada identificador de token, se extrae o calcula un vector correspondiente de dimensión fija: el **embedding**. Esta representación numérica multidimensional reemplaza al ID y ya contiene información sobre el significado y las propiedades contextuales del token. Todos los embeddings tienen la misma longitud para facilitar el procesamiento.
- *Adición de codificaciones posicionales*: Dado que la arquitectura Transformer por sí sola no tiene en cuenta el *orden* de los elementos, a los embeddings se les añaden **codificaciones posicionales** (*positional encodings*), que proporcionan información sobre la posición del token en la secuencia. En otras palabras, gracias a esto, el modelo «sabe» qué token va primero, segundo, tercero, etc., en la oración.
- *Formación de matrices de entrada*: El resultado es una matriz de dimensiones `[longitud de la secuencia × dimensión del embedding]`, que sirve como la representación inicial del texto y se pasa a la entrada de la red neuronal, en particular a los bloques de autoatención (*self-attention*) del Transformer. Cada fila de esta matriz corresponde a un token, y el vector que contiene lleva tanto su significado semántico (embedding) como información sobre su posición en el texto (codificación posicional).

<!-- -->

    Texto → Tokens → Identificadores → Embeddings + Codificaciones Posicionales → Entrada al modelo

### Mecanismo de atención

El **mecanismo de atención (attention mechanism)** es un componente clave de la arquitectura Transformer que permite tener en cuenta las dependencias entre tokens independientemente de la *distancia* que los separe en la secuencia. Una vez que el texto de entrada se ha convertido en una secuencia de vectores, esta secuencia se introduce en el elemento central del Transformer: el **bloque de atención** (*attention block*).

El mecanismo de atención es una forma que tiene la red neuronal de determinar a qué partes de los datos de entrada debe prestar más atención al procesar cada elemento de la secuencia. Gracias a él, los vectores de fragmentos de texto individuales pueden interactuar entre sí, enriqueciéndose con información y actualizando sus valores en función del contexto circundante. Esto permite al modelo capturar eficazmente tanto las dependencias locales como las de largo alcance entre los tokens, lo que aumenta significativamente su capacidad para interpretar estructuras de texto complejas.

En el lenguaje natural, el significado de una palabra o expresión no se determina de forma aislada, sino que depende del contexto, es decir, de otras palabras y estructuras a su alrededor. En las redes neuronales, el texto se codifica mediante representaciones vectoriales —embeddings— que reflejan numéricamente las propiedades léxicas y sintácticas de los tokens. Sin un mecanismo de atención directo (como en el Transformer), la información contextual se perdería en distancias largas (como en los modelos simples) o se transmitiría secuencialmente, lo que es menos eficiente para capturar relaciones a largo plazo. Sin embargo, en el lenguaje natural, el significado de una palabra o construcción sintáctica es dinámico, y su interpretación debe adaptarse en función del contexto. El mecanismo de atención realiza la contextualización de las representaciones vectoriales, **lo que significa** (o simplemente **:**):

- Cada token «evalúa» su importancia en relación con los demás tokens de la oración.
- En el proceso de actualización, las representaciones vectoriales se enriquecen con información mutua, reflejando dependencias sintácticas, roles semánticos y el contexto pragmático.

Como resultado de este intercambio de información, los vectores actualizados comienzan a codificar no solo el *significado del propio token*, sino también sus conexiones gramaticales (sintaxis), su rol en la situación descrita (semántica) y su sentido general en el contexto (pragmática).

    Vectores de entrada de tokens (con posiciones) → Mecanismo de Atención (Interacción de vectores) → Vectores de tokens contextualizados (Vectores enriquecidos con información sobre sus relaciones con otros tokens)

### Implementación técnica del mecanismo de atención

El funcionamiento interno del mecanismo de atención incluye varios pasos y componentes computacionales clave. Para cada vector de entrada, se generan tres vectores: Consulta (Query), Clave (Key) y Valor (Value). A partir de su interacción, se calculan los pesos de atención, que luego se utilizan para obtener representaciones vectoriales actualizadas y contextualizadas. Un enfoque común es el uso de una arquitectura de múltiples cabezas (Multi-Head Attention) para el procesamiento paralelo de la información.

#### Consulta (Query), Clave (Key), Valor (Value)

En la base del cálculo del mecanismo de atención se encuentra la transformación de cada vector de entrada (que es la suma del embedding del token y su codificación posicional) en tres representaciones vectoriales diferentes: Consulta (Query, Q), Clave (Key, K) y Valor (Value, V).

Conceptualmente, estos tres vectores desempeñan los siguientes roles en el mecanismo de atención:

- **Consulta (Query)**: Representa el vector del token actual, que inicia el proceso de búsqueda de información relevante en la secuencia. Puede considerarse como una «pregunta» o «sonda» utilizada para evaluar la importancia de otros tokens en relación con el actual.
- **Clave (Key):** Actúa como un identificador o «etiqueta» que describe un aspecto del contenido de cada token. El vector de Consulta (Q) del token actual se compara con todos los vectores de Clave (K) en la secuencia (incluido el suyo propio) para determinar el grado de su correspondencia o relevancia.
- **Valor (Value):** Contiene la información o representación real asociada con cada token que se transmitirá más adelante. Después de calcular los pesos de atención basándose en la interacción de las Consultas y las Claves, estos pesos se aplican a los vectores de Valor para formar la representación ponderada final, que es la salida del mecanismo de atención para ese token.

## Entrenamiento de grandes modelos de lenguaje

El entrenamiento de los LLM se lleva a cabo principalmente en dos etapas:

1.  **Preentrenamiento (Pretraining)** En esta etapa, el modelo se entrena en grandes corpus de texto no etiquetados mediante el aprendizaje auto-supervisado (*self-supervised learning*). La tarea consiste en predecir el siguiente token en una secuencia (autorregresión) o en reconstruir fragmentos ocultos (aprendizaje enmascarado). El preentrenamiento permite al modelo asimilar amplios patrones estadísticos del lenguaje, gramática, hechos sobre el mundo y formas básicas de razonamiento.
2.  **Ajuste fino (Fine-tuning)** Después del preentrenamiento, el modelo se entrena adicionalmente con datos especializados para realizar tareas específicas, como la generación de respuestas, la clasificación de textos o la ejecución de instrucciones. Los enfoques modernos incluyen:
    - Ajuste fino en conjuntos de datos etiquetados (*supervised fine-tuning*).
    - Aprendizaje por refuerzo a partir de retroalimentación humana (RLHF, *reinforcement learning from human feedback*) para corregir el comportamiento del modelo de acuerdo con las métricas deseadas de calidad, seguridad y utilidad.

## Problemas y limitaciones

A pesar de sus impresionantes avances, los grandes modelos de lenguaje (LLM) modernos presentan una serie de problemas y limitaciones:

**I. Limitaciones computacionales y arquitectónicas**

1.  **Altos costos computacionales:** El entrenamiento y la operación de los LLM requieren una potencia computacional, tiempo y energía significativos, lo que conlleva altos costos económicos y ambientales. Además, la naturaleza autorregresiva de la generación (creación secuencial de tokens) limita la paralelización y ralentiza la velocidad de inferencia en comparación con enfoques no autorregresivos.
2.  **Limitación de la longitud del contexto:** La arquitectura Transformer tiene una dependencia cuadrática de los costos computacionales y los requisitos de memoria con respecto a la longitud de la secuencia. Esto obliga a establecer un límite fijo (ventana de contexto) en la cantidad de texto que el modelo puede procesar a la vez, lo que lleva al recorte de documentos largos y a la pérdida de información fuera de la ventana.

**II. Problemas de fiabilidad y precisión en la generación**

1.  **Alucinaciones:** Generación de información que es fácticamente incorrecta pero que suena plausible. Esto se debe a la falta de una comprensión real del mundo por parte del modelo, su dependencia de patrones estadísticos en los datos y su incapacidad para verificar las afirmaciones que genera.
2.  **Acumulación de errores (Error Propagation):** Proceso en el que los errores cometidos en las primeras etapas de la generación se amplifican y conducen a un aumento de las imprecisiones en los pasos posteriores, disminuyendo la calidad y coherencia general del texto.
3.  **Composicionalidad limitada:** Dificultades con tareas que requieren un razonamiento lógico de varios pasos o cálculos precisos (por ejemplo, la multiplicación de números de varios dígitos, la resolución de acertijos). La precisión de los modelos en tales tareas disminuye drásticamente a medida que aumenta la complejidad debido a la naturaleza autorregresiva de la generación.
4.  **Repeticiones:** Tendencia a repetir excesivamente palabras o frases, lo que reduce la informatividad y la legibilidad del texto. Está relacionado con las particularidades del entrenamiento y los algoritmos de decodificación (selección del siguiente token).
5.  **La maldición de la reversión (Reversal Curse):** Incapacidad del modelo para generalizar automáticamente el conocimiento en la dirección opuesta: después de aprender la afirmación «A es B», el modelo a menudo no puede inferir «B es A».
6.  **El compromiso entre «creatividad» y «precisión»:** La necesidad de equilibrar la generación de respuestas diversas y originales con el mantenimiento de la precisión fáctica. Mejorar un aspecto a menudo afecta negativamente al otro; por ejemplo, una alta creatividad puede correlacionarse con un aumento de las alucinaciones.

**III. Problemas de interacción y control:**

1.  **Baja controlabilidad:** Dificultad para controlar con precisión el estilo, el tono, el contenido del texto generado o el seguimiento de instrucciones complejas. La controlabilidad depende en gran medida de la calidad de las instrucciones de entrada («prompts») y de los métodos de ajuste fino (*fine-tuning*).
2.  **Sensibilidad a la formulación:** Cambios menores en la consulta de entrada (prompt) pueden llevar a respuestas significativamente diferentes, incluso si la semántica de la consulta se mantiene. Esto dificulta la obtención de resultados estables y predecibles.

**IV. Aspectos éticos y sociales:**

1.  **Problemas de sesgo y equidad:** Los modelos pueden reproducir y amplificar los estereotipos sociales, los prejuicios o la toxicidad existentes en los datos de entrenamiento. Garantizar la equidad y la seguridad de los modelos es una tarea compleja.
2.  **El problema del alineamiento (LLM Alignment):** Un problema más general que incluye el punto anterior. Es la tarea de garantizar que el comportamiento del modelo se corresponda con los valores, intenciones y normas éticas humanas. Incluye la lucha contra el sesgo, las alucinaciones, la generación de contenido dañino y la mejora de la controlabilidad.
3.  **Riesgos de uso malintencionado:** La posibilidad de utilizar los LLM para crear y difundir masivamente desinformación, phishing, spam, código malicioso o generar textos falsos convincentes, lo que representa una amenaza para la seguridad de la información y personal, y socava la confianza en la sociedad.

## Enlaces externos

- <a href="https://en.wikipedia.org/wiki/es:Modelo_de_lenguaje_grande" class="extiw" title="wikipedia:es:Modelo de lenguaje grande">Gran modelo de lenguaje en Wikipedia (ES)</a>
- <a href="https://en.wikipedia.org/wiki/Large_language_model" class="extiw" title="wikipedia:Large language model">Large language model en Wikipedia (EN)</a>
- <a href="https://en.wikipedia.org/wiki/fr:Grand_mod%C3%A8le_de_langage" class="extiw" title="wikipedia:fr:Grand modèle de langage">Grand modèle de langage en Wikipédia (FR)</a>
- <a href="https://en.wikipedia.org/wiki/de:Large_Language_Model" class="extiw" title="wikipedia:de:Large Language Model">Large Language Model en Wikipedia (DE)</a>
- *Naveed H. et al.* A Comprehensive Overview of Large Language Models. <a href="https://arxiv.org/abs/2307.06435" class="external text" rel="nofollow">arXiv:2307.06435</a>, 2023.

## Bibliografía

- *Vaswani, A. et al.* Attention Is All You Need. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>, 2017.
- *Devlin, J. et al.* BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>, 2019.
- *Brown, T. et al.* Language Models Are Few-Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>, 2020.
- *Kaplan, J. et al.* Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external text" rel="nofollow">arXiv:2001.08361</a>, 2020.
- *Hoffmann, J. et al.* Training Compute-Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external text" rel="nofollow">arXiv:2203.15556</a>, 2022.
- *Ouyang, L. et al.* Training Language Models to Follow Instructions with Human Feedback. <a href="https://arxiv.org/abs/2203.02155" class="external text" rel="nofollow">arXiv:2203.02155</a>, 2022.
- *Bai, Y. et al.* Constitutional AI: Harmlessness from AI Feedback. <a href="https://arxiv.org/abs/2212.08073" class="external text" rel="nofollow">arXiv:2212.08073</a>, 2022.
- *Bubeck, S. et al.* Sparks of Artificial General Intelligence: Early Experiments with GPT-4. <a href="https://arxiv.org/abs/2303.12712" class="external text" rel="nofollow">arXiv:2303.12712</a>, 2023.
- *OpenAI.* GPT-4 Technical Report. <a href="https://arxiv.org/abs/2303.08774" class="external text" rel="nofollow">arXiv:2303.08774</a>, 2023.
- *Touvron, H. et al.* The Llama 3 Herd of Models. <a href="https://arxiv.org/abs/2407.21783" class="external text" rel="nofollow">arXiv:2407.21783</a>, 2024.
