---
title: "In-Context Learning (ES)"
source: "https://systems-analysis.info/int/In-Context_Learning_(ES)"
wiki: "systems-analysis.info/int"
article: "In-Context_Learning_(ES)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 3200
wiki_created_at: 2026-09-06T23:17:12Z
wiki_modified_at: 2026-09-06T23:17:12Z
downloaded_at: 2026-09-07T22:55:43Z
---

# In-Context Learning (ES)

**Aprendizaje en contexto** (del inglés **In-Context Learning**, **ICL**) es la capacidad fundamental de los modelos de lenguaje grandes (LLM) para aprender nuevas tareas "sobre la marcha", utilizando únicamente ejemplos (demostraciones) proporcionados en el contexto (prompt) de una consulta. La característica clave es que este proceso de adaptación ocurre sin actualizar los pesos (parámetros) del modelo, es decir, sin el reentrenamiento tradicional (fine-tuning)<sup>[\[1\]](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_note-lakera-1)[\[2\]](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_note-hopsworks-2)</sup>.

Este mecanismo permite a los modelos demostrar una flexibilidad asombrosa, resolviendo tareas para las que no fueron entrenados específicamente. El ICL se ha convertido en uno de los avances clave que ha hecho que los modelos de lenguaje grandes sean tan potentes y versátiles<sup>[\[3\]](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_note-gradient_pub-3)</sup>.

## Mecanismos de funcionamiento

La comprensión exacta de cómo funciona el ICL sigue siendo un área activa de investigación; sin embargo, existen varias teorías principales que explican este fenómeno.

### El Transformer como metaoptimizador

Una de las teorías populares sostiene que la arquitectura Transformer, durante el preentrenamiento, aprende a implementar algoritmos de aprendizaje en sus pasadas hacia adelante (forward passes). Cuando el modelo recibe un prompt con ejemplos, realiza implícitamente una especie de optimización para resolver la tarea presentada, ajustando sus estados internos (activaciones) en lugar de sus pesos<sup>[\[4\]](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_note-arxiv_grad-4)</sup>.

### Inferencia bayesiana

Otra teoría considera el ICL como una forma de inferencia bayesiana. El modelo, preentrenado con enormes cantidades de datos, posee una comprensión a priori de una multitud de conceptos. Los ejemplos en el contexto sirven como evidencia que permite al modelo refinar su distribución de probabilidad a posteriori sobre los conceptos latentes. En otras palabras, los ejemplos ayudan al modelo a "comprender" cuál de las miles de tareas que conoce debe resolver en ese momento<sup>[\[5\]](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_note-stanford-5)</sup>.

## Tipos de In-Context Learning

Dependiendo del número de ejemplos proporcionados, el ICL se divide en tres tipos principales.

- **Few-shot Learning (aprendizaje con pocos ejemplos)**: Es el enfoque más común y equilibrado. Al modelo se le proporcionan varias demostraciones (generalmente de 2 a 10).

*Ejemplo (clasificación de sentimiento):*

    Texto: "¡Qué día tan maravilloso!"
    Sentimiento: Positivo

    Texto: "Odio estar atascado en el tráfico."
    Sentimiento: Negativo

    Texto: "Esta película fue bastante mediocre."
    Sentimiento:

**Respuesta esperada:**

    Neutro

- **One-shot Learning (aprendizaje con un solo ejemplo)**: Al modelo se le da un único ejemplo. Esto suele ser suficiente para establecer el formato de la respuesta y mejorar significativamente el rendimiento en comparación con el enfoque zero-shot.

<!-- -->

- **Zero-shot Learning (aprendizaje sin ejemplos)**: Al modelo no se le proporcionan ejemplos, solo una instrucción o la descripción de la tarea. En este caso, el modelo se basa completamente en el conocimiento adquirido durante su preentrenamiento.

## Aplicación práctica

La aplicación correcta del ICL permite resolver una amplia gama de tareas sin la necesidad de un costoso desarrollo y reentrenamiento.

- **Para tareas creativas y estilísticas** (generación de código en un estilo específico, escritura de texto al estilo de un autor concreto):
  - Se recomienda el **Few-shot Learning**.
  - Los ejemplos ayudan al modelo a captar el estilo, formato y estructura de salida deseados.

<!-- -->

- **Para tareas sencillas con instrucciones claras** (traducción, resumen, respuestas a preguntas simples):
  - A menudo es suficiente con el **Zero-shot Learning**.
  - Los modelos modernos manejan bastante bien estas tareas si formaron parte de su preentrenamiento.

<!-- -->

- **Para tareas donde el formato de salida es crucial** (generación de JSON, extracción de entidades):
  - Se recomienda el **One-shot** o **Few-shot Learning**.
  - Incluso un solo ejemplo puede establecer claramente la estructura de respuesta requerida, evitando errores de formato.

## Ventajas y desventajas

<table class="wikitable">
<caption>Comparación de las ventajas y desventajas del ICL</caption>
<colgroup>
<col style="width: 50%" />
<col style="width: 50%" />
</colgroup>
<thead>
<tr class="header">
<th>Ventajas</th>
<th>Desventajas</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td><ul>
<li><strong>Flexibilidad y velocidad:</strong> Adaptación instantánea a nuevas tareas sin necesidad de reentrenamiento.</li>
<li><strong>Ahorro de recursos:</strong> No requiere la recopilación de datos, el etiquetado ni la capacidad computacional para el reentrenamiento.</li>
<li><strong>Accesibilidad:</strong> Permite a los usuarios sin experiencia en ML ajustar los modelos mediante simples ejemplos de texto.</li>
</ul></td>
<td><ul>
<li><strong>Limitaciones de la ventana de contexto:</strong> El número de ejemplos está limitado por la longitud máxima del contexto del modelo.</li>
<li><strong>Sensibilidad a los ejemplos:</strong> El resultado depende en gran medida de la calidad, el orden y el formato de las demostraciones proporcionadas.</li>
<li><strong>Altos costos en la etapa de inferencia:</strong> Los prompts largos con muchos ejemplos aumentan el costo y el tiempo de generación.</li>
<li><strong>Riesgos de seguridad:</strong> Proporcionar información confidencial como ejemplos puede ser inseguro.</li>
</ul></td>
</tr>
</tbody>
</table>

Comparación de las ventajas y desventajas del ICL

## Comparación con otros paradigmas

### ICL vs. Fine-tuning

El fine-tuning (reentrenamiento o ajuste fino) modifica los pesos del modelo, "grabando" en él nuevos conocimientos. Esto convierte al modelo en un experto en un campo específico, pero reduce su flexibilidad general. El ICL, por el contrario, no altera los pesos y es más flexible, aunque puede tener un rendimiento inferior en tareas altamente especializadas que requieren un conocimiento profundo del dominio.

### ICL vs. RAG (Retrieval-Augmented Generation)

Ambos métodos amplían el contexto del modelo, pero con diferentes propósitos:

- **ICL** utiliza ejemplos para **enseñar** al modelo *cómo* realizar una tarea (demostración de una habilidad).
- **RAG** utiliza información recuperada para **informar** al modelo de los hechos necesarios para la respuesta (provisión de conocimiento).

En la práctica, ICL y RAG a menudo se combinan para lograr los mejores resultados.

## Literatura

- Brown, T. B. et al. (2020). *Language Models are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Dai, D. et al. (2022). *Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers*. <a href="https://arxiv.org/abs/2212.10559" class="external text" rel="nofollow">arXiv:2212.10559</a>.
- Panwar, M.; Ahuja, K.; Goyal, N. (2024). *In-Context Learning through the Bayesian Prism*. <a href="https://arxiv.org/abs/2306.04891" class="external text" rel="nofollow">arXiv:2306.04891</a>.
- Müller, S. et al. (2021). *Transformers Can Do Bayesian Inference*. <a href="https://arxiv.org/abs/2112.10510" class="external text" rel="nofollow">arXiv:2112.10510</a>.
- Garg, S. et al. (2022). *What Can Transformers Learn In-Context? A Case Study of Simple Function Classes*. <a href="https://arxiv.org/abs/2208.01066" class="external text" rel="nofollow">arXiv:2208.01066</a>.
- Min, S. et al. (2022). *Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?*. <a href="https://arxiv.org/abs/2202.12837" class="external text" rel="nofollow">arXiv:2202.12837</a>.
- Wang, X. et al. (2023). *Explaining and Finding Good Demonstrations for In-Context Learning*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Xie, S. et al. (2024). *A Survey on In-Context Learning*. <a href="https://arxiv.org/abs/2301.00234" class="external text" rel="nofollow">arXiv:2301.00234</a>.
- Yu, Z.; Ananiadou, S. (2024). *How Do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads Are Two Towers for Metric Learning*. <a href="https://arxiv.org/abs/2402.02872" class="external text" rel="nofollow">arXiv:2402.02872</a>.
- Wibisono, K. C.; Wang, Y. (2024). *From Unstructured Data to In-Context Learning: Exploring What Tasks Can Be Learned and When*. <a href="https://arxiv.org/abs/2406.00131" class="external text" rel="nofollow">arXiv:2406.00131</a>.
- Chan, J. K. et al. (2022). *Data Distributional Properties Drive Emergent In-Context Learning in Transformers*. <a href="https://arxiv.org/abs/2205.05055" class="external text" rel="nofollow">arXiv:2205.05055</a>.
- Hahn, M.; Goyal, N. (2023). *A Theory of Emergent In-Context Learning as Implicit Structure Induction*. <a href="https://arxiv.org/abs/2303.07971" class="external text" rel="nofollow">arXiv:2303.07971</a>.

## Referencias

1.  <span id="cite_note-lakera-1">[↑](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_ref-lakera_1-0) <a href="https://www.lakera.ai/blog/what-is-in-context-learning" class="external text" rel="nofollow">What is In-Context Learning (ICL)?</a> // Lakera.ai</span>
2.  <span id="cite_note-hopsworks-2">[↑](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_ref-hopsworks_2-0) <a href="https://www.hopsworks.ai/dictionary/in-context-learning-icl" class="external text" rel="nofollow">In-Context Learning (ICL)</a> // Hopsworks.ai</span>
3.  <span id="cite_note-gradient_pub-3">[↑](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_ref-gradient_pub_3-0) <a href="https://thegradient.pub/in-context-learning-in-context/" class="external text" rel="nofollow">In-Context Learning, In Context</a> // The Gradient</span>
4.  <span id="cite_note-arxiv_grad-4">[↑](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_ref-arxiv_grad_4-0) <a href="https://arxiv.org/abs/2212.10559" class="external text" rel="nofollow">Why Can GPT Learn In-Context? Language Models Secretly Perform Gradient Descent as Meta-Optimizers</a> // arXiv, 2022.</span>
5.  <span id="cite_note-stanford-5">[↑](https://systems-analysis.info/int/In-Context_Learning_(ES)#cite_ref-stanford_5-0) <a href="https://ai.stanford.edu/blog/understanding-incontext/" class="external text" rel="nofollow">Understanding In-Context Learning</a> // Stanford Human-Centered AI, 2023.</span>
