---
title: "In-Context Learning (PT)"
source: "https://systems-analysis.info/int/In-Context_Learning_(PT)"
wiki: "systems-analysis.info/int"
article: "In-Context_Learning_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 3210
wiki_created_at: 2026-09-06T23:17:21Z
wiki_modified_at: 2026-09-06T23:17:21Z
downloaded_at: 2026-09-07T22:55:46Z
---

# In-Context Learning (PT)

**Aprendizagem em Contexto** (do inglês **In-Context Learning**, **ICL**) — é a capacidade fundamental dos modelos de linguagem grandes (LLMs) de aprender novas tarefas "dinamicamente" (on the fly), utilizando apenas exemplos (demonstrações) fornecidos no contexto (prompt) da solicitação. A característica principal é que esse processo de adaptação ocorre sem a atualização dos pesos (parâmetros) do modelo, ou seja, sem o tradicional ajuste fino (fine-tuning)<sup>[\[1\]](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_note-lakera-1)[\[2\]](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_note-hopsworks-2)</sup>.

Este mecanismo permite que os modelos demonstrem uma flexibilidade surpreendente, resolvendo tarefas para as quais não foram especificamente treinados. O ICL tornou-se um dos avanços cruciais que tornaram os modelos de linguagem grandes tão poderosos e versáteis<sup>[\[3\]](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_note-gradient_pub-3)</sup>.

## Mecanismos de Funcionamento

A compreensão exata de como o ICL funciona permanece uma área ativa de pesquisa, no entanto, existem várias teorias principais que explicam esse fenômeno.

### Transformer como um meta-otimizador

Uma das teorias populares sustenta que a arquitetura Transformer, durante o pré-treinamento, aprende a implementar algoritmos de aprendizado em suas passagens diretas (forward passes). Quando o modelo recebe um prompt com exemplos, ele realiza implicitamente uma espécie de otimização para resolver a tarefa apresentada, ajustando seus estados internos (ativações), e não os pesos<sup>[\[4\]](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_note-arxiv_grad-4)</sup>.

### Inferência Bayesiana

Outra teoria considera o ICL como uma forma de inferência bayesiana. O modelo, pré-treinado em vastos conjuntos de dados, possui uma compreensão a priori de múltiplos conceitos. Os exemplos no contexto servem como evidências que permitem ao modelo refinar sua distribuição de probabilidade a posteriori sobre os conceitos ocultos. Em outras palavras, os exemplos ajudam o modelo a "entender" qual das milhares de tarefas que conhece precisa ser resolvida no momento<sup>[\[5\]](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_note-stanford-5)</sup>.

## Tipos de In-Context Learning

Dependendo do número de exemplos fornecidos, o ICL é dividido em três tipos principais.

- **Few-shot Learning (aprendizagem com poucos exemplos)**: Esta é a abordagem mais comum e equilibrada. O modelo recebe alguns (geralmente de 2 a 10) exemplos de demonstração.

*Exemplo (classificação de sentimento):*

    Texto: "Que dia maravilhoso!"
    Sentimento: Positivo

    Texto: "Eu odeio ficar preso no trânsito."
    Sentimento: Negativo

    Texto: "Este filme foi bem mediano."
    Sentimento:

**Resposta esperada:**

    Neutro

- **One-shot Learning (aprendizagem com um exemplo)**: O modelo recebe apenas um exemplo. Isso geralmente é suficiente para definir o formato da resposta e melhorar significativamente o desempenho em comparação com a abordagem zero-shot.

<!-- -->

- **Zero-shot Learning (aprendizagem sem exemplos)**: O modelo não recebe exemplos, apenas uma instrução ou descrição da tarefa. Nesse caso, o modelo depende inteiramente do conhecimento adquirido durante o pré-treinamento.

## Aplicação Prática

A aplicação correta do ICL permite resolver uma ampla gama de tarefas sem o custo de desenvolvimento e ajuste fino.

- **Para tarefas criativas e estilísticas** (geração de código em um estilo específico, escrita de texto no estilo de um autor particular):
  - Recomenda-se o **Few-shot Learning**.
  - Os exemplos ajudam o modelo a captar o estilo, formato e estrutura de saída desejados.

<!-- -->

- **Para tarefas simples com instruções claras** (tradução, sumarização, respostas a perguntas simples):
  - O **Zero-shot Learning** é frequentemente suficiente.
  - Os modelos modernos lidam bem com essas tarefas se elas fizeram parte de seu pré-treinamento.

<!-- -->

- **Para tarefas onde o formato de saída é importante** (geração de JSON, extração de entidades):
  - Recomenda-se o **One-shot** ou **Few-shot Learning**.
  - Mesmo um único exemplo pode definir claramente a estrutura de resposta necessária, evitando erros de formatação.

## Vantagens e Desvantagens

<table class="wikitable">
<caption>Comparação das vantagens e desvantagens do ICL</caption>
<colgroup>
<col style="width: 50%" />
<col style="width: 50%" />
</colgroup>
<thead>
<tr class="header">
<th>Vantagens</th>
<th>Desvantagens</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td><ul>
<li><strong>Flexibilidade e velocidade:</strong> Adaptação instantânea a novas tarefas sem a necessidade de retreinamento.</li>
<li><strong>Economia de recursos:</strong> Não requer coleta de dados, rotulagem e poder computacional para ajuste fino.</li>
<li><strong>Acessibilidade:</strong> Permite que usuários sem experiência em ML configurem modelos usando exemplos de texto simples.</li>
</ul></td>
<td><ul>
<li><strong>Limitações da janela de contexto:</strong> O número de exemplos é limitado pelo comprimento máximo do contexto do modelo.</li>
<li><strong>Sensibilidade aos exemplos:</strong> O resultado depende fortemente da qualidade, ordem e formato das demonstrações fornecidas.</li>
<li><strong>Custos elevados na inferência:</strong> Prompts longos com muitos exemplos aumentam o custo e o tempo de geração.</li>
<li><strong>Riscos de segurança:</strong> Fornecer informações confidenciais como exemplos pode não ser seguro.</li>
</ul></td>
</tr>
</tbody>
</table>

Comparação das vantagens e desvantagens do ICL

## Comparação com Outros Paradigmas

### ICL vs. Fine-tuning

O Fine-tuning (ajuste fino) modifica os pesos do modelo, "imprimindo" novos conhecimentos nele. Isso torna o modelo um especialista em uma área restrita, mas reduz sua flexibilidade geral. O ICL, por outro lado, não altera os pesos e é mais flexível, mas pode ter um desempenho inferior em tarefas altamente especializadas que exigem profundo conhecimento do domínio.

### ICL vs. RAG (Retrieval-Augmented Generation)

Ambos os métodos expandem o contexto do modelo, mas para finalidades diferentes:

- O **ICL** usa exemplos para **ensinar** o modelo a *como* executar uma tarefa (demonstração de habilidade).
- O **RAG** usa informações recuperadas para **informar** o modelo sobre fatos necessários para a resposta (fornecimento de conhecimento).

Na prática, o ICL e o RAG são frequentemente combinados para obter os melhores resultados.

## Literatura

- Brown, T. B. et al. (2020). *Language Models are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Dai, D. et al. (2022). *Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers*. <a href="https://arxiv.org/abs/2212.10559" class="external text" rel="nofollow">arXiv:2212.10559</a>.
- Panwar, M.; Ahuja, K.; Goyal, N. (2024). *In-Context Learning through the Bayesian Prism*. <a href="https://arxiv.org/abs/2306.04891" class="external text" rel="nofollow">arXiv:2306.04891</a>.
- Müller, S. et al. (2021). *Transformers Can Do Bayesian Inference*. <a href="https://arxiv.org/abs/2112.10510" class="external text" rel="nofollow">arXiv:2112.10510</a>.
- Garg, S. et al. (2022). *What Can Transformers Learn In-Context? A Case Study of Simple Function Classes*. <a href="https://arxiv.org/abs/2208.01066" class="external text" rel="nofollow">arXiv:2208.01066</a>.
- Min, S. et al. (2022). *Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?*. <a href="https://arxiv.org/abs/2202.12837" class="external text" rel="nofollow">arXiv:2202.12837</a>.
- Wang, X. et al. (2023). *Explaining and Finding Good Demonstrations for In-Context Learning*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Xie, S. et al. (2024). *A Survey on In-Context Learning*. <a href="https://arxiv.org/abs/2301.00234" class="external text" rel="nofollow">arXiv:2301.00234</a>.
- Yu, Z.; Ananiadou, S. (2024). *How Do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads Are Two Towers for Metric Learning*. <a href="https://arxiv.org/abs/2402.02872" class="external text" rel="nofollow">arXiv:2402.02872</a>.
- Wibisono, K. C.; Wang, Y. (2024). *From Unstructured Data to In-Context Learning: Exploring What Tasks Can Be Learned and When*. <a href="https://arxiv.org/abs/2406.00131" class="external text" rel="nofollow">arXiv:2406.00131</a>.
- Chan, J. K. et al. (2022). *Data Distributional Properties Drive Emergent In-Context Learning in Transformers*. <a href="https://arxiv.org/abs/2205.05055" class="external text" rel="nofollow">arXiv:2205.05055</a>.
- Hahn, M.; Goyal, N. (2023). *A Theory of Emergent In-Context Learning as Implicit Structure Induction*. <a href="https://arxiv.org/abs/2303.07971" class="external text" rel="nofollow">arXiv:2303.07971</a>.

## Notas

1.  <span id="cite_note-lakera-1">[↑](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_ref-lakera_1-0) <a href="https://www.lakera.ai/blog/what-is-in-context-learning" class="external text" rel="nofollow">What is In-Context Learning (ICL)?</a> // Lakera.ai</span>
2.  <span id="cite_note-hopsworks-2">[↑](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_ref-hopsworks_2-0) <a href="https://www.hopsworks.ai/dictionary/in-context-learning-icl" class="external text" rel="nofollow">In-Context Learning (ICL)</a> // Hopsworks.ai</span>
3.  <span id="cite_note-gradient_pub-3">[↑](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_ref-gradient_pub_3-0) <a href="https://thegradient.pub/in-context-learning-in-context/" class="external text" rel="nofollow">In-Context Learning, In Context</a> // The Gradient</span>
4.  <span id="cite_note-arxiv_grad-4">[↑](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_ref-arxiv_grad_4-0) <a href="https://arxiv.org/abs/2212.10559" class="external text" rel="nofollow">Why Can GPT Learn In-Context? Language Models Secretly Perform Gradient Descent as Meta-Optimizers</a> // arXiv, 2022.</span>
5.  <span id="cite_note-stanford-5">[↑](https://systems-analysis.info/int/In-Context_Learning_(PT)#cite_ref-stanford_5-0) <a href="https://ai.stanford.edu/blog/understanding-incontext/" class="external text" rel="nofollow">Understanding In-Context Learning</a> // Stanford Human-Centered AI, 2023.</span>
