---
title: "PEFT (Parameter-Efficient Fine-Tuning) (PT)"
source: "https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)"
wiki: "systems-analysis.info/int"
article: "PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 5294
wiki_created_at: 2026-09-06T23:47:14Z
wiki_modified_at: 2026-09-06T23:47:14Z
downloaded_at: 2026-09-07T23:07:39Z
---

# PEFT (Parameter-Efficient Fine-Tuning) (PT)

**Ajuste Fino Eficiente em Parâmetros** (do inglês **Parameter-Efficient Fine-Tuning, PEFT**) — é um conjunto de métodos para a adaptação de grandes modelos pré-treinados, como grandes modelos de linguagem (LLMs), a tarefas específicas com custos computacionais e de recursos mínimos. Ao contrário do **ajuste fino completo** (*full fine-tuning*) tradicional, que exige a atualização de todos os parâmetros do modelo, os métodos PEFT focam na modificação de apenas uma pequena parte dos pesos (menos de 1-5% do total), deixando a maior parte do modelo inalterada ("congelada")<sup>[\[1\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-survey_arxiv_2025-1)</sup>.

Essa abordagem permite reduzir significativamente os requisitos de memória, espaço de armazenamento e tempo de treinamento, tornando o processo de adaptação de modelos fundamentais poderosos mais acessível e resiliente ao problema do esquecimento catastrófico<sup>[\[2\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-mlm_problems_2025-2)</sup>.

## Problemas do ajuste fino completo

A abordagem tradicional de ajuste fino completo, na qual todos os parâmetros do modelo são atualizados, enfrenta uma série de problemas críticos que catalisaram o desenvolvimento do PEFT:

- **Altos custos computacionais:** A atualização de centenas de bilhões de parâmetros exige enormes capacidades computacionais (GPUs/TPUs de alto desempenho) e uma grande quantidade de memória de vídeo (VRAM), o que torna o processo caro e inacessível para muitos pesquisadores.
- **Ineficiência de armazenamento:** Para cada nova tarefa, é necessário armazenar uma cópia completa do modelo, que ocupa vários gigabytes, levando a um crescimento exponencial nos requisitos de espaço em disco.
- **Esquecimento catastrófico (Catastrophic Forgetting):** O modelo, ao se adaptar a novos dados, "esquece" o conhecimento geral adquirido na fase de pré-treinamento, o que reduz seu desempenho em outras tarefas.
- **Risco de sobreajuste (Overfitting):** Em conjuntos de dados pequenos para o ajuste fino, modelos com bilhões de parâmetros tendem a "memorizar" os exemplos de treinamento em vez de aprender padrões generalizáveis<sup>[\[2\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-mlm_problems_2025-2)</sup>.

## Taxonomia dos métodos PEFT

Os métodos PEFT podem ser classificados pela forma como alteram os parâmetros do modelo. Existem três categorias principais: aditivos, seletivos e de reparametrização<sup>[\[3\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-huggingface_peft_methods-3)</sup>.

### Métodos aditivos

Esses métodos congelam todos os pesos originais do modelo e adicionam novos módulos treináveis de pequeno porte.

- **Adaptadores (Adapters):** O método aditivo mais antigo. Pequenos módulos de rede neural com arquitetura "gargalo de garrafa" (bottleneck) são inseridos entre as camadas do transformer. Apenas os pesos desses adaptadores são treinados<sup>[\[4\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-houlsby2019-4)</sup>.
- **Métodos baseados em prompts suaves (Soft Prompts):** Em vez de alterar os pesos do modelo, esses métodos adicionam vetores treináveis ("tokens virtuais") aos dados de entrada, que direcionam o comportamento do modelo. As principais variantes são:
  - **Prompt Tuning:** Adiciona vetores treináveis apenas aos embeddings de entrada.
  - **Prefix-Tuning:** Adiciona prefixos de vetores treináveis aos estados ocultos em cada camada do mecanismo de atenção, o que proporciona um controle mais refinado<sup>[\[5\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-li2021prefix-5)</sup>.
  - **P-Tuning v2:** Uma generalização da ideia do Prefix-Tuning que aplica prompts treináveis em todas as camadas do modelo, alcançando um desempenho comparável ao do ajuste fino completo<sup>[\[6\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-liu2021ptuningv2-6)</sup>.

### Métodos seletivos

Esses métodos não adicionam novos parâmetros, mas selecionam e ajustam um pequeno subconjunto dos já existentes.

- **BitFit:** Um método extremamente econômico que ajusta apenas os vetores de bias (bias terms) e os parâmetros das camadas de normalização, atualizando menos de 0.1% do número total de parâmetros.
- **Poda diferencial (Diff Pruning):** Utiliza uma máscara treinável para determinar dinamicamente quais pesos devem ser atualizados durante o processo de treinamento<sup>[\[3\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-huggingface_peft_methods-3)</sup>.

### Métodos de reparametrização

Esta categoria baseia-se na hipótese de que as alterações nos pesos para a adaptação do modelo têm um baixo "posto intrínseco" (intrinsic rank). Em vez de atualizar matrizes de peso de tamanho completo, esses métodos atualizam sua representação de baixo posto.

- **LoRA (Low-Rank Adaptation):** O método PEFT mais popular atualmente. Ele assume que a atualização da matriz de pesos \`ΔW\` pode ser aproximada pelo produto de duas matrizes de baixo posto: \`ΔW = BA\`. Durante o ajuste fino, a matriz original \`W\` é congelada, e apenas \`A\` e \`B\` são treinadas<sup>[\[7\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-hu2021lora-7)</sup>.
- **QLoRA:** Combina LoRA com técnicas de quantização para reduzir ainda mais os requisitos de memória, permitindo o ajuste fino de modelos com 65 bilhões de parâmetros em uma única GPU de consumidor<sup>[\[8\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-dettmers2023qlora-8)</sup>.

## Comparação de desempenho e recursos

Os métodos PEFT permitem alcançar um desempenho comparável ao do ajuste fino completo, com uma redução radical nos custos.

| Modelo     | Método                  | Parâmetros treináveis (%) | Resultado no benchmark (Avg. Accuracy) | Fonte                                                                                                                     |
|------------|-------------------------|---------------------------|----------------------------------------|---------------------------------------------------------------------------------------------------------------------------|
| BERT-Large | Ajuste fino completo    | 100%                      | 80.4 (GLUE)                            | <sup>[\[4\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-houlsby2019-4)</sup> |
| BERT-Large | Adapters                | 3.6%                      | 80.0 (GLUE)                            | <sup>[\[4\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-houlsby2019-4)</sup> |
| LLaMA-7B   | LoRA                    | 0.83%                     | 74.7%                                  | <sup>[\[9\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-dora_paper-9)</sup>  |
| LLaMA-7B   | DoRA (variante do LoRA) | 0.84%                     | 78.1%                                  | <sup>[\[9\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-dora_paper-9)</sup>  |

Desempenho comparativo e eficiência dos métodos PEFT

As principais vantagens do PEFT na economia de recursos são:

- **Memória da GPU (VRAM):** Para o modelo LLaMA 65B, o ajuste fino completo teoricamente requer \>780 GB de VRAM, enquanto o **QLoRA** permite ajustá-lo em uma GPU com \<48 GB de VRAM<sup>[\[8\]](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_note-dettmers2023qlora-8)</sup>.
- **Espaço de armazenamento:** Os checkpoints salvos após o PEFT ocupam megabytes, e não gigabytes. Isso permite armazenar centenas de "adaptadores" para diferentes tarefas no espaço que seria ocupado por um único modelo totalmente ajustado.

## Áreas de aplicação

Originalmente desenvolvidos para PNL, os métodos PEFT foram adaptados com sucesso para uma ampla gama de tarefas:

- **Visão computacional (CV) e modelos multimodais (VLM):** Adaptação de modelos como Vision Transformer (ViT) e Segment Anything Model (SAM) para tarefas de segmentação de imagens, inclusive em biomedicina.
- **Geração e análise de código:** Ajuste de LLMs para a especificidade de projetos de software concretos, APIs internas ou bases de código.
- **Modelos generativos:** "Estilização" de modelos de geração de imagens, como o Stable Diffusion, com o uso de adaptadores LoRA (técnica Dreambooth).
- **Síntese de fala:** Adaptação de modelos para gerar fala com uma voz, entonação ou coloração emocional específica.

## Ligações externas

- <a href="https://github.com/huggingface/peft" class="external text" rel="nofollow">Repositório da biblioteca PEFT no GitHub</a>
- <a href="https://huggingface.co/docs/peft/index" class="external text" rel="nofollow">Documentação oficial da biblioteca PEFT da Hugging Face</a>

## Literatura

- Hu, E.J. et al. (2021). *LoRA: Low-Rank Adaptation of Large Language Models*. <a href="https://arxiv.org/abs/2106.09685" class="external text" rel="nofollow">arXiv:2106.09685</a>.
- Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external text" rel="nofollow">arXiv:2305.14314</a>.
- Houlsby, N. et al. (2019). *Parameter-Efficient Transfer Learning for NLP*. <a href="https://proceedings.mlr.press/v97/houlsby19a.html" class="external text" rel="nofollow">ICML 2019</a>.
- Li, X.L.; Liang, P. (2021). *Prefix-Tuning: Optimizing Continuous Prompts for Generation*. <a href="https://arxiv.org/abs/2101.00190" class="external text" rel="nofollow">arXiv:2101.00190</a>.
- Liu, X. et al. (2022). *P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks*. <a href="https://arxiv.org/abs/2110.07602" class="external text" rel="nofollow">arXiv:2110.07602</a>.
- Ben Zaken, E.; Ravfogel, S.; Goldberg, Y. (2021). *BitFit: Simple Parameter-Efficient Fine-Tuning for Transformer-Based Masked Language Models*. <a href="https://arxiv.org/abs/2106.10199" class="external text" rel="nofollow">arXiv:2106.10199</a>.
- Guo, D.; Rush, A.M.; Kim, Y. (2020). *Parameter-Efficient Transfer Learning with Diff Pruning*. <a href="https://arxiv.org/abs/2012.07463" class="external text" rel="nofollow">arXiv:2012.07463</a>.
- Jiang, Z. et al. (2024). *MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning*. <a href="https://arxiv.org/abs/2405.12130" class="external text" rel="nofollow">arXiv:2405.12130</a>.
- Mao, K. et al. (2024). *A Survey on LoRA of Large Language Models*. <a href="https://arxiv.org/abs/2407.11046" class="external text" rel="nofollow">arXiv:2407.11046</a>.
- Chen, S. et al. (2024). *Parameter-Efficient Fine Tuning: A Comprehensive Analysis Across Applications*. <a href="https://arxiv.org/abs/2404.13506" class="external text" rel="nofollow">arXiv:2404.13506</a>.
- Zhang, J. et al. (2025). *Parameter-Efficient Fine-Tuning for Foundation Models*. <a href="https://arxiv.org/abs/2501.13787" class="external text" rel="nofollow">arXiv:2501.13787</a>.

## Notas

1.  <span id="cite_note-survey_arxiv_2025-1">[↑](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-survey_arxiv_2025_1-0) «Parameter-Efficient Fine-Tuning for Foundation Models». *arXiv:2501.13787*. <a href="https://arxiv.org/abs/2501.13787" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-mlm_problems_2025-2">↑ <sup>[2.0](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-mlm_problems_2025_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-mlm_problems_2025_2-1)</sup> «5 Problems Encountered Fine-Tuning LLMs with Solutions». *Machine Learning Mastery*. <a href="https://machinelearningmastery.com/5-problems-encountered-fine-tuning-llms-with-solutions/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-huggingface_peft_methods-3">↑ <sup>[3.0](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-huggingface_peft_methods_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-huggingface_peft_methods_3-1)</sup> «PEFT: Parameter-Efficient Fine-Tuning Methods for LLMs». *Hugging Face Blog*. <a href="https://huggingface.co/blog/samuellimabraz/peft-methods" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-houlsby2019-4">↑ <sup>[4.0](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-houlsby2019_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-houlsby2019_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-houlsby2019_4-2)</sup> Houlsby, N., et al. «Parameter-Efficient Transfer Learning for NLP». *Proceedings of the 36th International Conference on Machine Learning*. <a href="https://proceedings.mlr.press/v97/houlsby19a.html" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-li2021prefix-5">[↑](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-li2021prefix_5-0) Li, X.L., Liang, P. «Prefix-Tuning: Optimizing Continuous Prompts for Generation». *arXiv:2101.00190*. <a href="https://arxiv.org/abs/2101.00190" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-liu2021ptuningv2-6">[↑](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-liu2021ptuningv2_6-0) Liu, X., et al. «P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks». *arXiv:2110.07602*. <a href="https://arxiv.org/abs/2110.07602" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-hu2021lora-7">[↑](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-hu2021lora_7-0) Hu, E.J., et al. «LoRA: Low-Rank Adaptation of Large Language Models». *arXiv:2106.09685*. <a href="https://arxiv.org/abs/2106.09685" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dettmers2023qlora-8">↑ <sup>[8.0](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-dettmers2023qlora_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-dettmers2023qlora_8-1)</sup> Dettmers, T., et al. «QLoRA: Efficient Finetuning of Quantized LLMs». *arXiv:2305.14314*. <a href="https://arxiv.org/abs/2305.14314" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-dora_paper-9">↑ <sup>[9.0](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-dora_paper_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/PEFT_(Parameter-Efficient_Fine-Tuning)_(PT)#cite_ref-dora_paper_9-1)</sup> «Parameter Efficient Fine Tuning: A Comprehensive Analysis Across Applications». *arXiv:2404.13506*. <a href="https://arxiv.org/html/2404.13506v1" class="external autonumber" rel="nofollow">[9]</a></span>
