---
title: "Low-Rank Adaptation (LoRA) (PT)"
source: "https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)"
wiki: "systems-analysis.info/int"
article: "Low-Rank_Adaptation_(LoRA)_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 3930
wiki_created_at: 2026-09-06T23:28:07Z
wiki_modified_at: 2026-09-06T23:28:07Z
downloaded_at: 2026-09-07T22:59:45Z
---

# Low-Rank Adaptation (LoRA) (PT)

**Low-Rank Adaptation** (**LoRA**) é um método de ajuste fino paramétrico-eficiente (PEFT) que permite adaptar grandes modelos de linguagem (LLMs) a novas tarefas com custos computacionais mínimos. A tecnologia foi apresentada pela primeira vez em um trabalho de **Edward Hu** e seus colegas em 2021<sup>[\[1\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_note-hu2021-1)</sup>.

O ajuste fino completo (*full fine-tuning*) de modelos grandes, como LLaMA ou GPT, exige enormes recursos, tornando-o inacessível para a maioria dos pesquisadores e desenvolvedores. O LoRA resolve esse problema ao permitir o ajuste fino de apenas uma pequena parte dos parâmetros do modelo, mantendo alta qualidade e desempenho comparáveis ao ajuste fino completo<sup>[\[2\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_note-mao2024-2)</sup>.

## Princípio de Funcionamento

A ideia principal do LoRA é não modificar os pesos originais do modelo pré-treinado, mas sim adicionar a eles uma pequena matriz de "correção". Em vez de treinar diretamente a enorme matriz de pesos \`W\`, o LoRA representa sua alteração como o produto de duas matrizes menores de baixo posto.

Formalmente, se a matriz de pesos original de uma camada \`W_0\` tem dimensão \`d × k\`, sua atualização é representada como \`ΔW = BA\`, onde \`B\` é uma matriz de dimensão \`d × r\`, e \`A\` é uma matriz de dimensão \`r × k\`. O posto \`r\` é um hiperparâmetro e é significativamente menor (\`r \<\< d, k\`). Durante o processo de ajuste fino, os pesos originais \`W_0\` são **congelados**, e apenas as matrizes \`A\` e \`B\` são treinadas. A matriz de pesos final é calculada como \`W = W_0 + BA\`.

Isso permite reduzir o número de parâmetros treináveis em milhares de vezes. Por exemplo, ao ajustar o **GPT-3** (175 bilhões de parâmetros), o LoRA reduz o número de parâmetros treináveis em 10.000 vezes e diminui os requisitos de memória da GPU em 3 vezes<sup>[\[1\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_note-hu2021-1)</sup>.

## Principais Vantagens

- **Economia de recursos**: Reduz drasticamente o número de parâmetros treináveis (até 90% ou mais), o que diminui significativamente o consumo de memória de vídeo (VRAM) e acelera o processo de treinamento.
- **Ausência de latência na inferência**: Após o treinamento, as matrizes \`B\` e \`A\` podem ser "fundidas" com a matriz principal \`W_0\`, calculando \`W = W_0 + BA\`. Assim, durante o uso do modelo, não há cálculos ou atrasos adicionais<sup>[\[1\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_note-hu2021-1)</sup>.
- **Modularidade e troca rápida de tarefas**: Os adaptadores LoRA treinados são arquivos pequenos (alguns megabytes). Isso permite armazenar facilmente dezenas de adaptadores para diferentes tarefas e alternar rapidamente entre eles sem alterar o modelo principal<sup>[\[3\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_note-ibm_lora-3)</sup>.

## Limitações e Modificações

Embora o LoRA seja muito eficiente, sua natureza de baixo posto pode ser uma limitação para tarefas que exigem a memorização de um grande volume de novas informações. Para resolver este e outros problemas, várias modificações foram propostas.

### QLoRA

**QLoRA** (Quantized Low-Rank Adaptation) é uma das modificações mais populares, proposta em 2023. Ela combina o LoRA com a **quantização de 4 bits** do modelo base<sup>[\[4\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_note-dettmers2023-4)</sup>. Isso permite reduzir ainda mais os requisitos de memória, tornando possível o ajuste fino de modelos com dezenas de bilhões de parâmetros (por exemplo, modelos de 65B) em uma única GPU de consumidor. Com base no QLoRA, foi criado, em particular, o modelo **Guanaco**, que demonstrou resultados comparáveis aos do ChatGPT.

### Outras Modificações

- **MoRA** (High-Rank Updating): Proposta para tarefas onde o LoRA apresenta desempenho insuficiente devido à limitação de posto. O MoRA utiliza métodos que permitem atualizar pesos com alto posto, mantendo a eficiência paramétrica<sup>[\[5\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_note-jiang2024-5)</sup>.

## Implementação e Aplicação

A tecnologia LoRA ganhou ampla adoção devido à sua eficiência e facilidade de integração. A biblioteca **PEFT** (Parameter-Efficient Fine-Tuning) da **Hugging Face** desempenhou um papel fundamental em sua popularização. A PEFT fornece uma interface unificada para aplicar LoRA e outros métodos de PEFT a modelos do ecossistema Transformers<sup>[\[6\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_note-hf_peft-6)</sup>.

O LoRA é ativamente utilizado para:

- Adaptação de chatbots e sistemas de diálogo (por exemplo, ajuste fino de LLaMA, Mistral).
- Criação de modelos para classificação e geração de texto em domínios altamente especializados.
- Personalização de modelos para um estilo ou formato de dados específico.

## Ligações externas

- <a href="https://huggingface.co/docs/peft/index" class="external text" rel="nofollow">Documentação oficial da biblioteca PEFT da Hugging Face</a>

## Literatura

- Hu, E.J. et al. (2021). *LoRA: Low-Rank Adaptation of Large Language Models*. <a href="https://arxiv.org/abs/2106.09685" class="external text" rel="nofollow">arXiv:2106.09685</a>.
- Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external text" rel="nofollow">arXiv:2305.14314</a>.
- Zhang, Q. et al. (2023). *AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning*. <a href="https://arxiv.org/abs/2303.10512" class="external text" rel="nofollow">arXiv:2303.10512</a>.
- Chen, Y. et al. (2023). *LongLoRA: Efficient Fine-Tuning of Long-Context Large Language Models*. <a href="https://arxiv.org/abs/2309.12307" class="external text" rel="nofollow">arXiv:2309.12307</a>.
- Mao, K. et al. (2024). *A Survey on LoRA of Large Language Models*. <a href="https://arxiv.org/abs/2407.11046" class="external text" rel="nofollow">arXiv:2407.11046</a>.
- Jiang, T. et al. (2024). *MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning*. <a href="https://arxiv.org/abs/2405.12130" class="external text" rel="nofollow">arXiv:2405.12130</a>.
- Liu, Z. et al. (2024). *ALoRA: Allocating Low-Rank Adaptation for Fine-Tuning Large Language Models*. <a href="https://arxiv.org/abs/2403.16187" class="external text" rel="nofollow">arXiv:2403.16187</a>.
- Liu, J. et al. (2025). *RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation*. <a href="https://arxiv.org/abs/2501.04315" class="external text" rel="nofollow">arXiv:2501.04315</a>.
- Albert, P. et al. (2025). *RandLoRA: Full-Rank Parameter-Efficient Fine-Tuning of Large Models*. <a href="https://arxiv.org/abs/2502.00987" class="external text" rel="nofollow">arXiv:2502.00987</a>.
- Tastan, N. et al. (2025). *LoFT: Low-Rank Adaptation That Behaves Like Full Fine-Tuning*. <a href="https://arxiv.org/abs/2505.21289" class="external text" rel="nofollow">arXiv:2505.21289</a>.

## Notas

1.  <span id="cite_note-hu2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_ref-hu2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_ref-hu2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_ref-hu2021_1-2)</sup> Hu, E.J., et al. «LoRA: Low-Rank Adaptation of Large Language Models». *arXiv:2106.09685*. <a href="https://arxiv.org/abs/2106.09685" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-mao2024-2">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_ref-mao2024_2-0) Mao, K., et al. «A Survey on LoRA of Large Language Models». *arXiv:2407.11046*. <a href="https://arxiv.org/abs/2407.11046" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-ibm_lora-3">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_ref-ibm_lora_3-0) Noble, Joshua. «What is LoRA (Low-Rank Adaption)?». *IBM Technology*. <a href="https://www.ibm.com/think/topics/lora" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-dettmers2023-4">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_ref-dettmers2023_4-0) Dettmers, T., et al. «QLoRA: Efficient Finetuning of Quantized LLMs». *arXiv:2305.14314*. <a href="https://arxiv.org/abs/2305.14314" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-jiang2024-5">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_ref-jiang2024_5-0) Jiang, Z., et al. «MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning». *arXiv:2405.12130*. <a href="https://arxiv.org/abs/2405.12130" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hf_peft-6">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(PT)#cite_ref-hf_peft_6-0) «LoRA (Low-Rank Adaptation)». *Hugging Face LLM Course*. <a href="https://huggingface.co/learn/llm-course/en/chapter11/4" class="external autonumber" rel="nofollow">[6]</a></span>
