---
title: "Low-Rank Adaptation (LoRA) (BG)"
source: "https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)"
wiki: "systems-analysis.info/int"
article: "Low-Rank_Adaptation_(LoRA)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3914
wiki_created_at: 2026-09-06T23:27:53Z
wiki_modified_at: 2026-09-06T23:27:53Z
downloaded_at: 2026-09-07T22:59:41Z
---

# Low-Rank Adaptation (LoRA) (BG)

**Low-Rank Adaptation** (**LoRA**) — това е метод за параметрично ефективно дообучване (PEFT), който позволява адаптирането на големи езикови модели (LLM) към нови задачи с минимални изчислителни разходи. Технологията е представена за първи път в работата на **Едуард Ху** (Edward Hu) и неговите колеги през 2021 година<sup>[\[1\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_note-hu2021-1)</sup>.

Пълното дообучване (*full fine-tuning*) на големи модели като LLaMA или GPT изисква огромни ресурси, което го прави недостъпно за повечето изследователи и разработчици. LoRA решава този проблем, като позволява дообучването само на малка част от параметрите на модела, като същевременно запазва високо качество и производителност, сравними с пълното дообучване<sup>[\[2\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_note-mao2024-2)</sup>.

## Принцип на работа

Основната идея на LoRA се състои в това, да не се променят изходните тегла на предобучения модел, а да се добави към тях малка „коригираща" матрица. Вместо да обучава директно огромната матрица на теглата \`W\`, LoRA представя нейната промяна като произведение на две малки матрици с нисък ранг.

Формално, ако изходната матрица на теглата на слоя \`W_0\` има размер \`d × k\`, нейното обновяване се представя като \`ΔW = BA\`, където \`B\` е матрица с размерност \`d × r\`, а \`A\` е матрица с размерност \`r × k\`. Рангът \`r\` е хиперпараметър и е значително по-малък (\`r \<\< d, k\`). По време на дообучването изходните тегла \`W_0\` се **замразяват**, а се обучават само матриците \`A\` и \`B\`. Крайната матрица на теглата се изчислява като \`W = W_0 + BA\`.

Това позволява да се намали броят на обучаваните параметри хиляди пъти. Например при дообучване на **GPT-3** (175 млрд. параметъра) LoRA намалява броя на обучаваните параметри 10 000 пъти и намалява изискванията към GPU-паметта 3 пъти<sup>[\[1\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_note-hu2021-1)</sup>.

## Ключови предимства

- **Икономия на ресурси**: Броят на обучаваните параметри се намалява драстично (до 90% и повече), което значително намалява потреблението на видеопамет (VRAM) и ускорява процеса на обучение.
- **Липса на закъснение при извод (inference)**: След обучението матриците \`B\` и \`A\` могат да се „слеят" с основната матрица \`W_0\`, изчислявайки \`W = W_0 + BA\`. По този начин при използването на модела не се добавят никакви допълнителни изчисления или закъснения<sup>[\[1\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_note-hu2021-1)</sup>.
- **Модулност и бързо превключване между задачи**: Обучените LoRA-адаптери представляват малки файлове (няколко мегабайта). Това позволява лесно съхранение на десетки адаптери за различни задачи и бързо превключване между тях, без да се променя основният модел<sup>[\[3\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_note-ibm_lora-3)</sup>.

## Ограничения и модификации

Въпреки че LoRA е много ефективна, нейната нискорангова природа може да бъде ограничение за задачи, изискващи запаметяване на голям обем нова информация. За решаването на този и на други проблеми са предложени различни модификации.

### QLoRA

**QLoRA** (Quantized Low-Rank Adaptation) — една от най-популярните модификации, предложена през 2023 година. Тя обединява LoRA с **4-битово квантуване** на базовия модел<sup>[\[4\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_note-dettmers2023-4)</sup>. Това позволява допълнително намаляване на изискванията към паметта, правейки възможно дообучването на модели с десетки милиарди параметри (например 65B-модели) на един потребителски GPU. На основата на QLoRA е създаден, по-специално, моделът **Guanaco**, който показа резултати, сравними с ChatGPT.

### Други модификации

- **MoRA** (High-Rank Updating): Предложена за задачи, при които LoRA показва недостатъчна производителност поради ограничението на ранга. MoRA използва методи, позволяващи актуализиране на теглата с висок ранг, като същевременно запазва параметричната ефективност<sup>[\[5\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_note-jiang2024-5)</sup>.

## Реализация и приложение

Технологията LoRA получи широко разпространение благодарение на своята ефективност и лесна интеграция. Ключова роля в нейната популяризация изигра библиотеката **PEFT** (Parameter-Efficient Fine-Tuning) от компанията **Hugging Face**. PEFT предоставя единен интерфейс за прилагане на LoRA и на други методи PEFT към модели от екосистемата Transformers<sup>[\[6\]](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_note-hf_peft-6)</sup>.

LoRA се използва активно за:

- Адаптиране на чатботове и диалогови системи (например дообучване на LLaMA, Mistral).
- Създаване на модели за класификация и генериране на текст в тясно специализирани области.
- Персонализиране на модели към конкретен стил или формат на данни.

## Връзки

- Официална документация на библиотеката PEFT от Hugging Face

## Литература

- Hu, E.J. et al. (2021). *LoRA: Low-Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. arXiv:2305.14314.
- Zhang, Q. et al. (2023). *AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning*. arXiv:2303.10512.
- Chen, Y. et al. (2023). *LongLoRA: Efficient Fine-Tuning of Long-Context Large Language Models*. arXiv:2309.12307.
- Mao, K. et al. (2024). *A Survey on LoRA of Large Language Models*. arXiv:2407.11046.
- Jiang, T. et al. (2024). *MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning*. arXiv:2405.12130.
- Liu, Z. et al. (2024). *ALoRA: Allocating Low-Rank Adaptation for Fine-Tuning Large Language Models*. arXiv:2403.16187.
- Liu, J. et al. (2025). *RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation*. arXiv:2501.04315.
- Albert, P. et al. (2025). *RandLoRA: Full-Rank Parameter-Efficient Fine-Tuning of Large Models*. arXiv:2502.00987.
- Tastan, N. et al. (2025). *LoFT: Low-Rank Adaptation That Behaves Like Full Fine-Tuning*. arXiv:2505.21289.

## Бележки

1.  <span id="cite_note-hu2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_ref-hu2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_ref-hu2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_ref-hu2021_1-2)</sup> Hu, E.J., et al. «LoRA: Low-Rank Adaptation of Large Language Models». *arXiv:2106.09685*. <a href="https://arxiv.org/abs/2106.09685" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-mao2024-2">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_ref-mao2024_2-0) Mao, K., et al. «A Survey on LoRA of Large Language Models». *arXiv:2407.11046*. <a href="https://arxiv.org/abs/2407.11046" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-ibm_lora-3">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_ref-ibm_lora_3-0) Noble, Joshua. «What is LoRA (Low-Rank Adaption)?». *IBM Technology*. <a href="https://www.ibm.com/think/topics/lora" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-dettmers2023-4">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_ref-dettmers2023_4-0) Dettmers, T., et al. «QLoRA: Efficient Finetuning of Quantized LLMs». *arXiv:2305.14314*. <a href="https://arxiv.org/abs/2305.14314" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-jiang2024-5">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_ref-jiang2024_5-0) Jiang, Z., et al. «MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning». *arXiv:2405.12130*. <a href="https://arxiv.org/abs/2405.12130" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hf_peft-6">[↑](https://systems-analysis.info/int/Low-Rank_Adaptation_(LoRA)_(BG)#cite_ref-hf_peft_6-0) «LoRA (Low-Rank Adaptation)». *Hugging Face LLM Course*. <a href="https://huggingface.co/learn/llm-course/en/chapter11/4" class="external autonumber" rel="nofollow">[6]</a></span>
