Low-Rank Adaptation (LoRA) (TR)
Low-Rank Adaptation (LoRA) — büyük dil modellerini (LLM) minimum hesaplama maliyetiyle yeni görevlere uyarlamayı sağlayan parametrik açıdan verimli ince ayar (PEFT) yöntemidir. Teknoloji ilk kez Edward Hu ve meslektaşları tarafından 2021 yılında yayımlanan bir çalışmada tanıtılmıştır[1].
LLaMA veya GPT gibi büyük modellerin tam ince ayarı (full fine-tuning) devasa kaynaklar gerektirmekte ve bu durum söz konusu yöntemi araştırmacıların ve geliştiricilerin büyük çoğunluğu için erişilemez kılmaktadır. LoRA, modelin yalnızca küçük bir parametre bölümünü ince ayara tabi tutarak bu sorunu çözmekte; bununla birlikte tam ince ayarla kıyaslanabilir yüksek kalite ve performansı korumaktadır[2].
Çalışma Prensibi
LoRA'nın temel fikri, önceden eğitilmiş modelin özgün ağırlıklarını değiştirmek yerine onlara küçük bir "düzeltici" matris eklemektir. Büyük ağırlık matrisi `W`'yu doğrudan eğitmek yerine LoRA, değişimini düşük ranklı iki küçük matrisin çarpımı olarak temsil eder.
Biçimsel olarak, katmanın özgün ağırlık matrisi `W_0` boyutu `d × k` ise, güncelleme `ΔW = BA` şeklinde ifade edilir; burada `B`, `d × r` boyutlu matris, `A` ise `r × k` boyutlu matristir. `r` rankı bir hiperparametredir ve oldukça küçük bir değer alır (`r << d, k`). İnce ayar sürecinde özgün ağırlıklar `W_0` dondurulur, yalnızca `A` ve `B` matrisleri eğitilir. Nihai ağırlık matrisi `W = W_0 + BA` olarak hesaplanır.
Bu yaklaşım, eğitilebilir parametre sayısını binlerce kat azaltmayı mümkün kılar. Örneğin GPT-3'ün (175 milyar parametre) ince ayarında LoRA, eğitilebilir parametre sayısını 10.000 kat azaltmakta ve GPU belleği gereksinimini 3 kat düşürmektedir[1].
Temel Avantajlar
- Kaynak tasarrufu: Eğitilebilir parametre sayısı belirgin biçimde azalır (%90 ve üzeri), bu da video belleği (VRAM) tüketimini önemli ölçüde düşürür ve eğitim sürecini hızlandırır.
- Çıkarım sırasında gecikme olmaması (inference): Eğitimin ardından `B` ve `A` matrisleri ana matris `W_0` ile "birleştirilerek" `W = W_0 + BA` hesaplanabilir. Bu sayede model kullanımı sırasında herhangi bir ek hesaplama ya da gecikme oluşmaz[1].
- Modülerlik ve hızlı görev geçişi: Eğitilmiş LoRA adaptörleri küçük dosyalar (birkaç megabayt) biçimindedir. Bu özellik, onlarca farklı görev adaptörünü kolayca depolamayı ve ana modeli değiştirmeksizin aralarında hızla geçiş yapmayı mümkün kılar[3].
Sınırlılıklar ve Değiştirimler
LoRA son derece verimli olmakla birlikte, düşük ranklı yapısı büyük miktarda yeni bilginin ezberlenmesini gerektiren görevler için bir kısıt oluşturabilir. Bu ve benzeri sorunları gidermek amacıyla çeşitli değiştirimler önerilmiştir.
QLoRA
QLoRA (Quantized Low-Rank Adaptation), 2023 yılında önerilen en popüler değiştirimlerin biridir. LoRA'yı temel modelin 4-bit kuantizasyonu ile birleştirir[4]. Bu yaklaşım bellek gereksinimlerini daha da düşürerek onlarca milyar parametreli modellerin (örneğin 65B model) tek bir tüketici GPU'su üzerinde ince ayarını mümkün kılar. QLoRA temelinde, başta ChatGPT ile kıyaslanabilir sonuçlar sergileyen Guanaco modeli olmak üzere çeşitli modeller geliştirilmiştir.
Diğer Değiştirimler
- MoRA (High-Rank Updating): Rank kısıtlaması nedeniyle LoRA'nın yetersiz performans gösterdiği görevler için önerilmiştir. MoRA, parametrik verimliliği korurken ağırlıkları yüksek rankla güncellemeyi sağlayan yöntemler kullanır[5].
Uygulama ve Kullanım Alanları
LoRA teknolojisi, verimliliği ve entegrasyon kolaylığı sayesinde yaygın kullanım kazanmıştır. Hugging Face şirketinin PEFT (Parameter-Efficient Fine-Tuning) kütüphanesi bu teknolojinin popülerleşmesinde anahtar bir rol oynamıştır. PEFT, LoRA ve diğer PEFT yöntemlerinin Transformers ekosistemindeki modellere uygulanması için birleşik bir arayüz sunar[6].
LoRA aktif olarak şu amaçlar için kullanılmaktadır:
- Sohbet botları ve diyalog sistemlerinin uyarlanması (örneğin LLaMA, Mistral'ın ince ayarı).
- Dar uzmanlaşmış alanlarda metin sınıflandırma ve üretimi için modeller oluşturma.
- Modellerin belirli bir stil veya veri formatına göre kişiselleştirilmesi.
Dış bağlantılar
- Hugging Face'in PEFT kütüphanesinin resmi dokümantasyonu
Kaynakça
- Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
- Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. arXiv:2305.14314.
- Zhang, Q. et al. (2023). AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning. arXiv:2303.10512.
- Chen, Y. et al. (2023). LongLoRA: Efficient Fine-Tuning of Long-Context Large Language Models. arXiv:2309.12307.
- Mao, K. et al. (2024). A Survey on LoRA of Large Language Models. arXiv:2407.11046.
- Jiang, T. et al. (2024). MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning. arXiv:2405.12130.
- Liu, Z. et al. (2024). ALoRA: Allocating Low-Rank Adaptation for Fine-Tuning Large Language Models. arXiv:2403.16187.
- Liu, J. et al. (2025). RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation. arXiv:2501.04315.
- Albert, P. et al. (2025). RandLoRA: Full-Rank Parameter-Efficient Fine-Tuning of Large Models. arXiv:2502.00987.
- Tastan, N. et al. (2025). LoFT: Low-Rank Adaptation That Behaves Like Full Fine-Tuning. arXiv:2505.21289.
Notlar
- ↑ 1.0 1.1 1.2 Hu, E.J., et al. «LoRA: Low-Rank Adaptation of Large Language Models». arXiv:2106.09685. [1]
- ↑ Mao, K., et al. «A Survey on LoRA of Large Language Models». arXiv:2407.11046. [2]
- ↑ Noble, Joshua. «What is LoRA (Low-Rank Adaption)?». IBM Technology. [3]
- ↑ Dettmers, T., et al. «QLoRA: Efficient Finetuning of Quantized LLMs». arXiv:2305.14314. [4]
- ↑ Jiang, Z., et al. «MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning». arXiv:2405.12130. [5]
- ↑ «LoRA (Low-Rank Adaptation)». Hugging Face LLM Course. [6]