PEFT (Parameter-Efficient Fine-Tuning) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Parameter-efficient na karagdagang pagsasanay (Ingles: Parameter-Efficient Fine-Tuning, PEFT) — ito ay isang koleksyon ng mga pamamaraan para sa pag-aangkop ng malalaking paunang sinanay na modelo, tulad ng malalaking modelo ng wika (LLM), sa mga tiyak na gawain nang may pinakamaliit na gastos sa pagkalkula at mapagkukunan. Hindi tulad ng tradisyonal na kumpletong karagdagang pagsasanay (full fine-tuning), na nangangailangan ng pag-update ng lahat ng parameter ng modelo, ang mga pamamaraan ng PEFT ay nakatuon sa pagbabago ng isang maliit na bahagi lamang ng mga timbang (wala pang 1-5% ng kabuuang bilang), na iniiwan ang pangunahing bahagi ng modelo nang walang pagbabago («naka-freeze»)[1].

Ang diskarteng ito ay nagbibigay-daan na makabuluhang mabawasan ang mga kinakailangan sa memorya, espasyo ng imbakan at oras ng pagsasanay, na ginagawang mas naa-access at mas lumalaban sa problema ng catastrophic forgetting ang proseso ng pag-aangkop ng mga makapangyarihang pangunahing modelo[2].

Mga problema ng kumpletong karagdagang pagsasanay

Ang tradisyonal na kumpletong karagdagang pagsasanay, kung saan ina-update ang lahat ng parameter ng modelo, ay nahaharap sa ilang kritikal na problema na naging dahilan ng pagbuo ng PEFT:

  • Mataas na gastos sa pagkalkula: Ang pag-update ng daan-daang bilyon na parameter ay nangangailangan ng napakaraming kapasidad sa pagkalkula (mataas na pagganap na GPU/TPU) at malaking dami ng video memory (VRAM), na ginagawang mahal at hindi naa-access ang proseso para sa maraming mananaliksik.
  • Kahirap-trapan sa imbakan: Para sa bawat bagong gawain, kailangan na mag-imbak ng kumpletong kopya ng modelo na may maraming gigabytes, na nagdudulot ng exponential na paglago ng mga kinakailangan sa espasyo ng disk.
  • Catastrophic Forgetting: Ang modelo, habang nag-aadapt sa bagong datos, ay «nakakalimot» ng pangkalahatang kaalaman na nakuha sa yugto ng paunang pagsasanay, na nagpapababa ng pagganap nito sa iba pang mga gawain.
  • Panganib ng overfitting: Sa maliliit na dataset para sa karagdagang pagsasanay, ang mga modelo na may bilyun-bilyong parameter ay may posibilidad na «kabisahin» ang mga halimbawa ng pagsasanay kaysa pag-aralan ang mga pangkalahatang pattern[2].

Taksonomiyang PEFT - Taxonomy ng mga pamamaraan ng PEFT

Ang mga pamamaraan ng PEFT ay maaaring uriin ayon sa paraan ng pagbabago ng mga parameter ng modelo. Mayroong tatlong pangunahing kategorya: additive, selective at reparameterization[3].

Mga additive na pamamaraan

Ang mga pamamaraang ito ay nini-freeze ang lahat ng orihinal na timbang ng modelo at nagdadagdag ng mga bagong maliit na module na sinasamahan ng pagsasanay.

  • Adapters: Ang pinaka-unang additive na pamamaraan. Ang maliliit na neural network module na may arkitektura ng «bottleneck» ay ipinasok sa pagitan ng mga layer ng transformer. Ang mga timbang lamang ng mga adapter na ito ang sinasamahan ng pagsasanay[4].
  • Mga pamamaraan batay sa «malambot» na mga prompt (Soft Prompts): Sa halip na baguhin ang mga timbang ng modelo, ang mga pamamaraang ito ay nagdaragdag ng mga sinasamahan ng pagsasanay na vector («mga virtual na token») sa input data, na ginagabayan ang gawi ng modelo. Mga pangunahing variant:
    • Prompt Tuning: Nagdaragdag ng mga sinasamahan ng pagsasanay na vector sa mga input embedding lamang.
    • Prefix-Tuning: Nagdaragdag ng mga sinasamahan ng pagsasanay na vector prefix sa mga nakatagong estado sa bawat layer ng mekanismo ng attention, na nagbibigay ng mas pinong kontrol[5].
    • P-Tuning v2: Pangkalahatan ng ideya ng Prefix-Tuning, na nag-aaplay ng mga sinasamahan ng pagsasanay na prompt sa lahat ng layer ng modelo, na nakakamit ng pagganap na maihahambing sa kumpletong karagdagang pagsasanay[6].

Mga selective na pamamaraan

Ang mga pamamaraang ito ay hindi nagdaragdag ng mga bagong parameter, ngunit pumipili at nagsa-sanay muli ng isang maliit na subset ng mga kasalukuyang parameter.

  • BitFit: Isang napaka-matipid na pamamaraan na nagsa-sanay muli lamang ng mga bias vector (bias terms) at mga parameter ng layer ng normalization, na ina-update ang wala pang 0.1% ng kabuuang bilang ng mga parameter.
  • Differential Pruning (Diff Pruning): Gumagamit ng sinasamahan ng pagsasanay na mask para sa dynamic na pagtukoy kung aling mga timbang ang dapat i-update sa proseso ng pagsasanay[3].

Mga reparameterization na pamamaraan

Ang kategoryang ito ay batay sa hypothesis na ang mga pagbabago ng timbang para sa pag-aangkop ng modelo ay may mababang «panloob na ranggo». Sa halip na i-update ang mga full-size na matrix ng timbang, ini-update ng mga pamamaraang ito ang kanilang low-rank na representasyon.

  • LoRA (Low-Rank Adaptation): Ang pinakasikat na pamamaraan ng PEFT sa kasalukuyan. Ipinapalagay nito na ang pag-update ng matrix ng timbang `ΔW` ay maaaring i-approximate sa pamamagitan ng produkto ng dalawang low-rank na matrix: `ΔW = BA`. Sa proseso ng karagdagang pagsasanay, nini-freeze ang orihinal na matrix `W`, at sina-sanay lamang ang `A` at `B`[7].
  • QLoRA: Pinagsasama ang LoRA sa mga teknik ng quantization para sa karagdagang pagbawas ng mga kinakailangan sa memorya, na nagbibigay-daan sa pagsasanay ng mga modelo na may 65 bilyong parameter sa isang consumer GPU[8].

Paghahambing ng pagganap at mapagkukunan

Ang mga pamamaraan ng PEFT ay nagbibigay-daan na makamit ang pagganap na maihahambing sa kumpletong karagdagang pagsasanay, na may radikal na pagbawas ng mga gastos.

Paghahambing ng pagganap at kahusayan ng mga pamamaraan ng PEFT
Modelo Pamamaraan Mga sinasamahan ng pagsasanay na parameter (%) Resulta sa benchmark (Avg. Accuracy) Pinagkukunan
BERT-Large Kumpletong karagdagang pagsasanay 100% 80.4 (GLUE) [4]
BERT-Large Adapters 3.6% 80.0 (GLUE) [4]
LLaMA-7B LoRA 0.83% 74.7% [9]
LLaMA-7B DoRA (variant ng LoRA) 0.84% 78.1% [9]

Mga pangunahing kalamangan ng PEFT sa pagtitipid ng mapagkukunan:

  • Memorya ng GPU (VRAM): Para sa modelong LLaMA 65B, ang kumpletong karagdagang pagsasanay ay teoretikal na nangangailangan ng >780 GB VRAM, habang ang QLoRA ay nagbibigay-daan sa pagsasanay nito sa GPU na may <48 GB VRAM[8].
  • Dami ng imbakan: Ang mga checkpoint na nai-save pagkatapos ng PEFT ay sumasaklaw ng mga megabytes, hindi gigabytes. Nagbibigay-daan ito na mag-imbak ng daan-daang «adapter» para sa iba't ibang gawain sa dami na kayang sakupin ng isang buong sinanay na modelo.

Mga larangan ng aplikasyon

Orihinal na binuo para sa NLP, ang mga pamamaraan ng PEFT ay matagumpay na nai-angkop para sa malawak na hanay ng mga gawain:

  • Computer Vision (CV) at multimodal na modelo (VLM): Pag-aangkop ng mga modelo, tulad ng Vision Transformer (ViT) at Segment Anything Model (SAM), para sa mga gawain ng segmentasyon ng imahe, kabilang ang sa biomedicine.
  • Pagbuo at pagsusuri ng code: Pag-configure ng LLM para sa partikularidad ng mga tiyak na software project, panloob na API o mga codebase.
  • Mga generative na modelo: «Pag-istilo» ng mga modelo ng pagbuo ng imahe, tulad ng Stable Diffusion, gamit ang mga LoRA adapter (teknik na Dreambooth).
  • Synthesis ng pananalita: Pag-aangkop ng mga modelo para sa pagbuo ng pananalita na may tiyak na boses, intonasyon o emosyonal na kulay.

Mga sanggunian

  • Repositoryo ng library ng PEFT sa GitHub
  • Opisyal na dokumentasyon ng library ng PEFT mula sa Hugging Face

Panitikan

  • Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
  • Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. arXiv:2305.14314.
  • Houlsby, N. et al. (2019). Parameter-Efficient Transfer Learning for NLP. ICML 2019.
  • Li, X.L.; Liang, P. (2021). Prefix-Tuning: Optimizing Continuous Prompts for Generation. arXiv:2101.00190.
  • Liu, X. et al. (2022). P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks. arXiv:2110.07602.
  • Ben Zaken, E.; Ravfogel, S.; Goldberg, Y. (2021). BitFit: Simple Parameter-Efficient Fine-Tuning for Transformer-Based Masked Language Models. arXiv:2106.10199.
  • Guo, D.; Rush, A.M.; Kim, Y. (2020). Parameter-Efficient Transfer Learning with Diff Pruning. arXiv:2012.07463.
  • Jiang, Z. et al. (2024). MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning. arXiv:2405.12130.
  • Mao, K. et al. (2024). A Survey on LoRA of Large Language Models. arXiv:2407.11046.
  • Chen, S. et al. (2024). Parameter-Efficient Fine Tuning: A Comprehensive Analysis Across Applications. arXiv:2404.13506.
  • Zhang, J. et al. (2025). Parameter-Efficient Fine-Tuning for Foundation Models. arXiv:2501.13787.

Mga tala

  1. «Parameter-Efficient Fine-Tuning for Foundation Models». arXiv:2501.13787. [1]
  2. 2.0 2.1 «5 Problems Encountered Fine-Tuning LLMs with Solutions». Machine Learning Mastery. [2]
  3. 3.0 3.1 «PEFT: Parameter-Efficient Fine-Tuning Methods for LLMs». Hugging Face Blog. [3]
  4. 4.0 4.1 4.2 Houlsby, N., et al. «Parameter-Efficient Transfer Learning for NLP». Proceedings of the 36th International Conference on Machine Learning. [4]
  5. Li, X.L., Liang, P. «Prefix-Tuning: Optimizing Continuous Prompts for Generation». arXiv:2101.00190. [5]
  6. Liu, X., et al. «P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks». arXiv:2110.07602. [6]
  7. Hu, E.J., et al. «LoRA: Low-Rank Adaptation of Large Language Models». arXiv:2106.09685. [7]
  8. 8.0 8.1 Dettmers, T., et al. «QLoRA: Efficient Finetuning of Quantized LLMs». arXiv:2305.14314. [8]
  9. 9.0 9.1 «Parameter Efficient Fine Tuning: A Comprehensive Analysis Across Applications». arXiv:2404.13506. [9]