PEFT (Parameter-Efficient Fine-Tuning) (BN)
প্যারামিটার-দক্ষ ফাইন-টিউনিং (ইংরেজি: Parameter-Efficient Fine-Tuning, PEFT) — এটি বড় পূর্ব-প্রশিক্ষিত মডেল, যেমন বৃহৎ ভাষা মডেল (LLM), কে ন্যূনতম গণনামূলক ও সম্পদ ব্যয়ে নির্দিষ্ট কাজের জন্য অভিযোজিত করার পদ্ধতিসমূহের একটি সমন্বয়। ঐতিহ্যবাহী পূর্ণ ফাইন-টিউনিং (full fine-tuning) থেকে ভিন্ন — যেখানে মডেলের সমস্ত প্যারামিটার আপডেট করতে হয় — PEFT পদ্ধতিগুলো কেবলমাত্র ওজনের একটি ক্ষুদ্র অংশ (মোট সংখ্যার ১-৫%-এরও কম) পরিবর্তনের উপর মনোযোগ দেয়, মডেলের মূল অংশকে অপরিবর্তিত («হিমায়িত») রাখে[1]।
এই পদ্ধতি মেমরি, স্টোরেজ এবং প্রশিক্ষণের সময়ের চাহিদা উল্লেখযোগ্যভাবে হ্রাস করে, শক্তিশালী ফান্ডামেন্টাল মডেলগুলির অভিযোজন প্রক্রিয়াকে আরও সহজলভ্য করে তোলে এবং বিপর্যয়মূলক ভুলে যাওয়ার (catastrophic forgetting) সমস্যার বিরুদ্ধে স্থিতিস্থাপকতা বাড়ায়[2]।
পূর্ণ ফাইন-টিউনিংয়ের সমস্যাসমূহ
ঐতিহ্যবাহী পূর্ণ ফাইন-টিউনিং, যেখানে মডেলের সমস্ত প্যারামিটার আপডেট করা হয়, বেশ কিছু গুরুত্বপূর্ণ সমস্যার সম্মুখীন হয়, যা PEFT উন্নয়নের অনুঘটক হিসেবে কাজ করেছে:
- উচ্চ গণনামূলক ব্যয়: শত শত কোটি প্যারামিটার আপডেট করতে বিশাল গণনা ক্ষমতা (উচ্চ-কার্যক্ষমতাসম্পন্ন GPU/TPU) এবং প্রচুর ভিডিও মেমরি (VRAM) প্রয়োজন, যা প্রক্রিয়াটিকে ব্যয়বহুল এবং অনেক গবেষকের কাছে দুর্গম করে তোলে।
- স্টোরেজ অদক্ষতা: প্রতিটি নতুন কাজের জন্য মডেলের একটি সম্পূর্ণ, বহু-গিগাবাইট কপি সংরক্ষণ করতে হয়, যা ডিস্ক স্পেসের চাহিদায় তাৎপর্যপূর্ণ বৃদ্ধি ঘটায়।
- বিপর্যয়মূলক ভুলে যাওয়া (Catastrophic Forgetting): নতুন ডেটার সাথে অভিযোজনের সময় মডেলটি পূর্ব-প্রশিক্ষণ পর্যায়ে অর্জিত সাধারণ জ্ঞান «ভুলে» যায়, যা অন্যান্য কাজে এর কার্যক্ষমতা হ্রাস করে।
- অতিরিক্ত শিক্ষণের ঝুঁকি (Overfitting): ছোট dataset-এ কোটি কোটি প্যারামিটারযুক্ত মডেলগুলো সাধারণ প্যাটার্ন শেখার পরিবর্তে প্রশিক্ষণের উদাহরণগুলো «মুখস্থ» করার প্রবণতা দেখায়[2]।
PEFT পদ্ধতির শ্রেণিবিভাগ
PEFT পদ্ধতিগুলোকে মডেলের প্যারামিটার পরিবর্তনের পদ্ধতি অনুযায়ী শ্রেণিবদ্ধ করা যায়। তিনটি মূল বিভাগ রয়েছে: সংযোজনমূলক (additive), নির্বাচনমূলক (selective) এবং পুনঃপ্যারামিটারীকরণ (reparameterization)[3]।
সংযোজনমূলক পদ্ধতি
এই পদ্ধতিগুলো মডেলের সমস্ত মূল ওজন হিমায়িত করে এবং নতুন, ছোট প্রশিক্ষণযোগ্য মডিউল যোগ করে।
- অ্যাডাপ্টার (Adapters): সবচেয়ে প্রাচীন সংযোজনমূলক পদ্ধতি। «বটলনেক» আর্কিটেকচারযুক্ত ছোট নিউরাল নেটওয়ার্ক মডিউল transformer-এর স্তরগুলির মাঝে সন্নিবেশিত হয়। শুধুমাত্র এই অ্যাডাপ্টারগুলোর ওজন প্রশিক্ষিত হয়[4]।
- «নরম» prompt-ভিত্তিক পদ্ধতি (Soft Prompts): মডেলের ওজন পরিবর্তন করার পরিবর্তে, এই পদ্ধতিগুলো ইনপুট ডেটায় প্রশিক্ষণযোগ্য ভেক্টর («ভার্চুয়াল token») যোগ করে, যা মডেলের আচরণকে পরিচালিত করে। মূল রূপভেদগুলো:
- Prompt Tuning: কেবলমাত্র ইনপুট embedding-এ প্রশিক্ষণযোগ্য ভেক্টর যোগ করে।
- Prefix-Tuning: attention মেকানিজমের প্রতিটি স্তরে লুকানো অবস্থায় প্রশিক্ষণযোগ্য ভেক্টর prefix যোগ করে, যা আরও সূক্ষ্ম নিয়ন্ত্রণ প্রদান করে[5]।
- P-Tuning v2: Prefix-Tuning ধারণার সাধারণীকরণ, যা মডেলের সমস্ত স্তরে প্রশিক্ষণযোগ্য prompt প্রয়োগ করে এবং পূর্ণ ফাইন-টিউনিংয়ের সাথে তুলনীয় কার্যক্ষমতা অর্জন করে[6]।
নির্বাচনমূলক পদ্ধতি
এই পদ্ধতিগুলো নতুন প্যারামিটার যোগ করে না, বরং বিদ্যমান প্যারামিটারের একটি ছোট উপসেট বেছে নিয়ে ফাইন-টিউন করে।
- BitFit: অত্যন্ত সাশ্রয়ী একটি পদ্ধতি, যা কেবলমাত্র bias term এবং normalization স্তরের প্যারামিটার ফাইন-টিউন করে, মোট প্যারামিটারের ০.১%-এরও কম আপডেট করে।
- ডিফারেনশিয়াল প্রুনিং (Diff Pruning): প্রশিক্ষণ প্রক্রিয়ায় কোন ওজনগুলো আপডেট করতে হবে তা গতিশীলভাবে নির্ধারণ করতে একটি প্রশিক্ষণযোগ্য মাস্ক ব্যবহার করে[3]।
পুনঃপ্যারামিটারীকরণ পদ্ধতি
এই বিভাগটি এই অনুমানের উপর ভিত্তি করে যে মডেল অভিযোজনের জন্য ওজন পরিবর্তনের একটি কম «অভ্যন্তরীণ র্যাংক» রয়েছে। পূর্ণ আকারের ওজন ম্যাট্রিক্স আপডেট করার পরিবর্তে, এই পদ্ধতিগুলো তাদের নিম্ন-র্যাংক উপস্থাপনা আপডেট করে।
- LoRA (Low-Rank Adaptation): আজ পর্যন্ত সবচেয়ে জনপ্রিয় PEFT পদ্ধতি। এটি অনুমান করে যে ওজন ম্যাট্রিক্স আপডেট `ΔW` কে দুটি নিম্ন-র্যাংক ম্যাট্রিক্সের গুণফল দিয়ে আনুমানিক করা যায়: `ΔW = BA`। ফাইন-টিউনিং প্রক্রিয়ায় মূল ম্যাট্রিক্স `W` হিমায়িত থাকে, এবং কেবলমাত্র `A` ও `B` প্রশিক্ষিত হয়[7]।
- QLoRA: মেমরির চাহিদা আরও কমাতে LoRA-কে quantization কৌশলের সাথে একত্রিত করে, যা একটি ভোক্তা GPU-তে ৬৫ কোটি প্যারামিটারের মডেল ফাইন-টিউন করতে দেয়[8]।
কার্যক্ষমতা ও সম্পদের তুলনা
PEFT পদ্ধতিগুলো ব্যয় আমূল হ্রাস করে পূর্ণ ফাইন-টিউনিংয়ের সাথে তুলনীয় কার্যক্ষমতা অর্জন করতে সক্ষম।
| মডেল | পদ্ধতি | প্রশিক্ষণযোগ্য প্যারামিটার (%) | benchmark-এ ফলাফল (Avg. Accuracy) | উৎস |
|---|---|---|---|---|
| BERT-Large | পূর্ণ ফাইন-টিউনিং | 100% | 80.4 (GLUE) | [4] |
| BERT-Large | Adapters | 3.6% | 80.0 (GLUE) | [4] |
| LLaMA-7B | LoRA | 0.83% | 74.7% | [9] |
| LLaMA-7B | DoRA (LoRA-এর রূপভেদ) | 0.84% | 78.1% | [9] |
সম্পদ সাশ্রয়ে PEFT-এর মূল সুবিধাসমূহ:
- GPU মেমরি (VRAM): LLaMA 65B মডেলের ক্ষেত্রে পূর্ণ ফাইন-টিউনিংয়ে তাত্ত্বিকভাবে >৭৮০ GB VRAM প্রয়োজন, তবে QLoRA এটিকে <৪৮ GB VRAM-এর GPU-তে ফাইন-টিউন করতে দেয়[8]।
- স্টোরেজ আয়তন: PEFT-এর পর সংরক্ষিত চেকপয়েন্টগুলো গিগাবাইটের পরিবর্তে মেগাবাইটে পরিমাপ করা যায়। এটি একটি সম্পূর্ণ ফাইন-টিউন করা মডেল যতটুকু জায়গা নিত, সেই পরিমাণে বিভিন্ন কাজের জন্য শত শত «অ্যাডাপ্টার» সংরক্ষণ করতে দেয়।
প্রয়োগের ক্ষেত্রসমূহ
প্রাথমিকভাবে NLP-এর জন্য তৈরি হলেও, PEFT পদ্ধতিগুলো বিস্তৃত কাজের ক্ষেত্রে সফলভাবে অভিযোজিত হয়েছে:
- কম্পিউটার ভিশন (CV) ও মাল্টিমোডাল মডেল (VLM): Vision Transformer (ViT) এবং Segment Anything Model (SAM)-এর মতো মডেলগুলোকে জৈবচিকিৎসা সহ চিত্র বিভাজন কাজের জন্য অভিযোজিত করা।
- কোড তৈরি ও বিশ্লেষণ: নির্দিষ্ট সফটওয়্যার প্রকল্প, অভ্যন্তরীণ API বা কোডবেসের জন্য LLM-কে কাস্টমাইজ করা।
- জেনারেটিভ মডেল: LoRA অ্যাডাপ্টার ব্যবহার করে Stable Diffusion-এর মতো চিত্র তৈরির মডেলের «স্টাইলাইজেশন» (Dreambooth কৌশল)।
- বাকসংশ্লেষণ: নির্দিষ্ট কণ্ঠস্বর, সুর বা আবেগীয় রঙের সাথে বাক তৈরির জন্য মডেল অভিযোজন।
তথ্যসূত্র
- GitHub-এ PEFT লাইব্রেরির রিপোজিটরি
- Hugging Face থেকে PEFT লাইব্রেরির অফিশিয়াল ডকুমেন্টেশন
সাহিত্য
- Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
- Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. arXiv:2305.14314.
- Houlsby, N. et al. (2019). Parameter-Efficient Transfer Learning for NLP. ICML 2019.
- Li, X.L.; Liang, P. (2021). Prefix-Tuning: Optimizing Continuous Prompts for Generation. arXiv:2101.00190.
- Liu, X. et al. (2022). P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks. arXiv:2110.07602.
- Ben Zaken, E.; Ravfogel, S.; Goldberg, Y. (2021). BitFit: Simple Parameter-Efficient Fine-Tuning for Transformer-Based Masked Language Models. arXiv:2106.10199.
- Guo, D.; Rush, A.M.; Kim, Y. (2020). Parameter-Efficient Transfer Learning with Diff Pruning. arXiv:2012.07463.
- Jiang, Z. et al. (2024). MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning. arXiv:2405.12130.
- Mao, K. et al. (2024). A Survey on LoRA of Large Language Models. arXiv:2407.11046.
- Chen, S. et al. (2024). Parameter-Efficient Fine Tuning: A Comprehensive Analysis Across Applications. arXiv:2404.13506.
- Zhang, J. et al. (2025). Parameter-Efficient Fine-Tuning for Foundation Models. arXiv:2501.13787.
টীকা
- ↑ «Parameter-Efficient Fine-Tuning for Foundation Models». arXiv:2501.13787. [১]
- ↑ 2.0 2.1 «5 Problems Encountered Fine-Tuning LLMs with Solutions». Machine Learning Mastery. [২]
- ↑ 3.0 3.1 «PEFT: Parameter-Efficient Fine-Tuning Methods for LLMs». Hugging Face Blog. [৩]
- ↑ 4.0 4.1 4.2 Houlsby, N., et al. «Parameter-Efficient Transfer Learning for NLP». Proceedings of the 36th International Conference on Machine Learning. [৪]
- ↑ Li, X.L., Liang, P. «Prefix-Tuning: Optimizing Continuous Prompts for Generation». arXiv:2101.00190. [৫]
- ↑ Liu, X., et al. «P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks». arXiv:2110.07602. [৬]
- ↑ Hu, E.J., et al. «LoRA: Low-Rank Adaptation of Large Language Models». arXiv:2106.09685. [৭]
- ↑ 8.0 8.1 Dettmers, T., et al. «QLoRA: Efficient Finetuning of Quantized LLMs». arXiv:2305.14314. [৮]
- ↑ 9.0 9.1 «Parameter Efficient Fine Tuning: A Comprehensive Analysis Across Applications». arXiv:2404.13506. [৯]