Pre-training of large language models — পূর্ব-প্রশিক্ষণ
বৃহৎ ভাষা মডেলের (LLM) পূর্ব-প্রশিক্ষণ (Pre-training) — এটি আধুনিক বৃহৎ ভাষা মডেল তৈরির একটি মৌলিক পর্যায়, যেখানে মডেলগুলিকে বিশাল ও বৈচিত্র্যময় অচিহ্নিত (unlabeled) পাঠ্য ডেটার উপর প্রশিক্ষণ দেওয়া হয়। এই প্রক্রিয়াটি মডেলগুলিকে সাধারণ ভাষাগত নিয়মকানুন, বিশ্ব-জ্ঞান এবং অর্থগত সম্পর্ক আত্মস্থ করতে সক্ষম করে, যার ফলে তথাকথিত ফান্ডামেন্টাল মডেল (foundation model) তৈরি হয়, যা পরবর্তীতে নির্দিষ্ট কাজের জন্য অভিযোজিত করা যায়।
পূর্ব-প্রশিক্ষণ কী?
পূর্ব-প্রশিক্ষণ (pre-training) হলো প্রশিক্ষণের প্রাথমিক পর্যায়, যেখানে LLM-কে স্ব-নিয়ন্ত্রিত শিক্ষণ (self-supervised learning) পদ্ধতি ব্যবহার করে বৃহৎ পাঠ্য dataset-এর উপর প্রশিক্ষণ দেওয়া হয়। এর অর্থ হলো প্রশিক্ষণের সংকেত (লেবেল) স্বয়ং ডেটা থেকেই তৈরি হয়, মানুষের হাতে লেবেলিংয়ের প্রয়োজন হয় না।
এই পর্যায়ের মূল লক্ষ্য হলো পাঠ্যের লুকানো বা ভবিষ্যৎ অংশ পূর্বানুমান করা। আর্কিটেকচারের উপর নির্ভর করে দুটি প্রধান কাজ ব্যবহৃত হয়:
- কার্যকারণ ভাষা মডেলিং (Causal Language Modeling, CLM): মডেল পূর্ববর্তী সমস্ত token-এর ভিত্তিতে ক্রমের পরবর্তী শব্দ (token) পূর্বানুমান করতে শেখে। এই পদ্ধতি GPT-এর মতো জেনারেটিভ মডেলের ভিত্তি।
- মাস্কড ভাষা মডেলিং (Masked Language Modeling, MLM): মডেল পাঠ্যে দৈবচয়নে "মাস্ক" করা (লুকানো) শব্দগুলি পুনরুদ্ধার করতে শেখে, এর জন্য চারপাশের দ্বিমুখী প্রসঙ্গ (বাম ও ডান দিকের শব্দ) ব্যবহার করে। এই পদ্ধতি BERT-এর মতো মডেলে ব্যবহৃত হয়।
এই কাজগুলির মাধ্যমে মডেল সফলভাবে পূর্বানুমান করতে সক্ষম হওয়ার জন্য বাক্যতত্ত্ব, অর্থতত্ত্ব এবং বিশ্ব সম্পর্কে প্রকৃত জ্ঞান অর্জন করতে বাধ্য হয়।
পূর্ব-প্রশিক্ষণের ডেটা
পূর্ব-প্রশিক্ষণের কার্যকারিতা মূলত প্রশিক্ষণ ডেটার গুণমান ও বৈচিত্র্যের উপর নির্ভর করে। নিম্নলিখিত প্রধান উৎসগুলি ব্যবহার করা হয়:
- ওয়েবপেজ: Common Crawl এবং C4-এর মতো dataset বিভিন্ন বিষয়, শৈলী ও ভাষার বিস্তৃত পরিসর নিশ্চিত করে, ইন্টারনেটের একটি "স্ন্যাপশট" হিসেবে কাজ করে।
- বই: BookCorpus এবং The Pile-এর মতো কর্পাস কাঠামোবদ্ধ ও সংহত পাঠ্য সরবরাহ করে, যা দীর্ঘমেয়াদী নির্ভরতা ও আখ্যান বোঝার জন্য উপযোগী।
- কথোপকথনমূলক ডেটা: ফোরাম (যেমন Reddit) ও সামাজিক মাধ্যমের ডেটা, যা মডেলগুলিকে অনানুষ্ঠানিক ভাষা ও কথোপকথনের pattern আয়ত্ত করতে সাহায্য করে।
- বিশেষায়িত ডেটা: বৈজ্ঞানিক নিবন্ধ (arXiv থেকে), প্রোগ্রামিং কোড (GitHub ও The Stack থেকে) অথবা মডেলের বিশেষ সক্ষমতা উন্নত করতে বহুভাষিক পাঠ্য।
ডেটা বিতরণের উদাহরণ
বিভিন্ন মডেল বিভিন্ন অনুপাতে উৎস ব্যবহার করে, যা তাদের চূড়ান্ত সক্ষমতাকে প্রভাবিত করে:
- GPT-3 (১৭৫ বিলিয়ন প্যারামিটার):** ১৬% বই, ৮৪% ওয়েবপেজ।
- PaLM (৫৪০ বিলিয়ন প্যারামিটার):** ৫% বই, ১৪% ওয়েবপেজ, ৫০% কথোপকথনমূলক ডেটা, ৩১% অন্যান্য।
- LLaMA (৬৫ বিলিয়ন প্যারামিটার):** ৫% বই, ২% ওয়েবপেজ, ৮৭% কথোপকথনমূলক ডেটা।
এই বিতরণগুলি দেখায় যে ডেটা নির্বাচন একটি কৌশলগত সিদ্ধান্ত, যা মডেলের লক্ষ্য অনুযায়ী পরিবর্তিত হয়।
প্রায়শই ব্যবহৃত কর্পাস
| কর্পাস | আকার | উৎস | সর্বশেষ আপডেট |
|---|---|---|---|
| BookCorpus | 5GB | বই | ডিসে-2015 |
| Gutenberg | - | বই | ডিসে-2021 |
| C4 | 800GB | Common Crawl | এপ্রি-2019 |
| CC-Stories-R | 31GB | Common Crawl | সেপ্টে-2019 |
| CC-NEWS | 78GB | Common Crawl | ফেব্রু-2019 |
| REALNEWS | 120GB | Common Crawl | এপ্রি-2019 |
| OpenWebText | 38GB | Reddit লিঙ্ক | মার্চ-2023 |
| Pushshift.io | 2TB | Reddit লিঙ্ক | মার্চ-2023 |
| Wikipedia | 21GB | উইকিপিডিয়া | মার্চ-2023 |
| The Pile | 800GB | অন্যান্য | ডিসে-2020 |
| ROOTS | 1.6TB | অন্যান্য | জুন-2022 |
প্রশিক্ষণ কৌশল
LLM-এর পূর্ব-প্রশিক্ষণে উল্লেখযোগ্য গণনামূলক সম্পদ প্রয়োজন। এই প্রক্রিয়া পরিচালনার জন্য নিম্নলিখিত কৌশলগুলি প্রয়োগ করা হয়:
- বিতরণকৃত প্রশিক্ষণ (Distributed Training): সমান্তরাল প্রক্রিয়াকরণের জন্য একাধিক GPU বা TPU ব্যবহার।
- মিশ্র নির্ভুলতা (Mixed Precision): গণনা ত্বরান্বিত করতে এবং মেমরি ব্যবহার কমাতে কম নির্ভুলতার সংখ্যা বিন্যাস (যেমন ৩২-বিটের পরিবর্তে ১৬-বিট) ব্যবহার।
- গ্রেডিয়েন্ট চেকপয়েন্টিং (Gradient Checkpointing): কিছু মধ্যবর্তী অ্যাক্টিভেশন সংরক্ষণের পরিবর্তে পুনর্গণনার মাধ্যমে মেমরি সাশ্রয়ের কৌশল।
- মডেল প্যারালেলিজম (Model Parallelism): মডেলটিকে নিজেই একাধিক ডিভাইসে বিতরণ করা।
GPT-3-এর মতো একটি মডেলের প্রশিক্ষণ হাজার হাজার GPU-তে কয়েক মাস সময় নিতে পারে।
স্কেলিং আইন (Scaling Laws)
OpenAI-এর গবেষণা (Kaplan et al., 2020) দেখিয়েছে যে ভাষা মডেলের কার্যক্ষমতা তিনটি উপাদান বৃদ্ধির সাথে পূর্বানুমানযোগ্যভাবে উন্নত হয়:
- মডেলের আকার (প্যারামিটারের সংখ্যা)।
- ডেটার পরিমাণ।
- গণনামূলক সম্পদ।
এই অভিজ্ঞতামূলক নির্ভরতাগুলি, যা স্কেলিং আইন নামে পরিচিত, ডেভেলপারদের বৃহত্তর ও আরও শক্তিশালী মডেল ডিজাইন ও প্রশিক্ষণে পথ দেখায় এবং গণনামূলক বাজেট সর্বোত্তমভাবে বরাদ্দ করতে সহায়তা করে।
চ্যালেঞ্জ ও অর্জন
- স্কেলিং: পূর্ব-প্রশিক্ষণের প্রধান অর্জন হলো সর্বোত্তম কার্যক্ষমতা অর্জনের জন্য মডেলের আকার, ডেটা ও গণনার মধ্যে ভারসাম্য রক্ষার সম্ভাবনা।
- ডেটার গুণমান: প্রশিক্ষণ ডেটার বিশুদ্ধতা, বৈচিত্র্য এবং পক্ষপাতমুক্ততা নিশ্চিত করা একটি মূল চ্যালেঞ্জ।
- দক্ষতা: গণনামূলক ব্যয় কমানোর পদ্ধতি উদ্ভাবন, যেমন ক্রমাগত পূর্ব-প্রশিক্ষণ বা আরও দক্ষ আর্কিটেকচার।
- বহুভাষিকতা: কয়েকটি ভাষা কার্যকরভাবে প্রক্রিয়া করতে সক্ষম মডেল তৈরির জন্য ডেটার যত্নশীল নির্বাচন ও ভারসাম্য প্রয়োজন।
আরও দেখুন
- বৃহৎ ভাষা মডেল
- BERT
- GPT