Pre-training of large language models — পূর্ব-প্রশিক্ষণ

From Systems analysis Wiki
Jump to navigation Jump to search

বৃহৎ ভাষা মডেলের (LLM) পূর্ব-প্রশিক্ষণ (Pre-training) — এটি আধুনিক বৃহৎ ভাষা মডেল তৈরির একটি মৌলিক পর্যায়, যেখানে মডেলগুলিকে বিশাল ও বৈচিত্র্যময় অচিহ্নিত (unlabeled) পাঠ্য ডেটার উপর প্রশিক্ষণ দেওয়া হয়। এই প্রক্রিয়াটি মডেলগুলিকে সাধারণ ভাষাগত নিয়মকানুন, বিশ্ব-জ্ঞান এবং অর্থগত সম্পর্ক আত্মস্থ করতে সক্ষম করে, যার ফলে তথাকথিত ফান্ডামেন্টাল মডেল (foundation model) তৈরি হয়, যা পরবর্তীতে নির্দিষ্ট কাজের জন্য অভিযোজিত করা যায়।

পূর্ব-প্রশিক্ষণ কী?

পূর্ব-প্রশিক্ষণ (pre-training) হলো প্রশিক্ষণের প্রাথমিক পর্যায়, যেখানে LLM-কে স্ব-নিয়ন্ত্রিত শিক্ষণ (self-supervised learning) পদ্ধতি ব্যবহার করে বৃহৎ পাঠ্য dataset-এর উপর প্রশিক্ষণ দেওয়া হয়। এর অর্থ হলো প্রশিক্ষণের সংকেত (লেবেল) স্বয়ং ডেটা থেকেই তৈরি হয়, মানুষের হাতে লেবেলিংয়ের প্রয়োজন হয় না।

এই পর্যায়ের মূল লক্ষ্য হলো পাঠ্যের লুকানো বা ভবিষ্যৎ অংশ পূর্বানুমান করা। আর্কিটেকচারের উপর নির্ভর করে দুটি প্রধান কাজ ব্যবহৃত হয়:

  • কার্যকারণ ভাষা মডেলিং (Causal Language Modeling, CLM): মডেল পূর্ববর্তী সমস্ত token-এর ভিত্তিতে ক্রমের পরবর্তী শব্দ (token) পূর্বানুমান করতে শেখে। এই পদ্ধতি GPT-এর মতো জেনারেটিভ মডেলের ভিত্তি।
  • মাস্কড ভাষা মডেলিং (Masked Language Modeling, MLM): মডেল পাঠ্যে দৈবচয়নে "মাস্ক" করা (লুকানো) শব্দগুলি পুনরুদ্ধার করতে শেখে, এর জন্য চারপাশের দ্বিমুখী প্রসঙ্গ (বাম ও ডান দিকের শব্দ) ব্যবহার করে। এই পদ্ধতি BERT-এর মতো মডেলে ব্যবহৃত হয়।

এই কাজগুলির মাধ্যমে মডেল সফলভাবে পূর্বানুমান করতে সক্ষম হওয়ার জন্য বাক্যতত্ত্ব, অর্থতত্ত্ব এবং বিশ্ব সম্পর্কে প্রকৃত জ্ঞান অর্জন করতে বাধ্য হয়।

পূর্ব-প্রশিক্ষণের ডেটা

পূর্ব-প্রশিক্ষণের কার্যকারিতা মূলত প্রশিক্ষণ ডেটার গুণমান ও বৈচিত্র্যের উপর নির্ভর করে। নিম্নলিখিত প্রধান উৎসগুলি ব্যবহার করা হয়:

  • ওয়েবপেজ: Common Crawl এবং C4-এর মতো dataset বিভিন্ন বিষয়, শৈলী ও ভাষার বিস্তৃত পরিসর নিশ্চিত করে, ইন্টারনেটের একটি "স্ন্যাপশট" হিসেবে কাজ করে।
  • বই: BookCorpus এবং The Pile-এর মতো কর্পাস কাঠামোবদ্ধ ও সংহত পাঠ্য সরবরাহ করে, যা দীর্ঘমেয়াদী নির্ভরতা ও আখ্যান বোঝার জন্য উপযোগী।
  • কথোপকথনমূলক ডেটা: ফোরাম (যেমন Reddit) ও সামাজিক মাধ্যমের ডেটা, যা মডেলগুলিকে অনানুষ্ঠানিক ভাষা ও কথোপকথনের pattern আয়ত্ত করতে সাহায্য করে।
  • বিশেষায়িত ডেটা: বৈজ্ঞানিক নিবন্ধ (arXiv থেকে), প্রোগ্রামিং কোড (GitHub ও The Stack থেকে) অথবা মডেলের বিশেষ সক্ষমতা উন্নত করতে বহুভাষিক পাঠ্য।

ডেটা বিতরণের উদাহরণ

বিভিন্ন মডেল বিভিন্ন অনুপাতে উৎস ব্যবহার করে, যা তাদের চূড়ান্ত সক্ষমতাকে প্রভাবিত করে:

  • GPT-3 (১৭৫ বিলিয়ন প্যারামিটার):** ১৬% বই, ৮৪% ওয়েবপেজ।
  • PaLM (৫৪০ বিলিয়ন প্যারামিটার):** ৫% বই, ১৪% ওয়েবপেজ, ৫০% কথোপকথনমূলক ডেটা, ৩১% অন্যান্য।
  • LLaMA (৬৫ বিলিয়ন প্যারামিটার):** ৫% বই, ২% ওয়েবপেজ, ৮৭% কথোপকথনমূলক ডেটা।

এই বিতরণগুলি দেখায় যে ডেটা নির্বাচন একটি কৌশলগত সিদ্ধান্ত, যা মডেলের লক্ষ্য অনুযায়ী পরিবর্তিত হয়।

প্রায়শই ব্যবহৃত কর্পাস

LLM পূর্ব-প্রশিক্ষণের জন্য প্রায়শই ব্যবহৃত dataset
কর্পাস আকার উৎস সর্বশেষ আপডেট
BookCorpus 5GB বই ডিসে-2015
Gutenberg - বই ডিসে-2021
C4 800GB Common Crawl এপ্রি-2019
CC-Stories-R 31GB Common Crawl সেপ্টে-2019
CC-NEWS 78GB Common Crawl ফেব্রু-2019
REALNEWS 120GB Common Crawl এপ্রি-2019
OpenWebText 38GB Reddit লিঙ্ক মার্চ-2023
Pushshift.io 2TB Reddit লিঙ্ক মার্চ-2023
Wikipedia 21GB উইকিপিডিয়া মার্চ-2023
The Pile 800GB অন্যান্য ডিসে-2020
ROOTS 1.6TB অন্যান্য জুন-2022

প্রশিক্ষণ কৌশল

LLM-এর পূর্ব-প্রশিক্ষণে উল্লেখযোগ্য গণনামূলক সম্পদ প্রয়োজন। এই প্রক্রিয়া পরিচালনার জন্য নিম্নলিখিত কৌশলগুলি প্রয়োগ করা হয়:

  • বিতরণকৃত প্রশিক্ষণ (Distributed Training): সমান্তরাল প্রক্রিয়াকরণের জন্য একাধিক GPU বা TPU ব্যবহার।
  • মিশ্র নির্ভুলতা (Mixed Precision): গণনা ত্বরান্বিত করতে এবং মেমরি ব্যবহার কমাতে কম নির্ভুলতার সংখ্যা বিন্যাস (যেমন ৩২-বিটের পরিবর্তে ১৬-বিট) ব্যবহার।
  • গ্রেডিয়েন্ট চেকপয়েন্টিং (Gradient Checkpointing): কিছু মধ্যবর্তী অ্যাক্টিভেশন সংরক্ষণের পরিবর্তে পুনর্গণনার মাধ্যমে মেমরি সাশ্রয়ের কৌশল।
  • মডেল প্যারালেলিজম (Model Parallelism): মডেলটিকে নিজেই একাধিক ডিভাইসে বিতরণ করা।

GPT-3-এর মতো একটি মডেলের প্রশিক্ষণ হাজার হাজার GPU-তে কয়েক মাস সময় নিতে পারে।

স্কেলিং আইন (Scaling Laws)

OpenAI-এর গবেষণা (Kaplan et al., 2020) দেখিয়েছে যে ভাষা মডেলের কার্যক্ষমতা তিনটি উপাদান বৃদ্ধির সাথে পূর্বানুমানযোগ্যভাবে উন্নত হয়:

  • মডেলের আকার (প্যারামিটারের সংখ্যা)।
  • ডেটার পরিমাণ।
  • গণনামূলক সম্পদ।

এই অভিজ্ঞতামূলক নির্ভরতাগুলি, যা স্কেলিং আইন নামে পরিচিত, ডেভেলপারদের বৃহত্তর ও আরও শক্তিশালী মডেল ডিজাইন ও প্রশিক্ষণে পথ দেখায় এবং গণনামূলক বাজেট সর্বোত্তমভাবে বরাদ্দ করতে সহায়তা করে।

চ্যালেঞ্জ ও অর্জন

  • স্কেলিং: পূর্ব-প্রশিক্ষণের প্রধান অর্জন হলো সর্বোত্তম কার্যক্ষমতা অর্জনের জন্য মডেলের আকার, ডেটা ও গণনার মধ্যে ভারসাম্য রক্ষার সম্ভাবনা।
  • ডেটার গুণমান: প্রশিক্ষণ ডেটার বিশুদ্ধতা, বৈচিত্র্য এবং পক্ষপাতমুক্ততা নিশ্চিত করা একটি মূল চ্যালেঞ্জ।
  • দক্ষতা: গণনামূলক ব্যয় কমানোর পদ্ধতি উদ্ভাবন, যেমন ক্রমাগত পূর্ব-প্রশিক্ষণ বা আরও দক্ষ আর্কিটেকচার।
  • বহুভাষিকতা: কয়েকটি ভাষা কার্যকরভাবে প্রক্রিয়া করতে সক্ষম মডেল তৈরির জন্য ডেটার যত্নশীল নির্বাচন ও ভারসাম্য প্রয়োজন।

আরও দেখুন

  • বৃহৎ ভাষা মডেল
  • BERT
  • GPT