Chinchilla (language model) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Chinchilla — এটি একটি বৃহৎ ভাষা মডেল (LLM), যা DeepMind-এর গবেষণা দল তৈরি করেছে এবং ২০২২ সালের মার্চ মাসে উপস্থাপন করা হয়েছে[1]। মডেলটিতে প্রায় ৭০ বিলিয়ন প্যারামিটার রয়েছে এবং এটি ১.৪ ট্রিলিয়ন token-এর একটি টেক্সট কর্পাসে প্রশিক্ষিত হয়েছে।

Chinchilla-এর মূল বৈশিষ্ট্য হল এর প্রশিক্ষণে গণনা-সর্বোত্তম (compute-optimal) পদ্ধতির প্রয়োগ। পূর্ববর্তী মডেলগুলোতে মূলত প্যারামিটারের সংখ্যা বৃদ্ধির উপর জোর দেওয়া হতো, কিন্তু Chinchilla তৈরি হয়েছিল এই অনুকল্পের উপর ভিত্তি করে যে মডেলের আকার এবং প্রশিক্ষণ ডেটার পরিমাণ উভয়কেই আনুপাতিকভাবে বৃদ্ধি করা প্রয়োজন। এই পদ্ধতির ফলে Chinchilla Gopher (২৮০ বিলিয়ন প্যারামিটার) এবং GPT-3 (১৭৫ বিলিয়ন)-এর মতো উল্লেখযোগ্যভাবে বড় মডেলগুলোর তুলনায় বিভিন্ন ভাষাগত কাজের বিস্তৃত পরিসরে শ্রেষ্ঠত্ব প্রদর্শন করেছে[2]

পটভূমি ও ইতিহাস

Chinchilla-এর বিকাশ ছিল DeepMind-এ Gopher মডেল পরিবারের উপর ভিত্তি করে পরিচালিত LLM স্কেলিং গবেষণার ফলাফল[3]। ২০২১ সালে উপস্থাপিত Gopher মডেলে ২৮০ বিলিয়ন প্যারামিটার ছিল, কিন্তু এটি তুলনামূলকভাবে ছোট ৩০০ বিলিয়ন token-এর একটি কর্পাসে প্রশিক্ষিত হয়েছিল। সেই সময়ে শিল্পে এমন একটি পদ্ধতি প্রাধান্য পেয়েছিল যেখানে মডেলের কর্মক্ষমতা মূলত তাদের আকার (প্যারামিটারের সংখ্যা) বৃদ্ধির মাধ্যমে বাড়ানো হতো, যখন ডেটার পরিমাণ তুলনামূলকভাবে স্থির থাকত।

গণনা-সর্বোত্তম প্রশিক্ষণের অনুকল্প

DeepMind-এর গবেষকরা এই অনুকল্প উপস্থাপন করেন যে Gopher-সহ অনেক বড় মডেল তাদের আকারের তুলনায় অপর্যাপ্তভাবে প্রশিক্ষিত (undertrained) ছিল। নির্ধারিত গণনা বাজেটে তারা সর্বোচ্চ সম্ভব মান অর্জন করতে পারেনি, কারণ তাদের প্রশিক্ষণের জন্য যথেষ্ট ডেটা ছিল না[2]

অনুকল্পের মূল বিষয় হলো গণনা সম্পদের সর্বোত্তম ব্যবহারের জন্য মডেলের আকার এবং প্রশিক্ষণ ডেটার পরিমাণ আনুপাতিকভাবে বৃদ্ধি করা উচিত। অন্য কথায়, মডেলের প্যারামিটার দ্বিগুণ করলে প্রশিক্ষণ token-এর সংখ্যাও প্রায় দ্বিগুণ করা প্রয়োজন[1]। এই উপসংহার পূর্ববর্তী গবেষণার সাথে সাংঘর্ষিক ছিল, যা স্থির ডেটা পরিমাণে পরিচালিত হওয়ায় মডেলের আকার বৃদ্ধির মূল্যকে অতিমূল্যায়ন করেছিল।

এই অনুকল্প যাচাই করতে DeepMind দল ব্যাপক পরীক্ষা-নিরীক্ষা পরিচালনা করে, ৫ থেকে ৫০০ বিলিয়ন token-এর dataset-এ বিভিন্ন আকারের ৪০০টিরও বেশি মডেল প্রশিক্ষিত করে। ফলাফলগুলো নিশ্চিত করেছে যে সমান্তরাল স্কেলিং একটি সর্বোত্তম কৌশল। এই উপসংহারের ভিত্তিতে Chinchilla মডেলটি নতুন দৃষ্টান্তের ব্যবহারিক পরীক্ষা হিসেবে তৈরি করা হয়েছিল[4]

আর্কিটেকচার ও প্রশিক্ষণ

আর্কিটেকচারের বৈশিষ্ট্য

Chinchilla অটোরিগ্রেসিভ transformer পরিবারের অন্তর্গত এবং এর আর্কিটেকচার GPT-2/GPT-3 মডেলগুলোর কাছাকাছি[3]। এটি Gopher থেকে অনেক সমাধান উত্তরাধিকারসূত্রে পেয়েছে, কিন্তু নেটওয়ার্কের গভীরতা বজায় রেখে আকার কমানোর লক্ষ্যে গুরুত্বপূর্ণ পার্থক্য রয়েছে:

  • প্যারামিটার: ~৭০ বিলিয়ন প্যারামিটার, ৮০টি লেয়ারে বিতরণ করা।
  • মডেলের প্রস্থ: self-attention head-এর সংখ্যা ৬৪-এ হ্রাস করা হয়েছে (Gopher-এ ১২৮-এর বিপরীতে), এবং লেয়ারগুলোর অভ্যন্তরীণ মাত্রা ৮১৯২-এ কমানো হয়েছে (Gopher-এ ~১৬৩৮৪-এর বিপরীতে)।
  • অপটিমাইজার: Adam-এর পরিবর্তে AdamW ব্যবহার করা হয়েছে, যা বড় dataset-এ convergence উন্নত করে[3]

এই আর্কিটেকচার Chinchilla-কে Gopher-এর মতো একই নেটওয়ার্ক গভীরতা বজায় রাখতে সক্ষম করেছে, কিন্তু উল্লেখযোগ্যভাবে কম প্যারামিটার সহ, যা মেমরি এবং গণনা সম্পদের প্রয়োজনীয়তা হ্রাস করেছে।

স্কেলিং ও প্রশিক্ষণ ডেটা

অনুকল্প যাচাই করতে Chinchilla-কে Gopher-এর মতো একই গণনা বাজেটে প্রশিক্ষিত করা হয়েছিল, কিন্তু ডেটার পক্ষে সম্পদ পুনর্বণ্টন করে। ৭০ বিলিয়ন প্যারামিটারের মডেলটি ১.৪ ট্রিলিয়ন token-এর একটি কর্পাসে প্রশিক্ষিত হয়েছিল, যা Gopher-এর জন্য ব্যবহৃত ডেটার পরিমাণের প্রায় ৪ গুণ[1]

এই অনুপাত, প্রতিটি প্যারামিটারের জন্য প্রায় ২০টি token, Chinchilla Point (Chinchilla Point) নামে পরিচিত হয়ে ওঠে এবং আধুনিক LLM-এর গণনা-সর্বোত্তম প্রশিক্ষণের জন্য একটি মানদণ্ড হিসেবে কাজ করছে[5]। পরীক্ষাটি নিশ্চিত করেছে যে Chinchilla, এই সর্বোত্তম সীমার কাছাকাছি প্রশিক্ষিত হওয়ায়, অপর্যাপ্তভাবে প্রশিক্ষিত কিন্তু আরও বড় মডেলগুলোর তুলনায় তার সম্ভাবনাকে আরও পরিপূর্ণভাবে উপলব্ধি করতে পেরেছে।

ফলাফল ও কর্মক্ষমতা

বিস্তৃত প্রামাণিক পরীক্ষার সেটে Chinchilla পূর্ববর্তী মডেলগুলোর তুলনায় উল্লেখযোগ্য শ্রেষ্ঠত্ব প্রদর্শন করেছে। এটি শুধু Gopher-কেই নয়, সেই সময়ের অন্যান্য আধুনিক LLM-কেও ছাড়িয়ে গেছে, যার মধ্যে রয়েছে OpenAI GPT-3 (১৭৫ বিলিয়ন প্যারামিটার) এবং Megatron-Turing NLG (৫৩০ বিলিয়ন প্যারামিটার)[1]

সবচেয়ে উল্লেখযোগ্য ফলাফল এসেছে জটিল benchmark MMLU (Measuring Massive Multitask Language Understanding)-এ, যা শত শত বিভিন্ন ধরনের কাজে জ্ঞান ও যুক্তিতর্ক মূল্যায়ন করে। Chinchilla গড় নির্ভুলতা ৬৭.৫% অর্জন করেছে, যা এই শ্রেণির মডেলের জন্য একটি নতুন রেকর্ড এবং Gopher-এর ফলাফলকে ৭ শতাংশ পয়েন্ট ছাড়িয়ে গেছে[4]

উচ্চ কার্যকারিতার পাশাপাশি Chinchilla ব্যবহারে সাশ্রয়ী হওয়ার প্রমাণও দিয়েছে। মডেলের ছোট আকার (সমকক্ষদের ১৭৫+ বিলিয়নের বিপরীতে ৭০ বিলিয়ন) মানে logical inference (inference) এবং fine-tuning-এর জন্য উল্লেখযোগ্যভাবে কম গণনা সম্পদ প্রয়োজন, যা এর ব্যবহারিক প্রয়োগকে সহজ করে তোলে।

গুরুত্ব ও প্রভাব

Chinchilla গবেষণা বৃহৎ ভাষা মডেল প্রশিক্ষণের পদ্ধতিগুলোতে মৌলিক প্রভাব ফেলেছে।

  • Chinchilla scaling laws (Chinchilla scaling laws): মডেলের আকার এবং ডেটার পরিমাণের মধ্যে চিহ্নিত সর্বোত্তম অনুপাত শিল্পে পরবর্তী উন্নয়নের জন্য কার্যত একটি মানদণ্ড হয়ে উঠেছে।
  • আকার থেকে ডেটায় ফোকাস স্থানান্তর: এই কাজ শিল্পকে শুধু নির্বিচারে প্যারামিটারের সংখ্যা বৃদ্ধির পরিবর্তে প্রশিক্ষণ কর্পাস তৈরি, পরিষ্কার এবং সম্প্রসারণে আরও মনোযোগ দিতে উৎসাহিত করেছে।
  • মাল্টিমোডাল সিস্টেমে প্রয়োগ: Chinchilla DeepMind-এর মাল্টিমোডাল মডেল Flamingo-তে প্রধান ভাষা উপাদান হিসেবে ব্যবহৃত হয়েছে, যা চিত্র এবং টেক্সট উভয়ই বুঝতে সক্ষম[6]

যদিও Chinchilla মডেলটি নিজে সর্বজনীনভাবে প্রকাশিত হয়নি, বৈজ্ঞানিক প্রবন্ধে প্রকাশিত এর ধারণা ও ফলাফল পুরো LLM ক্ষেত্রের বিকাশের গতিপথ পরিবর্তন করেছে, কৃত্রিম বুদ্ধিমত্তার সক্ষমতার আরও দক্ষ ও সুষম বৃদ্ধির পথ নির্দেশ করেছে।

সাহিত্য

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
  • Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
  • Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.

টীকা

  1. 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [১]
  2. 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [২]
  3. 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
  4. 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
  5. «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
  6. «Chinchilla (language model)». Wikipedia.