BLOOM (language model) (BN)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — এটি একটি উন্মুক্ত অ্যাক্সেসযুক্ত বৃহৎ ভাষা মডেল (LLM), যাতে রয়েছে ১৭৬ বিলিয়ন প্যারামিটার। এটি ২০২২ সালে BigScience প্রকল্পের অধীনে তৈরি করা হয়েছিল — Hugging Face কোম্পানির পৃষ্ঠপোষকতায় ৭০টি দেশের ১০০০-এরও বেশি গবেষকের আন্তর্জাতিক সহযোগিতায়[1]।
BLOOM একটি অটোরিগ্রেসিভ transformer মডেল, যা ৪৬টি প্রাকৃতিক ভাষায় এবং ১৩টি প্রোগ্রামিং ভাষায় সংগতিপূর্ণ পাঠ্য তৈরি করতে সক্ষম। মডেলটি ফ্রান্সের Jean Zay সুপারকম্পিউটারে প্রশিক্ষিত হয়েছিল এবং OpenAI-এর GPT-3-এর মতো বন্ধ মডেলগুলির প্রথম সত্যিকারের উন্মুক্ত বিকল্পগুলির মধ্যে একটি হয়ে উঠেছিল[2]।
পূর্ব ইতিহাস ও উন্নয়ন
BigScience উদ্যোগটি ২০২১ সালের মে মাসে একটি বৃহৎ উন্মুক্ত ভাষা মডেল যৌথভাবে তৈরির মাধ্যমে AI গবেষণার গণতন্ত্রীকরণের লক্ষ্যে চালু হয়েছিল[1]। সেই সময়ে GPT-3-এর মতো অগ্রণী LLM-গুলি বড় কোম্পানিতে বদ্ধভাবে তৈরি হচ্ছিল, যারা আর্কিটেকচার, প্রশিক্ষণ ডেটা এবং সোর্স কোড প্রকাশ করত না। BigScience প্রকল্প বিশ্বজুড়ে এক হাজারেরও বেশি স্বেচ্ছাসেবী গবেষককে একটি প্রতিযোগিতামূলক ও সম্পূর্ণ উন্মুক্ত মডেল তৈরির জন্য একত্রিত করেছিল।
প্রকল্পটি ফ্রান্সের Jean Zay সুপারকম্পিউটারে (IDRIS/CNRS) কম্পিউটেশনাল সম্পদের জন্য অনুদান পেয়েছিল। মডেলের প্রশিক্ষণ ২০২২ সালের ১১ মার্চ থেকে ৬ জুলাই পর্যন্ত চলেছিল[3]। উন্নয়ন সর্বোচ্চ স্বচ্ছতার সাথে পরিচালিত হয়েছিল: দলটি ডেটা নির্বাচন, প্রশিক্ষণ সেটিংস সম্পর্কে তথ্য প্রকাশ করেছিল এবং প্রকল্পের গৃহীত নৈতিক সনদ অনুসরণ করে জনসাধারণের আলোচনা পরিচালনা করেছিল।
আর্কিটেকচার ও প্রশিক্ষণ
মডেলের আর্কিটেকচার
BLOOM অটোরিগ্রেসিভ ধরনের transformer আর্কিটেকচারে (decoder-only) নির্মিত, যা GPT-3 মডেলের অনুরূপ[2]।
| প্যারামিটার | বৈশিষ্ট্য |
|---|---|
| ধরন | Decoder-only transformer |
| প্যারামিটার | 176 247 271 424 |
| স্তর (layers) | 70 |
| Attention head | 112 |
| Hidden state আকার | 14 336 |
| ক্রমের দৈর্ঘ্য | 2048 token |
| সক্রিয়করণ ফাংশন | GeLU; অবস্থানগত এনকোডিং ALiBi |
মডেলটি যথাক্রমে Nvidia ও Microsoft-এর তৈরি Megatron-LM এবং DeepSpeed ফ্রেমওয়ার্কের ভিত্তিতে বাস্তবায়িত হয়েছিল, কার্যকর বিতরণকৃত প্রশিক্ষণের জন্য কিছু পরিবর্তনসহ[5]।
প্রশিক্ষণ ডেটা
BLOOM বিশেষভাবে তৈরি একটি পাঠ্য ডেটার কর্পাস ROOTS (The Responsible Open-science Open-collaboration Text Sources)-এ প্রশিক্ষিত হয়েছিল। ডেটার মোট পরিমাণ ছিল ১.৬ টেরাবাইট পরিষ্কার ও ডিডুপ্লিকেটকৃত পাঠ্য (≈৩৬৬ বিলিয়ন token)[6]।
কর্পাসে ৫৯টি ভাষার পাঠ্য রয়েছে:
- ৪৬টি প্রাকৃতিক ভাষা, যেমন ইংরেজি (৩০% token), চীনা, ফরাসি, স্পেনীয়, আরবি, এবং অল্প সম্পদসম্পন্ন অনেক ভাষা (যেমন Chi Tumbuka — ০.০০০০২% token)।
- ১৩টি প্রোগ্রামিং ভাষা, যেমন Python, Java, JavaScript এবং C++।
এই বহুভাষিক ও বহু-ডোমেন dataset ইচ্ছাকৃতভাবে সংগ্রহ করা হয়েছিল যাতে মডেলটি বিস্তৃত ভাষাগত সম্প্রদায়ের জন্য উপযুক্ত হয়।
কর্মক্ষমতা ও প্রয়োগ
BLOOM বিভিন্ন benchmark-এ প্রতিযোগিতামূলক ফলাফল প্রদর্শন করে, যা Meta-র OPT-175B-এর মতো একই আকারের মডেলগুলির সাথে তুলনীয়, তার বহুভাষিক বৈশিষ্ট্য সত্ত্বেও[2]।
মডেলটি zero-shot মোডে (অতিরিক্ত প্রশিক্ষণ ছাড়া) বিস্তৃত কাজ সম্পাদন করতে সক্ষম, যেমন:
- নির্দিষ্ট শৈলীতে পাঠ্য তৈরি করা।
- নথির সারসংক্ষেপ করা।
- প্রসঙ্গ অনুযায়ী প্রশ্নের উত্তর দেওয়া।
- ভাষার মধ্যে অনুবাদ করা।
- সহজ প্রোগ্রাম কোড তৈরি করা।
ব্যবহারিক উপযোগিতা উন্নত করতে BigScience দল পরে মডেলটির অতিরিক্ত বহু-কার্য fine-tuning পরিচালনা করে BLOOMZ সংস্করণ তৈরি করে, যা ব্যবহারকারীর নির্দেশনা আরও সঠিকভাবে অনুসরণ করে।
লাইসেন্সিং ও উন্মুক্ত অ্যাক্সেস
BLOOM-এর পূর্ণ ১৭৬-বিলিয়ন মডেল, এর সোর্স কোড এবং ডেটা ২০২২ সালের জুলাই মাসে প্রকাশিত হয়েছিল। মডেলটি বিশেষভাবে তৈরি RAIL (Responsible AI License) v1.0 লাইসেন্সের অধীনে বিতরণ করা হয়[7]।
এই লাইসেন্স মডেলটির বিনামূল্যে ব্যবহার ও পরিবর্তনের অনুমতি দেয়, তবে নির্দিষ্ট ক্ষেত্রে এর প্রয়োগে কিছু বিধিনিষেধ আরোপ করে। বিশেষত, BigScience-এর নৈতিক মানদণ্ডের পরিপন্থী উদ্দেশ্যে BLOOM ব্যবহার নিষিদ্ধ, যেমন:
- গণ নজরদারি।
- অ্যালগরিদমিক বৈষম্য।
- ভুল তথ্য প্রচার।
- মারাত্মক অস্ত্র ব্যবস্থাপনা।
BLOOM দায়িত্বশীল ব্যবহার সম্পর্কিত স্পষ্ট বিধান সহ লাইসেন্সের অধীনে প্রকাশিত প্রথম বৃহৎ AI মডেল হয়ে উঠেছে[8]।
সাহিত্য
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
তথ্যসূত্র
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [১]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [২]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [৩]
- ↑ «bigscience/bloom». Hugging Face. [৪]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [৫]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [৬]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [৭]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [৮]