Jais (language model) (BN)
Jais (উচ্চারণ «জেইস») — এটি একটি উন্মুক্ত বৃহৎ ভাষা মডেলের (LLM) পরিবার, যা সংযুক্ত আরব আমিরাতে তৈরি এবং বিশেষভাবে আরবি ভাষার জন্য অপ্টিমাইজ করা হয়েছে[1]। মডেলটির নামকরণ করা হয়েছে জেবেল জেইস পর্বতের নামে — যা সংযুক্ত আরব আমিরাতের সর্বোচ্চ শৃঙ্গ[2]।
প্রকল্পটি তৈরি হয়েছে গবেষণা প্রতিষ্ঠান Inception (প্রযুক্তি কনগ্লোমারেট G42-এর একটি অঙ্গপ্রতিষ্ঠান), মোহামেদ বিন জায়েদ ইউনিভার্সিটি অব আর্টিফিশিয়াল ইন্টেলিজেন্স (MBZUAI) এবং ক্যালিফোর্নিয়ার AI-চিপ নির্মাতা Cerebras Systems-এর সহযোগিতায়[2]। Jais একটি মুক্ত লাইসেন্সের অধীনে প্রকাশ্যে প্রকাশিত হয়েছে, যা আরবি ভাষার AI ইকোসিস্টেমের বিকাশকে উৎসাহিত করতে, সাংস্কৃতিক-ভাষাগত ঐতিহ্য সংরক্ষণ করতে এবং আরবিভাষী বিশ্বের কাছে আধুনিক AI প্রযুক্তিকে আরও সহজলভ্য করতে উদ্দিষ্ট[1]।
উন্নয়নের ইতিহাস ও প্রকাশনা
Jais প্রকল্পটি ২০২৩ সালে উদ্যোগ নেওয়া হয়, কম-সম্পদ ভাষার জন্য বিদ্যমান LLM-গুলোর সীমাবদ্ধতার প্রেক্ষাপটে। ডেভেলপাররা আরবি এবং ইংরেজি উভয় ভাষা সমানভাবে প্রক্রিয়া করতে সক্ষম মানসম্পন্ন দ্বিভাষিক মডেলের অভাব লক্ষ্য করেছিলেন[2]।
Jais-13B: প্রথম সংস্করণ
প্রথম সংস্করণ, Jais-13B, ২০২৩ সালের ৩০ আগস্ট প্রকাশিত হয় এবং এতে ১৩ বিলিয়ন প্যারামিটার ছিল[1]। মডেলটি ইংরেজি ও আরবি পাঠ্যের মিশ্রিত corpus-এ প্রশিক্ষিত হয়েছিল, যার পরিমাণ ছিল ৩৯৫ বিলিয়ন token[3]। প্রকাশের সময় এটিকে «সর্বোচ্চ মানের আরবি LLM» হিসেবে আখ্যায়িত করা হয়েছিল[1]।
Jais-30B: মাপ বৃদ্ধি
২০২৩ সালের ৮ নভেম্বর, তিন মাসেরও কম সময়ের মধ্যে, কনসোর্টিয়াম দ্বিতীয় ও উল্লেখযোগ্যভাবে উন্নত সংস্করণ — Jais-30B উপস্থাপন করে, যাতে ৩০ বিলিয়ন প্যারামিটার রয়েছে[4]। মাপ বৃদ্ধির প্রয়োজনীয়তা ছিল সারসংক্ষেপ ও অনুবাদের মতো আরও জটিল ব্যবহারিক কাজ সমাধানের জন্য। মডেলটি একটি বর্ধিত ও পরিশোধিত dataset-এ প্রশিক্ষিত হয়েছিল, যার পরিমাণ ১.৬৩ ট্রিলিয়ন token[4]।
Jais-70B এবং মডেল পরিবার
২০২৪ সালের ৬ আগস্ট Inception (G42) ফ্ল্যাগশিপ মডেল Jais-70B (৭০ বিলিয়ন প্যারামিটার) এবং সংশ্লিষ্ট মডেলগুলোর একটি সম্পূর্ণ পরিবার চালু করার ঘোষণা দেয়[5]। Jais-70B আরবি ভাষাভিত্তিক সবচেয়ে বড় উন্মুক্ত LLM হয়ে ওঠে। এর উন্নয়নে continuous training পদ্ধতি প্রয়োগ করা হয়েছিল: শূন্য থেকে প্রশিক্ষণের পরিবর্তে Meta-র Llama 2 70B মডেলকে ভিত্তি হিসেবে নিয়ে আরবি ভাষায় ৩৩০ বিলিয়ন token-এ fine-tuning করা হয়। এটি Llama 2 থেকে ইংরেজি ভাষার জ্ঞান কার্যকরভাবে স্থানান্তর করতে এবং আরবি ভাষা শেখার দিকে সম্পদ কেন্দ্রীভূত করতে সক্ষম করেছে[5]।
আর্কিটেকচার ও প্রযুক্তিগত বৈশিষ্ট্য
Jais GPT-3 আর্কিটেকচার (decoder-only) ভিত্তিক অটোরিগ্রেসিভ transformer মডেলের অন্তর্গত। মডেলটির মূল বৈশিষ্ট্য হলো আরবি ও ইংরেজি ভাষায় এর দ্বিভাষিক বিশেষায়ন, যেখানে অনেক বহুভাষিক LLM-এ ইংরেজির আধিপত্য থাকে। এটি আরবি ভাষা ও এর উপভাষাগুলোর গভীর বোঝাপড়া অর্জনে সহায়তা করে[3]।
Jais তৈরিতে অগ্রণী প্রযুক্তিগত সমাধানগুলো সংযুক্ত করা হয়েছে[3]:
- ALiBi পজিশনিং: একটি বিশেষ positional embedding স্কিম, যা মডেলকে প্রশিক্ষণকালীন context-এর চেয়ে দীর্ঘ context প্রক্রিয়া করতে সক্ষম করে।
- SwiGLU অ্যাক্টিভেশন: একটি অ্যাক্টিভেশন ফাংশন যা প্রশিক্ষণের মান এবং নিউরাল স্তরগুলোর এক্সপ্রেসিভনেস বৃদ্ধি করে।
- Maximal Update Parametrization (µP): হাইপারপ্যারামিটার কনফিগারেশনের একটি পদ্ধতি যা মডেলের আকার বৃদ্ধির সময় প্রশিক্ষণকে স্থিতিশীল রাখে।
- বিশেষায়িত tokenizer: আরবি ও ইংরেজি ভাষার বৈশিষ্ট্য বিবেচনা করে তৈরি, যা সার্বজনীন tokenizer-এর তুলনায় আরবি পাঠ্যের জন্য token সংখ্যা ৩–৪ গুণ কমায় এবং কার্যক্ষমতা বাড়ায়[6]।
মূল মডেলগুলো (foundation models) ছাড়াও, Jais-chat সংস্করণ প্রকাশিত হয়েছে, যা চ্যাটবট ও সহকারীর কাজের সাথে মানানসই করতে ৯.৬ মিলিয়ন প্রশ্ন-উত্তর জোড়ায় অতিরিক্তভাবে fine-tuning করা হয়েছে[3]।
প্রশিক্ষণ ও dataset
প্রকল্পের প্রধান কাজগুলোর একটি ছিল আরবি পাঠ্যের একটি মানসম্পন্ন ও বিশাল corpus তৈরি করা। Jais-13B-এর জন্য চূড়ান্ত প্রশিক্ষণ সেট ছিল ৩৯৫ বিলিয়ন token, যার মধ্যে:
- ১১৬ বিলিয়ন token (২৯%) — আরবি পাঠ্য।
- ২৭৯ বিলিয়ন token (৭১%) — ইংরেজি পাঠ্য ও প্রোগ্রামিং কোড।
আরবি উপাদান ইচ্ছাকৃতভাবে উল্লেখযোগ্য (প্রায় ৩০%) রাখা হয়েছিল, যাতে ভাষায় উচ্চমানের দক্ষতা নিশ্চিত করা যায়[3]। তথ্যে বই, সংবাদ নিবন্ধ, ওয়েবপেজ এবং সোর্স কোড অন্তর্ভুক্ত ছিল। মানসম্পন্ন আরবি পাঠ্যের পরিমাণ বৃদ্ধির জন্য ইংরেজি উৎসের মেশিন অনুবাদ ব্যবহার করা হয়েছিল[3]।
মডেলগুলোর প্রশিক্ষণ আবুধাবিতে Condor Galaxy 1 (CG-1) সুপারকম্পিউটারে পরিচালিত হয়েছিল, যা G42 ও Cerebras Systems যৌথভাবে তৈরি করেছে। এই অবকাঠামোর সুবাদে Jais-13B-এর প্রশিক্ষণে মাত্র প্রায় ৩.৫ দিন বিশুদ্ধ সময় লেগেছিল[2]।
প্রয়োগ ও গুরুত্ব
Jais আরবি ভাষা এবং আধুনিক LLM-এ অপর্যাপ্তভাবে প্রতিনিধিত্বকারী অন্যান্য ভাষিক সম্প্রদায়ের জন্য জেনারেটিভ AI-এর বিকাশে একটি গুরুত্বপূর্ণ পদক্ষেপ হিসেবে বিবেচিত। মডেলটিতে উন্মুক্ত অ্যাক্সেস মধ্যপ্রাচ্য ও উত্তর আফ্রিকার অঞ্চলে প্রাকৃতিক ভাষা প্রক্রিয়াকরণ প্রযুক্তির বিস্তারকে উৎসাহিত করতে উদ্দিষ্ট।
চালু হওয়ার পর থেকে প্রকল্পটি সংযুক্ত আরব আমিরাতের সরকারি ও বাণিজ্যিক প্রতিষ্ঠানের আগ্রহ আকর্ষণ করেছে। সংযুক্ত আরব আমিরাতের পররাষ্ট্র মন্ত্রণালয়, তেল ও গ্যাস কোম্পানি ADNOC, বিমান সংস্থা Etihad Airways এবং First Abu Dhabi Bank প্রাথমিক অ্যাক্সেস পেয়েছে[1]। ২০২৪ সালে Microsoft তার ক্লাউড প্ল্যাটফর্ম Microsoft Azure-এ Jais সংযুক্ত করার ঘোষণা দেয়, যা বৈশ্বিক ব্যবহারকারীদের কাছে এটি সহজলভ্য করে তোলে[6]।
Jais-এর নির্মাতারা আরবি সাংস্কৃতিক-ভাষাগত ঐতিহ্য সংরক্ষণে এর ভূমিকার উপর জোর দেন। Inception-এর প্রধান নির্বাহী কর্মকর্তা অ্যান্ড্রু জ্যাকসনের মতে, প্রকল্পটির লক্ষ্য «নিশ্চিত করা যে তার সমৃদ্ধ ঐতিহ্য সহ আরবি ভাষা AI-এর দৃশ্যপটে তার কণ্ঠস্বর খুঁজে পায়»[1]। সংগৃহীত অভিজ্ঞতা অন্যান্য ভাষা ও সংস্কৃতির জন্য অনুরূপ LLM তৈরিতে ব্যবহারের পরিকল্পনা রয়েছে[1]।
সাহিত্য
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
তথ্যসূত্র
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [১]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [২]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [৩]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [৪]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [৫]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [৬]