Jais (language model) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (উচ্চারণ «জেইস») — এটি একটি উন্মুক্ত বৃহৎ ভাষা মডেলের (LLM) পরিবার, যা সংযুক্ত আরব আমিরাতে তৈরি এবং বিশেষভাবে আরবি ভাষার জন্য অপ্টিমাইজ করা হয়েছে[1]। মডেলটির নামকরণ করা হয়েছে জেবেল জেইস পর্বতের নামে — যা সংযুক্ত আরব আমিরাতের সর্বোচ্চ শৃঙ্গ[2]

প্রকল্পটি তৈরি হয়েছে গবেষণা প্রতিষ্ঠান Inception (প্রযুক্তি কনগ্লোমারেট G42-এর একটি অঙ্গপ্রতিষ্ঠান), মোহামেদ বিন জায়েদ ইউনিভার্সিটি অব আর্টিফিশিয়াল ইন্টেলিজেন্স (MBZUAI) এবং ক্যালিফোর্নিয়ার AI-চিপ নির্মাতা Cerebras Systems-এর সহযোগিতায়[2]। Jais একটি মুক্ত লাইসেন্সের অধীনে প্রকাশ্যে প্রকাশিত হয়েছে, যা আরবি ভাষার AI ইকোসিস্টেমের বিকাশকে উৎসাহিত করতে, সাংস্কৃতিক-ভাষাগত ঐতিহ্য সংরক্ষণ করতে এবং আরবিভাষী বিশ্বের কাছে আধুনিক AI প্রযুক্তিকে আরও সহজলভ্য করতে উদ্দিষ্ট[1]

উন্নয়নের ইতিহাস ও প্রকাশনা

Jais প্রকল্পটি ২০২৩ সালে উদ্যোগ নেওয়া হয়, কম-সম্পদ ভাষার জন্য বিদ্যমান LLM-গুলোর সীমাবদ্ধতার প্রেক্ষাপটে। ডেভেলপাররা আরবি এবং ইংরেজি উভয় ভাষা সমানভাবে প্রক্রিয়া করতে সক্ষম মানসম্পন্ন দ্বিভাষিক মডেলের অভাব লক্ষ্য করেছিলেন[2]

Jais-13B: প্রথম সংস্করণ

প্রথম সংস্করণ, Jais-13B, ২০২৩ সালের ৩০ আগস্ট প্রকাশিত হয় এবং এতে ১৩ বিলিয়ন প্যারামিটার ছিল[1]। মডেলটি ইংরেজি ও আরবি পাঠ্যের মিশ্রিত corpus-এ প্রশিক্ষিত হয়েছিল, যার পরিমাণ ছিল ৩৯৫ বিলিয়ন token[3]। প্রকাশের সময় এটিকে «সর্বোচ্চ মানের আরবি LLM» হিসেবে আখ্যায়িত করা হয়েছিল[1]

Jais-30B: মাপ বৃদ্ধি

২০২৩ সালের ৮ নভেম্বর, তিন মাসেরও কম সময়ের মধ্যে, কনসোর্টিয়াম দ্বিতীয় ও উল্লেখযোগ্যভাবে উন্নত সংস্করণ — Jais-30B উপস্থাপন করে, যাতে ৩০ বিলিয়ন প্যারামিটার রয়েছে[4]। মাপ বৃদ্ধির প্রয়োজনীয়তা ছিল সারসংক্ষেপ ও অনুবাদের মতো আরও জটিল ব্যবহারিক কাজ সমাধানের জন্য। মডেলটি একটি বর্ধিত ও পরিশোধিত dataset-এ প্রশিক্ষিত হয়েছিল, যার পরিমাণ ১.৬৩ ট্রিলিয়ন token[4]

Jais-70B এবং মডেল পরিবার

২০২৪ সালের ৬ আগস্ট Inception (G42) ফ্ল্যাগশিপ মডেল Jais-70B (৭০ বিলিয়ন প্যারামিটার) এবং সংশ্লিষ্ট মডেলগুলোর একটি সম্পূর্ণ পরিবার চালু করার ঘোষণা দেয়[5]। Jais-70B আরবি ভাষাভিত্তিক সবচেয়ে বড় উন্মুক্ত LLM হয়ে ওঠে। এর উন্নয়নে continuous training পদ্ধতি প্রয়োগ করা হয়েছিল: শূন্য থেকে প্রশিক্ষণের পরিবর্তে Meta-র Llama 2 70B মডেলকে ভিত্তি হিসেবে নিয়ে আরবি ভাষায় ৩৩০ বিলিয়ন token-এ fine-tuning করা হয়। এটি Llama 2 থেকে ইংরেজি ভাষার জ্ঞান কার্যকরভাবে স্থানান্তর করতে এবং আরবি ভাষা শেখার দিকে সম্পদ কেন্দ্রীভূত করতে সক্ষম করেছে[5]

আর্কিটেকচার ও প্রযুক্তিগত বৈশিষ্ট্য

Jais GPT-3 আর্কিটেকচার (decoder-only) ভিত্তিক অটোরিগ্রেসিভ transformer মডেলের অন্তর্গত। মডেলটির মূল বৈশিষ্ট্য হলো আরবি ও ইংরেজি ভাষায় এর দ্বিভাষিক বিশেষায়ন, যেখানে অনেক বহুভাষিক LLM-এ ইংরেজির আধিপত্য থাকে। এটি আরবি ভাষা ও এর উপভাষাগুলোর গভীর বোঝাপড়া অর্জনে সহায়তা করে[3]

Jais তৈরিতে অগ্রণী প্রযুক্তিগত সমাধানগুলো সংযুক্ত করা হয়েছে[3]:

  • ALiBi পজিশনিং: একটি বিশেষ positional embedding স্কিম, যা মডেলকে প্রশিক্ষণকালীন context-এর চেয়ে দীর্ঘ context প্রক্রিয়া করতে সক্ষম করে।
  • SwiGLU অ্যাক্টিভেশন: একটি অ্যাক্টিভেশন ফাংশন যা প্রশিক্ষণের মান এবং নিউরাল স্তরগুলোর এক্সপ্রেসিভনেস বৃদ্ধি করে।
  • Maximal Update Parametrization (µP): হাইপারপ্যারামিটার কনফিগারেশনের একটি পদ্ধতি যা মডেলের আকার বৃদ্ধির সময় প্রশিক্ষণকে স্থিতিশীল রাখে।
  • বিশেষায়িত tokenizer: আরবি ও ইংরেজি ভাষার বৈশিষ্ট্য বিবেচনা করে তৈরি, যা সার্বজনীন tokenizer-এর তুলনায় আরবি পাঠ্যের জন্য token সংখ্যা ৩–৪ গুণ কমায় এবং কার্যক্ষমতা বাড়ায়[6]

মূল মডেলগুলো (foundation models) ছাড়াও, Jais-chat সংস্করণ প্রকাশিত হয়েছে, যা চ্যাটবট ও সহকারীর কাজের সাথে মানানসই করতে ৯.৬ মিলিয়ন প্রশ্ন-উত্তর জোড়ায় অতিরিক্তভাবে fine-tuning করা হয়েছে[3]

প্রশিক্ষণ ও dataset

প্রকল্পের প্রধান কাজগুলোর একটি ছিল আরবি পাঠ্যের একটি মানসম্পন্ন ও বিশাল corpus তৈরি করা। Jais-13B-এর জন্য চূড়ান্ত প্রশিক্ষণ সেট ছিল ৩৯৫ বিলিয়ন token, যার মধ্যে:

  • ১১৬ বিলিয়ন token (২৯%) — আরবি পাঠ্য।
  • ২৭৯ বিলিয়ন token (৭১%) — ইংরেজি পাঠ্য ও প্রোগ্রামিং কোড।

আরবি উপাদান ইচ্ছাকৃতভাবে উল্লেখযোগ্য (প্রায় ৩০%) রাখা হয়েছিল, যাতে ভাষায় উচ্চমানের দক্ষতা নিশ্চিত করা যায়[3]। তথ্যে বই, সংবাদ নিবন্ধ, ওয়েবপেজ এবং সোর্স কোড অন্তর্ভুক্ত ছিল। মানসম্পন্ন আরবি পাঠ্যের পরিমাণ বৃদ্ধির জন্য ইংরেজি উৎসের মেশিন অনুবাদ ব্যবহার করা হয়েছিল[3]

মডেলগুলোর প্রশিক্ষণ আবুধাবিতে Condor Galaxy 1 (CG-1) সুপারকম্পিউটারে পরিচালিত হয়েছিল, যা G42 ও Cerebras Systems যৌথভাবে তৈরি করেছে। এই অবকাঠামোর সুবাদে Jais-13B-এর প্রশিক্ষণে মাত্র প্রায় ৩.৫ দিন বিশুদ্ধ সময় লেগেছিল[2]

প্রয়োগ ও গুরুত্ব

Jais আরবি ভাষা এবং আধুনিক LLM-এ অপর্যাপ্তভাবে প্রতিনিধিত্বকারী অন্যান্য ভাষিক সম্প্রদায়ের জন্য জেনারেটিভ AI-এর বিকাশে একটি গুরুত্বপূর্ণ পদক্ষেপ হিসেবে বিবেচিত। মডেলটিতে উন্মুক্ত অ্যাক্সেস মধ্যপ্রাচ্য ও উত্তর আফ্রিকার অঞ্চলে প্রাকৃতিক ভাষা প্রক্রিয়াকরণ প্রযুক্তির বিস্তারকে উৎসাহিত করতে উদ্দিষ্ট।

চালু হওয়ার পর থেকে প্রকল্পটি সংযুক্ত আরব আমিরাতের সরকারি ও বাণিজ্যিক প্রতিষ্ঠানের আগ্রহ আকর্ষণ করেছে। সংযুক্ত আরব আমিরাতের পররাষ্ট্র মন্ত্রণালয়, তেল ও গ্যাস কোম্পানি ADNOC, বিমান সংস্থা Etihad Airways এবং First Abu Dhabi Bank প্রাথমিক অ্যাক্সেস পেয়েছে[1]। ২০২৪ সালে Microsoft তার ক্লাউড প্ল্যাটফর্ম Microsoft Azure-এ Jais সংযুক্ত করার ঘোষণা দেয়, যা বৈশ্বিক ব্যবহারকারীদের কাছে এটি সহজলভ্য করে তোলে[6]

Jais-এর নির্মাতারা আরবি সাংস্কৃতিক-ভাষাগত ঐতিহ্য সংরক্ষণে এর ভূমিকার উপর জোর দেন। Inception-এর প্রধান নির্বাহী কর্মকর্তা অ্যান্ড্রু জ্যাকসনের মতে, প্রকল্পটির লক্ষ্য «নিশ্চিত করা যে তার সমৃদ্ধ ঐতিহ্য সহ আরবি ভাষা AI-এর দৃশ্যপটে তার কণ্ঠস্বর খুঁজে পায়»[1]। সংগৃহীত অভিজ্ঞতা অন্যান্য ভাষা ও সংস্কৃতির জন্য অনুরূপ LLM তৈরিতে ব্যবহারের পরিকল্পনা রয়েছে[1]

সাহিত্য

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

তথ্যসূত্র

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [১]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [২]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [৩]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [৪]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [৫]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [৬]