Gemma (Google) (BN)
Gemma — এটি Google কোম্পানির (Google DeepMind বিভাগ) দ্বারা তৈরি ও প্রকাশিত একটি মুক্তভাবে পাওয়া যায় এমন ভাষা মডেলের পরিবার। Gemma মডেলগুলি ফ্ল্যাগশিপ Gemini পরিবারের মতো একই গবেষণা ও প্রযুক্তিগত ভিত্তির উপর নির্মিত এবং এগুলিকে Gemini-এর হালকা, উচ্চ-কার্যক্ষমতাসম্পন্ন সংস্করণ হিসেবে উপস্থাপন করা হয়[1]। নামটি লাতিন শব্দ gemma থেকে এসেছে, যার অর্থ «মূল্যবান পাথর»[2]।
Gemma open models (উন্মুক্ত মডেল) বিভাগের অন্তর্গত: Google মডেলগুলির weights প্রকাশ করে, যা গবেষক ও ডেভেলপারদের দায়িত্বশীল ব্যবহারের শর্ত মেনে সেগুলি অবাধে ব্যবহার, fine-tuning এবং বিতরণ করতে দেয়, এমনকি বাণিজ্যিক প্রকল্পেও[2]। এটি Gemini মডেলগুলি থেকে মূল পার্থক্য, যেগুলিতে শুধুমাত্র ক্লাউড API-এর মাধ্যমে অ্যাক্সেস করা সম্ভব। Gemma মডেলগুলি শুধুমাত্র ডেটা সেন্টারে নয়, ভোক্তা-পর্যায়ের হার্ডওয়্যারে (ল্যাপটপ, GPU-সহ ডেস্কটপ কম্পিউটার) স্থানীয়ভাবে চালানো সক্ষম[3]।
উন্নয়ন ও রিলিজ
Gemma পরিবারে বেশ কয়েকটি প্রজন্মের মডেল রয়েছে, যার প্রতিটি আর্কিটেকচার, কার্যক্ষমতা ও সক্ষমতায় উন্নতি এনেছে।
প্রথম প্রজন্ম: Gemma 1
Gemma-এর প্রথম সংস্করণ ২১ ফেব্রুয়ারি ২০২৪ সালে প্রকাশিত হয়েছিল[4]। এতে decoder transformer আর্কিটেকচারের উপর ভিত্তি করে দুটি টেক্সট মডেল অন্তর্ভুক্ত ছিল:
- Gemma 2B (২০০ কোটি parameter)
- Gemma 7B (৭০০ কোটি parameter)
প্রকাশের সময় Google দাবি করেছিল যে এই মডেলগুলি মূল benchmark-এ উল্লেখযোগ্যভাবে বড় প্রতিযোগীদের ছাড়িয়ে গেছে[2]। মূল মডেলগুলি প্রধানত ইংরেজি ভাষার ছিল, তবে ওয়েব ডকুমেন্ট, প্রোগ্রাম কোড এবং গাণিতিক সমস্যাসহ বৈচিত্র্যময় ডেটায় প্রশিক্ষিত হয়েছিল[1]। উভয় মডেলই দুটি রূপে প্রকাশিত হয়েছিল: বেস (pre-trained) এবং ব্যবহারকারীর নির্দেশ অনুসরণের জন্য instruction-tuned[2]।
দ্বিতীয় প্রজন্ম: Gemma 2
Gemma 2 ২৭ জুন ২০২৪ সালে ঘোষণা করা হয়েছিল এবং এটি উল্লেখযোগ্য উন্নতি এনেছিল[1]।
- মডেলের আকার: ৯০০ কোটি ও ২৭০০ কোটি parameter-এর মডেল প্রকাশিত হয়েছিল। মানের উন্নতির জন্য ছোট সংস্করণগুলি বড় মডেল থেকে knowledge distillation পদ্ধতি ব্যবহার করে প্রশিক্ষিত হয়েছিল[5]।
- Context window: প্রথম সংস্করণের ৮১৯২ token-এর তুলনায় উল্লেখযোগ্যভাবে বিস্তৃত করে ৮০,০০০ token-এ উন্নীত করা হয়েছিল[6][7]।
- আর্কিটেকচারগত উন্নতি: দীর্ঘ context দক্ষতার সাথে প্রক্রিয়া করার জন্য grouped-query attention এবং স্থানীয় ও বৈশ্বিক attention-এর পর্যায়ক্রমিক পরিকল্পনা প্রবর্তন করা হয়েছিল[1]।
তৃতীয় প্রজন্ম: Gemma 3
Gemma 3 মার্চ ২০২৫ সালে মাল্টিমোডালিটি ও বিস্তৃত কাজের পরিধিতে জোর দিয়ে পরিবারের পরবর্তী পদক্ষেপ হিসেবে উপস্থাপন করা হয়েছিল[6]।
- মাল্টিমোডালিটি: মডেলগুলি টেক্সটের পাশাপাশি ইনপুট হিসেবে ছবি ও ভিডিও সমর্থন পেয়েছে।
- আকার ও ভাষা: মডেল পরিসরে চারটি আকার (1B, 4B, 12B, 27B) রয়েছে এবং ১৪০টি পর্যন্ত ভাষা সমর্থন করে[6]।
- Context window: ১,২৮,০০০ token-এ বৃদ্ধি করা হয়েছে[6]।
Google-এর তথ্য অনুযায়ী, Gemma 3 27B তার সময়ের সেরা উন্মুক্ত মডেলগুলির সমকক্ষ ফলাফল দেখিয়েছে, শুধুমাত্র DeepSeek-R1-এর মতো বিশেষায়িত মডেলগুলির কাছে র্যাঙ্কিংয়ে পিছিয়ে ছিল[6]।
আর্কিটেকচার ও প্রযুক্তিগত বৈশিষ্ট্য
Gemma মডেলগুলি GPT মডেলের অনুরূপ «শুধুমাত্র decoder» (decoder-only) কনফিগারেশনের transformer আর্কিটেকচারের উপর ভিত্তি করে তৈরি[7]। এর অর্থ হলো মডেলটি পূর্ববর্তী সমস্ত token-এর উপর ভিত্তি করে পরবর্তী token পূর্বাভাস দিয়ে autoregressive পদ্ধতিতে টেক্সট তৈরি করে। মূল প্রযুক্তিগত সমাধানগুলির মধ্যে রয়েছে:
- Rotational Positional Embeddings (RoPE): পরম অবস্থানগত embedding-এর পরিবর্তে RoPE ব্যবহার করা হয়, যা অবস্থানগত তথ্য কার্যকরভাবে এনকোড করতে সহায়তা করে।
- Multi-query ও Grouped-query attention: ছোট মডেলগুলিতে (যেমন Gemma 2B) গতি বৃদ্ধি ও মেমরি সাশ্রয়ের জন্য multi-query attention (সকল attention head-এর জন্য একক key/value) ব্যবহার করা হয়। Gemma 2-এ grouped-query attention প্রবর্তন করা হয়েছে, যেখানে query-গুলি দলে বিভক্ত হয়, যা গতি ও মানের মধ্যে একটি আপোষ[1][7]।
- পর্যায়ক্রমিক attention পরিকল্পনা: Gemma 2-এ এমন একটি পরিকল্পনা বাস্তবায়িত হয়েছে যেখানে বৈশ্বিক self-attention স্তরগুলি সীমিত «sliding window»-সহ স্তরগুলির সাথে পর্যায়ক্রমে আসে, যা দীর্ঘ context দক্ষতার সাথে প্রক্রিয়া করতে সক্ষম করে[1]।
মডেলের পরিবার ও রূপান্তর
সাধারণ বেস মডেলের পাশাপাশি, Google নির্দিষ্ট কাজের জন্য অপ্টিমাইজ করা Gemma-এর বেশ কয়েকটি ডেরিভেটিভ সংস্করণ প্রকাশ করেছে।
- CodeGemma: C++, C#, Go, Java, JavaScript, Python, Rust এবং অন্যান্য ভাষা সমর্থনকারী প্রোগ্রাম কোড তৈরি ও সম্পূর্ণ করার মডেল[1]।
- DataGemma: RAG কৌশল ব্যবহার করে বাহ্যিক ডেটার সাথে একীভূতকরণের জন্য fine-tuned মডেলের পরিবার। মডেলটি তথ্যগত নির্ভুলতা বৃদ্ধির জন্য ডেটাবেসে (যেমন Google Data Commons) সার্চ কোয়েরি চালাতে সক্ষম[1]।
- PaliGemma: মাল্টিমোডাল মডেল যা ছবি ও টেক্সট ইনপুট হিসেবে গ্রহণ করতে পারে। এটি ছবির বর্ণনা ও বস্তু শনাক্তকরণের মতো ভিজ্যুয়াল প্রশ্নোত্তর কাজের জন্য ডিজাইন করা হয়েছে[1]।
- RecurrentGemma: Griffin হাইব্রিড আর্কিটেকচারের একটি পরীক্ষামূলক রূপান্তর, যা স্থানীয় attention ও রৈখিক recurrent সংযোগের সমন্বয় করে। এটি দীর্ঘ sequence তৈরিকে উল্লেখযোগ্যভাবে ত্বরান্বিত করতে পারে[7]।
- MedGemma: চিকিৎসা ক্ষেত্রের জন্য Gemma 3-এর বিশেষায়িত সংস্করণ। চিকিৎসা ছবি (এক্স-রে, স্লাইস) ও ক্লিনিক্যাল ডকুমেন্ট বিশ্লেষণের জন্য মাল্টিমোডাল (4B) ও টেক্সট (27B) মডেল অন্তর্ভুক্ত। মডেলগুলি উন্মুক্তভাবে বিতরণ করা হয়, তবে অতিরিক্ত যাচাইকরণ ছাড়া সরাসরি ক্লিনিক্যাল ব্যবহারের জন্য নয়[8]।
- DolphinGemma: ডলফিনের যোগাযোগ পাঠোদ্ধারে Gemma প্রযুক্তির প্রয়োগ নিয়ে একটি গবেষণা প্রকল্প। মডেলটি বহু বছরের অডিও রেকর্ডিংয়ে প্রশিক্ষিত এবং প্রাণীর ভাষায় pattern চিহ্নিত করতে ব্যবহৃত হয়[9]।
উপলব্ধতা ও প্রয়োগ
Gemma মডেলগুলি Kaggle ও Hugging Face প্ল্যাটফর্মে পাওয়া যায় এবং Google Colab ও Vertex AI Model Garden সেবায় একীভূত করা হয়েছে[2]। inference ত্বরান্বিত করতে Google NVIDIA-এর সাথে সহযোগিতায় TensorRT-এর জন্য মডেলগুলি অভিযোজিত করেছে। Gemma-এর লাইসেন্স শর্তাবলী মডেলগুলির বাণিজ্যিক ব্যবহার ও পরিবর্তনের অনুমতি দেয়, যা অন্য কিছু উন্মুক্ত প্রকল্প থেকে আলাদা। বিতরণ Responsible AI License-দ্বারা নিয়ন্ত্রিত, যা নির্দিষ্ট ক্ষেত্রে (যেমন অস্ত্র তৈরি) ব্যবহারে সীমাবদ্ধতা আরোপ করে এবং ডেরিভেটিভ পণ্যগুলিকে AI-এর নিরাপদ ও নৈতিক প্রয়োগের নীতি মেনে চলতে বাধ্য করে[3]।
নিরাপত্তা ও দায়িত্বশীলতা
মডেলগুলির উন্মুক্ত প্রকৃতির কথা মাথায় রেখে ডেভেলপাররা নিরাপত্তা বিষয়ে বিশেষ মনোযোগ দিয়েছেন।
- ডেটা ফিল্টারিং: প্রশিক্ষণ dataset প্রস্তুত করার সময় তথ্য ফাঁসের ঝুঁকি কমাতে ব্যক্তিগত তথ্য ও অন্যান্য সংবেদনশীল তথ্য স্বয়ংক্রিয়ভাবে ফিল্টার করা হয়েছিল[2]।
- Alignment: মডেলগুলির instruction সংস্করণগুলি পছন্দসই উত্তরের ধরন নিশ্চিত করতে Supervised Fine-Tuning (SFT) ও RLHF (মানুষের প্রতিক্রিয়ার উপর ভিত্তি করে Reinforcement Learning) পদ্ধতি ব্যবহার করে বহু-পর্যায়ের alignment-এর মধ্য দিয়ে গেছে[1]।
- Red Teaming: প্রকাশের আগে মডেলগুলি দূষিত অনুরোধের বিরুদ্ধে স্থিতিস্থাপকতার জন্য গভীরভাবে পরীক্ষা করা হয়েছিল। বিশেষজ্ঞরা দুর্বলতা চিহ্নিত করতে বিপজ্জনক বা অবাঞ্ছিত বিষয়বস্তু তৈরিতে উৎসাহিত করার চেষ্টা করেছিলেন[3]।
- Responsible AI Toolkit: মডেলগুলির পাশাপাশি Google নিরাপদ deployment সহজ করতে মডেলের অভ্যন্তরীণ অবস্থা বিশ্লেষণের জন্য Gemma Debugger ইউটিলিটি ও অবাঞ্ছিত বিষয়বস্তুর classifier সহ একটি টুলসেট প্রকাশ করেছে[2]।
- ShieldGemma: Gemma-এর মাল্টিমোডাল সংস্করণে অনিরাপদ বিষয়বস্তু তৈরি রোধ করার জন্য ডিজাইন করা একটি বিশেষায়িত ফিল্টার মডেল[6]।
তথ্যসূত্র
- Google AI সাইটে Gemma-এর অফিসিয়াল পৃষ্ঠা
- Hugging Face-এ Gemma মডেলগুলি
সাহিত্য
- Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
- Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
- Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
- Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
- Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
- Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
- Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.
টীকা
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [১]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [২]
- ↑ 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [৩]
- ↑ «Google launches two new open LLMs». TechCrunch. [৪]
- ↑ «Gemma 2: Improving Open Language Models at a Practical Size». Google.
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [৫]
- ↑ 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [৬]
- ↑ «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [৭]
- ↑ «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [৮]