IBM Granite (language model) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

IBM Granite — এটি IBM কর্পোরেশন কর্তৃক কর্পোরেট পরিবেশে ব্যবহারের জন্য তৈরি বৃহৎ ভাষা মডেলের (LLM) একটি সিরিজ। Granite মডেলগুলি decoder-only আর্কিটেকচারের অটোরিগ্রেসিভ transformer, যা প্রদত্ত প্রসঙ্গ অনুযায়ী পাঠ্য তৈরি করতে সক্ষম[1]

পরিবারটি আনুষ্ঠানিকভাবে ২০২৩ সালের ৭ সেপ্টেম্বর IBM watsonx.ai ক্লাউড প্ল্যাটফর্মের উদ্বোধনের সময় উপস্থাপন করা হয়[2]। IBM, Granite-কে উন্মুক্ত, কার্যকর এবং নির্ভরযোগ্য এন্টারপ্রাইজ সমাধান হিসেবে উপস্থাপন করে, প্রশিক্ষণ ডেটার স্বচ্ছতা, ঝুঁকি নিয়ন্ত্রণ এবং বাণিজ্যিক ব্যবহার-অনুমোদিত লাইসেন্সিংয়ের উপর জোর দেয়[3]

ইতিহাস

Granite মডেল পরিবার IBM-এর ব্যবসায়িক প্রতিষ্ঠানগুলিকে অংশীদারদের মডেলের পাশাপাশি নিজস্ব জেনারেটিভ মডেল সরবরাহ করার কৌশলের অংশ হয়ে উঠেছে।

  • সেপ্টেম্বর ২০২৩: watsonx.ai প্ল্যাটফর্মে প্রথম মডেলগুলির আনুষ্ঠানিক ঘোষণা ও উদ্বোধন। প্রথম প্রকাশিত সংস্করণ, Granite.13b.instruct এবং Granite.13b.chat, প্রায় ১৩ বিলিয়ন প্যারামিটার বিশিষ্ট ছিল এবং ভাষা প্রক্রিয়াকরণের মূল কাজগুলির উপর দৃষ্টি নিবদ্ধ ছিল[2]
  • মে ২০২৪: IBM, Apache 2.0 লাইসেন্সের অধীনে একাধিক Granite Code মডেল (৩ থেকে ৩৪ বিলিয়ন প্যারামিটার) খোলা উৎস হিসেবে প্রকাশের ঘোষণা দেয়। মডেলের ওজন Hugging Face প্ল্যাটফর্মে প্রকাশিত হয়, যা উন্মুক্ত AI ইকোসিস্টেম সমর্থনের একটি গুরুত্বপূর্ণ পদক্ষেপ ছিল[4]
  • শরৎ ২০২৪: IBM, Granite 3.0 আপডেট প্রকাশ করে, যাতে ছোট আকারের মডেল (২ এবং ৮ বিলিয়ন প্যারামিটার) এবং নতুন বৈশিষ্ট্য অন্তর্ভুক্ত রয়েছে, যা পরিবার সম্প্রসারণের ধারা নিশ্চিত করে[5]

আর্কিটেকচার এবং প্রশিক্ষণ

আর্কিটেকচার

IBM Granite মডেলগুলি GPT মডেলের মতো decoder-only transformer আর্কিটেকচারে নির্মিত। বেস মডেল Granite.13b, multi-query attention মেকানিজম ব্যবহার করে এবং ৮০০০ token পর্যন্ত প্রসঙ্গ উইন্ডো রয়েছে[6]। মডেলগুলি self-supervised learning পদ্ধতিতে প্রশিক্ষিত হয়।

প্রশিক্ষণ ডেটা এবং AI Governance

Granite-এর একটি মূল বৈশিষ্ট্য হল এন্টারপ্রাইজের প্রয়োজন অনুযায়ী নির্বাচিত নিজস্ব কিউরেটেড ডেটা কর্পাসের ব্যবহার। অনেক LLM যেভাবে অফিল্টার্ড ওয়েব স্যাম্পলে প্রশিক্ষিত হয়, তার বিপরীতে Granite নিম্নলিখিত ডোমেন জুড়ে enterprise-quality উচ্চমানের ডেটায় প্রশিক্ষিত হয়েছে[6]:

  • একাডেমিক ও বৈজ্ঞানিক ডেটা: বৈজ্ঞানিক সাহিত্য, প্রযুক্তিগত প্রকাশনা।
  • প্রোগ্রাম কোড: বহু প্রোগ্রামিং ভাষায় কোডের সংগ্রহ।
  • আইন: আদালতের রায়, সরকারি প্রতিবেদন।
  • অর্থ: কোম্পানির আর্থিক প্রতিবেদন।
  • ইন্টারনেট: ফিল্টার করা সাধারণ প্রকৃতির অসংগঠিত পাঠ্য।

IBM জোর দিয়ে বলে যে উন্নয়ন কাজ কঠোর AI Governance (নৈতিকতা ও ডেটা পরিচালনা) নীতি অনুসরণ করেছে। ডেটার প্রতিটি অংশ কর্পোরেট নীতির সাথে সামঞ্জস্য যাচাইয়ের প্রক্রিয়ার মধ্য দিয়ে গেছে। অবাঞ্ছিত কন্টেন্ট অপসারণের জন্য অভ্যন্তরীণ «HAP» (Hate and Profanity) ডিটেক্টর এবং স্বয়ংক্রিয় ওয়েব রিসোর্স ব্লকলিস্ট ব্যবহার করা হয়েছে[1]। IBM একটি বিস্তারিত কারিগরি প্রতিবেদন প্রকাশ করেছে যাতে উৎসের তালিকা রয়েছে, যা বড় প্রযুক্তি কোম্পানিগুলির জন্য একটি বিরল পদক্ষেপ এবং উচ্চ স্বচ্ছতা নিশ্চিত করে।

Granite মডেল পরিবার

IBM Granite পরিবার বিভিন্ন ব্যবসায়িক কাজের জন্য একাধিক বিভাগের মডেল অন্তর্ভুক্ত করে:

  • ভাষা মডেল (Granite Language Models): পাঠ্য প্রক্রিয়াকরণের কাজের জন্য বেস এবং instruction fine-tuned মডেল: তৈরি, সংক্ষেপণ, শ্রেণিবদ্ধকরণ ইত্যাদি।
  • কোডের জন্য মডেল (Granite Code Models): ১০০+ প্রোগ্রামিং ভাষায় প্রশিক্ষিত বিশেষায়িত LLM, অটোকমপ্লিশন, কোড তৈরি ও সংশোধনের জন্য। ৩ থেকে ৩৪ বিলিয়ন প্যারামিটার আকারে পাওয়া যায়[4]
  • ভিশন মডেল (Granite Vision Models): চিত্র ও দলিল বিশ্লেষণ, পাঠ্য শনাক্তকরণ এবং বিষয়বস্তু বোঝার জন্য নিউরাল নেটওয়ার্ক।
  • বাক্ মডেল (Granite Speech Models): বাক্ শনাক্তকরণ ও অনুবাদের জন্য কমপ্যাক্ট মডেল।
  • টাইম সিরিজের জন্য মডেল (Granite for Time Series): টাইম সিরিজ ভিত্তিক পূর্বাভাসের জন্য বিশেষায়িত মডেল।
  • জিওস্পেশিয়াল মডেল (Granite for Geospatial): স্যাটেলাইট চিত্র ও অন্যান্য ভূস্থানিক ডেটা বিশ্লেষণের জন্য NASA-এর সহযোগিতায় তৈরি।
  • Embedding মডেল (Granite Embedding Models): সিম্যান্টিক অনুসন্ধান এবং RAG সিস্টেম নির্মাণের কাজে ব্যবহারের জন্য মডেল।
  • Granite Guardian: অবাঞ্ছিত অনুরোধ ফিল্টার করতে এবং কন্টেন্ট পর্যবেক্ষণের জন্য নিরাপত্তা নিশ্চিতকরণের বিশেষায়িত মডিউল।

উন্মুক্ত কোড এবং লাইসেন্সিং

IBM, Granite পরিবারের উন্মুক্ততার উপর উল্লেখযোগ্য জোর দিয়েছে, এটিকে বন্ধ মালিকানাধীন LLM-এর স্বচ্ছ বিকল্প হিসেবে উপস্থাপন করছে। ২০২৪ সালের মে মাসে কোম্পানিটি মূল Granite Code মডেলগুলি Apache 2.0 লাইসেন্সের অধীনে উন্মুক্ত সম্প্রদায়ের কাছে হস্তান্তর করে, যা এগুলি স্বাধীনভাবে ব্যবহার, পরিবর্তন এবং বিতরণের অনুমতি দেয়[4]

এই পদক্ষেপ, প্রশিক্ষণ ডেটা সম্পর্কিত বিস্তারিত তথ্য প্রকাশের পাশাপাশি, IBM-কে গবেষণা সম্প্রদায়ের কাছ থেকে উচ্চ প্রশংসা এনে দিয়েছে। ২০২৪ সালে মডেলটি স্ট্যানফোর্ড বিশ্ববিদ্যালয়ের ফান্ডামেন্টাল মডেল ট্রান্সপারেন্সি ইন্ডেক্স-এ শীর্ষ অবস্থান অর্জন করে[3]

প্রয়োগ

Granite মডেলগুলি IBM watsonx ক্লাউড প্ল্যাটফর্মে সংযুক্ত এবং বিভিন্ন কর্পোরেট পরিস্থিতিতে ব্যবহৃত হয়।

  • ক্রীড়া বিশ্লেষণ (US Open): মার্কিন টেনিস সংস্থার (USTA) সহযোগিতায় IBM, US Open টুর্নামেন্টে প্রতিটি ম্যাচের পর স্বয়ংক্রিয় ম্যাচ রিপোর্ট এবং অডিও ধারাভাষ্য তৈরিতে Granite ব্যবহার করে। সমাধানটি ম্যাচ শেষ হওয়ার কয়েক মিনিটের মধ্যে বিস্তারিত পাঠ্য পর্যালোচনা তৈরি করে[7]
  • প্রোগ্রামারদের সহায়তা: Granite Code মডেলগুলি IBM watsonx Code Assistant-এর ভিত্তি — যা একটি টুল পরিবার যা উদাহরণস্বরূপ IBM Z-এর জন্য পুরনো COBOL কোড স্বয়ংক্রিয়ভাবে আধুনিক মাইক্রোসার্ভিসে রূপান্তর করতে পারে[4]
  • শিল্পভিত্তিক AI অ্যাপ্লিকেশন: Lockheed Martin জাতীয় নিরাপত্তার কাজে তার AI Factory প্ল্যাটফর্মে Granite মডেলগুলি সংযুক্ত করেছে। ESPN, ফ্যান্টাসি স্পোর্টসে ব্যক্তিগতকৃত ধারাভাষ্য তৈরিতে Granite ব্যবহার করে[3]

সাহিত্য

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

টীকা

  1. 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [১]
  2. 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [২]
  3. 3.0 3.1 3.2 «Granite». IBM. [৩]
  4. 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [৪]
  5. «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [৫]
  6. 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [৬]
  7. «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [৭]