IBM Granite (language model) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

IBM Granite — این یک مجموعه از مدل‌های زبانی بزرگ (LLM) است که توسط شرکت IBM برای استفاده در محیط‌های سازمانی توسعه یافته‌اند. مدل‌های Granite از نوع transformer خودبازگشتی با معماری decoder-only هستند که قادر به تولید متن بر اساس زمینه داده‌شده می‌باشند[1].

این خانواده به طور رسمی در تاریخ ۷ سپتامبر ۲۰۲۳ در قالب راه‌اندازی پلتفرم ابری IBM watsonx.ai معرفی شد[2]. IBM، مدل‌های Granite را به عنوان راهکارهایی باز، کارآمد و قابل‌اعتماد برای سازمان‌ها معرفی می‌کند و بر شفافیت داده‌های آموزشی، کنترل ریسک و مجوزدهی با امکان استفاده تجاری تأکید دارد[3].

تاریخچه توسعه

خانواده مدل‌های Granite بخشی از استراتژی IBM برای ارائه مدل‌های تولیدی اختصاصی به کسب‌وکارها در کنار مدل‌های شرکای تجاری بود.

  • سپتامبر ۲۰۲۳: اعلام رسمی و راه‌اندازی اولین مدل‌ها در پلتفرم watsonx.ai. اولین نسخه‌ها، Granite.13b.instruct و Granite.13b.chat، دارای حدود ۱۳ میلیارد پارامتر بودند و بر وظایف کلیدی پردازش زبان متمرکز شده بودند[2].
  • مه ۲۰۲۴: IBM انتشار عمومی چندین مدل Granite Code (از ۳ تا ۳۴ میلیارد پارامتر) را تحت مجوز Apache 2.0 اعلام کرد. وزن‌های مدل‌ها در پلتفرم Hugging Face منتشر شدند که گامی مهم در حمایت از اکوسیستم باز هوش مصنوعی بود[4].
  • پاییز ۲۰۲۴: IBM به‌روزرسانی Granite 3.0 را منتشر کرد که شامل مدل‌های کوچک‌تر (۲ و ۸ میلیارد پارامتر) و قابلیت‌های جدید بود و مسیر گسترش این خانواده را تأیید کرد[5].

معماری و آموزش

معماری

مدل‌های IBM Granite بر اساس معماری decoder-only transformer ساخته شده‌اند، مشابه مدل‌های GPT. مدل پایه Granite.13b از مکانیزم multi-query attention استفاده می‌کند و دارای پنجره زمینه تا ۸۰۰۰ token است[6]. این مدل‌ها با روش self-supervised learning آموزش می‌بینند.

داده‌های آموزشی و AI Governance

ویژگی کلیدی Granite استفاده از مجموعه داده‌های اختصاصی و منتخب است که برای نیازهای سازمانی گردآوری شده‌اند. برخلاف بسیاری از LLM‌هایی که بر روی نمونه‌های فیلترنشده وب آموزش می‌بینند، Granite بر داده‌های با کیفیت بالا (enterprise-quality) آموزش دیده که حوزه‌های زیر را در بر می‌گیرد[6]:

  • داده‌های علمی و دانشگاهی: ادبیات علمی، انتشارات فنی.
  • کد برنامه‌نویسی: مجموعه‌های کد در زبان‌های برنامه‌نویسی متعدد.
  • حقوق: آراء قضایی، گزارش‌های عمومی.
  • مالی: گزارش‌های مالی شرکت‌ها.
  • اینترنت: متون غیرساختاریافته عمومی که فیلترسازی شده‌اند.

IBM تأکید می‌کند که توسعه این مدل‌ها از اصول سختگیرانه AI Governance (اخلاق و مدیریت داده) پیروی کرده است. هر بخش از داده‌ها فرایند بررسی انطباق با سیاست‌های سازمانی را طی کرده است. برای حذف محتوای ناخواسته از آشکارساز داخلی «HAP» (Hate and Profanity) و همچنین فهرست‌های مسدودسازی خودکار منابع وب استفاده شده است[1]. IBM گزارش فنی دقیقی با فهرست منابع منتشر کرده که گامی نادر از سوی شرکت‌های بزرگ فناوری است و شفافیت بالایی را تضمین می‌کند.

خانواده مدل‌های Granite

خانواده IBM Granite چندین دسته مدل برای وظایف گوناگون کسب‌وکار را در بر می‌گیرد:

  • مدل‌های زبانی (Granite Language Models): مدل‌های پایه و fine-tuning شده با دستورالعمل برای وظایف پردازش متن: تولید، خلاصه‌سازی، دسته‌بندی و غیره.
  • مدل‌های کد (Granite Code Models): LLM‌های تخصصی آموزش‌دیده بر روی بیش از ۱۰۰ زبان برنامه‌نویسی، برای تکمیل خودکار، تولید و اصلاح کد. در اندازه‌های ۳ تا ۳۴ میلیارد پارامتر در دسترس هستند[4].
  • مدل‌های بینایی (Granite Vision Models): شبکه‌های عصبی برای تحلیل تصاویر و اسناد، تشخیص متن و درک محتوا.
  • مدل‌های گفتاری (Granite Speech Models): مدل‌های فشرده برای تشخیص و ترجمه گفتار.
  • مدل‌های سری زمانی (Granite for Time Series): مدل‌های تخصصی برای پیش‌بینی بر اساس داده‌های سری زمانی.
  • مدل فضایی-جغرافیایی (Granite for Geospatial): در همکاری با ناسا برای تحلیل تصاویر ماهواره‌ای و سایر داده‌های جغرافیایی توسعه یافته است.
  • مدل‌های embedding (Granite Embedding Models): مدل‌هایی برای جستجوی معنایی و ساخت سیستم‌های RAG.
  • Granite Guardian: ماژول تخصصی برای تأمین امنیت، طراحی‌شده برای فیلتر کردن درخواست‌های ناخواسته و نظارت بر محتوا.

کد باز و مجوزدهی

IBM تأکید قابل‌توجهی بر باز بودن خانواده Granite داشته و آن را به عنوان جایگزینی شفاف برای LLM‌های اختصاصی بسته معرفی کرده است. در مه ۲۰۲۴، شرکت مدل‌های اصلی Granite Code را تحت مجوز Apache 2.0 در اختیار جامعه متن‌باز قرار داد که امکان استفاده آزادانه، تغییر و توزیع آن‌ها را فراهم می‌کند[4].

این اقدام، همراه با انتشار اطلاعات دقیق درباره داده‌های آموزشی، ارزیابی بالایی از جامعه پژوهشی برای IBM به همراه داشت. در سال ۲۰۲۴، این مدل در شاخص شفافیت مدل‌های بنیادی دانشگاه استنفورد جایگاه پیشرو را کسب کرد[3].

کاربردها

مدل‌های Granite در پلتفرم ابری IBM watsonx یکپارچه شده‌اند و در سناریوهای گوناگون سازمانی مورد استفاده قرار می‌گیرند.

  • تحلیل ورزشی (US Open): در همکاری با انجمن تنیس ایالات متحده (USTA)، IBM از Granite برای تولید خودکار گزارش‌های مسابقات و تفسیر صوتی پس از پایان هر بازی در تورنمنت US Open استفاده می‌کند. این راهکار در چند دقیقه پس از پایان بازی، یک مرور متنی کامل از مسابقه تولید می‌کند[7].
  • کمک به برنامه‌نویسان: مدل‌های Granite Code پایه و اساس IBM watsonx Code Assistant هستند — خانواده‌ای از ابزارها که می‌توانند، برای مثال، کد قدیمی COBOL را به میکروسرویس‌های مدرن برای IBM Z تبدیل کنند[4].
  • کاربردهای هوش مصنوعی صنعتی: Lockheed Martin مدل‌های Granite را در پلتفرم AI Factory خود برای وظایف امنیت ملی یکپارچه کرده است. ESPN از Granite برای تولید تفسیرهای شخصی‌سازی‌شده در فانتزی-ورزش استفاده می‌کند[3].

منابع

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

یادداشت‌ها

  1. 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [۱]
  2. 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [۲]
  3. 3.0 3.1 3.2 «Granite». IBM. [۳]
  4. 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [۴]
  5. «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [۵]
  6. 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [۶]
  7. «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [۷]