IBM Granite (language model) (FA)
IBM Granite — این یک مجموعه از مدلهای زبانی بزرگ (LLM) است که توسط شرکت IBM برای استفاده در محیطهای سازمانی توسعه یافتهاند. مدلهای Granite از نوع transformer خودبازگشتی با معماری decoder-only هستند که قادر به تولید متن بر اساس زمینه دادهشده میباشند[1].
این خانواده به طور رسمی در تاریخ ۷ سپتامبر ۲۰۲۳ در قالب راهاندازی پلتفرم ابری IBM watsonx.ai معرفی شد[2]. IBM، مدلهای Granite را به عنوان راهکارهایی باز، کارآمد و قابلاعتماد برای سازمانها معرفی میکند و بر شفافیت دادههای آموزشی، کنترل ریسک و مجوزدهی با امکان استفاده تجاری تأکید دارد[3].
تاریخچه توسعه
خانواده مدلهای Granite بخشی از استراتژی IBM برای ارائه مدلهای تولیدی اختصاصی به کسبوکارها در کنار مدلهای شرکای تجاری بود.
- سپتامبر ۲۰۲۳: اعلام رسمی و راهاندازی اولین مدلها در پلتفرم watsonx.ai. اولین نسخهها، Granite.13b.instruct و Granite.13b.chat، دارای حدود ۱۳ میلیارد پارامتر بودند و بر وظایف کلیدی پردازش زبان متمرکز شده بودند[2].
- مه ۲۰۲۴: IBM انتشار عمومی چندین مدل Granite Code (از ۳ تا ۳۴ میلیارد پارامتر) را تحت مجوز Apache 2.0 اعلام کرد. وزنهای مدلها در پلتفرم Hugging Face منتشر شدند که گامی مهم در حمایت از اکوسیستم باز هوش مصنوعی بود[4].
- پاییز ۲۰۲۴: IBM بهروزرسانی Granite 3.0 را منتشر کرد که شامل مدلهای کوچکتر (۲ و ۸ میلیارد پارامتر) و قابلیتهای جدید بود و مسیر گسترش این خانواده را تأیید کرد[5].
معماری و آموزش
معماری
مدلهای IBM Granite بر اساس معماری decoder-only transformer ساخته شدهاند، مشابه مدلهای GPT. مدل پایه Granite.13b از مکانیزم multi-query attention استفاده میکند و دارای پنجره زمینه تا ۸۰۰۰ token است[6]. این مدلها با روش self-supervised learning آموزش میبینند.
دادههای آموزشی و AI Governance
ویژگی کلیدی Granite استفاده از مجموعه دادههای اختصاصی و منتخب است که برای نیازهای سازمانی گردآوری شدهاند. برخلاف بسیاری از LLMهایی که بر روی نمونههای فیلترنشده وب آموزش میبینند، Granite بر دادههای با کیفیت بالا (enterprise-quality) آموزش دیده که حوزههای زیر را در بر میگیرد[6]:
- دادههای علمی و دانشگاهی: ادبیات علمی، انتشارات فنی.
- کد برنامهنویسی: مجموعههای کد در زبانهای برنامهنویسی متعدد.
- حقوق: آراء قضایی، گزارشهای عمومی.
- مالی: گزارشهای مالی شرکتها.
- اینترنت: متون غیرساختاریافته عمومی که فیلترسازی شدهاند.
IBM تأکید میکند که توسعه این مدلها از اصول سختگیرانه AI Governance (اخلاق و مدیریت داده) پیروی کرده است. هر بخش از دادهها فرایند بررسی انطباق با سیاستهای سازمانی را طی کرده است. برای حذف محتوای ناخواسته از آشکارساز داخلی «HAP» (Hate and Profanity) و همچنین فهرستهای مسدودسازی خودکار منابع وب استفاده شده است[1]. IBM گزارش فنی دقیقی با فهرست منابع منتشر کرده که گامی نادر از سوی شرکتهای بزرگ فناوری است و شفافیت بالایی را تضمین میکند.
خانواده مدلهای Granite
خانواده IBM Granite چندین دسته مدل برای وظایف گوناگون کسبوکار را در بر میگیرد:
- مدلهای زبانی (Granite Language Models): مدلهای پایه و fine-tuning شده با دستورالعمل برای وظایف پردازش متن: تولید، خلاصهسازی، دستهبندی و غیره.
- مدلهای کد (Granite Code Models): LLMهای تخصصی آموزشدیده بر روی بیش از ۱۰۰ زبان برنامهنویسی، برای تکمیل خودکار، تولید و اصلاح کد. در اندازههای ۳ تا ۳۴ میلیارد پارامتر در دسترس هستند[4].
- مدلهای بینایی (Granite Vision Models): شبکههای عصبی برای تحلیل تصاویر و اسناد، تشخیص متن و درک محتوا.
- مدلهای گفتاری (Granite Speech Models): مدلهای فشرده برای تشخیص و ترجمه گفتار.
- مدلهای سری زمانی (Granite for Time Series): مدلهای تخصصی برای پیشبینی بر اساس دادههای سری زمانی.
- مدل فضایی-جغرافیایی (Granite for Geospatial): در همکاری با ناسا برای تحلیل تصاویر ماهوارهای و سایر دادههای جغرافیایی توسعه یافته است.
- مدلهای embedding (Granite Embedding Models): مدلهایی برای جستجوی معنایی و ساخت سیستمهای RAG.
- Granite Guardian: ماژول تخصصی برای تأمین امنیت، طراحیشده برای فیلتر کردن درخواستهای ناخواسته و نظارت بر محتوا.
کد باز و مجوزدهی
IBM تأکید قابلتوجهی بر باز بودن خانواده Granite داشته و آن را به عنوان جایگزینی شفاف برای LLMهای اختصاصی بسته معرفی کرده است. در مه ۲۰۲۴، شرکت مدلهای اصلی Granite Code را تحت مجوز Apache 2.0 در اختیار جامعه متنباز قرار داد که امکان استفاده آزادانه، تغییر و توزیع آنها را فراهم میکند[4].
این اقدام، همراه با انتشار اطلاعات دقیق درباره دادههای آموزشی، ارزیابی بالایی از جامعه پژوهشی برای IBM به همراه داشت. در سال ۲۰۲۴، این مدل در شاخص شفافیت مدلهای بنیادی دانشگاه استنفورد جایگاه پیشرو را کسب کرد[3].
کاربردها
مدلهای Granite در پلتفرم ابری IBM watsonx یکپارچه شدهاند و در سناریوهای گوناگون سازمانی مورد استفاده قرار میگیرند.
- تحلیل ورزشی (US Open): در همکاری با انجمن تنیس ایالات متحده (USTA)، IBM از Granite برای تولید خودکار گزارشهای مسابقات و تفسیر صوتی پس از پایان هر بازی در تورنمنت US Open استفاده میکند. این راهکار در چند دقیقه پس از پایان بازی، یک مرور متنی کامل از مسابقه تولید میکند[7].
- کمک به برنامهنویسان: مدلهای Granite Code پایه و اساس IBM watsonx Code Assistant هستند — خانوادهای از ابزارها که میتوانند، برای مثال، کد قدیمی COBOL را به میکروسرویسهای مدرن برای IBM Z تبدیل کنند[4].
- کاربردهای هوش مصنوعی صنعتی: Lockheed Martin مدلهای Granite را در پلتفرم AI Factory خود برای وظایف امنیت ملی یکپارچه کرده است. ESPN از Granite برای تولید تفسیرهای شخصیسازیشده در فانتزی-ورزش استفاده میکند[3].
منابع
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
- Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
- Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.
یادداشتها
- ↑ 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [۱]
- ↑ 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [۲]
- ↑ 3.0 3.1 3.2 «Granite». IBM. [۳]
- ↑ 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [۴]
- ↑ «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [۵]
- ↑ 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [۶]
- ↑ «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [۷]