IBM Granite
IBM Granite — это серия больших языковых моделей (LLM), разработанных корпорацией IBM для применения в корпоративной среде. Модели Granite представляют собой авторегрессионные трансформеры с архитектурой только декодера, способные генерировать текст по заданному контексту[1].
Семейство было официально представлено 7 сентября 2023 года в рамках запуска облачной платформы IBM watsonx.ai[2]. IBM позиционирует Granite как открытые, производительные и надежные решения для предприятий, делая акцент на прозрачности обучающих данных, контроле рисков и лицензировании, допускающем коммерческое использование[3].
История разработки
Семейство моделей Granite стало частью стратегии IBM по предоставлению бизнесу собственных генеративных моделей наряду с моделями от партнеров.
- Сентябрь 2023: Официальный анонс и запуск первых моделей на платформе watsonx.ai. Первые выпуски, Granite.13b.instruct и Granite.13b.chat, имели объем около 13 миллиардов параметров и были ориентированы на ключевые задачи обработки языка[2].
- Май 2024: IBM объявляет об открытом выпуске нескольких моделей Granite Code (от 3 до 34 млрд параметров) под лицензией Apache 2.0. Веса моделей были опубликованы на платформе Hugging Face, что стало важным шагом в поддержке открытой экосистемы ИИ[4].
- Осень 2024: IBM выпускает обновление Granite 3.0, включающее модели меньшего размера (2 и 8 млрд параметров) и новые функции, подтверждая курс на расширение семейства[5].
Архитектура и обучение
Архитектура
Модели IBM Granite построены по архитектуре декодера трансформера (decoder-only), аналогично моделям GPT. Базовая модель Granite.13b использует механизм multi-query attention и имеет контекстное окно до 8000 токенов[6]. Модели обучаются с помощью самонаблюдения (self-supervised learning).
Обучающие данные и AI Governance
Ключевой особенностью Granite является использование собственного курированного корпуса данных, отобранного под нужды предприятий. В отличие от многих LLM, обучающихся на нефильтрованных веб-выборках, Granite обучался на данных повышенного качества (enterprise-quality), охватывающих следующие домены[6]:
- Академические и научные данные: научная литература, технические публикации.
- Программный код: массивы кода на множестве языков.
- Юриспруденция: судебные решения, публичные отчеты.
- Финансы: финансовая отчетность компаний.
- Интернет: неструктурированные тексты общего характера, прошедшие фильтрацию.
IBM подчеркивает, что разработка следовала строгим принципам AI Governance (этики и управления данными). Каждая часть данных проходила процедуру проверки на соответствие корпоративным политикам. Для удаления нежелательного контента использовался внутренний детектор «HAP» (Hate and Profanity), а также автоматические блок-листы веб-ресурсов[1]. IBM опубликовала детальный технический отчет с перечнем источников, что является редким шагом для крупных технологических компаний и обеспечивает высокую прозрачность.
Семейство моделей Granite
Семейство IBM Granite охватывает несколько категорий моделей для различных бизнес-задач:
- Языковые модели (Granite Language Models): Базовые и инструкционно-дообученные модели для задач обработки текста: генерация, суммирование, классификация и др.
- Модели для кода (Granite Code Models): Специализированные LLM, обученные на 100+ языках программирования, для автодополнения, генерации и исправления кода. Доступны в размерах от 3 до 34 млрд параметров[4].
- Модели зрения (Granite Vision Models): Нейросети для анализа изображений и документов, распознавания текста и понимания содержимого.
- Речевые модели (Granite Speech Models): Компактные модели для распознавания и перевода речи.
- Модели для временных рядов (Granite for Time Series): Специализированные модели для прогнозирования на основе временных рядов.
- Геопространственная модель (Granite for Geospatial): Разработана в сотрудничестве с НАСА для анализа спутниковых снимков и других геоданных.
- Модели эмбеддингов (Granite Embedding Models): Модели для задач семантического поиска и построения систем RAG.
- Granite Guardian: Специализированный модуль для обеспечения безопасности, предназначенный для фильтрации нежелательных запросов и мониторинга контента.
Открытый код и лицензирование
IBM сделала значительный акцент на открытости семейства Granite, позиционируя его как прозрачную альтернативу закрытым проприетарным LLM. В мае 2024 года компания передала открытому сообществу исходные модели Granite Code под лицензией Apache 2.0, что позволяет их свободно использовать, модифицировать и распространять[4].
Этот шаг, наряду с публикацией детальной информации об обучающих данных, принес IBM высокую оценку от исследовательского сообщества. В 2024 году модель заняла лидирующие позиции в Индексе прозрачности фундаментальных моделей Стэнфордского университета[3].
Применение
Модели Granite интегрированы в облачную платформу IBM watsonx и используются в различных корпоративных сценариях.
- Спортивная аналитика (US Open): В сотрудничестве с Ассоциацией тенниса США (USTA) IBM применяет Granite для автоматического создания матчевых отчетов и аудиокомментариев по итогам каждого матча на турнире US Open. Решение генерирует развернутый текстовый обзор матча за считанные минуты после его завершения[7].
- Помощь программистам: Модели Granite Code лежат в основе IBM watsonx Code Assistant — семейства инструментов, которые могут, например, автоматически преобразовывать устаревший код на COBOL в современные микросервисы для IBM Z[4].
- Отраслевые AI-приложения: Lockheed Martin интегрировала модели Granite в свою платформу AI Factory для задач национальной безопасности. ESPN использует Granite для генерации персонализированных комментариев в фэнтези-спорте[3].
См. также
Литература
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
- Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
- Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.
Примечания
- ↑ 1,0 1,1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
- ↑ 2,0 2,1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
- ↑ 3,0 3,1 3,2 «Granite». IBM. [3]
- ↑ 4,0 4,1 4,2 4,3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
- ↑ «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
- ↑ 6,0 6,1 «Granite Foundation Models: Technical Specifications». IBM. [6]
- ↑ «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]