IBM Granite

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

IBM Granite — это серия больших языковых моделей (LLM), разработанных корпорацией IBM для применения в корпоративной среде. Модели Granite представляют собой авторегрессионные трансформеры с архитектурой только декодера, способные генерировать текст по заданному контексту[1].

Семейство было официально представлено 7 сентября 2023 года в рамках запуска облачной платформы IBM watsonx.ai[2]. IBM позиционирует Granite как открытые, производительные и надежные решения для предприятий, делая акцент на прозрачности обучающих данных, контроле рисков и лицензировании, допускающем коммерческое использование[3].

История разработки

Семейство моделей Granite стало частью стратегии IBM по предоставлению бизнесу собственных генеративных моделей наряду с моделями от партнеров.

  • Сентябрь 2023: Официальный анонс и запуск первых моделей на платформе watsonx.ai. Первые выпуски, Granite.13b.instruct и Granite.13b.chat, имели объем около 13 миллиардов параметров и были ориентированы на ключевые задачи обработки языка[2].
  • Май 2024: IBM объявляет об открытом выпуске нескольких моделей Granite Code (от 3 до 34 млрд параметров) под лицензией Apache 2.0. Веса моделей были опубликованы на платформе Hugging Face, что стало важным шагом в поддержке открытой экосистемы ИИ[4].
  • Осень 2024: IBM выпускает обновление Granite 3.0, включающее модели меньшего размера (2 и 8 млрд параметров) и новые функции, подтверждая курс на расширение семейства[5].

Архитектура и обучение

Архитектура

Модели IBM Granite построены по архитектуре декодера трансформера (decoder-only), аналогично моделям GPT. Базовая модель Granite.13b использует механизм multi-query attention и имеет контекстное окно до 8000 токенов[6]. Модели обучаются с помощью самонаблюдения (self-supervised learning).

Обучающие данные и AI Governance

Ключевой особенностью Granite является использование собственного курированного корпуса данных, отобранного под нужды предприятий. В отличие от многих LLM, обучающихся на нефильтрованных веб-выборках, Granite обучался на данных повышенного качества (enterprise-quality), охватывающих следующие домены[6]:

  • Академические и научные данные: научная литература, технические публикации.
  • Программный код: массивы кода на множестве языков.
  • Юриспруденция: судебные решения, публичные отчеты.
  • Финансы: финансовая отчетность компаний.
  • Интернет: неструктурированные тексты общего характера, прошедшие фильтрацию.

IBM подчеркивает, что разработка следовала строгим принципам AI Governance (этики и управления данными). Каждая часть данных проходила процедуру проверки на соответствие корпоративным политикам. Для удаления нежелательного контента использовался внутренний детектор «HAP» (Hate and Profanity), а также автоматические блок-листы веб-ресурсов[1]. IBM опубликовала детальный технический отчет с перечнем источников, что является редким шагом для крупных технологических компаний и обеспечивает высокую прозрачность.

Семейство моделей Granite

Семейство IBM Granite охватывает несколько категорий моделей для различных бизнес-задач:

  • Языковые модели (Granite Language Models): Базовые и инструкционно-дообученные модели для задач обработки текста: генерация, суммирование, классификация и др.
  • Модели для кода (Granite Code Models): Специализированные LLM, обученные на 100+ языках программирования, для автодополнения, генерации и исправления кода. Доступны в размерах от 3 до 34 млрд параметров[4].
  • Модели зрения (Granite Vision Models): Нейросети для анализа изображений и документов, распознавания текста и понимания содержимого.
  • Речевые модели (Granite Speech Models): Компактные модели для распознавания и перевода речи.
  • Модели для временных рядов (Granite for Time Series): Специализированные модели для прогнозирования на основе временных рядов.
  • Геопространственная модель (Granite for Geospatial): Разработана в сотрудничестве с НАСА для анализа спутниковых снимков и других геоданных.
  • Модели эмбеддингов (Granite Embedding Models): Модели для задач семантического поиска и построения систем RAG.
  • Granite Guardian: Специализированный модуль для обеспечения безопасности, предназначенный для фильтрации нежелательных запросов и мониторинга контента.

Открытый код и лицензирование

IBM сделала значительный акцент на открытости семейства Granite, позиционируя его как прозрачную альтернативу закрытым проприетарным LLM. В мае 2024 года компания передала открытому сообществу исходные модели Granite Code под лицензией Apache 2.0, что позволяет их свободно использовать, модифицировать и распространять[4].

Этот шаг, наряду с публикацией детальной информации об обучающих данных, принес IBM высокую оценку от исследовательского сообщества. В 2024 году модель заняла лидирующие позиции в Индексе прозрачности фундаментальных моделей Стэнфордского университета[3].

Применение

Модели Granite интегрированы в облачную платформу IBM watsonx и используются в различных корпоративных сценариях.

  • Спортивная аналитика (US Open): В сотрудничестве с Ассоциацией тенниса США (USTA) IBM применяет Granite для автоматического создания матчевых отчетов и аудиокомментариев по итогам каждого матча на турнире US Open. Решение генерирует развернутый текстовый обзор матча за считанные минуты после его завершения[7].
  • Помощь программистам: Модели Granite Code лежат в основе IBM watsonx Code Assistant — семейства инструментов, которые могут, например, автоматически преобразовывать устаревший код на COBOL в современные микросервисы для IBM Z[4].
  • Отраслевые AI-приложения: Lockheed Martin интегрировала модели Granite в свою платформу AI Factory для задач национальной безопасности. ESPN использует Granite для генерации персонализированных комментариев в фэнтези-спорте[3].

См. также

Литература

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

Примечания

  1. 1,0 1,1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
  2. 2,0 2,1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
  3. 3,0 3,1 3,2 «Granite». IBM. [3]
  4. 4,0 4,1 4,2 4,3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
  5. «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
  6. 6,0 6,1 «Granite Foundation Models: Technical Specifications». IBM. [6]
  7. «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]