IBM Granite (language model) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

IBM Granite — това е серия от големи езикови модели (LLM), разработени от корпорацията IBM за приложение в корпоративна среда. Моделите Granite представляват авторегресивни трансформери с архитектура само на декодера, способни да генерират текст по зададен контекст[1].

Семейството беше официално представено на 7 септември 2023 година в рамките на стартирането на облачната платформа IBM watsonx.ai[2]. IBM позиционира Granite като отворени, производителни и надеждни решения за предприятия, като поставя акцент върху прозрачността на данните за обучение, контрола на рисковете и лицензирането, допускащо търговска употреба[3].

История на разработката

Семейството от модели Granite стана част от стратегията на IBM за предоставяне на бизнеса на собствени генеративни модели наред с модели от партньори.

  • Септември 2023: Официално обявяване и стартиране на първите модели на платформата watsonx.ai. Първите издания, Granite.13b.instruct и Granite.13b.chat, имаха обем от около 13 милиарда параметъра и бяха насочени към ключови задачи за обработка на език[2].
  • Май 2024: IBM обявява открито издание на няколко модела Granite Code (от 3 до 34 млрд. параметъра) под лиценз Apache 2.0. Теглата на моделите бяха публикувани на платформата Hugging Face, което стана важна стъпка в подкрепа на отворената AI екосистема[4].
  • Есен 2024: IBM издава актуализацията Granite 3.0, включваща модели с по-малък размер (2 и 8 млрд. параметъра) и нови функции, потвърждавайки курса към разширяване на семейството[5].

Архитектура и обучение

Архитектура

Моделите IBM Granite са изградени по архитектурата на трансформерния декодер (decoder-only), аналогично на моделите GPT. Базовият модел Granite.13b използва механизма multi-query attention и има контекстен прозорец до 8000 токена[6]. Моделите се обучават чрез самонаблюдение (self-supervised learning).

Данни за обучение и AI Governance

Ключова особеност на Granite е използването на собствен курираран корпус от данни, подбран за нуждите на предприятията. За разлика от много LLM, обучавани на нефилтрирани уеб извадки, Granite беше обучен на данни с повишено качество (enterprise-quality), обхващащи следните домейни[6]:

  • Академични и научни данни: научна литература, технически публикации.
  • Програмен код: масиви от код на множество езици за програмиране.
  • Юриспруденция: съдебни решения, публични отчети.
  • Финанси: финансови отчети на компании.
  • Интернет: неструктурирани текстове от общ характер, преминали филтриране.

IBM подчертава, че разработката следваше строги принципи на AI Governance (етика и управление на данните). Всяка част от данните преминаваше процедура за проверка на съответствие с корпоративните политики. За премахване на нежелано съдържание беше използван вътрешен детектор „HAP" (Hate and Profanity), както и автоматични блок-листи на уеб ресурси[1]. IBM публикува подробен технически отчет с изброяване на източниците, което е рядка стъпка за големите технологични компании и осигурява висока прозрачност.

Семейство модели Granite

Семейството IBM Granite обхваща няколко категории модели за различни бизнес задачи:

  • Езикови модели (Granite Language Models): Базови и инструкционно дообучени модели за задачи по обработка на текст: генерация, обобщаване, класификация и др.
  • Модели за код (Granite Code Models): Специализирани LLM, обучени на 100+ езика за програмиране, за автодопълване, генерация и корекция на код. Налични в размери от 3 до 34 млрд. параметъра[4].
  • Модели за зрение (Granite Vision Models): Невронни мрежи за анализ на изображения и документи, разпознаване на текст и разбиране на съдържание.
  • Речеви модели (Granite Speech Models): Компактни модели за разпознаване и превод на реч.
  • Модели за времеви редове (Granite for Time Series): Специализирани модели за прогнозиране на базата на времеви редове.
  • Геопространствен модел (Granite for Geospatial): Разработен в сътрудничество с НАСА за анализ на спътникови снимки и други геоданни.
  • Модели за embedding (Granite Embedding Models): Модели за задачи по семантично търсене и изграждане на RAG системи.
  • Granite Guardian: Специализиран модул за осигуряване на безопасност, предназначен за филтриране на нежелани заявки и мониторинг на съдържание.

Отворен код и лицензиране

IBM постави значителен акцент върху откритостта на семейството Granite, позиционирайки го като прозрачна алтернатива на затворените проприетарни LLM. През май 2024 година компанията предостави на отвореното общество изходните модели Granite Code под лиценз Apache 2.0, което позволява тяхното свободно използване, модифициране и разпространение[4].

Тази стъпка, наред с публикуването на подробна информация за данните за обучение, донесе на IBM висока оценка от изследователската общност. През 2024 година моделът заема водещи позиции в Индекса на прозрачност на фундаменталните модели на Станфордския университет[3].

Приложение

Моделите Granite са интегрирани в облачната платформа IBM watsonx и се използват в различни корпоративни сценарии.

  • Спортна аналитика (US Open): В сътрудничество с Асоциацията по тенис на САЩ (USTA) IBM прилага Granite за автоматично създаване на мачови отчети и аудиокоментари след всеки мач на турнира US Open. Решението генерира разгърнат текстов преглед на мача за броени минути след неговото приключване[7].
  • Помощ за програмисти: Моделите Granite Code стоят в основата на IBM watsonx Code Assistant — семейство от инструменти, които могат например автоматично да преобразуват остарял код на COBOL в съвременни микросервиси за IBM Z[4].
  • Отраслови AI приложения: Lockheed Martin интегрира модели Granite в своята платформа AI Factory за задачи в областта на националната сигурност. ESPN използва Granite за генериране на персонализирани коментари във фентъзи спорта[3].

Литература

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

Бележки

  1. 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
  2. 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
  3. 3.0 3.1 3.2 «Granite». IBM. [3]
  4. 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
  5. «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
  6. 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [6]
  7. «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]