IBM Granite (language model) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

IBM Granite — to seria dużych modeli językowych (LLM), opracowanych przez korporację IBM do zastosowania w środowisku korporacyjnym. Modele Granite są autoregresywnymi transformerami z architekturą tylko-dekodera, zdolnymi do generowania tekstu na podstawie zadanego kontekstu[1].

Rodzina została oficjalnie zaprezentowana 7 września 2023 roku w ramach uruchomienia platformy chmurowej IBM watsonx.ai[2]. IBM pozycjonuje Granite jako otwarte, wydajne i niezawodne rozwiązania dla przedsiębiorstw, kładąc nacisk na przejrzystość danych treningowych, kontrolę ryzyka oraz licencjonowanie dopuszczające użytek komercyjny[3].

Historia rozwoju

Rodzina modeli Granite stała się częścią strategii IBM polegającej na dostarczaniu firmom własnych modeli generatywnych obok modeli od partnerów.

  • Wrzesień 2023: Oficjalna zapowiedź i uruchomienie pierwszych modeli na platformie watsonx.ai. Pierwsze wydania, Granite.13b.instruct i Granite.13b.chat, miały około 13 miliardów parametrów i były ukierunkowane na kluczowe zadania przetwarzania języka[2].
  • Maj 2024: IBM ogłasza otwarte wydanie kilku modeli Granite Code (od 3 do 34 mld parametrów) na licencji Apache 2.0. Wagi modeli zostały opublikowane na platformie Hugging Face, co stanowiło ważny krok w kierunku wsparcia otwartego ekosystemu AI[4].
  • Jesień 2024: IBM wydaje aktualizację Granite 3.0, obejmującą modele o mniejszych rozmiarach (2 i 8 mld parametrów) oraz nowe funkcje, potwierdzając kurs na rozszerzanie rodziny[5].

Architektura i uczenie

Architektura

Modele IBM Granite zbudowane są w oparciu o architekturę dekodera transformera (decoder-only), analogicznie do modeli GPT. Bazowy model Granite.13b wykorzystuje mechanizm multi-query attention i posiada okno kontekstowe do 8000 tokenów[6]. Modele są trenowane metodą self-supervised learning.

Dane treningowe i AI Governance

Kluczową cechą Granite jest wykorzystanie własnego, kurowanego korpusu danych, wyselekcjonowanego na potrzeby przedsiębiorstw. W odróżnieniu od wielu LLM trenowanych na niefiltrowanych próbkach z sieci, Granite był trenowany na danych wysokiej jakości (enterprise-quality), obejmujących następujące domeny[6]:

  • Dane akademickie i naukowe: literatura naukowa, publikacje techniczne.
  • Kod źródłowy: zbiory kodu w wielu językach programowania.
  • Prawo: orzeczenia sądowe, publiczne sprawozdania.
  • Finanse: sprawozdania finansowe spółek.
  • Internet: nieustrukturyzowane teksty ogólnego charakteru, poddane filtracji.

IBM podkreśla, że prace rozwojowe przebiegały zgodnie ze ścisłymi zasadami AI Governance (etyki i zarządzania danymi). Każda część danych przechodziła procedurę weryfikacji pod kątem zgodności z polityką korporacyjną. Do usuwania niepożądanych treści używano wewnętrznego detektora „HAP" (Hate and Profanity), a także automatycznych list blokowania zasobów internetowych[1]. IBM opublikował szczegółowy raport techniczny z wykazem źródeł, co stanowi rzadki krok wśród dużych firm technologicznych i zapewnia wysoki poziom przejrzystości.

Rodzina modeli Granite

Rodzina IBM Granite obejmuje kilka kategorii modeli przeznaczonych do różnych zadań biznesowych:

  • Modele językowe (Granite Language Models): Bazowe i instrukcyjnie dostrojone modele do zadań przetwarzania tekstu: generowanie, podsumowywanie, klasyfikacja i inne.
  • Modele do kodu (Granite Code Models): Wyspecjalizowane LLM trenowane na 100+ językach programowania, przeznaczone do autouzupełniania, generowania i poprawiania kodu. Dostępne w rozmiarach od 3 do 34 mld parametrów[4].
  • Modele wizji (Granite Vision Models): Sieci neuronowe do analizy obrazów i dokumentów, rozpoznawania tekstu oraz rozumienia zawartości.
  • Modele mowy (Granite Speech Models): Kompaktowe modele do rozpoznawania i tłumaczenia mowy.
  • Modele dla szeregów czasowych (Granite for Time Series): Wyspecjalizowane modele do prognozowania na podstawie szeregów czasowych.
  • Model geoprzestrzenny (Granite for Geospatial): Opracowany we współpracy z NASA do analizy zdjęć satelitarnych i innych danych geoprzestrzennych.
  • Modele embeddingów (Granite Embedding Models): Modele do zadań wyszukiwania semantycznego i budowania systemów RAG.
  • Granite Guardian: Wyspecjalizowany moduł bezpieczeństwa przeznaczony do filtrowania niepożądanych zapytań i monitorowania treści.

Otwarty kod i licencjonowanie

IBM położył znaczący nacisk na otwartość rodziny Granite, pozycjonując ją jako przejrzystą alternatywę dla zamkniętych, własnościowych LLM. W maju 2024 roku firma udostępniła społeczności open-source bazowe modele Granite Code na licencji Apache 2.0, co pozwala na ich swobodne używanie, modyfikowanie i rozpowszechnianie[4].

Ten krok, wraz z publikacją szczegółowych informacji o danych treningowych, przyniósł IBM wysokie uznanie ze strony społeczności badawczej. W 2024 roku model zajął czołowe pozycje w Indeksie Przejrzystości Modeli Fundamentalnych Uniwersytetu Stanforda[3].

Zastosowania

Modele Granite są zintegrowane z platformą chmurową IBM watsonx i wykorzystywane w różnych scenariuszach korporacyjnych.

  • Analityka sportowa (US Open): We współpracy z Amerykańskim Związkiem Tenisowym (USTA) IBM wykorzystuje Granite do automatycznego tworzenia raportów meczowych i komentarzy audio po każdym meczu turnieju US Open. Rozwiązanie generuje szczegółowy przegląd tekstowy meczu w ciągu kilku minut od jego zakończenia[7].
  • Wspomaganie programistów: Modele Granite Code stanowią podstawę IBM watsonx Code Assistant — rodziny narzędzi, które potrafią na przykład automatycznie przekształcać przestarzały kod COBOL w nowoczesne mikroserwisy dla IBM Z[4].
  • Branżowe aplikacje AI: Lockheed Martin zintegrowała modele Granite ze swoją platformą AI Factory na potrzeby bezpieczeństwa narodowego. ESPN wykorzystuje Granite do generowania spersonalizowanych komentarzy w fantasy sports[3].

Literatura

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

Przypisy

  1. 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
  2. 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
  3. 3.0 3.1 3.2 «Granite». IBM. [3]
  4. 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
  5. «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
  6. 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [6]
  7. «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]