IBM Granite (language model) (PL)
IBM Granite — to seria dużych modeli językowych (LLM), opracowanych przez korporację IBM do zastosowania w środowisku korporacyjnym. Modele Granite są autoregresywnymi transformerami z architekturą tylko-dekodera, zdolnymi do generowania tekstu na podstawie zadanego kontekstu[1].
Rodzina została oficjalnie zaprezentowana 7 września 2023 roku w ramach uruchomienia platformy chmurowej IBM watsonx.ai[2]. IBM pozycjonuje Granite jako otwarte, wydajne i niezawodne rozwiązania dla przedsiębiorstw, kładąc nacisk na przejrzystość danych treningowych, kontrolę ryzyka oraz licencjonowanie dopuszczające użytek komercyjny[3].
Historia rozwoju
Rodzina modeli Granite stała się częścią strategii IBM polegającej na dostarczaniu firmom własnych modeli generatywnych obok modeli od partnerów.
- Wrzesień 2023: Oficjalna zapowiedź i uruchomienie pierwszych modeli na platformie watsonx.ai. Pierwsze wydania, Granite.13b.instruct i Granite.13b.chat, miały około 13 miliardów parametrów i były ukierunkowane na kluczowe zadania przetwarzania języka[2].
- Maj 2024: IBM ogłasza otwarte wydanie kilku modeli Granite Code (od 3 do 34 mld parametrów) na licencji Apache 2.0. Wagi modeli zostały opublikowane na platformie Hugging Face, co stanowiło ważny krok w kierunku wsparcia otwartego ekosystemu AI[4].
- Jesień 2024: IBM wydaje aktualizację Granite 3.0, obejmującą modele o mniejszych rozmiarach (2 i 8 mld parametrów) oraz nowe funkcje, potwierdzając kurs na rozszerzanie rodziny[5].
Architektura i uczenie
Architektura
Modele IBM Granite zbudowane są w oparciu o architekturę dekodera transformera (decoder-only), analogicznie do modeli GPT. Bazowy model Granite.13b wykorzystuje mechanizm multi-query attention i posiada okno kontekstowe do 8000 tokenów[6]. Modele są trenowane metodą self-supervised learning.
Dane treningowe i AI Governance
Kluczową cechą Granite jest wykorzystanie własnego, kurowanego korpusu danych, wyselekcjonowanego na potrzeby przedsiębiorstw. W odróżnieniu od wielu LLM trenowanych na niefiltrowanych próbkach z sieci, Granite był trenowany na danych wysokiej jakości (enterprise-quality), obejmujących następujące domeny[6]:
- Dane akademickie i naukowe: literatura naukowa, publikacje techniczne.
- Kod źródłowy: zbiory kodu w wielu językach programowania.
- Prawo: orzeczenia sądowe, publiczne sprawozdania.
- Finanse: sprawozdania finansowe spółek.
- Internet: nieustrukturyzowane teksty ogólnego charakteru, poddane filtracji.
IBM podkreśla, że prace rozwojowe przebiegały zgodnie ze ścisłymi zasadami AI Governance (etyki i zarządzania danymi). Każda część danych przechodziła procedurę weryfikacji pod kątem zgodności z polityką korporacyjną. Do usuwania niepożądanych treści używano wewnętrznego detektora „HAP" (Hate and Profanity), a także automatycznych list blokowania zasobów internetowych[1]. IBM opublikował szczegółowy raport techniczny z wykazem źródeł, co stanowi rzadki krok wśród dużych firm technologicznych i zapewnia wysoki poziom przejrzystości.
Rodzina modeli Granite
Rodzina IBM Granite obejmuje kilka kategorii modeli przeznaczonych do różnych zadań biznesowych:
- Modele językowe (Granite Language Models): Bazowe i instrukcyjnie dostrojone modele do zadań przetwarzania tekstu: generowanie, podsumowywanie, klasyfikacja i inne.
- Modele do kodu (Granite Code Models): Wyspecjalizowane LLM trenowane na 100+ językach programowania, przeznaczone do autouzupełniania, generowania i poprawiania kodu. Dostępne w rozmiarach od 3 do 34 mld parametrów[4].
- Modele wizji (Granite Vision Models): Sieci neuronowe do analizy obrazów i dokumentów, rozpoznawania tekstu oraz rozumienia zawartości.
- Modele mowy (Granite Speech Models): Kompaktowe modele do rozpoznawania i tłumaczenia mowy.
- Modele dla szeregów czasowych (Granite for Time Series): Wyspecjalizowane modele do prognozowania na podstawie szeregów czasowych.
- Model geoprzestrzenny (Granite for Geospatial): Opracowany we współpracy z NASA do analizy zdjęć satelitarnych i innych danych geoprzestrzennych.
- Modele embeddingów (Granite Embedding Models): Modele do zadań wyszukiwania semantycznego i budowania systemów RAG.
- Granite Guardian: Wyspecjalizowany moduł bezpieczeństwa przeznaczony do filtrowania niepożądanych zapytań i monitorowania treści.
Otwarty kod i licencjonowanie
IBM położył znaczący nacisk na otwartość rodziny Granite, pozycjonując ją jako przejrzystą alternatywę dla zamkniętych, własnościowych LLM. W maju 2024 roku firma udostępniła społeczności open-source bazowe modele Granite Code na licencji Apache 2.0, co pozwala na ich swobodne używanie, modyfikowanie i rozpowszechnianie[4].
Ten krok, wraz z publikacją szczegółowych informacji o danych treningowych, przyniósł IBM wysokie uznanie ze strony społeczności badawczej. W 2024 roku model zajął czołowe pozycje w Indeksie Przejrzystości Modeli Fundamentalnych Uniwersytetu Stanforda[3].
Zastosowania
Modele Granite są zintegrowane z platformą chmurową IBM watsonx i wykorzystywane w różnych scenariuszach korporacyjnych.
- Analityka sportowa (US Open): We współpracy z Amerykańskim Związkiem Tenisowym (USTA) IBM wykorzystuje Granite do automatycznego tworzenia raportów meczowych i komentarzy audio po każdym meczu turnieju US Open. Rozwiązanie generuje szczegółowy przegląd tekstowy meczu w ciągu kilku minut od jego zakończenia[7].
- Wspomaganie programistów: Modele Granite Code stanowią podstawę IBM watsonx Code Assistant — rodziny narzędzi, które potrafią na przykład automatycznie przekształcać przestarzały kod COBOL w nowoczesne mikroserwisy dla IBM Z[4].
- Branżowe aplikacje AI: Lockheed Martin zintegrowała modele Granite ze swoją platformą AI Factory na potrzeby bezpieczeństwa narodowego. ESPN wykorzystuje Granite do generowania spersonalizowanych komentarzy w fantasy sports[3].
Literatura
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
- Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
- Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.
Przypisy
- ↑ 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
- ↑ 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
- ↑ 3.0 3.1 3.2 «Granite». IBM. [3]
- ↑ 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
- ↑ «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
- ↑ 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [6]
- ↑ «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]