IBM Granite (language model) (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

IBM Granite — är en serie stora språkmodeller (LLM) utvecklade av IBM för användning i företagsmiljöer. Granite-modellerna är autoregressiva transformer-modeller med en decoder-only-arkitektur, kapabla att generera text utifrån ett givet sammanhang[1].

Familjen presenterades officiellt den 7 september 2023 i samband med lanseringen av IBM:s molnplattform watsonx.ai[2]. IBM positionerar Granite som öppna, högpresterande och tillförlitliga lösningar för företag, med betoning på transparens kring träningsdata, riskhantering och licensiering som tillåter kommersiellt bruk[3].

Utvecklingshistorik

Granite-modellfamiljen blev en del av IBM:s strategi att erbjuda företag egna generativa modeller vid sidan av modeller från partners.

  • September 2023: Officiellt tillkännagivande och lansering av de första modellerna på watsonx.ai-plattformen. De första versionerna, Granite.13b.instruct och Granite.13b.chat, hade cirka 13 miljarder parametrar och var inriktade på centrala språkbehandlingsuppgifter[2].
  • Maj 2024: IBM tillkännager öppen publicering av flera Granite Code-modeller (från 3 till 34 miljarder parametrar) under Apache 2.0-licensen. Modellvikterna publicerades på Hugging Face-plattformen, vilket var ett viktigt steg i stödet för det öppna AI-ekosystemet[4].
  • Höst 2024: IBM släpper uppdateringen Granite 3.0, som inkluderar modeller av mindre storlek (2 och 8 miljarder parametrar) och nya funktioner, vilket bekräftar inriktningen på att utöka familjen[5].

Arkitektur och träning

Arkitektur

IBM Granite-modellerna är byggda på en transformer-decoder-arkitektur (decoder-only), liknande GPT-modeller. Basmodellen Granite.13b använder multi-query attention-mekanismen och har ett kontextfönster på upp till 8 000 token[6]. Modellerna tränas med hjälp av self-supervised learning.

Träningsdata och AI Governance

En central egenskap hos Granite är användningen av ett eget kurerat datakorpus, utvalt för företagets behov. Till skillnad från många LLM som tränas på ofiltrerade webbdatamängder, tränade Granite på data av hög kvalitet (enterprise-quality) som täcker följande domäner[6]:

  • Akademiska och vetenskapliga data: vetenskaplig litteratur, tekniska publikationer.
  • Programkod: kodmängder på ett stort antal programmeringsspråk.
  • Juridik: domstolsavgöranden, offentliga rapporter.
  • Finans: företags finansiella rapporter.
  • Internet: ostrukturerade texter av allmän karaktär som genomgått filtrering.

IBM betonar att utvecklingen följde strikta principer för AI Governance (etik och datahantering). Varje del av data genomgick en granskningsprocedur för att säkerställa efterlevnad av företagets policyer. För att ta bort oönskat innehåll användes den interna detektorn "HAP" (Hate and Profanity), samt automatiska blockeringslistor för webbresurser[1]. IBM har publicerat en detaljerad teknisk rapport med en förteckning över källor, vilket är ett sällsynt steg bland stora teknikföretag och säkerställer hög transparens.

Granite-modellfamiljen

IBM Granite-familjen omfattar flera kategorier av modeller för olika affärsbehov:

  • Språkmodeller (Granite Language Models): Bas- och instruktionsfintunade modeller för textbehandlingsuppgifter: generering, sammanfattning, klassificering m.m.
  • Kodmodeller (Granite Code Models): Specialiserade LLM tränade på 100+ programmeringsspråk, för kodkomplettering, kodgenerering och felkorrigering. Finns i storlekar från 3 till 34 miljarder parametrar[4].
  • Synmodeller (Granite Vision Models): Neurala nätverk för analys av bilder och dokument, textigenkänning och innehållsförståelse.
  • Talmodeller (Granite Speech Models): Kompakta modeller för taligenkänning och talöversättning.
  • Modeller för tidsserier (Granite for Time Series): Specialiserade modeller för prognostisering baserat på tidsserier.
  • Geospatial modell (Granite for Geospatial): Utvecklad i samarbete med NASA för analys av satellitbilder och andra geospatialdata.
  • Embedding-modeller (Granite Embedding Models): Modeller för semantisk sökning och uppbyggnad av RAG-system.
  • Granite Guardian: En specialiserad modul för säkerhet, avsedd för filtrering av oönskade förfrågningar och innehållsövervakning.

Öppen källkod och licensiering

IBM har lagt stor vikt vid öppenhet i Granite-familjen och positionerar den som ett transparent alternativ till slutna proprietära LLM. I maj 2024 överlämnade företaget ursprungsmodellerna för Granite Code till den öppna communityn under licensen Apache 2.0, vilket gör det möjligt att fritt använda, modifiera och distribuera dem[4].

Detta steg, tillsammans med publiceringen av detaljerad information om träningsdata, gav IBM höga betyg från forskarsamhället. Under 2024 inntog modellen ledande positioner i Stanford-universitetets Foundation Model Transparency Index[3].

Tillämpningar

Granite-modellerna är integrerade i IBM:s molnplattform watsonx och används i olika företagsscenarier.

  • Sportanalys (US Open): I samarbete med United States Tennis Association (USTA) använder IBM Granite för att automatiskt skapa matchrapporter och audiokommentarer efter varje match i US Open-turneringen. Lösningen genererar en utförlig textgenomgång av matchen inom några minuter efter dess slut[7].
  • Stöd för programmerare: Granite Code-modellerna utgör grunden för IBM watsonx Code Assistant — en familj av verktyg som bland annat automatiskt kan omvandla föråldrad COBOL-kod till moderna mikrotjänster för IBM Z[4].
  • Branschspecifika AI-applikationer: Lockheed Martin har integrerat Granite-modeller i sin AI Factory-plattform för uppgifter inom nationell säkerhet. ESPN använder Granite för att generera personaliserade kommentarer inom fantasy-sport[3].

Litteratur

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

Noter

  1. 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
  2. 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
  3. 3.0 3.1 3.2 «Granite». IBM. [3]
  4. 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
  5. «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
  6. 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [6]
  7. «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]