IBM Granite (Sprachmodell)

From Systems analysis Wiki
Jump to navigation Jump to search

IBM Granite ist eine Serie von großen Sprachmodellen (LLM), die von IBM für den Einsatz in Unternehmensumgebungen entwickelt wurde. Die Granite-Modelle sind autoregressive Transformer mit einer reinen Decoder-Architektur (decoder-only), die in der Lage sind, Text basierend auf einem gegebenen Kontext zu generieren[1].

Die Modellfamilie wurde am 7. September 2023 im Rahmen des Starts der Cloud-Plattform IBM watsonx.ai offiziell vorgestellt[2]. IBM positioniert Granite als offene, leistungsstarke und zuverlässige Lösungen für Unternehmen und legt dabei den Schwerpunkt auf die Transparenz der Trainingsdaten, die Risikokontrolle und eine Lizenzierung, die eine kommerzielle Nutzung erlaubt[3].

Entwicklungsgeschichte

Die Granite-Modellfamilie wurde Teil der Strategie von IBM, Unternehmen neben den Modellen von Partnern auch eigene generative Modelle anzubieten.

  • September 2023: Offizielle Ankündigung und Einführung der ersten Modelle auf der watsonx.ai-Plattform. Die ersten Versionen, Granite.13b.instruct und Granite.13b.chat, hatten einen Umfang von etwa 13 Milliarden Parametern und waren auf zentrale Aufgaben der Sprachverarbeitung ausgerichtet[2].
  • Mai 2024: IBM kündigt die Open-Source-Veröffentlichung mehrerer Granite Code-Modelle (von 3 bis 34 Mrd. Parametern) unter der Apache-2.0-Lizenz an. Die Modellgewichte wurden auf der Plattform Hugging Face veröffentlicht, was ein wichtiger Schritt zur Unterstützung des offenen KI-Ökosystems war[4].
  • Herbst 2024: IBM veröffentlicht das Update Granite 3.0, das kleinere Modelle (2 und 8 Mrd. Parameter) und neue Funktionen umfasst und damit den Kurs zur Erweiterung der Familie bestätigt[5].

Architektur und Training

Architektur

Die IBM Granite-Modelle basieren auf einer Transformer-Decoder-Architektur (decoder-only), ähnlich den GPT-Modellen. Das Basismodell Granite.13b verwendet den Multi-Query Attention-Mechanismus und hat ein Kontextfenster von bis zu 8000 Token[6]. Die Modelle werden mittels selbstüberwachtem Lernen (self-supervised learning) trainiert.

Trainingsdaten und AI Governance

Ein Hauptmerkmal von Granite ist die Verwendung eines eigenen kuratierten Datenkorpus, der speziell für die Bedürfnisse von Unternehmen ausgewählt wurde. Im Gegensatz zu vielen LLMs, die auf ungefilterten Web-Samples trainiert werden, wurde Granite auf Daten von erhöhter Qualität (enterprise-quality) trainiert, die die folgenden Domänen abdecken[6]:

  • Akademische und wissenschaftliche Daten: Wissenschaftliche Literatur, technische Veröffentlichungen.
  • Programmcode: Code-Sammlungen in zahlreichen Sprachen.
  • Rechtswesen: Gerichtsentscheidungen, öffentliche Berichte.
  • Finanzen: Finanzberichte von Unternehmen.
  • Internet: Gefilterte, unstrukturierte Texte allgemeiner Art.

IBM betont, dass die Entwicklung strengen Prinzipien der AI Governance (Ethik und Datenmanagement) folgte. Jeder Datensatz durchlief ein Prüfverfahren zur Einhaltung der Unternehmensrichtlinien. Zur Entfernung unerwünschter Inhalte wurde der interne Detektor „HAP“ (Hate and Profanity) sowie automatische Sperrlisten für Webressourcen verwendet[1]. IBM veröffentlichte einen detaillierten technischen Bericht mit einer Liste der Quellen, was für große Technologieunternehmen ein seltener Schritt ist und eine hohe Transparenz gewährleistet.

Die Granite-Modellfamilie

Die IBM Granite-Familie umfasst mehrere Modellkategorien für verschiedene Geschäftsanwendungen:

  • Sprachmodelle (Granite Language Models): Basis- und instruktionsangepasste Modelle für Aufgaben der Textverarbeitung: Generierung, Zusammenfassung, Klassifizierung usw.
  • Code-Modelle (Granite Code Models): Spezialisierte LLMs, die auf über 100 Programmiersprachen trainiert wurden, für Autovervollständigung, Generierung und Korrektur von Code. Verfügbar in Größen von 3 bis 34 Mrd. Parametern[4].
  • Vision-Modelle (Granite Vision Models): Neuronale Netze zur Analyse von Bildern und Dokumenten, Texterkennung und Inhaltsverständnis.
  • Speech-Modelle (Granite Speech Models): Kompakte Modelle zur Spracherkennung und -übersetzung.
  • Zeitreihen-Modelle (Granite for Time Series): Spezialisierte Modelle für Prognosen auf Basis von Zeitreihen.
  • Geodaten-Modell (Granite for Geospatial): Entwickelt in Zusammenarbeit mit der NASA zur Analyse von Satellitenbildern und anderen Geodaten.
  • Embedding-Modelle (Granite Embedding Models): Modelle für Aufgaben der semantischen Suche und den Aufbau von RAG-Systemen.
  • Granite Guardian: Spezialisiertes Modul zur Gewährleistung der Sicherheit, das zur Filterung unerwünschter Anfragen und zur Überwachung von Inhalten dient.

Open Source und Lizenzierung

IBM hat einen starken Schwerpunkt auf die Offenheit der Granite-Familie gelegt und sie als transparente Alternative zu geschlossenen, proprietären LLMs positioniert. Im Mai 2024 stellte das Unternehmen die ursprünglichen Granite Code-Modelle der Open-Source-Community unter der Apache-2.0-Lizenz zur Verfügung, was deren freie Nutzung, Änderung und Verbreitung ermöglicht[4].

Dieser Schritt, zusammen mit der Veröffentlichung detaillierter Informationen über die Trainingsdaten, brachte IBM hohe Anerkennung von der Forschungsgemeinschaft ein. Im Jahr 2024 erreichte das Modell eine Spitzenposition im Foundation Model Transparency Index der Stanford University[3].

Anwendung

Die Granite-Modelle sind in die Cloud-Plattform IBM watsonx integriert und werden in verschiedenen Unternehmensszenarien eingesetzt.

  • Sportanalytik (US Open): In Zusammenarbeit mit der United States Tennis Association (USTA) setzt IBM Granite zur automatischen Erstellung von Spielberichten und Audiokommentaren nach jedem Match des Turniers US Open ein. Die Lösung generiert innerhalb weniger Minuten nach Spielende eine detaillierte Textzusammenfassung des Matches[7].
  • Unterstützung für Programmierer: Die Granite Code-Modelle bilden die Grundlage für IBM watsonx Code Assistant – eine Familie von Werkzeugen, die beispielsweise veralteten COBOL-Code automatisch in moderne Microservices für IBM Z umwandeln können[4].
  • Branchenspezifische KI-Anwendungen: Lockheed Martin hat die Granite-Modelle in seine AI-Factory-Plattform für Aufgaben der nationalen Sicherheit integriert. ESPN verwendet Granite zur Generierung personalisierter Kommentare im Fantasy-Sport[3].

Literatur

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

Einzelnachweise

  1. 1.0 1.1 „Building AI for business: IBM's Granite foundation models“. IBM Blog. [1]
  2. 2.0 2.1 Lardinois, Frederic (7. September 2023). „IBM rolls out new generative AI features and models“. TechCrunch. [2]
  3. 3.0 3.1 3.2 „Granite“. IBM. [3]
  4. 4.0 4.1 4.2 4.3 „IBM's Granite code model family is going open source“. IBM Research Blog. [4]
  5. „Granite 3.3 Language Models - a ibm-granite Collection“. Hugging Face. [5]
  6. 6.0 6.1 „Granite Foundation Models: Technical Specifications“. IBM. [6]
  7. „IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms“. IBM Newsroom. [7]