IBM Granite (modèle de langage)

From Systems analysis Wiki
Jump to navigation Jump to search

IBM Granite est une série de grands modèles de langage (LLM) développés par IBM pour des applications en environnement d'entreprise. Les modèles Granite sont des transformeurs autorégressifs avec une architecture de type décodeur-seul (decoder-only), capables de générer du texte à partir d'un contexte donné[1].

La famille de modèles a été officiellement présentée le 7 septembre 2023 dans le cadre du lancement de la plateforme cloud IBM watsonx.ai[2]. IBM positionne Granite comme une solution ouverte, performante et fiable pour les entreprises, en mettant l'accent sur la transparence des données d'entraînement, le contrôle des risques et une licence autorisant un usage commercial[3].

Histoire du développement

La famille de modèles Granite s'inscrit dans la stratégie d'IBM visant à fournir aux entreprises ses propres modèles génératifs, aux côtés de ceux de ses partenaires.

  • Septembre 2023 : Annonce officielle et lancement des premiers modèles sur la plateforme watsonx.ai. Les premières versions, Granite.13b.instruct et Granite.13b.chat, comptaient environ 13 milliards de paramètres et étaient axées sur des tâches clés du traitement du langage[2].
  • Mai 2024 : IBM annonce la publication en open source de plusieurs modèles Granite Code (de 3 à 34 milliards de paramètres) sous la licence Apache 2.0. Les poids des modèles ont été publiés sur la plateforme Hugging Face, marquant une étape importante dans le soutien à l'écosystème ouvert de l'IA[4].
  • Automne 2024 : IBM publie la mise à jour Granite 3.0, qui inclut des modèles de plus petite taille (2 et 8 milliards de paramètres) et de nouvelles fonctionnalités, confirmant sa volonté d'élargir la famille de modèles[5].

Architecture et entraînement

Architecture

Les modèles IBM Granite sont basés sur une architecture de transformeur de type décodeur (decoder-only), similaire aux modèles GPT. Le modèle de base Granite.13b utilise le mécanisme de multi-query attention et dispose d'une fenêtre de contexte allant jusqu'à 8000 tokens[6]. Les modèles sont entraînés par apprentissage auto-supervisé (self-supervised learning).

Données d'entraînement et AI Governance

Une caractéristique clé de Granite est l'utilisation d'un corpus de données propriétaire et soigneusement sélectionné pour répondre aux besoins des entreprises. Contrairement à de nombreux LLM entraînés sur des extraits non filtrés du web, Granite a été entraîné sur des données de haute qualité (enterprise-quality), couvrant les domaines suivants[6] :

  • Données académiques et scientifiques : littérature scientifique, publications techniques.
  • Code source : ensembles de code dans de nombreuses langues.
  • Données juridiques : décisions de justice, rapports publics.
  • Finance : rapports financiers d'entreprises.
  • Internet : textes non structurés de nature générale ayant subi un processus de filtrage.

IBM souligne que le développement a suivi des principes stricts d' AI Governance (éthique et gouvernance des données). Chaque ensemble de données a été soumis à une procédure de vérification de conformité avec les politiques de l'entreprise. Pour supprimer les contenus indésirables, un détecteur interne, le « HAP » (Hate and Profanity), a été utilisé, ainsi que des listes de blocage automatiques de sites web[1]. IBM a publié un rapport technique détaillé listant les sources de données, une démarche rare pour les grandes entreprises technologiques, ce qui garantit une grande transparence.

La famille de modèles Granite

La famille IBM Granite comprend plusieurs catégories de modèles conçus pour différentes tâches professionnelles :

  • Modèles de langage (Granite Language Models) : Modèles de base et modèles affinés par instructions (instruction-tuned) pour des tâches de traitement de texte : génération, résumé, classification, etc.
  • Modèles de code (Granite Code Models) : LLM spécialisés, entraînés sur plus de 100 langages de programmation, pour la complétion automatique, la génération et la correction de code. Disponibles dans des tailles allant de 3 à 34 milliards de paramètres[4].
  • Modèles de vision (Granite Vision Models) : Réseaux de neurones pour l'analyse d'images et de documents, la reconnaissance de texte et la compréhension de contenu.
  • Modèles de parole (Granite Speech Models) : Modèles compacts pour la reconnaissance et la traduction vocale.
  • Modèles pour séries temporelles (Granite for Time Series) : Modèles spécialisés pour la prévision basée sur des séries temporelles.
  • Modèle géospatial (Granite for Geospatial) : Développé en collaboration avec la NASA pour l'analyse d'images satellites et d'autres données géospatiales.
  • Modèles d'embedding (Granite Embedding Models) : Modèles pour des tâches de recherche sémantique et la construction de systèmes RAG.
  • Granite Guardian : Un module spécialisé pour garantir la sécurité, conçu pour filtrer les requêtes indésirables et surveiller le contenu.

Open source et licence

IBM a mis un accent particulier sur le caractère ouvert de la famille Granite, la positionnant comme une alternative transparente aux LLM propriétaires et fermés. En mai 2024, l'entreprise a publié les modèles Granite Code de base pour la communauté open source sous la licence Apache 2.0, ce qui permet de les utiliser, de les modifier et de les distribuer librement[4].

Cette initiative, associée à la publication d'informations détaillées sur les données d'entraînement, a valu à IBM une reconnaissance importante de la part de la communauté des chercheurs. En 2024, le modèle a atteint les premières places de l' Index de Transparence des Modèles Fondamentaux de l'Université de Stanford[3].

Applications

Les modèles Granite sont intégrés à la plateforme cloud IBM watsonx et sont utilisés dans divers scénarios d'entreprise.

  • Analyse sportive (US Open) : En collaboration avec l'Association de tennis des États-Unis (USTA), IBM utilise Granite pour générer automatiquement des comptes rendus de match et des commentaires audio après chaque rencontre du tournoi de l'US Open. La solution produit un résumé textuel détaillé du match en quelques minutes seulement après sa conclusion[7].
  • Assistance aux développeurs : Les modèles Granite Code sont au cœur d' IBM watsonx Code Assistant, une suite d'outils capables, par exemple, de convertir automatiquement du code COBOL existant en microservices modernes pour IBM Z[4].
  • Applications sectorielles d'IA : Lockheed Martin a intégré les modèles Granite dans sa plateforme AI Factory pour des tâches liées à la sécurité nationale. ESPN utilise Granite pour générer des commentaires personnalisés dans les ligues de fantasy sport[3].

Bibliographie

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

Références

  1. 1.0 1.1 « Building AI for business: IBM's Granite foundation models ». IBM Blog. [1]
  2. 2.0 2.1 Lardinois, Frederic (7 septembre 2023). « IBM rolls out new generative AI features and models ». TechCrunch. [2]
  3. 3.0 3.1 3.2 « Granite ». IBM. [3]
  4. 4.0 4.1 4.2 4.3 « IBM's Granite code model family is going open source ». IBM Research Blog. [4]
  5. « Granite 3.3 Language Models - a ibm-granite Collection ». Hugging Face. [5]
  6. 6.0 6.1 « Granite Foundation Models: Technical Specifications ». IBM. [6]
  7. « IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms ». IBM Newsroom. [7]