IBM Granite (language model) (HU)
IBM Granite — egy nagy nyelvi modellek (LLM) sorozata, amelyet az IBM vállalat fejlesztett ki vállalati környezetben való alkalmazásra. A Granite modellek csak dekódert alkalmazó, autoregresszív transformer architektúrán alapulnak, és képesek szöveget generálni adott kontextus alapján[1].
A modellcsaládot hivatalosan 2023. szeptember 7-én mutatták be az IBM watsonx.ai felhőplatform indításakor[2]. Az IBM a Granite-et nyílt, hatékony és megbízható vállalati megoldásként pozicionálja, kiemelve a tanítási adatok átláthatóságát, a kockázatok kezelését és a kereskedelmi felhasználást lehetővé tevő licencelést[3].
Fejlesztéstörténet
A Granite modellcsalád az IBM azon stratégiájának részeként jött létre, amelynek célja saját generatív modellek biztosítása a vállalkozások számára a partnermodellek mellett.
- 2023 szeptember: Az első modellek hivatalos bejelentése és elindítása a watsonx.ai platformon. Az első kiadások, a Granite.13b.instruct és a Granite.13b.chat, körülbelül 13 milliárd paraméterrel rendelkeztek, és a nyelvfeldolgozás kulcsfeladataira összpontosítottak[2].
- 2024 május: Az IBM bejelenti több Granite Code modell (3-tól 34 milliárd paraméterig) nyílt forráskódú kiadását Apache 2.0 licenc alatt. A modellek súlyait a Hugging Face platformon tették közzé, ami fontos lépés volt a nyílt AI-ökoszisztéma támogatásában[4].
- 2024 ősz: Az IBM kiadja a Granite 3.0 frissítést, amely kisebb méretű modelleket (2 és 8 milliárd paraméter) és új funkciókat tartalmaz, megerősítve a modellcsalád bővítésének irányát[5].
Architektúra és tanítás
Architektúra
Az IBM Granite modellek dekóderes transformer (decoder-only) architektúrára épülnek, hasonlóan a GPT modellekhez. Az alap Granite.13b modell multi-query attention mechanizmust alkalmaz, és kontextusablaka akár 8000 tokent is befogadhat[6]. A modellek tanítása önfelügyelt tanulással (self-supervised learning) történik.
Tanítási adatok és AI Governance
A Granite egyik kulcsjellemzője a saját, válogatott adatkorpusz használata, amelyet vállalati igényekre választottak ki. Sok LLM-mel ellentétben, amelyek szűretlen webes mintákon tanulnak, a Granite vállalati minőségű (enterprise-quality) adatokon tanult, amelyek az alábbi területeket fedik le[6]:
- Tudományos és akadémiai adatok: tudományos irodalom, műszaki kiadványok.
- Programkód: kódgyűjtemények számos programozási nyelven.
- Jogtudomány: bírósági döntések, nyilvános jelentések.
- Pénzügy: vállalati pénzügyi beszámolók.
- Internet: szűrt, általános jellegű, strukturálatlan szövegek.
Az IBM hangsúlyozza, hogy a fejlesztés szigorú AI Governance (adatetikai és adatkezelési) elveket követett. Az adatok minden részét ellenőrzési eljáráson vetették alá a vállalati irányelveknek való megfelelés érdekében. A nem kívánt tartalom eltávolítására a belső „HAP" (Hate and Profanity) detektort, valamint automatikus webes tiltólistákat alkalmaztak[1]. Az IBM részletes műszaki jelentést tett közzé a források listájával, ami ritka lépés a nagy technológiai vállalatoknál, és magas fokú átláthatóságot biztosít.
A Granite modellcsalád
Az IBM Granite modellcsalád különböző üzleti feladatokhoz számos modelltípust foglal magában:
- Nyelvi modellek (Granite Language Models): Alap- és utasításra finomhangolt modellek szövegfeldolgozási feladatokhoz: generálás, összefoglalás, osztályozás stb.
- Kódmodellek (Granite Code Models): Speciális LLM-ek, amelyeket 100+ programozási nyelven tanítottak, kódkiegészítés, -generálás és -javítás céljaira. 3-tól 34 milliárd paraméterig érhetők el[4].
- Látásos modellek (Granite Vision Models): Neurális hálózatok képek és dokumentumok elemzéséhez, szövegfelismeréshez és tartalomértelmezéshez.
- Beszédmodellek (Granite Speech Models): Kompakt modellek beszédfelismeréshez és -fordításhoz.
- Idősor-modellek (Granite for Time Series): Speciális modellek idősoron alapuló előrejelzéshez.
- Térinformatikai modell (Granite for Geospatial): A NASA-val közösen fejlesztett, műholdfelvételek és egyéb térbeli adatok elemzésére.
- Embedding modellek (Granite Embedding Models): Modellek szemantikus keresési feladatokhoz és RAG rendszerek kiépítéséhez.
- Granite Guardian: Speciális biztonsági modul, amely nem kívánt lekérdezések szűrésére és tartalommonitorozásra szolgál.
Nyílt forráskód és licencelés
Az IBM jelentős hangsúlyt fektetett a Granite modellcsalád nyíltságára, zárt, tulajdonosi LLM-ek átlátható alternatívájaként pozicionálva azt. 2024 májusában a vállalat az Apache 2.0 licenc alatt bocsátotta a nyílt közösség rendelkezésére az eredeti Granite Code modelleket, amelyek így szabadon felhasználhatók, módosíthatók és terjeszthetők[4].
Ez a lépés, a tanítási adatokra vonatkozó részletes információk közzétételével együtt, magas elismerést hozott az IBM-nek a kutatói közösségtől. 2024-ben a modell vezető pozíciót foglalt el a Stanford Egyetem Alapmodellek Átláthatósági Indexében[3].
Alkalmazások
A Granite modellek integrálva vannak az IBM watsonx felhőplatformba, és különböző vállalati forgatókönyvekben alkalmazzák őket.
- Sportanalitika (US Open): Az Egyesült Államok Tenisz Szövetségével (USTA) együttműködve az IBM a Granite-et alkalmazza az US Open tornán minden mérkőzés után automatikus mérkőzés-összefoglalók és hangkommentárok létrehozásához. A megoldás a mérkőzés befejeztét követő perceken belül részletes szöveges összefoglalót generál[7].
- Programozói segítség: A Granite Code modellek az IBM watsonx Code Assistant alapját képezik — ez egy eszközcsalád, amely képes például az IBM Z platformon futó elavult COBOL-kódot automatikusan modern mikroszolgáltatásokká alakítani[4].
- Ágazati AI-alkalmazások: A Lockheed Martin integrálta a Granite modelleket saját AI Factory platformjába nemzetbiztonsági feladatokhoz. Az ESPN a Granite-et használja személyre szabott fantasy sport kommentárok generálásához[3].
Irodalom
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
- Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
- Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.
Jegyzetek
- ↑ 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
- ↑ 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
- ↑ 3.0 3.1 3.2 «Granite». IBM. [3]
- ↑ 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
- ↑ «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
- ↑ 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [6]
- ↑ «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]