IBM Granite (language model) (KO)
IBM Granite — 이것은 기업 환경에서 활용하기 위해 IBM 사가 개발한 대형 언어 모델(LLM) 시리즈입니다. Granite 모델은 주어진 컨텍스트를 기반으로 텍스트를 생성할 수 있는, 디코더 전용 아키텍처의 자기회귀 transformer입니다[1].
이 패밀리는 2023년 9월 7일 IBM watsonx.ai 클라우드 플랫폼 출시와 함께 공식 발표되었습니다[2]. IBM은 Granite를 기업을 위한 개방적이고 성능이 뛰어나며 신뢰할 수 있는 솔루션으로 포지셔닝하며, 학습 데이터의 투명성, 리스크 관리, 상업적 사용이 허용되는 라이선스를 강조합니다[3].
개발 역사
Granite 모델 패밀리는 IBM이 파트너 모델과 함께 자체 생성형 모델을 기업에 제공하는 전략의 일환이 되었습니다.
- 2023년 9월: watsonx.ai 플랫폼에서 첫 번째 모델의 공식 발표 및 출시. 첫 번째 릴리즈인 Granite.13b.instruct와 Granite.13b.chat은 약 130억 개의 파라미터를 보유하며 핵심 언어 처리 작업에 초점을 맞추었습니다[2].
- 2024년 5월: IBM이 Apache 2.0 라이선스 하에 여러 Granite Code 모델(30억~340억 파라미터)의 오픈 릴리즈를 발표. 모델 가중치가 Hugging Face 플랫폼에 공개되었으며, 이는 개방형 AI 생태계 지원을 위한 중요한 발걸음이 되었습니다[4].
- 2024년 가을: IBM이 소형 모델(20억 및 80억 파라미터)과 새로운 기능을 포함한 Granite 3.0 업데이트를 출시하며 패밀리 확장 방침을 재확인하였습니다[5].
아키텍처 및 학습
아키텍처
IBM Granite 모델은 GPT 모델과 유사하게 트랜스포머 디코더(decoder-only) 아키텍처를 기반으로 구축되었습니다. 기본 모델인 Granite.13b는 multi-query attention 메커니즘을 사용하며 최대 8,000 token의 컨텍스트 윈도우를 가집니다[6]. 모델은 자기지도학습(self-supervised learning)을 통해 학습됩니다.
학습 데이터 및 AI Governance
Granite의 주요 특징은 기업의 요구에 맞게 선별된 자체 큐레이션 데이터 코퍼스를 사용한다는 점입니다. 필터링되지 않은 웹 샘플로 학습되는 많은 LLM과 달리, Granite는 다음 도메인을 포함하는 고품질(enterprise-quality) 데이터로 학습되었습니다[6]:
- 학술 및 과학 데이터: 과학 문헌, 기술 출판물.
- 프로그램 코드: 다양한 언어의 코드 데이터셋.
- 법률: 법원 판결, 공개 보고서.
- 금융: 기업 재무 보고서.
- 인터넷: 필터링을 거친 일반적인 비정형 텍스트.
IBM은 개발이 엄격한 AI Governance(데이터 윤리 및 관리) 원칙을 준수했음을 강조합니다. 데이터의 각 부분은 기업 정책 준수 여부를 검토하는 절차를 거쳤습니다. 불필요한 콘텐츠 제거를 위해 내부 탐지기인 「HAP」(Hate and Profanity)와 자동화된 웹 리소스 차단 목록이 활용되었습니다[1]. IBM은 출처 목록을 포함한 상세한 기술 보고서를 공개했으며, 이는 대형 기술 기업들 사이에서 드문 조치로 높은 수준의 투명성을 보장합니다.
Granite 모델 패밀리
IBM Granite 패밀리는 다양한 비즈니스 과제를 위한 여러 카테고리의 모델을 포괄합니다:
- 언어 모델(Granite Language Models): 텍스트 생성, 요약, 분류 등 텍스트 처리 작업을 위한 기본 및 인스트럭션 fine-tuning 모델.
- 코드 모델(Granite Code Models): 자동 완성, 코드 생성 및 수정을 위해 100개 이상의 프로그래밍 언어로 학습된 특화 LLM. 30억~340억 파라미터 크기로 제공됩니다[4].
- 비전 모델(Granite Vision Models): 이미지 및 문서 분석, 텍스트 인식, 콘텐츠 이해를 위한 신경망.
- 음성 모델(Granite Speech Models): 음성 인식 및 번역을 위한 경량 모델.
- 시계열 모델(Granite for Time Series): 시계열 기반 예측을 위한 특화 모델.
- 지리공간 모델(Granite for Geospatial): 위성 이미지 및 기타 지리공간 데이터 분석을 위해 NASA와 협력하여 개발.
- 임베딩 모델(Granite Embedding Models): 의미론적 검색 및 RAG 시스템 구축을 위한 모델.
- Granite Guardian: 불필요한 요청 필터링 및 콘텐츠 모니터링을 위한 특화 안전 모듈.
오픈 소스 및 라이선싱
IBM은 Granite 패밀리의 개방성에 큰 비중을 두며, 이를 폐쇄형 독점 LLM에 대한 투명한 대안으로 포지셔닝합니다. 2024년 5월, 회사는 Apache 2.0 라이선스 하에 Granite Code 원본 모델을 오픈 커뮤니티에 공개하였으며, 이를 통해 자유로운 사용, 수정 및 배포가 가능해졌습니다[4].
이 조치는 학습 데이터에 대한 상세한 정보 공개와 함께 연구 커뮤니티로부터 높은 평가를 받았습니다. 2024년 해당 모델은 스탠퍼드 대학교의 파운데이션 모델 투명성 지수에서 선도적인 위치를 차지하였습니다[3].
활용 사례
Granite 모델은 IBM watsonx 클라우드 플랫폼에 통합되어 다양한 기업 시나리오에서 활용됩니다.
- 스포츠 분석(US Open): 미국 테니스 협회(USTA)와의 협력을 통해 IBM은 Granite를 활용하여 US Open 토너먼트의 각 경기 결과를 기반으로 자동으로 경기 보고서 및 오디오 해설을 생성합니다. 이 솔루션은 경기 종료 후 몇 분 만에 상세한 텍스트 경기 리뷰를 생성합니다[7].
- 개발자 지원: Granite Code 모델은 IBM watsonx Code Assistant 도구 패밀리의 핵심을 이루며, 예를 들어 IBM Z용으로 노후화된 COBOL 코드를 현대적인 마이크로서비스로 자동 변환하는 기능을 제공합니다[4].
- 산업별 AI 애플리케이션: Lockheed Martin은 국가 안보 과제를 위해 자사 AI Factory 플랫폼에 Granite 모델을 통합하였습니다. ESPN은 판타지 스포츠에서 개인화된 해설 생성을 위해 Granite를 활용합니다[3].
참고 문헌
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
- Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
- Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.
각주
- ↑ 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
- ↑ 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
- ↑ 3.0 3.1 3.2 «Granite». IBM. [3]
- ↑ 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
- ↑ «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
- ↑ 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [6]
- ↑ «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]