Google's large language models — Google의 대형 언어 모델
Google의 대형 언어 모델(LLM)은 Google AI(구 Google Brain)와 DeepMind를 포함한 Google의 다양한 부서에서 개발된 대형 언어 모델(LLM) 시리즈입니다. 딥러닝과 Transformer 아키텍처 분야의 선구자 중 하나인 Google은 현대 LLM 발전에 근본적인 기여를 했습니다. 이 모델들의 개발 역사는 특수화된 언어 이해 시스템에서부터 Google의 많은 제품의 기반이 되고 AI 산업 전체의 발전 방향을 결정하는 대규모 멀티모달 및 에이전트 시스템에 이르는 여정을 반영합니다.
Google 모델의 역사와 발전
초기 성과와 신경망 번역 (2011–2016)
Google에서 LLM 개발의 토대는 심층 신경망 응용에 전념한 Google Brain 프로젝트(2011)를 통해 마련되었습니다. 초기 돌파구 중 하나는 Tomáš Mikolov가 개발한 Word2Vec 알고리즘(2013)이었습니다. 이 알고리즘은 단어를 의미론적 맥락을 반영하는 벡터(embedding) 형태로 표현할 수 있게 해 주었으며, 이는 신경망에서의 언어 이해를 위한 기본적인 방법이 되었습니다.
다음 단계는 seq2seq (2014)와 같은 시퀀스 모델로의 전환이었으며, 이는 Google Neural Machine Translation (GNMT) (2016)의 기반이 되었습니다. Google 번역기를 LSTM 기반의 신경망 아키텍처로 전환함으로써 기계 번역의 품질이 크게 향상되었습니다. 동시에 2014년 Google에 인수된 자회사 DeepMind는 AlphaGo 시스템이 세계 바둑 챔피언을 꺾음으로써 딥러닝의 강력함을 증명하며 AI의 잠재력에 대한 믿음을 강화했습니다.
Transformer 혁명과 BERT의 탄생 (2017–2018)
2017년 Google Brain의 연구자들은 「Attention Is All You Need」 논문을 통해 Transformer 아키텍처를 발표했습니다. 자기 주의(self-attention) 메커니즘을 기반으로 하는 이 아키텍처는 시퀀스를 순차적이 아닌 병렬로 처리할 수 있게 하여 NLP 분야에 혁명을 일으켰으며 현대 모든 LLM의 기반이 되었습니다.
이 성공을 바탕으로 Google은 2018년 BERT (Bidirectional Encoder Representations from Transformers) 모델을 발표했습니다. BERT는 단어의 맥락을 좌우 양방향에서 동시에 고려하는 최초의 깊은 양방향 모델이었습니다. 이를 통해 다양한 언어 이해 과제(GLUE, SQuAD)에서 기록적인 성과를 달성하고 새로운 산업 표준을 세웠습니다. BERT는 두 가지 버전(1억 1천만 파라미터의 BASE와 3억 4천만 파라미터의 LARGE)으로 공개 코드 및 가중치와 함께 출시되어 대중적으로 확산되었습니다. 2019년부터 BERT는 Google 검색에서 쿼리를 더 잘 이해하기 위해 활용되기 시작했습니다.
규모 확대와 대화형 모델의 시대 (2019–2022)
BERT 이후 Google은 규모와 아키텍처에 대한 실험을 계속했습니다:
- T5 (Text-to-Text Transfer Transformer, 2019): 모든 NLP 과제를 '텍스트-투-텍스트' 변환으로 처리하는 통합 모델. 거대한 C4 (Colossal Clean Crawled Corpus) 코퍼스로 학습되었으며, T5 역시 여러 크기(최대 110억 파라미터)로 공개 출시되었습니다.
- Meena (2020): 26억 파라미터를 가진 Google 최초의 특화 대화형 모델로, 개방형 대화에서 높은 품질을 보였습니다.
- LaMDA (Language Model for Dialogue Applications, 2021): 방대한 대화 코퍼스(1조 5,600억 단어)로 학습된 대화형 모델 패밀리(최대 1,370억 파라미터). LaMDA는 보다 자연스럽고 의미 있는 대화 생성을 목표로 했으며, Google 엔지니어가 모델의 '지각 능력'을 주장한 사건으로 일반 대중에게 알려졌습니다.
- Gopher와 Chinchilla (DeepMind, 2021–2022): 동시에 DeepMind는 스케일링 법칙을 연구했습니다. Gopher 모델(2,800억 파라미터)은 규모가 품질에 어떤 영향을 미치는지 보여주었습니다. 그리고 Chinchilla 모델(700억)은 최적의 성능을 위해 파라미터 수를 최대화하는 것보다 모델 크기와 학습 데이터 양 사이의 균형이 더 중요하다는 것을 증명했습니다. 이 결론은 'Chinchilla 법칙'으로 알려지게 되었으며 업계 전반의 LLM 학습 전략에 영향을 미쳤습니다.
초대형 및 멀티모달 모델의 시대 (2022–현재)
- PaLM (Pathways Language Model, 2022): 발표 당시 Google 최대의 밀집(dense) 모델로 5,400억 파라미터를 보유하며, 새로운 분산 인프라인 Pathways에서 학습되었습니다. PaLM은 특히 Chain-of-Thought (CoT) prompting 기법을 활용한 논리적 추론에서 획기적인 능력을 보여주었습니다. 이를 기반으로 의료 분야를 위한 Med-PaLM 등 특화 버전이 개발되었습니다. 2023년에는 개선된 버전인 PaLM 2 (~3,400억 파라미터)가 출시되어 업데이트된 챗봇 Bard의 기반이 되었습니다.
- Gemini (2023–현재): Google DeepMind의 통합 팀이 만든 차세대 모델. Gemini는 처음부터 텍스트, 코드, 이미지, 오디오, 동영상을 처리할 수 있는 네이티브 멀티모달 시스템으로 설계되었습니다. 여러 버전으로 출시되었습니다:
- Gemini Ultra: 복잡한 작업을 위한 가장 강력한 모델.
- Gemini Pro: 다양한 작업을 위한 범용 모델.
- Gemini Nano: 모바일 기기에서 동작하는 경량 모델.
2024–2025년에는 Gemini 1.5 (최대 100만 토큰의 컨텍스트 창)와 에이전트 기능을 탑재한 Gemini 2.0으로 패밀리가 확장되었습니다.
아키텍처와 기술적 특성
기반: 인코더, 디코더, 하이브리드
Google은 과제에 따라 Transformer 아키텍처의 다양한 변형을 사용합니다:
- 인코더(Encoder-only): BERT 유형의 모델. 텍스트 전체를 처리하여 풍부한 맥락 표현을 생성합니다. 텍스트 분석 및 이해 과제(분류, 개체 추출)에 이상적이지만 생성에는 적합하지 않습니다.
- 디코더(Decoder-only): LaMDA 및 PaLM 유형의 모델(GPT와 유사). 자기회귀 방식으로, 즉 토큰 단위로 텍스트를 예측합니다. 텍스트 완성, 대화, 질의응답에 적합한 자연스러운 생성 모델입니다.
- 인코더-디코더(Encoder-Decoder): T5 및 GNMT 유형의 모델. 두 부분을 모두 갖추고 있어, 인코더가 입력 시퀀스를 처리하고 디코더가 출력을 생성합니다. 번역이나 요약과 같은 변환 과제를 위한 범용 아키텍처입니다.
규모: 파라미터, 데이터, 인프라
LLM 분야에서 Google의 성공은 주로 세 가지 요인에 기인합니다:
- 모델 규모: 수백만(BERT)에서 수천억(PaLM, Gemini)에 이르기까지 파라미터 수를 체계적으로 증가시켜 왔습니다.
- 데이터 규모: 세계 최대의 데이터 코퍼스 중 하나(Google 웹 인덱스, YouTube, Google Books)에 대한 접근을 통해 수조 개의 토큰으로 모델을 학습할 수 있습니다.
- 인프라: 자체 개발 전용 칩인 Tensor Processing Unit (TPU)와 분산 시스템 Pathways를 활용하여 초대형 모델을 효율적이고 안정적으로 학습합니다.
멀티모달리티와 에이전트 기능
Google의 최신 모델, 특히 Gemini는 깊은 멀티모달리티와 에이전트 기능을 향해 나아가고 있습니다.
- 네이티브 멀티모달리티는 단순히 별도의 모듈을 연결하는 것이 아니라 하나의 모델이 처음부터 다양한 유형의 데이터(텍스트, 이미지, 오디오)를 이해하고 결합하도록 학습된 것을 의미합니다.
- 에이전트 기능(Agentic AI)은 모델이 단순히 요청에 응답하는 것을 넘어 목표를 달성하기 위한 일련의 행동을 자율적으로 계획하고 실행하는 능력(예: 검색이나 계산기와 같은 외부 도구 호출)을 의미합니다.
주요 모델 요약 비교표
| 모델 | 출시 연도 | 파라미터 (추정) | 아키텍처 | 주요 특징 |
|---|---|---|---|---|
| BERT | 2018 | 1억 1천만–3억 4천만 | 인코더 | 양방향 문맥 이해, NLP 과제에서 SOTA 달성. |
| T5 | 2019 | 6천만–110억 | 인코더-디코더 | 모든 과제에 대한 통합 '텍스트-투-텍스트' 방식. |
| LaMDA | 2021 | 1,370억 | 디코더 | 개방적이고 의미 있는 대화에 특화. |
| PaLM | 2022 | 5,400억 | 디코더 | 논리적 추론의 획기적 발전 (Chain-of-Thought), 대규모 학습. |
| Chinchilla | 2022 | 700억 | 디코더 | '컴퓨트 최적(compute-optimal)' 모델로, 데이터와 파라미터 균형의 중요성을 입증. |
| Gemini 1.0 | 2023 | 최대 ~1조 (Ultra) | 멀티모달 (MoE 추정) | 네이티브 멀티모달리티, 다수 benchmark에서 SOTA (MMLU). |
| Gemini 1.5 | 2024 | 미공개 | 멀티모달 (MoE) | 최대 100~200만 토큰의 컨텍스트 창, 높은 효율성. |
| Gemini 2.0 | 2024 | 미공개 | 멀티모달 + Tools | 내장 에이전트 기능, 이미지/오디오 생성. |
제품 및 생태계 적용
Google은 LLM을 전체 제품 라인에 적극적으로 통합하고 있습니다:
- Google 검색: BERT, MUM, Gemini가 복잡한 쿼리를 더 잘 이해하고 AI Overviews (구 SGE) 형식으로 직접 답변을 제공하는 데 활용됩니다.
- Google 어시스턴트와 Bard (현재 Gemini): 단순한 음성 명령에서 LaMDA, PaLM 2, Gemini 기반의 본격적인 대화형 어시스턴트로의 전환.
- Google Workspace: Duet AI (현재 Gemini for Workspace) 기능이 Gmail에서 이메일 작성, Docs에서 텍스트 생성, Slides에서 프레젠테이션 제작을 지원합니다.
- Android: Gemini Nano는 Pixel 등 기기에서 AI 기능을 로컬로 실행하여 개인 정보 보호와 속도를 향상시킵니다.
- Google Cloud AI: Vertex AI 플랫폼은 기업들이 자체 애플리케이션 개발을 위해 API를 통해 PaLM 및 Gemini 모델에 접근할 수 있도록 합니다.
경쟁 환경에서의 역할
Google은 'AI 경쟁'의 핵심 주체 중 하나로, 주요 경쟁자는 OpenAI(Microsoft 지원)와 Meta입니다.
- OpenAI와의 경쟁: Google이 Transformer를 포함한 많은 기반 기술의 선구자였음에도 불구하고, 2022년 말 ChatGPT의 출시는 Google이 자사 제품(예: Bard)의 시장 출시를 가속화하게 만들었습니다. 경쟁은 모델 품질(Gemini Ultra vs. GPT-4), 컨텍스트 창 크기, API 사용 편의성 분야에서 전개됩니다.
- Meta와의 대비: Meta는 오픈 소스 전략(LLaMA 모델)을 선택하여 Google과 OpenAI의 폐쇄형 모델에 대한 강력한 대안을 만들었습니다. 이에 대응하여 Google도 개발자 커뮤니티를 지원하고 Meta에 생태계를 빼앗기지 않기 위해 Gemma 같은 오픈 모델을 출시하기 시작했습니다.
- 전략적 투자: Google은 클라우드 경쟁에서 자신의 입지를 강화하고 접근 방식을 다각화하기 위해 Claude 모델의 제작사인 스타트업 Anthropic 등 다른 플레이어에도 투자하고 있습니다.
참고 문헌
- Vaswani, A. et al. (2017). Attention Is All You Need. NIPS.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. JMLR.
- Thoppilan, R. et al. (2022). LaMDA: Language Models for Dialog Applications. arXiv:2201.08239.
- Hoffmann, R. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. JMLR.
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
외부 링크
- Google AI 공식 포털
- Google DeepMind 공식 사이트