LLaMA (Meta AI) (KO)
LLaMA (Large Language Model Meta AI) — 주로 오픈 소스로 공개되는 대형 언어 모델(LLM) 패밀리로, Meta AI 연구 부문에서 개발하고 있습니다. LLaMA 모델은 수정된 transformer 아키텍처를 기반으로 하며, 높은 연산 효율성, 최첨단 AI 기술에 대한 접근 민주화, 전문화된 과제에 대한 손쉬운 적응을 목표로 합니다. 이 패밀리는 최초의 연구용 릴리스인 LLaMA 1(2023년 2월)부터 멀티모달 모델인 LLaMA 4(2026년 릴리스 예정)까지 발전해 왔습니다.
명칭
LLaMA라는 약어는 Large Language Model Meta AI(Meta AI 대형 언어 모델)의 줄임말입니다.
- Large Language Model — 수십억에서 수조 개에 이르는 파라미터 규모를 강조합니다.
- Meta AI — 개발사인 Meta 연구 그룹을 가리킵니다.
개발 역사
LLaMA의 개발은 2022년 말, Meta가 OpenAI의 ChatGPT 성공에 대한 전략적 대응으로 시작되었습니다. 마크 저커버그는 FAIR(Facebook AI Research) 연구소 출신 연구자들을 포함한 학제간 팀을 구성했습니다. 2013년부터 연구소의 모든 연구를 완전히 공개한다는 원칙을 고수해 온 FAIR 소장 얀 르쿤은 프로젝트의 철학에 핵심적인 역할을 했습니다.
첫 번째 버전인 LLaMA 1은 2023년 2월 연구용 라이선스와 함께 출시되었습니다. 릴리스 직후인 2023년 3월, 모델 가중치가 BitTorrent를 통해 인터넷에 유출되었습니다. 이 사건은 우려와 달리 프로젝트 발전을 막기는커녕 오히려 촉진시켰으며, 전 세계의 독립 연구자와 애호가들이 모델을 실험할 수 있는 기회를 제공했습니다. 그 결과 Hugging Face 플랫폼에는 수만 개의 파생 모델이 등장했습니다. LLaMA 2부터 시작된 후속 버전들은 상업용 라이선스와 함께 출시되어[1] LLaMA를 오픈 AI 모델 시장의 핵심 플레이어로 자리매김했습니다.
모델 발전 및 릴리스 연혁
| 버전 | 출시일 | 파라미터 범위 | 주요 혁신 및 특징 |
|---|---|---|---|
| LLaMA 1 | 2023년 2월 | 7B – 65B | 기본 아키텍처(RMSNorm, SwiGLU, RoPE). 1.4조 token으로 학습. 컨텍스트 윈도우 2048 token. 연구용 라이선스. |
| LLaMA 2 | 2023년 7월 | 7B – 70B | 대화용 fine-tuning(RLHF). Grouped-Query Attention(GQA) 도입. 컨텍스트 윈도우 4096 token. 최초 상업용 라이선스. |
| Code Llama | 2023년 8월 | 7B – 70B | 코드 전용 특화 버전. 5000억 token의 코드 데이터로 fine-tuning. 기본형, Python 특화형, instruction-tuned 변형 제공. |
| LLaMA 3 | 2024년 4월 | 8B, 70B | 15조 token으로 학습. 어휘 크기 128,000 token의 개선된 tokenizer. 높은 성능(MMLU에서 82%). |
| LLaMA 3.1 | 2024년 7월[2] | 8B, 70B, 405B | GPT-4o 수준의 성능을 보이는 플래그십 모델 405B. 컨텍스트 윈도우 최대 128,000 token. 이미지 처리 기능 추가. |
| LLaMA 4 | (예정: 2025년 4월) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Mixture-of-Experts(MoE) 아키텍처. 네이티브 멀티모달리티(텍스트, 이미지, 동영상). 컨텍스트 윈도우 최대 1,000만 token. |
아키텍처
LLaMA는 자기회귀(autoregressive) decoder-only transformer 아키텍처를 사용하지만, 연산 효율성과 생성 텍스트 품질을 높이는 몇 가지 핵심 개선 사항을 도입합니다.
- Pre-normalization(사전 정규화). 정규화가 transformer 각 서브레이어의 출력이 아닌 입력에 적용됩니다. 이 방식은 매우 깊은 네트워크의 학습을 안정화하고 기울기 문제를 방지합니다.
- RMSNorm(Root Mean Square Layer Normalization). 표준 LayerNorm 대신 RMSNorm이 사용됩니다. 이 정규화 기법은 평균 감산 연산을 제거하여 안정성을 유지하면서 연산을 10~50% 가속합니다.
- SwiGLU(Swish-Gated Linear Unit). 활성화 함수로 ReLU 또는 GELU 대신 SwiGLU가 사용됩니다. 이 gating mechanism은 더 부드러운 기울기 흐름을 형성하고 모델 품질을 향상시킵니다.
- RoPE(Rotary Position Embeddings, 회전 위치 embedding). token 위치 인코딩에 상대적 위치 embedding인 RoPE가 적용되어, 학습 시 사용된 것보다 긴 시퀀스로의 외삽을 더 잘 수행할 수 있습니다.
- GQA(Grouped-Query Attention). LLaMA 2에서 도입된 이 기법은 멀티헤드 attention의 최적화로, 메모리 요구량을 크게 줄이고 텍스트 생성을 가속합니다.
- Mixture-of-Experts(MoE) (LLaMA 4에서 예정). 모델의 파라미터를 '전문가' 서브네트워크로 분할하여 각 요청마다 그 중 일부만 활성화하는 아키텍처입니다. 이는 추론(inference) 연산 비용을 크게 줄입니다.
LLaMA 1 구성
| 모델 | 파라미터 수 | 은닉 상태 차원 | 레이어 수 | attention 헤드 수 | 학습 데이터 규모 |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T token |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T token |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T token |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T token |
학습 데이터
학습 코퍼스의 규모는 LLaMA 1의 1.4조 token에서 LLaMA 3의 15조 token으로 증가했습니다. 학습에는 Common Crawl(데이터의 최대 67% 구성), C4, GitHub, Wikipedia, Books, ArXiv, Stack Exchange 등 공개된 출처가 사용됩니다. LLaMA 3의 경우 고품질 비공개 데이터도 활용되었습니다.
성능 및 비교
- benchmark 결과: LLaMA 3.1(405B) 모델은 GPT-4o에 근접한 결과를 보입니다. MMLU 테스트에서 88.6%를 달성하여 GPT-4o보다 단 0.1퍼센트포인트 낮습니다. 코드 생성 과제인 HumanEval에서 LLaMA 3.1은 89%(GPT-4o는 90.2%)를 기록합니다.
- 파라미터 효율성: 더 적은 파라미터를 가진 LLaMA 모델이 경쟁사의 더 큰 모델을 능가하는 경우가 많습니다. 예를 들어 LLaMA 1(13B)은 대부분의 테스트에서 GPT-3(175B)을 앞질렀습니다.
- 비용: 로컬 호스팅 시 LLaMA의 추론 비용은 독점 API 사용 대비 최대 50배 저렴할 수 있어, 중소기업도 기술에 접근하기 용이합니다.
라이선싱
- LLaMA 1은 요청을 통한 접근 방식의 비상업적 연구 라이선스로 배포되었습니다.
- LLaMA 2 및 이후 버전은 상업적 사용과 수정을 허용하는 Llama Community License로 배포됩니다. 다만 라이선스에는 제한이 있습니다. 월간 활성 사용자가 7억 명을 초과하는 기업은 Meta로부터 별도 허가를 받아야 합니다. 이로 인해 LLaMA가 완전한 오픈 모델인지에 대한 논쟁이 계속되고 있습니다.
활용 분야
LLaMA 모델은 수천 개 기업의 제품에 통합되어 다양한 분야에서 활용됩니다.
- 기업 부문: Zoom은 회의 요약을 위한 AI Companion에 LLaMA를 사용하고, Shopify는 상품 메타데이터 강화를 위해 하루 4,000만~6,000만 건의 요청 처리에 활용하며, Instacart는 사내 어시스턴트 Ava에 도입했습니다.
- 과학 및 사회: Meditron(LLaMA를 적응시킨 모델)은 자원이 제한된 지역에서 의료 진단에 활용됩니다.
- 공공 부문 및 산업: Meta는 Lockheed Martin, Palantir와 파트너십을 체결했습니다. NASA는 지구와의 통신 없이 핵심 작업을 수행하기 위한 오프라인 어시스턴트로 국제우주정거장(ISS)에서 LLaMA 3를 사용합니다.
한계 및 비판
- 편향성 및 안전성: 독립 감사에 따르면 LLaMA 모델은 안전 조치에도 불구하고 유해한 고정관념을 재현할 수 있습니다. LLaMA 1 가중치 유출은 기술의 악의적 사용 가능성에 대한 문제를 부각시켰습니다.
- 지식 공백: 고도로 전문화된 분야에서 LLaMA는 공백을 드러낼 수 있습니다. 예를 들어 의학 시험 nephSAP에서의 정확도는 17~30%로 GPT-4의 73%에 크게 못 미쳤습니다.
- 에너지 소비: 대형 모델 학습에는 막대한 자원이 필요합니다. LLaMA 1 학습에는 2,638 MWh의 전력이 소요되었으며, 이는 1,015톤의 CO₂ 배출에 해당합니다.
미래 전망
Meta는 2025년까지 AI 인프라에 최대 650억 달러를 투자할 계획입니다. 현재 2조 개의 파라미터를 가진 LLaMA 4 Behemoth 모델이 개발 중이며, 200개 이상의 언어를 지원하고 메타버스 제품과 깊이 통합될 예정입니다.
참고 문헌
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
주석
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
같이 보기
- GPT
- 대형 언어 모델
- Transformer (신경망 아키텍처)