Open-weight and closed-weight models — 개방형 및 폐쇄형 가중치 모델

From Systems analysis Wiki
Jump to navigation Jump to search

Open-weight와 Closed-weight 모델은 대형 언어 모델(LLM)의 개발 및 배포에 있어 근본적으로 서로 다른 두 가지 접근 방식으로, 현대 인공지능 생태계의 핵심적인 이분법을 형성합니다. 이 두 접근 방식 중 어느 것을 선택하느냐에 따라 기술적 가능성, 경제성, 안전성, 그리고 AI의 미래 발전 방향이 달라집니다[1].

차이점은 훈련된 모델 파라미터(가중치)의 접근 가능성에 있습니다. Open-weight 모델은 가중치를 공개하여 커뮤니티가 이를 사용하고, 수정하고, 로컬에 배포할 수 있도록 합니다. 반면 Closed-weight 모델은 가중치를 비공개로 유지하며, 독점적인 API를 통해서만 기능에 접근할 수 있도록 합니다[2].

정의 및 주요 차이점

Open-weight 모델 (개방형 가중치 모델)

Open-weight 모델은 신경망의 훈련된 파라미터(가중치)가 공개적으로 제공되어 누구나 사용하고, 수정하고, 배포할 수 있는 시스템입니다. OpenAI의 안드레이 카르파티(Andrej Karpathy)의 정의에 따르면, 이러한 모델은 "운영 체제의 바이너리 파일을 전달하는 것"과 유사합니다. 즉, 사용자는 작동하는 제품을 받지만 일반적으로 훈련 소스 코드나 훈련 데이터에는 접근할 수 없습니다.

주요 특징:

  • 로컬 배포: 자체 하드웨어에서 모델을 실행할 수 있어 데이터에 대한 완전한 통제권과 기밀성을 보장합니다.
  • Fine-tuning (미세 조정): 특정 작업과 도메인에 맞게 모델을 적응시킬 수 있습니다.
  • 투명성 및 감사: 연구자들이 모델의 내부 메커니즘을 분석하여 편향성과 취약점을 파악할 수 있습니다.

Closed-weight 모델 (폐쇄형 가중치 모델)

Closed-weight 모델(독점 모델이라고도 함)은 파라미터가 영업 비밀로 보호되며 API 또는 제한된 라이선스를 통해서만 접근할 수 있는 시스템입니다. OpenAI와 Anthropic과 같은 개발사들은 아키텍처, 훈련 방법 및 추론 메커니즘을 완전히 통제합니다. GPT-4 기술 보고서에서는 "경쟁 환경과 대규모 모델의 안전 관련 시사점을 고려하여" 세부 사항 공개를 거부한다고 명시적으로 밝히고 있습니다[3].

주요 특징:

  • 중앙집중식 통제: 개발사가 업데이트, 보안 및 사용 정책을 관리합니다.
  • 사용 편의성: API를 통한 접근으로 사용자가 복잡한 인프라를 직접 관리할 필요가 없습니다.
  • 불투명성: 내부 메커니즘에 대한 접근이 불가능하여 독립적인 감사가 어렵고, 오류나 편향된 응답의 원인을 파악하기 힘듭니다.

Open-source와의 차이점

open-weightopen-source라는 용어를 구분하는 것이 중요합니다. 진정한 open-source 모델은 재현에 필요한 모든 아티팩트, 즉 가중치, 아키텍처, 훈련 코드 및 데이터셋의 공개를 의미합니다. Meta의 Llama와 같이 현재의 「개방형」 모델 대부분은 open-weight이지만 완전한 open-source는 아닙니다. 훈련 데이터와 정확한 훈련 방법이 비공개로 유지되기 때문입니다.

비교 분석: 성능, 비용 및 혁신

성능 및 커스터마이징

역사적으로 GPT-4와 같은 closed-weight 모델들이 일반 benchmark에서 선두를 달려왔습니다. 그러나 성능 격차는 빠르게 좁혀지고 있습니다. Stanford AI Index 2025에 따르면, 지난 1년 동안 이 격차는 8%에서 1.7%로 줄어들었습니다[1]. Meta의 LLaMA 3.1 405BDeepSeek-V3 같은 강력한 open-weight 모델들은 유사하거나, 일부 작업(특히 프로그래밍 분야)에서는 이를 능가하는 결과를 보여주고 있습니다[4].

Open-weight 모델의 핵심 장점은 심층적인 커스터마이징에 있습니다. 특정 데이터로 fine-tuning을 할 수 있어, 의료나 법률과 같은 전문 분야에서 더 크지만 범용적인 closed-weight 모델을 능가하는 성능을 발휘할 수 있습니다.

경제적 측면

  • 훈련 비용: 최첨단(frontier) 모델을 개발하는 데는 막대한 비용이 듭니다. GPT-4의 훈련 비용은 1억 달러 이상으로 추산됩니다. DeepSeek-V3와 같은 open-weight 모델은 550만 달러의 비용으로 유사한 성능을 달성하여, 강력한 시스템 개발에 대한 접근성을 민주화하고 있습니다.
  • 추론 비용: Closed-weight 모델은 API를 통한 종량제(pay-per-use) 방식으로 과금되므로, 대용량 사용 시 높은 비용이 발생할 수 있습니다. 로컬에 배포된 open-weight 모델은 초기 인프라 투자가 필요하지만, 규모가 커질수록 총 소유 비용(TCO)이 훨씬 낮아집니다.

과학 연구 및 혁신에 미치는 영향

Open-weight 모델은 재현성접근의 민주화를 보장하여 과학 연구를 근본적으로 변화시키고 있습니다. 전 세계 연구자들이 개방형 모델을 분석하고, 비판하고, 개선할 수 있어 역동적인 생태계를 조성하고 발전을 가속화합니다. 반면 폐쇄형 모델은 발표된 결과를 독립적으로 검증할 수 없기 때문에 「재현성 위기」를 초래합니다.

안전성 및 윤리적 딜레마

안전성 문제는 개방성과 통제 사이의 논쟁에서 핵심적인 딜레마입니다.

  • Closed-weight 방식 (중앙집중식 예방): OpenAI와 Anthropic과 같은 개발사들은 예방적 접근 방식을 취합니다. 정교한 안전 필터를 구현하고, 집중적인 레드 팀 테스팅(red teaming)을 실시하며, Anthropic의 Responsible Scaling Policy와 같이 특정 위험 임계값을 초과하는 모델을 배포하지 않겠다는 엄격한 정책을 준수합니다[5].
  • Open-weight 방식 (분산형 복원력): 이 철학은 open-source 세계와 유사하게 「많은 눈이 있으면 모든 버그는 사소해진다」는 원칙을 따릅니다. 커뮤니티가 취약점을 더 빠르게 발견하고 수정할 수 있습니다. 그러나 이는 악의적인 행위자들이 취약점을 찾거나 fine-tuning을 통해 보호 메커니즘을 제거하는 데 모델을 동일하게 쉽게 활용할 수 있다는 위험도 수반합니다.

연구에 따르면, 모델의 접근 가능성이 아니라 인간의 의도가 위험의 주요 요인입니다. 생성형 AI 남용 사례의 90%는 시스템 자체가 생성한 피해가 아니라 허용된 기능의 악용과 관련이 있습니다.

규제 접근 방식: EU와 미국

  • EU AI 법: 예방적, 위험 기반 접근 방식을 채택합니다. 이 법은 「시스템적 위험」이 있는 모델(훈련에 1025 플롭스 이상 필요한 모델)에 엄격한 의무를 부과하지만, 그러한 위험을 수반하지 않는 open-source 모델에 대해서는 제한적인 예외를 인정합니다. 이는 투명성을 장려하는 동시에 규제적 복잡성을 초래합니다.
  • 미국의 접근 방식: 혁신 장려와 산업 표준을 통한 위험 관리에 기반합니다. 바이든 대통령의 행정 명령 14110과 후속 NTIA 보고서는 open-weight 모델에 대한 즉각적인 제한 도입을 자제하고, 실증적 데이터에 기반한 의사결정을 위한 모니터링 체계 구축을 제안합니다[6].

주요 모델 및 플레이어

주요 Open-weight 및 Closed-weight 모델 비교표
모델 유형 모델 개발사 주요 특징
Open-weight LLaMA 3.1 Meta 개방형 모델의 표준을 세운 높은 성능; 대규모 커뮤니티.
Mixtral 8x7B Mistral AI 낮은 추론 비용으로 높은 성능을 제공하는 혼합 전문가(MoE) 아키텍처.
Closed-weight GPT-4 / GPT-4o OpenAI 역사적인 성능 선두주자, 강력한 멀티모달 기능.
Claude 4 Opus Anthropic 안전성과 윤리(Constitutional AI)에 중점, 대용량 컨텍스트 윈도우.

참조

  • Stanford AI Index Report 2025 — AI 현황에 관한 연간 보고서.
  • 개방형 가중치 모델에 관한 NTIA 보고서

참고 문헌

  • OpenAI et al. (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv:2307.09288.
  • DeepSeek-AI (2025). DeepSeek-V3 Technical Report. arXiv:2412.19437.
  • Kapoor, S.; Bommasani, R. et al. (2024). On the Societal Impact of Open Foundation Models. arXiv:2403.07918.
  • U.S. NTIA (2024). Dual-Use Foundation Models with Widely Available Model Weights. NTIA Report.
  • Stanford HAI (2025). Artificial Intelligence Index Report 2025. Full PDF.
  • Anthropic (2023). Responsible Scaling Policy. Anthropiс RSP.
  • Klyman, K. et al. (2024). A Design Framework for Open-Source Foundation Model Safety. arXiv:2406.10415.
  • Kembery, E.; Reed, T. (2024). AI Safety Frameworks Should Include Procedure for Model Access Decisions. arXiv:2411.10547.
  • European Commission (2024). General-Purpose AI Models in the AI Act – Q&A. EU AI Act FAQ.
  • Zhang, X. et al. (2025). Mitigating Cyber Risk in the Age of Open-Weight LLMs. arXiv:2505.17109.
  • Biderman, S. et al. (2024). Risks and Opportunities of Open-Source Generative AI. arXiv:2405.08597.

각주

  1. 1.0 1.1 «Artificial Intelligence Index Report 2025». Stanford University HAI. [1] Проверено 4 июля 2025.
  2. Karpathy, Andrej. «On Open-sourcing LLMs». X (formerly Twitter).
  3. «GPT-4 Technical Report». OpenAI. [2]
  4. «DeepSeek-V2 and DeepSeek-Coder-V2 Technical Report».
  5. «Anthropic's Responsible Scaling Policy». Anthropic.
  6. «Dual-Use Foundation Models with Widely Available Model Weights». U.S. Department of Commerce, NTIA. (2024).