Open-weight and closed-weight models — مدل‌های با وزن‌های باز و بسته

From Systems analysis Wiki
Jump to navigation Jump to search

مدل‌های Open-weight و Closed-weight — دو رویکرد بنیادی متفاوت در توسعه و توزیع مدل‌های زبانی بزرگ (LLM) هستند که دوگانه‌ای کلیدی در اکوسیستم امروزی هوش مصنوعی را شکل می‌دهند. انتخاب میان این دو رویکرد بر قابلیت‌های فنی، اقتصاد، امنیت و آینده توسعه هوش مصنوعی تأثیر می‌گذارد[1].

تفاوت اصلی در دسترس‌پذیری پارامترهای آموزش‌دیده (وزن‌ها) مدل نهفته است. مدل‌های Open-weight وزن‌های خود را منتشر می‌کنند و به جامعه اجازه می‌دهند آن‌ها را استفاده، تغییر و به‌صورت محلی مستقر کنند. مدل‌های Closed-weight در مقابل، وزن‌ها را محرمانه نگه می‌دارند و دسترسی به قابلیت‌های خود را تنها از طریق API های اختصاصی فراهم می‌کنند[2].

تعاریف و تفاوت‌های کلیدی

مدل‌های Open-weight (با وزن‌های باز)

مدل‌های Open-weight — سیستم‌هایی هستند که پارامترهای آموزش‌دیده (وزن‌های) شبکه عصبی آن‌ها به‌صورت عمومی برای استفاده، تغییر و توزیع در دسترس است. بنا بر تعریف آندری کارپاتی از OpenAI، چنین مدلی شبیه «ارائه یک فایل باینری سیستم‌عامل» است — کاربران یک محصول کارکردی دریافت می‌کنند، اما معمولاً بدون دسترسی به کد منبع آموزش یا داده‌های آموزشی.

ویژگی‌های کلیدی:

  • استقرار محلی: امکان اجرای مدل روی سخت‌افزار خود کاربر، با تضمین کنترل کامل بر داده‌ها و حفظ حریم خصوصی.
  • تنظیم دقیق (Fine-tuning): امکان تطبیق مدل برای وظایف و حوزه‌های خاص.
  • شفافیت و ممیزی: پژوهشگران می‌توانند مکانیزم‌های درونی مدل را برای شناسایی سوگیری‌ها و آسیب‌پذیری‌ها بررسی کنند.

مدل‌های Closed-weight (با وزن‌های بسته)

مدل‌های Closed-weight (که به مدل‌های اختصاصی نیز شناخته می‌شوند) — سیستم‌هایی هستند که پارامترهای آن‌ها اسرار تجاری محسوب شده و تنها از طریق API یا مجوزهای محدود در دسترس است. شرکت‌های توسعه‌دهنده‌ای مانند OpenAI و Anthropic کنترل کامل معماری، روش‌های آموزش و مکانیزم‌های استنتاج را در اختیار دارند. در گزارش فنی GPT-4 صراحتاً به عدم افشای جزئیات اشاره شده است، «با توجه به محیط رقابتی و پیامدهای امنیتی مدل‌های در مقیاس بزرگ»[3].

ویژگی‌های کلیدی:

  • کنترل متمرکز: توسعه‌دهنده به‌روزرسانی‌ها، امنیت و سیاست‌های استفاده را مدیریت می‌کند.
  • سهولت استفاده: دسترسی از طریق API نیاز کاربران به مدیریت زیرساخت پیچیده را برطرف می‌کند.
  • ناشفافیت: عدم دسترسی به مکانیزم‌های درونی، ممیزی مستقل را ناممکن ساخته و درک علل پاسخ‌های نادرست یا سوگیرانه را دشوار می‌کند.

تفاوت با Open-source

تمایز میان اصطلاحات open-weight و open-source اهمیت دارد. یک مدل واقعی open-source انتشار تمام مصنوعات لازم برای بازتولید را در بر می‌گیرد: وزن‌ها، معماری، کد آموزش و مجموعه داده‌ها. اکثر مدل‌های «باز» امروزی، مانند Llama از Meta، open-weight هستند اما کاملاً open-source نیستند، چرا که داده‌های آموزشی و روش‌های دقیق تمرین آن‌ها همچنان بسته می‌ماند.

تحلیل مقایسه‌ای: عملکرد، هزینه و نوآوری

عملکرد و سفارشی‌سازی

تاریخاً مدل‌های closed-weight مانند GPT-4 در benchmark های عمومی پیشتاز بوده‌اند. با این حال شکاف عملکردی به‌سرعت در حال کاهش است. بنا بر داده‌های Stanford AI Index 2025، این شکاف در طول یک سال گذشته از ۸٪ به ۱.۷٪ کاهش یافته است[1]. مدل‌های open-weight قدرتمندی مانند LLaMA 3.1 405B از Meta و DeepSeek-V3 نتایج مقایسه‌پذیر و در برخی وظایف (به‌ویژه برنامه‌نویسی) حتی برتر را به نمایش می‌گذارند[4].

مزیت کلیدی مدل‌های open-weight در سفارشی‌سازی عمیق نهفته است. امکان fine-tuning بر روی داده‌های خاص به آن‌ها اجازه می‌دهد در حوزه‌های محدودی مانند پزشکی یا حقوق، از مدل‌های بزرگ‌تر اما عمومی‌تر closed-weight پیشی بگیرند.

جنبه‌های اقتصادی

  • هزینه آموزش: ایجاد مدل‌های پیشرفته (frontier) بسیار گران است. هزینه آموزش GPT-4 بیش از ۱۰۰ میلیون دلار برآورد می‌شود. مدل‌های open-weight مانند DeepSeek-V3 با هزینه‌ای معادل ۵.۵ میلیون دلار به عملکرد مشابهی دست می‌یابند و دسترسی به ساخت سیستم‌های قدرتمند را دموکراتیزه می‌کنند.
  • هزینه استفاده (استنتاج): مدل‌های closed-weight با مدل pay-per-use از طریق API تعرفه‌گذاری می‌شوند که در حجم‌های بالا می‌تواند هزینه‌بر باشد. مدل‌های open-weight که به‌صورت محلی مستقر می‌شوند به سرمایه‌گذاری اولیه در زیرساخت نیاز دارند، اما هزینه کل مالکیت (TCO) در مقیاس‌پذیری به‌طور قابل توجهی پایین‌تر است.

تأثیر بر پژوهش علمی و نوآوری

مدل‌های open-weight به‌طور بنیادی پژوهش علمی را با تضمین بازتولیدپذیری و دموکراتیزه کردن دسترسی متحول می‌کنند. پژوهشگران در سراسر جهان می‌توانند مدل‌های باز را تحلیل، نقد و بهبود بخشند که این امر اکوسیستمی پویا ایجاد کرده و پیشرفت را شتاب می‌دهد. در مقابل، مدل‌های بسته «بحران بازتولیدپذیری» ایجاد می‌کنند، زیرا نتایج اعلام‌شده را نمی‌توان به‌صورت مستقل تأیید کرد.

امنیت و معضلات اخلاقی

مسئله امنیت معضل محوری در مناظره میان بازبودن و کنترل است.

  • رویکرد Closed-weight (پیشگیری متمرکز): توسعه‌دهندگانی مانند OpenAI و Anthropic رویکرد پیشگیرانه اتخاذ می‌کنند. آن‌ها فیلترهای امنیتی پیچیده پیاده‌سازی کرده، red teaming فشرده انجام می‌دهند و به سیاست‌های سختگیرانه‌ای مانند Responsible Scaling Policy از Anthropic پایبند هستند و متعهد می‌شوند مدل‌هایی را که از آستانه‌های خطر مشخصی فراتر می‌روند مستقر نکنند[5].
  • رویکرد Open-weight (مقاومت غیرمتمرکز): این فلسفه، مشابه دنیای open-source، بر این اصل استوار است که «چشم‌های بسیار همه خطاها را کوچک می‌کنند». جامعه می‌تواند آسیب‌پذیری‌ها را سریع‌تر بیابد و برطرف کند. با این حال این امر خطراتی نیز ایجاد می‌کند: بدخواهان می‌توانند به همان سهولت مدل‌ها را برای یافتن آسیب‌پذیری‌ها بررسی کرده یا از طریق fine-tuning مکانیزم‌های حفاظتی را حذف کنند.

پژوهش‌ها نشان می‌دهند که قصد انسانی، نه دسترس‌پذیری مدل، عامل اصلی خطر است. ۹۰٪ موارد مستند سوءاستفاده از هوش مصنوعی مولد با بهره‌برداری از قابلیت‌های مجاز مرتبط است، نه با آسیبی که خود سیستم‌ها تولید می‌کنند.

رویکردهای نظارتی: اتحادیه اروپا و ایالات متحده

  • قانون هوش مصنوعی اتحادیه اروپا: رویکردی پیشگیرانه و مبتنی بر ریسک اتخاذ می‌کند. این قانون تعهدات سختگیرانه‌ای برای مدل‌های دارای «ریسک سیستمیک» (که برای آموزش به بیش از ۱۰۲۵ flops نیاز دارند) وضع می‌کند، اما برای مدل‌های open-source که چنین ریسکی ندارند استثنائات محدودی در نظر می‌گیرد. این امر انگیزه‌ای برای شفافیت ایجاد می‌کند، اما پیچیدگی نظارتی نیز به همراه دارد.
  • رویکرد ایالات متحده: بر تشویق نوآوری و مدیریت ریسک از طریق استانداردهای صنعتی استوار است. دستور اجرایی رئیس‌جمهور بایدن ۱۴۱۱۰ و گزارش بعدی NTIA توصیه می‌کنند از اعمال فوری محدودیت بر مدل‌های open-weight خودداری شود و در عوض سیستمی برای پایش جهت تصمیم‌گیری مبتنی بر داده‌های واقعی ایجاد گردد[6].

مدل‌ها و بازیگران کلیدی

جدول مقایسه‌ای مدل‌های پیشرو Open-weight و Closed-weight
نوع مدل مدل توسعه‌دهنده ویژگی کلیدی
Open-weight LLaMA 3.1 Meta عملکرد بالا که استاندارد مدل‌های باز را تعریف کرده؛ جامعه بزرگ.
Mixtral 8x7B Mistral AI معماری «ترکیب متخصصان» (MoE) که عملکرد بالا را با هزینه پایین استنتاج فراهم می‌کند.
Closed-weight GPT-4 / GPT-4o OpenAI رهبر تاریخی عملکرد، قابلیت‌های چندوجهی قوی.
Claude 4 Opus Anthropic تمرکز بر امنیت و اخلاق (Constitutional AI)، پنجره متنی بزرگ.

پیوندها

  • Stanford AI Index Report 2025 — گزارش سالانه وضعیت هوش مصنوعی.
  • گزارش NTIA درباره مدل‌های با وزن‌های باز

منابع

  • OpenAI et al. (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv:2307.09288.
  • DeepSeek-AI (2025). DeepSeek-V3 Technical Report. arXiv:2412.19437.
  • Kapoor, S.; Bommasani, R. et al. (2024). On the Societal Impact of Open Foundation Models. arXiv:2403.07918.
  • U.S. NTIA (2024). Dual-Use Foundation Models with Widely Available Model Weights. NTIA Report.
  • Stanford HAI (2025). Artificial Intelligence Index Report 2025. Full PDF.
  • Anthropic (2023). Responsible Scaling Policy. Anthropiс RSP.
  • Klyman, K. et al. (2024). A Design Framework for Open-Source Foundation Model Safety. arXiv:2406.10415.
  • Kembery, E.; Reed, T. (2024). AI Safety Frameworks Should Include Procedure for Model Access Decisions. arXiv:2411.10547.
  • European Commission (2024). General-Purpose AI Models in the AI Act – Q&A. EU AI Act FAQ.
  • Zhang, X. et al. (2025). Mitigating Cyber Risk in the Age of Open-Weight LLMs. arXiv:2505.17109.
  • Biderman, S. et al. (2024). Risks and Opportunities of Open-Source Generative AI. arXiv:2405.08597.

یادداشت‌ها

  1. 1.0 1.1 «Artificial Intelligence Index Report 2025». Stanford University HAI. [۱] Проверено 4 июля 2025.
  2. Karpathy, Andrej. «On Open-sourcing LLMs». X (formerly Twitter).
  3. «GPT-4 Technical Report». OpenAI. [۲]
  4. «DeepSeek-V2 and DeepSeek-Coder-V2 Technical Report».
  5. «Anthropic's Responsible Scaling Policy». Anthropic.
  6. «Dual-Use Foundation Models with Widely Available Model Weights». U.S. Department of Commerce, NTIA. (2024).