Open-weight and closed-weight models — مدلهای با وزنهای باز و بسته
مدلهای Open-weight و Closed-weight — دو رویکرد بنیادی متفاوت در توسعه و توزیع مدلهای زبانی بزرگ (LLM) هستند که دوگانهای کلیدی در اکوسیستم امروزی هوش مصنوعی را شکل میدهند. انتخاب میان این دو رویکرد بر قابلیتهای فنی، اقتصاد، امنیت و آینده توسعه هوش مصنوعی تأثیر میگذارد[1].
تفاوت اصلی در دسترسپذیری پارامترهای آموزشدیده (وزنها) مدل نهفته است. مدلهای Open-weight وزنهای خود را منتشر میکنند و به جامعه اجازه میدهند آنها را استفاده، تغییر و بهصورت محلی مستقر کنند. مدلهای Closed-weight در مقابل، وزنها را محرمانه نگه میدارند و دسترسی به قابلیتهای خود را تنها از طریق API های اختصاصی فراهم میکنند[2].
تعاریف و تفاوتهای کلیدی
مدلهای Open-weight (با وزنهای باز)
مدلهای Open-weight — سیستمهایی هستند که پارامترهای آموزشدیده (وزنهای) شبکه عصبی آنها بهصورت عمومی برای استفاده، تغییر و توزیع در دسترس است. بنا بر تعریف آندری کارپاتی از OpenAI، چنین مدلی شبیه «ارائه یک فایل باینری سیستمعامل» است — کاربران یک محصول کارکردی دریافت میکنند، اما معمولاً بدون دسترسی به کد منبع آموزش یا دادههای آموزشی.
ویژگیهای کلیدی:
- استقرار محلی: امکان اجرای مدل روی سختافزار خود کاربر، با تضمین کنترل کامل بر دادهها و حفظ حریم خصوصی.
- تنظیم دقیق (Fine-tuning): امکان تطبیق مدل برای وظایف و حوزههای خاص.
- شفافیت و ممیزی: پژوهشگران میتوانند مکانیزمهای درونی مدل را برای شناسایی سوگیریها و آسیبپذیریها بررسی کنند.
مدلهای Closed-weight (با وزنهای بسته)
مدلهای Closed-weight (که به مدلهای اختصاصی نیز شناخته میشوند) — سیستمهایی هستند که پارامترهای آنها اسرار تجاری محسوب شده و تنها از طریق API یا مجوزهای محدود در دسترس است. شرکتهای توسعهدهندهای مانند OpenAI و Anthropic کنترل کامل معماری، روشهای آموزش و مکانیزمهای استنتاج را در اختیار دارند. در گزارش فنی GPT-4 صراحتاً به عدم افشای جزئیات اشاره شده است، «با توجه به محیط رقابتی و پیامدهای امنیتی مدلهای در مقیاس بزرگ»[3].
ویژگیهای کلیدی:
- کنترل متمرکز: توسعهدهنده بهروزرسانیها، امنیت و سیاستهای استفاده را مدیریت میکند.
- سهولت استفاده: دسترسی از طریق API نیاز کاربران به مدیریت زیرساخت پیچیده را برطرف میکند.
- ناشفافیت: عدم دسترسی به مکانیزمهای درونی، ممیزی مستقل را ناممکن ساخته و درک علل پاسخهای نادرست یا سوگیرانه را دشوار میکند.
تفاوت با Open-source
تمایز میان اصطلاحات open-weight و open-source اهمیت دارد. یک مدل واقعی open-source انتشار تمام مصنوعات لازم برای بازتولید را در بر میگیرد: وزنها، معماری، کد آموزش و مجموعه دادهها. اکثر مدلهای «باز» امروزی، مانند Llama از Meta، open-weight هستند اما کاملاً open-source نیستند، چرا که دادههای آموزشی و روشهای دقیق تمرین آنها همچنان بسته میماند.
تحلیل مقایسهای: عملکرد، هزینه و نوآوری
عملکرد و سفارشیسازی
تاریخاً مدلهای closed-weight مانند GPT-4 در benchmark های عمومی پیشتاز بودهاند. با این حال شکاف عملکردی بهسرعت در حال کاهش است. بنا بر دادههای Stanford AI Index 2025، این شکاف در طول یک سال گذشته از ۸٪ به ۱.۷٪ کاهش یافته است[1]. مدلهای open-weight قدرتمندی مانند LLaMA 3.1 405B از Meta و DeepSeek-V3 نتایج مقایسهپذیر و در برخی وظایف (بهویژه برنامهنویسی) حتی برتر را به نمایش میگذارند[4].
مزیت کلیدی مدلهای open-weight در سفارشیسازی عمیق نهفته است. امکان fine-tuning بر روی دادههای خاص به آنها اجازه میدهد در حوزههای محدودی مانند پزشکی یا حقوق، از مدلهای بزرگتر اما عمومیتر closed-weight پیشی بگیرند.
جنبههای اقتصادی
- هزینه آموزش: ایجاد مدلهای پیشرفته (frontier) بسیار گران است. هزینه آموزش GPT-4 بیش از ۱۰۰ میلیون دلار برآورد میشود. مدلهای open-weight مانند DeepSeek-V3 با هزینهای معادل ۵.۵ میلیون دلار به عملکرد مشابهی دست مییابند و دسترسی به ساخت سیستمهای قدرتمند را دموکراتیزه میکنند.
- هزینه استفاده (استنتاج): مدلهای closed-weight با مدل pay-per-use از طریق API تعرفهگذاری میشوند که در حجمهای بالا میتواند هزینهبر باشد. مدلهای open-weight که بهصورت محلی مستقر میشوند به سرمایهگذاری اولیه در زیرساخت نیاز دارند، اما هزینه کل مالکیت (TCO) در مقیاسپذیری بهطور قابل توجهی پایینتر است.
تأثیر بر پژوهش علمی و نوآوری
مدلهای open-weight بهطور بنیادی پژوهش علمی را با تضمین بازتولیدپذیری و دموکراتیزه کردن دسترسی متحول میکنند. پژوهشگران در سراسر جهان میتوانند مدلهای باز را تحلیل، نقد و بهبود بخشند که این امر اکوسیستمی پویا ایجاد کرده و پیشرفت را شتاب میدهد. در مقابل، مدلهای بسته «بحران بازتولیدپذیری» ایجاد میکنند، زیرا نتایج اعلامشده را نمیتوان بهصورت مستقل تأیید کرد.
امنیت و معضلات اخلاقی
مسئله امنیت معضل محوری در مناظره میان بازبودن و کنترل است.
- رویکرد Closed-weight (پیشگیری متمرکز): توسعهدهندگانی مانند OpenAI و Anthropic رویکرد پیشگیرانه اتخاذ میکنند. آنها فیلترهای امنیتی پیچیده پیادهسازی کرده، red teaming فشرده انجام میدهند و به سیاستهای سختگیرانهای مانند Responsible Scaling Policy از Anthropic پایبند هستند و متعهد میشوند مدلهایی را که از آستانههای خطر مشخصی فراتر میروند مستقر نکنند[5].
- رویکرد Open-weight (مقاومت غیرمتمرکز): این فلسفه، مشابه دنیای open-source، بر این اصل استوار است که «چشمهای بسیار همه خطاها را کوچک میکنند». جامعه میتواند آسیبپذیریها را سریعتر بیابد و برطرف کند. با این حال این امر خطراتی نیز ایجاد میکند: بدخواهان میتوانند به همان سهولت مدلها را برای یافتن آسیبپذیریها بررسی کرده یا از طریق fine-tuning مکانیزمهای حفاظتی را حذف کنند.
پژوهشها نشان میدهند که قصد انسانی، نه دسترسپذیری مدل، عامل اصلی خطر است. ۹۰٪ موارد مستند سوءاستفاده از هوش مصنوعی مولد با بهرهبرداری از قابلیتهای مجاز مرتبط است، نه با آسیبی که خود سیستمها تولید میکنند.
رویکردهای نظارتی: اتحادیه اروپا و ایالات متحده
- قانون هوش مصنوعی اتحادیه اروپا: رویکردی پیشگیرانه و مبتنی بر ریسک اتخاذ میکند. این قانون تعهدات سختگیرانهای برای مدلهای دارای «ریسک سیستمیک» (که برای آموزش به بیش از ۱۰۲۵ flops نیاز دارند) وضع میکند، اما برای مدلهای open-source که چنین ریسکی ندارند استثنائات محدودی در نظر میگیرد. این امر انگیزهای برای شفافیت ایجاد میکند، اما پیچیدگی نظارتی نیز به همراه دارد.
- رویکرد ایالات متحده: بر تشویق نوآوری و مدیریت ریسک از طریق استانداردهای صنعتی استوار است. دستور اجرایی رئیسجمهور بایدن ۱۴۱۱۰ و گزارش بعدی NTIA توصیه میکنند از اعمال فوری محدودیت بر مدلهای open-weight خودداری شود و در عوض سیستمی برای پایش جهت تصمیمگیری مبتنی بر دادههای واقعی ایجاد گردد[6].
مدلها و بازیگران کلیدی
| نوع مدل | مدل | توسعهدهنده | ویژگی کلیدی |
|---|---|---|---|
| Open-weight | LLaMA 3.1 | Meta | عملکرد بالا که استاندارد مدلهای باز را تعریف کرده؛ جامعه بزرگ. |
| Mixtral 8x7B | Mistral AI | معماری «ترکیب متخصصان» (MoE) که عملکرد بالا را با هزینه پایین استنتاج فراهم میکند. | |
| Closed-weight | GPT-4 / GPT-4o | OpenAI | رهبر تاریخی عملکرد، قابلیتهای چندوجهی قوی. |
| Claude 4 Opus | Anthropic | تمرکز بر امنیت و اخلاق (Constitutional AI)، پنجره متنی بزرگ. |
پیوندها
- Stanford AI Index Report 2025 — گزارش سالانه وضعیت هوش مصنوعی.
- گزارش NTIA درباره مدلهای با وزنهای باز
منابع
- OpenAI et al. (2023). GPT-4 Technical Report. arXiv:2303.08774.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv:2307.09288.
- DeepSeek-AI (2025). DeepSeek-V3 Technical Report. arXiv:2412.19437.
- Kapoor, S.; Bommasani, R. et al. (2024). On the Societal Impact of Open Foundation Models. arXiv:2403.07918.
- U.S. NTIA (2024). Dual-Use Foundation Models with Widely Available Model Weights. NTIA Report.
- Stanford HAI (2025). Artificial Intelligence Index Report 2025. Full PDF.
- Anthropic (2023). Responsible Scaling Policy. Anthropiс RSP.
- Klyman, K. et al. (2024). A Design Framework for Open-Source Foundation Model Safety. arXiv:2406.10415.
- Kembery, E.; Reed, T. (2024). AI Safety Frameworks Should Include Procedure for Model Access Decisions. arXiv:2411.10547.
- European Commission (2024). General-Purpose AI Models in the AI Act – Q&A. EU AI Act FAQ.
- Zhang, X. et al. (2025). Mitigating Cyber Risk in the Age of Open-Weight LLMs. arXiv:2505.17109.
- Biderman, S. et al. (2024). Risks and Opportunities of Open-Source Generative AI. arXiv:2405.08597.
یادداشتها
- ↑ 1.0 1.1 «Artificial Intelligence Index Report 2025». Stanford University HAI. [۱] Проверено 4 июля 2025.
- ↑ Karpathy, Andrej. «On Open-sourcing LLMs». X (formerly Twitter).
- ↑ «GPT-4 Technical Report». OpenAI. [۲]
- ↑ «DeepSeek-V2 and DeepSeek-Coder-V2 Technical Report».
- ↑ «Anthropic's Responsible Scaling Policy». Anthropic.
- ↑ «Dual-Use Foundation Models with Widely Available Model Weights». U.S. Department of Commerce, NTIA. (2024).