Grok (xAI) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Grok — خانواده‌ای از مدل‌های زبانی بزرگ (LLM) چندوجهی و یک چت‌بات است که توسط شرکت xAI بنیان‌گذاری‌شده توسط ایلان ماسک توسعه یافته است. Grok به عنوان یک «مدل مرزی» (frontier model) معرفی می‌شود که در پی «درک ماهیت واقعی هستی» بوده و جایگزینی برای سیستم‌های هوش مصنوعی موجود ارائه می‌دهد که به باور ماسک «بیش از حد سیاسی‌کارانه» هستند[1][2].

ویژگی‌های کلیدی Grok عبارتند از: یکپارچگی عمیق با شبکه اجتماعی X برای دریافت اطلاعات در زمان واقعی، و نیز شخصیت ادعایی «سرکش» در پاسخ‌ها همراه با عناصری از شوخ‌طبعی و کنایه، که آن را از رقبای محتاط‌تر متمایز می‌سازد[3]. پایه فناورانه Grok شامل معماری Mixture-of-Experts (MoE) برای نسخه اول و آموزش بر روی یکی از قدرتمندترین ابررایانه‌های جهان — Colossus — برای نسخه‌های بعدی است.

تاریخچه و سیر تکامل

تکامل خانواده Grok با سرعتی چشمگیر مشخص می‌شود — از نمونه اولیه تا مدل پیشرو رقیب برترین‌های بازار، کمتر از دو سال طول کشید.

  • تیر تا مهر ۱۴۰۲ (ژوئیه تا اکتبر ۲۰۲۳): تأسیس xAI و توسعه شتاب‌زده نمونه اولیه. به گفته ماسک، آموزش نسخه اول تنها دو ماه طول کشید[4].
  • آبان ۱۴۰۲ (نوامبر ۲۰۲۳): انتشار بتای اولیه Grok-1. دسترسی به مشترکان سطح عالی X Premium+ داده شد. مدل به عنوان «محصولی بسیار اولیه» با سبک پاسخ‌دهی غیرمعمول معرفی شد[5].
  • اسفند ۱۴۰۲ (مارس ۲۰۲۴): xAI کد منبع و وزن‌های Grok-1 را تحت مجوز Apache 2.0 منتشر کرد و آن را به بزرگ‌ترین LLM متن‌باز آن زمان با ۳۱۴ میلیارد پارامتر تبدیل نمود[6]. در اواخر همان ماه، Grok-1.5 با استدلال بهبودیافته و پنجره زمینه افزایش‌یافته تا ۱۲۸٬۰۰۰ token معرفی شد[7].
  • فروردین ۱۴۰۳ (آوریل ۲۰۲۴): اولین نسخه چندوجهی — Grok-1.5 Vision — معرفی شد که قادر به تحلیل تصاویر و اسناد است. این مدل برتری بر GPT-4V در benchmark معروف به RealWorldQA را نشان داد، اما به صورت عمومی منتشر نشد[8].
  • مرداد ۱۴۰۳ (اوت ۲۰۲۴): انتشار Grok-2 و نسخه سبک‌تر آن Grok-2 mini. نوآوری اصلی، قابلیت تولید تصویر با استفاده از مدل FLUX.1 بود. کاربران متوجه شدند که Grok-2 تصاویر را با محدودیت‌های کمتری نسبت به رقبا تولید می‌کند (برای مثال، می‌تواند چهره سیاستمداران واقعی را ترسیم کند)[9][10].
  • پاییز ۱۴۰۳ (پاییز ۲۰۲۴): Grok-2 مجموعه‌ای از به‌روزرسانی‌ها دریافت کرد: درک تصویر (اکتبر)، جستجوی وب (نوامبر) و تحلیل فایل‌های PDF (نوامبر). در دسامبر، xAI مدل تولید تصویر اختصاصی خود به نام Aurora را معرفی کرد[8]. دسترسی به چت‌بات برای تمام کاربران X تا حدودی رایگان شد[11].
  • بهمن ۱۴۰۳ (فوریه ۲۰۲۵): انتشار مدل پیشرو Grok-3. این مدل که بر روی ابررایانه Colossus آموزش دیده، به ادعای xAI در برخی آزمون‌های دشوار (مانند AIME 2025) از GPT-4 پیشی گرفته است. حالت‌های منحصربه‌فردی مانند «Think» (استدلال عمیق‌تر) و DeepSearch (جستجوی گسترده وب) معرفی شدند[12].
  • بهار ۱۴۰۴ (بهار ۲۰۲۵): xAI دسترسی به Grok-3 را گسترش داد، API را برای توسعه‌دهندگان باز کرد و یکپارچه‌سازی با پلتفرم ابری Microsoft Azure و پیام‌رسان Telegram را اعلام نمود[13][14].

ویژگی‌های فنی و معماری

معماری و پارامترها

نسخه اول، Grok-1، بر اساس معماری Mixture-of-Experts (MoE) با حجم کلی ۳۱۴ میلیارد پارامتر ساخته شده است. این مدل از ۸ متخصص (expert) تشکیل شده که ۲ تای آن‌ها برای هر token فعال می‌شوند، که آن را از نظر محاسباتی برای مقیاسش کارآمد می‌سازد[15]. حداکثر زمینه مدل اصلی ۸۱۹۲ token بود.

نسخه‌های بعدی، Grok-1.5 و Grok-3، تکامل قابل توجهی داشتند. پنجره زمینه (context window) در Grok-1.5 به ۱۲۸٬۰۰۰ token و در Grok-3 به ۱ میلیون token افزایش یافت که از بزرگ‌ترین مقادیر در صنعت است[16]. تعداد دقیق پارامترهای Grok-3 فاش نشده، اما برخی تخمین‌ها آن را تا ۲.۷ تریلیون ذکر می‌کنند[17].

چندوجهی بودن و استدلال

از Grok-1.5V به بعد، مدل‌ها چندوجهی (multimodal) شدند. Grok-3 از چرخه کامل تعامل بصری پشتیبانی می‌کند: درک تصاویر، ویرایش آن‌ها بر اساس توضیح متنی و تولید تصاویر جدید.

xAI توجه ویژه‌ای به بهبود reasoning (استنتاج منطقی) دارد. در Grok-2 مکانیزم‌هایی برای جستجوی مستقل اطلاعات ناقص پیاده‌سازی شد. در Grok-3 این رویکرد در قالب حالت "Think" (همچنین با نام Big Brain Mode) توسعه یافت. با فعال‌سازی این حالت، مدل محاسبات اضافه‌ای به کار می‌گیرد، چندین راه‌حل احتمالی تولید می‌کند، از زنجیره‌های استدلالی طولانی‌تر (Chain-of-Thought) استفاده می‌نماید و خود را از نظر تناقض بررسی می‌کند. این امر به کاربر اجازه می‌دهد بین پاسخ سریع و پاسخ دقیق‌تر اما کندتر انتخاب کند[18].

آموزش و داده‌ها

Grok بر اساس ترکیبی از داده‌های عمومی (اینترنت، کد، ادبیات) و داده‌های منحصربه‌فرد اکوسیستم ایلان ماسک آموزش می‌بیند. مؤلفه کلیدی، جریان پیوسته داده‌ها از X (Twitter) است که به مدل امکان به‌روز بودن و آگاهی از رویدادهای جاری را می‌دهد. همچنین متون حقوقی و علمی نیز در dataset‌ها گنجانده می‌شوند[8]. این رویکرد از یک سو به Grok مزیت می‌دهد و از سوی دیگر، پرسش‌هایی را در میان نهادهای نظارتی درباره حریم خصوصی داده‌های کاربران مطرح می‌کند[19].

مقایسه با رقبا

مقایسه Grok با رقبای اصلی (ابتدای ۲۰۲۵)
ویژگی Grok (xAI) GPT (OpenAI) Claude (Anthropic) Gemini (Google)
مزیت کلیدی یکپارچگی با X، به‌روز بودن، سبک «سرکش» کیفیت بالا و ثبات پاسخ‌ها، اکوسیستم توسعه‌یافته ایمنی، زمینه بزرگ، تمرکز اخلاقی یکپارچگی با اکوسیستم Google، چندوجهی بودن
حداکثر زمینه ۱٬۰۰۰٬۰۰۰ token (Grok-3) ۱۲۸٬۰۰۰ token (GPT-4o) ۲۰۰٬۰۰۰+ token (Claude 3) ۲٬۰۰۰٬۰۰۰ token (Gemini 2.0 Pro)
تولید تصویر بله (داخلی، مدل Aurora) بله (از طریق DALL·E 3) خیر بله (مدل Imagen)
مجوز ترکیبی (Grok-1 متن‌باز، نسخه‌های جدید اختصاصی) اختصاصی اختصاصی اختصاصی
دسترسی به اطلاعات زمان واقعی بله (به‌صورت بومی از طریق X و جستجوی وب) بله (از طریق افزونه‌ها/مرور وب) خیر (به‌صورت پایه) بله (به‌صورت بومی از طریق جستجوی Google)

یکپارچگی‌ها و اکوسیستم

استراتژی xAI این است که Grok را به یک دستیار هوش مصنوعی همه‌جا حاضر تبدیل کند.

  • پلتفرم X: بستر اصلی که در آن Grok برای پاسخ به سؤالات، خلاصه‌سازی اخبار و اعتدال محتوا استفاده می‌شود.
  • Telegram: در سال ۲۰۲۵ یکپارچه‌سازی کامل Grok در این پیام‌رسان اعلام شد که دسترسی به هوش مصنوعی را برای بیش از یک میلیارد کاربر فراهم می‌کند. ارزش این قرارداد ۳۰۰ میلیون دلار به علاوه ۵۰٪ از سود برآورد شده است[20].
  • Tesla: برنامه‌ریزی شده که Grok به عنوان \u200cدستیار صوتی هوشمند\" (Smart Voice Assistant) در تمام خودروهای Tesla یکپارچه شود. این دستیار به سیستم‌های خودرو دسترسی خواهد داشت و قادر خواهد بود دستورات پیچیده را اجرا کند، زبان طبیعی را بفهمد و اطلاعات اینترنتی ارائه دهد[21].
  • API و مشارکت‌ها: Grok-3 از طریق API برای توسعه‌دهندگان در دسترس است و در ابزارهای محبوب توسعه (Vercel، Cursor) و پلتفرم‌های اتوماسیون (Zapier، Albato) یکپارچه شده است[22].

جدول زمانی انتشارها

جدول زمانی انتشارها و ویژگی‌های کلیدی مدل‌های Grok
مدل تاریخ انتشار پارامترهای مدل ویژگی‌های کلیدی دسترسی و مجوز
Grok-1 ۳ نوامبر ۲۰۲۳
(متن‌باز: ۱۷ مارس ۲۰۲۴)
۳۱۴ میلیارد (MoE) نسخه اول، معماری MoE، زمینه ۸k token. دسترسی اولیه برای X Premium+. بعداً تحت Apache 2.0 منتشر شد.
Grok-1.5 اعلام: ۲۹ مارس ۲۰۲۴
(دسترسی از ۱۵ مه ۲۰۲۴)
~۳۱۴ میلیارد استدلال بهبودیافته، زمینه ۱۲۸٬۰۰۰ token، امتیاز بالا در GSM8K (90٪). اختصاصی. دسترسی برای مشترکان X Premium.
Grok-1.5 Vision اعلام: ۱۲ آوریل ۲۰۲۴ ~۳۱۴ میلیارد + ماژول بصری اولین نسخه چندوجهی، درک تصاویر و نمودارها. به‌صورت عمومی منتشر نشد. دستاوردها در Grok-2 استفاده شد.
Grok-2 ۱۴ اوت ۲۰۲۴ فاش نشده گفتگو و کدنویسی بهبودیافته، تولید تصویر (از طریق Flux.1، سپس Aurora)، چندوجهی بودن بهتر. اختصاصی. دسترسی برای X Premium+، بعداً تا حدودی رایگان.
Grok-3 ۱۷ فوریه ۲۰۲۵ ~۲.۷ تریلیون (تخمین) مدل پیشرو، زمینه ۱ میلیون token، حالت‌های «Think» و «DeepSearch»، قابلیت ویرایش تصویر. اختصاصی. دسترسی از طریق X Premium+، SuperGrok و API.

منابع

  • Shazeer, N. et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Wei, J. et al. (2022). Chain‑of‑Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
  • Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
  • Li, K. et al. (2024). MME‑RealWorld: Could Your Multimodal LLM Challenge High‑Fidelity Real‑World Data?. arXiv:2408.13257.
  • Batifol, S. et al. (2025). FLUX.1 Kontext: Flow Matching for In‑Context Image Generation and Editing in Latent Space. arXiv:2506.15742.
  • Tran, P. et al. (2025). Search Arena: Analyzing Search‑Augmented Large Language Models. arXiv:2506.05334.
  • Suzuki, T.; Ozawa, K. (2025). Resampling Benchmark for Efficient Comprehensive Evaluation of Large Vision‑Language Models. arXiv:2504.09979.

یادداشت‌ها

  1. «What is Elon Musk's Grok 3?». LinkedIn. [۱]
  2. «"Grok, это правда?": насколько можно доверять чат-ботам с ИИ». Deutsche Welle. [۲]
  3. «Grok, an AI chatbot from Elon Musk’s xAI, is coming to X». TechCrunch. [۳]
  4. «Маск признался, что на тренировку нейросети Grok ушло два месяца». РБК. [۴]
  5. «Grok (chatbot)». Wikipedia. [۵]
  6. «Grok open release». GitHub. [۶]
  7. «xAI анонсировала ИИ-модель Grok-1.5». Habr. [۷]
  8. 8.0 8.1 8.2 «Grok (чат-бот)». Википедия. [۸]
  9. «xAI releases Grok-2, adds image generation on X». TechCrunch. [۹]
  10. «Grok-2's image generator has no content rules, for now». Mashable. [۱۰]
  11. «Grok-3: Everything you need to know about this new LLM by xAI». Daily.dev. [۱۱]
  12. «Grok-3 Release». xAI News. [۱۲]
  13. «Grok 3, xAI's latest model, is now available on the API». xAI Blog. [۱۳]
  14. «Дуров и Маск договорились о полной интеграции Grok в Telegram». РБК. [۱۴]
  15. «GitHub - xai-org/grok-1: Grok open release». GitHub. [۱۵]
  16. «Grok-3». xAI. [۱۶]
  17. «Visual Reasoning Evaluation of Grok, Deepseek's Janus, Gemini, Qwen, Mistral, and ChatGPT». arXiv. [۱۷]
  18. «Grok-3 Functions». xAI Blog. [۱۸]
  19. «Irish DPC probes X and xAI over Grok training data». TechCrunch. [۱۹]
  20. «Telegram и xAI Илона Маска заключили стратегическое партнерство». Sostav.ru. [۲۰]
  21. «All Tesla Vehicles to Receive Grok Smart Voice Assistant According to Musk». Not a Tesla App. [۲۱]
  22. «Grok by xAI Integrations». Zapier. [۲۲]