Google's large language models — مدل‌های زبانی بزرگ Google

From Systems analysis Wiki
Jump to navigation Jump to search

مدل‌های زبانی بزرگ Google مجموعه‌ای از مدل‌های زبانی بزرگ (LLM) هستند که توسط بخش‌های مختلف Google، از جمله Google AI (که پیش‌تر Google Brain نام داشت) و DeepMind توسعه یافته‌اند. Google به عنوان یکی از پیشگامان حوزه یادگیری عمیق و معماری Transformer، سهم بنیادینی در توسعه LLMهای مدرن داشته است. تاریخچه توسعه این مدل‌ها مسیری را از سیستم‌های تخصصی درک زبان تا سیستم‌های مقیاس‌پذیر چندوجهی و عاملی (agentic) نشان می‌دهد که پایه بسیاری از محصولات Google را تشکیل می‌دهند و مسیر توسعه کل صنعت هوش مصنوعی را تعیین می‌کنند.

تاریخچه و تکامل مدل‌های Google

دستاوردهای اولیه و ترجمه ماشینی مبتنی بر شبکه عصبی (۲۰۱۱–۲۰۱۶)

پایه‌های توسعه LLM در Google در چارچوب پروژه Google Brain (2011) گذاشته شد که به کاربرد شبکه‌های عصبی عمیق اختصاص داشت. یکی از اولین پیشرفت‌ها الگوریتم Word2Vec (2013) بود که توسط Tomas Mikolov ساخته شد. این الگوریتم امکان نمایش کلمات به صورت بردار (embedding) را فراهم کرد که زمینه معنایی آن‌ها را منعکس می‌ساخت و به روش پایه‌ای برای درک زبان در شبکه‌های عصبی تبدیل شد.

گام بعدی، گذار به مدل‌های دنباله‌ای مانند seq2seq (2014) بود که پایه Google Neural Machine Translation (GNMT) (2016) را شکل داد. مهاجرت Google Translate به معماری مبتنی بر LSTM کیفیت ترجمه ماشینی را به‌طور چشمگیری ارتقا داد. به‌موازات این تحولات، DeepMind — شرکت فرعی که Google در سال 2014 آن را خریداری کرد — با پیروزی سیستم AlphaGo بر قهرمان جهان بازی گو، قدرت یادگیری عمیق را به نمایش گذاشت و اعتقاد به پتانسیل هوش مصنوعی را تقویت کرد.

انقلاب Transformer و تولد BERT (۲۰۱۷–۲۰۱۸)

در سال 2017، پژوهشگران Google Brain معماری Transformer را در مقاله «Attention Is All You Need» معرفی کردند. این معماری که بر مکانیزم self-attention استوار است، امکان پردازش موازی دنباله‌ها را به جای پردازش متوالی فراهم کرد و این خود انقلابی در NLP و پایه‌ای برای تمام LLMهای مدرن شد.

در پی این موفقیت، Google در سال 2018 مدل BERT (Bidirectional Encoder Representations from Transformers) را معرفی کرد. BERT اولین مدل عمیقاً دوسویه بود که زمینه یک کلمه را هم‌زمان از چپ و راست در نظر می‌گرفت. این ویژگی به آن اجازه داد تا در بسیاری از وظایف درک زبان (GLUE، SQuAD) به نتایج رکوردشکنانه دست یابد و استاندارد جدیدی در صنعت تعیین کند. BERT در دو نسخه (BASE با ۱۱۰ میلیون پارامتر و LARGE با ۳۴۰ میلیون پارامتر) با کد و وزن‌های باز منتشر شد که به گسترش فراگیر آن کمک کرد. از سال 2019، BERT در Google Search برای درک بهتر جستجوها به کار گرفته شد.

افزایش مقیاس و دوران مدل‌های گفتگومحور (۲۰۱۹–۲۰۲۲)

پس از BERT، Google به آزمایش‌های بیشتر با مقیاس و معماری ادامه داد:

  • T5 (Text-to-Text Transfer Transformer, 2019): مدلی یکپارچه که هر وظیفه NLP را به صورت تبدیل «متن به متن» در نظر می‌گیرد. T5 که بر روی مجموعه داده عظیم C4 (Colossal Clean Crawled Corpus) آموزش دیده، در چندین اندازه (تا ۱۱ میلیارد پارامتر) به صورت آزاد منتشر شد.
  • Meena (2020): اولین مدل گفتگوی تخصصی Google با ۲٫۶ میلیارد پارامتر که کیفیت بالایی در مکالمات باز نشان داد.
  • LaMDA (Language Model for Dialogue Applications, 2021): خانواده‌ای از مدل‌های گفتگویی (تا ۱۳۷ میلیارد پارامتر) که بر روی مجموعه داده عظیمی از گفتگوها (۱٫۵۶ تریلیون کلمه) آموزش دیده بود. LaMDA هدف ایجاد مکالمات طبیعی‌تر و معنادارتر را دنبال می‌کرد و پس از آن‌که یک مهندس Google ادعای «هوشمندی» آن را مطرح کرد، به شهرت عمومی رسید.
  • Gopher و Chinchilla (DeepMind، ۲۰۲۱–۲۰۲۲): به‌موازات، DeepMind قوانین مقیاس‌پذیری را بررسی کرد. مدل Gopher (۲۸۰ میلیارد پارامتر) نشان داد مقیاس چگونه بر کیفیت تأثیر می‌گذارد. و مدل Chinchilla (۷۰ میلیارد پارامتر) نشان داد که برای عملکرد بهینه، نه حداکثر تعداد پارامترها، بلکه توازن درست میان اندازه مدل و حجم داده‌های آموزشی اهمیت دارد. این نتیجه‌گیری به «قانون Chinchilla» معروف شد و بر استراتژی آموزش LLM در کل صنعت تأثیر گذاشت.

دوران مدل‌های فوق‌بزرگ و چندوجهی (۲۰۲۲–کنون)

  • PaLM (Pathways Language Model, 2022): در زمان اعلام، بزرگ‌ترین مدل متراکم (dense) Google با ۵۴۰ میلیارد پارامتر، آموزش‌دیده بر زیرساخت توزیع‌شده جدید Pathways. PaLM توانایی‌های چشمگیری در استدلال منطقی، به‌ویژه با استفاده از تکنیک Chain-of-Thought (CoT) prompting، از خود نشان داد. بر پایه آن نسخه‌های تخصصی مانند Med-PaLM برای پزشکی ساخته شدند. در سال 2023 نسخه بهبودیافته PaLM 2 (حدود ۳۴۰ میلیارد پارامتر) منتشر شد که پایه چت‌بات به‌روزشده Bard را تشکیل داد.
  • Gemini (2023–کنون): نسل جدیدی از مدل‌ها که توسط تیم ادغام‌یافته Google DeepMind ساخته شده است. Gemini از ابتدا به عنوان سیستمی نیتیو چندوجهی (native multimodal) طراحی شد که قادر به پردازش متن، کد، تصویر، صدا و ویدیو است. در چندین نسخه منتشر شده است:
    • Gemini Ultra: قدرتمندترین مدل برای وظایف پیچیده.
    • Gemini Pro: مدل همه‌کاره برای طیف گسترده‌ای از وظایف.
    • Gemini Nano: مدل فشرده برای اجرا روی دستگاه‌های موبایل.

در سال‌های ۲۰۲۴–۲۰۲۵ این خانواده با نسخه‌های Gemini 1.5 (با پنجره زمینه تا ۱ میلیون token) و Gemini 2.0 که قابلیت‌های عاملی دریافت کرد، گسترش یافت.

معماری و ویژگی‌های فنی

پایه: Encoderها، Decoderها و ترکیب‌های هیبریدی

Google بسته به وظیفه، از انواع مختلف معماری Transformer استفاده می‌کند:

  • Encoderها (Encoder-only): مدل‌هایی مانند BERT. این مدل‌ها کل متن را یکجا پردازش کرده و بازنمایی غنی زمینه‌ای ایجاد می‌کنند. برای وظایف تحلیل و درک متن (طبقه‌بندی، استخراج موجودیت‌ها) ایده‌آل هستند، اما برای تولید متن مناسب نیستند.
  • Decoderها (Decoder-only): مدل‌هایی مانند LaMDA و PaLM (مشابه GPT). این مدل‌ها خودبازگشتی (autoregressive) هستند، یعنی متن را token به token پیش‌بینی می‌کنند. این مدل‌ها تولیدکننده‌های طبیعی هستند و برای ادامه متن، گفتگو و پاسخ به سؤالات بسیار مناسب‌اند.
  • Encoder-Decoderها (Encoder-Decoder): مدل‌هایی مانند T5 و GNMT. این مدل‌ها هر دو بخش را دارند: encoder دنباله ورودی را پردازش می‌کند و decoder دنباله خروجی را تولید می‌کند. این معماری همه‌منظوره برای وظایف تبدیلی مانند ترجمه یا خلاصه‌سازی مناسب است.

مقیاس: پارامترها، داده‌ها و زیرساخت

موفقیت Google در LLM تا حد زیادی به سه عامل بستگی دارد:

  1. مقیاس مدل‌ها: افزایش منظم تعداد پارامترها از میلیون‌ها (BERT) تا صدها میلیارد (PaLM، Gemini).
  2. مقیاس داده‌ها: دسترسی به یکی از بزرگ‌ترین مجموعه‌های داده جهان (فهرست وب Google، YouTube، Google Books) که امکان آموزش مدل‌ها روی تریلیون‌ها token را فراهم می‌کند.
  3. زیرساخت: استفاده از تراشه‌های تخصصی داخلی — Tensor Processing Unit (TPU) — و سیستم توزیع‌شده Pathways، که آموزش کارآمد و پایدار مدل‌های فوق‌بزرگ را ممکن می‌سازند.

چندوجهی بودن و عاملیت

جدیدترین مدل‌های Google، به‌ویژه Gemini، به سمت چندوجهی بودن عمیق و عاملیت (agentic) حرکت می‌کنند.

  • چندوجهی بودن نیتیو به این معناست که یک مدل از ابتدا برای درک و ترکیب انواع مختلف داده (متن، تصویر، صدا) آموزش دیده، نه صرفاً اتصال ماژول‌های جداگانه به یکدیگر.
  • عاملیت (Agentic AI) — توانایی مدل است که نه‌تنها به درخواست‌ها پاسخ دهد، بلکه به‌صورت مستقل برنامه‌ریزی کرده و مجموعه‌ای از اقدامات را برای رسیدن به هدف اجرا کند (مثلاً فراخوانی ابزارهای خارجی مانند جستجو یا ماشین‌حساب).

جدول خلاصه مدل‌های کلیدی

مقایسه مدل‌های اصلی زبانی Google
مدل سال انتشار پارامترها (تخمین) معماری ویژگی‌های کلیدی
BERT 2018 ۱۱۰–۳۴۰ میلیون Encoder درک دوسویه زمینه، SOTA در وظایف NLP.
T5 2019 ۶۰ میلیون – ۱۱ میلیارد Encoder-Decoder رویکرد یکپارچه «متن به متن» برای تمام وظایف.
LaMDA 2021 ۱۳۷ میلیارد Decoder تخصص در مکالمات باز و معنادار.
PaLM 2022 ۵۴۰ میلیارد Decoder پیشرفت در استدلال منطقی (Chain-of-Thought)، آموزش در مقیاس بزرگ.
Chinchilla 2022 ۷۰ میلیارد Decoder مدل «Compute-optimal» که اهمیت توازن داده‌ها و پارامترها را اثبات کرد.
Gemini 1.0 2023 تا ~۱ تریلیون (Ultra) چندوجهی (احتمالاً MoE) چندوجهی بودن نیتیو، SOTA در بسیاری از benchmark‌ها (MMLU).
Gemini 1.5 2024 فاش نشده چندوجهی (MoE) پنجره زمینه تا ۱-۲ میلیون token، کارایی بالا.
Gemini 2.0 2024 فاش نشده چندوجهی + Tools قابلیت‌های عاملی داخلی، تولید تصویر/صدا.

کاربرد در محصولات و اکوسیستم

Google به‌فعالی LLMهای خود را در تمام محصولاتش ادغام می‌کند:

  • Google Search: BERT، MUM و Gemini برای درک بهتر جستجوهای پیچیده و ارائه پاسخ‌های مستقیم در قالب AI Overviews (که پیش‌تر SGE نام داشت) به کار می‌روند.
  • Google Assistant و Bard (اکنون Gemini): گذار از دستورات صوتی ساده به دستیارهای گفتگومحور کامل مبتنی بر LaMDA، PaLM 2 و Gemini.
  • Google Workspace: ویژگی‌های Duet AI (اکنون Gemini for Workspace) در نوشتن ایمیل در Gmail، ایجاد متن در Docs و تولید ارائه در Slides کمک می‌کنند.
  • Android: Gemini Nano اجرای قابلیت‌های هوش مصنوعی را به‌صورت محلی روی دستگاه‌هایی مانند Pixel تأمین می‌کند تا حریم خصوصی و سرعت افزایش یابد.
  • Google Cloud AI: پلتفرم Vertex AI از طریق API دسترسی شرکت‌ها به مدل‌های PaLM و Gemini را برای ساخت برنامه‌های کاربردی خود فراهم می‌کند.

نقش در فضای رقابتی

Google یکی از بازیگران اصلی «مسابقه هوش مصنوعی» است که در آن رقبای اصلی‌اش OpenAI (با حمایت Microsoft) و Meta هستند.

  • رقابت با OpenAI: اگرچه Google در بسیاری از فناوری‌های بنیادی (از جمله Transformer) پیشگام بود، راه‌اندازی ChatGPT در اواخر سال 2022 Google را وادار کرد تا روند عرضه محصولاتش را (مثلاً Bard) شتاب دهد. رقابت در زمینه کیفیت مدل‌ها (Gemini Ultra در برابر GPT-4)، اندازه پنجره زمینه و کاربرپسندی API در جریان است.
  • تمایز با Meta: Meta بر متن‌باز بودن (مدل‌های LLaMA) تمرکز کرده و جایگزین قدرتمندی در برابر مدل‌های بسته Google و OpenAI ایجاد کرده است. در پاسخ به این موضع، Google نیز شروع به انتشار مدل‌های باز مانند Gemma کرد تا جامعه توسعه‌دهندگان را حمایت کند و اکوسیستم را به Meta واگذار نکند.
  • اتحادهای استراتژیک: Google در بازیگران دیگری سرمایه‌گذاری می‌کند، از جمله استارتاپ Anthropic (سازندگان مدل Claude)، تا رویکردها را متنوع سازد و جایگاه خود را در رقابت ابری تقویت کند.

پیوندها

  • درگاه رسمی Google AI
  • وب‌سایت رسمی Google DeepMind

منابع

  • Vaswani, A. et al. (2017). Attention Is All You Need. NIPS.
  • Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL.
  • Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. JMLR.
  • Thoppilan, R. et al. (2022). LaMDA: Language Models for Dialog Applications. arXiv:2201.08239.
  • Hoffmann, R. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. JMLR.
  • Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.