Google's large language models — مدلهای زبانی بزرگ Google
مدلهای زبانی بزرگ Google مجموعهای از مدلهای زبانی بزرگ (LLM) هستند که توسط بخشهای مختلف Google، از جمله Google AI (که پیشتر Google Brain نام داشت) و DeepMind توسعه یافتهاند. Google به عنوان یکی از پیشگامان حوزه یادگیری عمیق و معماری Transformer، سهم بنیادینی در توسعه LLMهای مدرن داشته است. تاریخچه توسعه این مدلها مسیری را از سیستمهای تخصصی درک زبان تا سیستمهای مقیاسپذیر چندوجهی و عاملی (agentic) نشان میدهد که پایه بسیاری از محصولات Google را تشکیل میدهند و مسیر توسعه کل صنعت هوش مصنوعی را تعیین میکنند.
تاریخچه و تکامل مدلهای Google
دستاوردهای اولیه و ترجمه ماشینی مبتنی بر شبکه عصبی (۲۰۱۱–۲۰۱۶)
پایههای توسعه LLM در Google در چارچوب پروژه Google Brain (2011) گذاشته شد که به کاربرد شبکههای عصبی عمیق اختصاص داشت. یکی از اولین پیشرفتها الگوریتم Word2Vec (2013) بود که توسط Tomas Mikolov ساخته شد. این الگوریتم امکان نمایش کلمات به صورت بردار (embedding) را فراهم کرد که زمینه معنایی آنها را منعکس میساخت و به روش پایهای برای درک زبان در شبکههای عصبی تبدیل شد.
گام بعدی، گذار به مدلهای دنبالهای مانند seq2seq (2014) بود که پایه Google Neural Machine Translation (GNMT) (2016) را شکل داد. مهاجرت Google Translate به معماری مبتنی بر LSTM کیفیت ترجمه ماشینی را بهطور چشمگیری ارتقا داد. بهموازات این تحولات، DeepMind — شرکت فرعی که Google در سال 2014 آن را خریداری کرد — با پیروزی سیستم AlphaGo بر قهرمان جهان بازی گو، قدرت یادگیری عمیق را به نمایش گذاشت و اعتقاد به پتانسیل هوش مصنوعی را تقویت کرد.
انقلاب Transformer و تولد BERT (۲۰۱۷–۲۰۱۸)
در سال 2017، پژوهشگران Google Brain معماری Transformer را در مقاله «Attention Is All You Need» معرفی کردند. این معماری که بر مکانیزم self-attention استوار است، امکان پردازش موازی دنبالهها را به جای پردازش متوالی فراهم کرد و این خود انقلابی در NLP و پایهای برای تمام LLMهای مدرن شد.
در پی این موفقیت، Google در سال 2018 مدل BERT (Bidirectional Encoder Representations from Transformers) را معرفی کرد. BERT اولین مدل عمیقاً دوسویه بود که زمینه یک کلمه را همزمان از چپ و راست در نظر میگرفت. این ویژگی به آن اجازه داد تا در بسیاری از وظایف درک زبان (GLUE، SQuAD) به نتایج رکوردشکنانه دست یابد و استاندارد جدیدی در صنعت تعیین کند. BERT در دو نسخه (BASE با ۱۱۰ میلیون پارامتر و LARGE با ۳۴۰ میلیون پارامتر) با کد و وزنهای باز منتشر شد که به گسترش فراگیر آن کمک کرد. از سال 2019، BERT در Google Search برای درک بهتر جستجوها به کار گرفته شد.
افزایش مقیاس و دوران مدلهای گفتگومحور (۲۰۱۹–۲۰۲۲)
پس از BERT، Google به آزمایشهای بیشتر با مقیاس و معماری ادامه داد:
- T5 (Text-to-Text Transfer Transformer, 2019): مدلی یکپارچه که هر وظیفه NLP را به صورت تبدیل «متن به متن» در نظر میگیرد. T5 که بر روی مجموعه داده عظیم C4 (Colossal Clean Crawled Corpus) آموزش دیده، در چندین اندازه (تا ۱۱ میلیارد پارامتر) به صورت آزاد منتشر شد.
- Meena (2020): اولین مدل گفتگوی تخصصی Google با ۲٫۶ میلیارد پارامتر که کیفیت بالایی در مکالمات باز نشان داد.
- LaMDA (Language Model for Dialogue Applications, 2021): خانوادهای از مدلهای گفتگویی (تا ۱۳۷ میلیارد پارامتر) که بر روی مجموعه داده عظیمی از گفتگوها (۱٫۵۶ تریلیون کلمه) آموزش دیده بود. LaMDA هدف ایجاد مکالمات طبیعیتر و معنادارتر را دنبال میکرد و پس از آنکه یک مهندس Google ادعای «هوشمندی» آن را مطرح کرد، به شهرت عمومی رسید.
- Gopher و Chinchilla (DeepMind، ۲۰۲۱–۲۰۲۲): بهموازات، DeepMind قوانین مقیاسپذیری را بررسی کرد. مدل Gopher (۲۸۰ میلیارد پارامتر) نشان داد مقیاس چگونه بر کیفیت تأثیر میگذارد. و مدل Chinchilla (۷۰ میلیارد پارامتر) نشان داد که برای عملکرد بهینه، نه حداکثر تعداد پارامترها، بلکه توازن درست میان اندازه مدل و حجم دادههای آموزشی اهمیت دارد. این نتیجهگیری به «قانون Chinchilla» معروف شد و بر استراتژی آموزش LLM در کل صنعت تأثیر گذاشت.
دوران مدلهای فوقبزرگ و چندوجهی (۲۰۲۲–کنون)
- PaLM (Pathways Language Model, 2022): در زمان اعلام، بزرگترین مدل متراکم (dense) Google با ۵۴۰ میلیارد پارامتر، آموزشدیده بر زیرساخت توزیعشده جدید Pathways. PaLM تواناییهای چشمگیری در استدلال منطقی، بهویژه با استفاده از تکنیک Chain-of-Thought (CoT) prompting، از خود نشان داد. بر پایه آن نسخههای تخصصی مانند Med-PaLM برای پزشکی ساخته شدند. در سال 2023 نسخه بهبودیافته PaLM 2 (حدود ۳۴۰ میلیارد پارامتر) منتشر شد که پایه چتبات بهروزشده Bard را تشکیل داد.
- Gemini (2023–کنون): نسل جدیدی از مدلها که توسط تیم ادغامیافته Google DeepMind ساخته شده است. Gemini از ابتدا به عنوان سیستمی نیتیو چندوجهی (native multimodal) طراحی شد که قادر به پردازش متن، کد، تصویر، صدا و ویدیو است. در چندین نسخه منتشر شده است:
- Gemini Ultra: قدرتمندترین مدل برای وظایف پیچیده.
- Gemini Pro: مدل همهکاره برای طیف گستردهای از وظایف.
- Gemini Nano: مدل فشرده برای اجرا روی دستگاههای موبایل.
در سالهای ۲۰۲۴–۲۰۲۵ این خانواده با نسخههای Gemini 1.5 (با پنجره زمینه تا ۱ میلیون token) و Gemini 2.0 که قابلیتهای عاملی دریافت کرد، گسترش یافت.
معماری و ویژگیهای فنی
پایه: Encoderها، Decoderها و ترکیبهای هیبریدی
Google بسته به وظیفه، از انواع مختلف معماری Transformer استفاده میکند:
- Encoderها (Encoder-only): مدلهایی مانند BERT. این مدلها کل متن را یکجا پردازش کرده و بازنمایی غنی زمینهای ایجاد میکنند. برای وظایف تحلیل و درک متن (طبقهبندی، استخراج موجودیتها) ایدهآل هستند، اما برای تولید متن مناسب نیستند.
- Decoderها (Decoder-only): مدلهایی مانند LaMDA و PaLM (مشابه GPT). این مدلها خودبازگشتی (autoregressive) هستند، یعنی متن را token به token پیشبینی میکنند. این مدلها تولیدکنندههای طبیعی هستند و برای ادامه متن، گفتگو و پاسخ به سؤالات بسیار مناسباند.
- Encoder-Decoderها (Encoder-Decoder): مدلهایی مانند T5 و GNMT. این مدلها هر دو بخش را دارند: encoder دنباله ورودی را پردازش میکند و decoder دنباله خروجی را تولید میکند. این معماری همهمنظوره برای وظایف تبدیلی مانند ترجمه یا خلاصهسازی مناسب است.
مقیاس: پارامترها، دادهها و زیرساخت
موفقیت Google در LLM تا حد زیادی به سه عامل بستگی دارد:
- مقیاس مدلها: افزایش منظم تعداد پارامترها از میلیونها (BERT) تا صدها میلیارد (PaLM، Gemini).
- مقیاس دادهها: دسترسی به یکی از بزرگترین مجموعههای داده جهان (فهرست وب Google، YouTube، Google Books) که امکان آموزش مدلها روی تریلیونها token را فراهم میکند.
- زیرساخت: استفاده از تراشههای تخصصی داخلی — Tensor Processing Unit (TPU) — و سیستم توزیعشده Pathways، که آموزش کارآمد و پایدار مدلهای فوقبزرگ را ممکن میسازند.
چندوجهی بودن و عاملیت
جدیدترین مدلهای Google، بهویژه Gemini، به سمت چندوجهی بودن عمیق و عاملیت (agentic) حرکت میکنند.
- چندوجهی بودن نیتیو به این معناست که یک مدل از ابتدا برای درک و ترکیب انواع مختلف داده (متن، تصویر، صدا) آموزش دیده، نه صرفاً اتصال ماژولهای جداگانه به یکدیگر.
- عاملیت (Agentic AI) — توانایی مدل است که نهتنها به درخواستها پاسخ دهد، بلکه بهصورت مستقل برنامهریزی کرده و مجموعهای از اقدامات را برای رسیدن به هدف اجرا کند (مثلاً فراخوانی ابزارهای خارجی مانند جستجو یا ماشینحساب).
جدول خلاصه مدلهای کلیدی
| مدل | سال انتشار | پارامترها (تخمین) | معماری | ویژگیهای کلیدی |
|---|---|---|---|---|
| BERT | 2018 | ۱۱۰–۳۴۰ میلیون | Encoder | درک دوسویه زمینه، SOTA در وظایف NLP. |
| T5 | 2019 | ۶۰ میلیون – ۱۱ میلیارد | Encoder-Decoder | رویکرد یکپارچه «متن به متن» برای تمام وظایف. |
| LaMDA | 2021 | ۱۳۷ میلیارد | Decoder | تخصص در مکالمات باز و معنادار. |
| PaLM | 2022 | ۵۴۰ میلیارد | Decoder | پیشرفت در استدلال منطقی (Chain-of-Thought)، آموزش در مقیاس بزرگ. |
| Chinchilla | 2022 | ۷۰ میلیارد | Decoder | مدل «Compute-optimal» که اهمیت توازن دادهها و پارامترها را اثبات کرد. |
| Gemini 1.0 | 2023 | تا ~۱ تریلیون (Ultra) | چندوجهی (احتمالاً MoE) | چندوجهی بودن نیتیو، SOTA در بسیاری از benchmarkها (MMLU). |
| Gemini 1.5 | 2024 | فاش نشده | چندوجهی (MoE) | پنجره زمینه تا ۱-۲ میلیون token، کارایی بالا. |
| Gemini 2.0 | 2024 | فاش نشده | چندوجهی + Tools | قابلیتهای عاملی داخلی، تولید تصویر/صدا. |
کاربرد در محصولات و اکوسیستم
Google بهفعالی LLMهای خود را در تمام محصولاتش ادغام میکند:
- Google Search: BERT، MUM و Gemini برای درک بهتر جستجوهای پیچیده و ارائه پاسخهای مستقیم در قالب AI Overviews (که پیشتر SGE نام داشت) به کار میروند.
- Google Assistant و Bard (اکنون Gemini): گذار از دستورات صوتی ساده به دستیارهای گفتگومحور کامل مبتنی بر LaMDA، PaLM 2 و Gemini.
- Google Workspace: ویژگیهای Duet AI (اکنون Gemini for Workspace) در نوشتن ایمیل در Gmail، ایجاد متن در Docs و تولید ارائه در Slides کمک میکنند.
- Android: Gemini Nano اجرای قابلیتهای هوش مصنوعی را بهصورت محلی روی دستگاههایی مانند Pixel تأمین میکند تا حریم خصوصی و سرعت افزایش یابد.
- Google Cloud AI: پلتفرم Vertex AI از طریق API دسترسی شرکتها به مدلهای PaLM و Gemini را برای ساخت برنامههای کاربردی خود فراهم میکند.
نقش در فضای رقابتی
Google یکی از بازیگران اصلی «مسابقه هوش مصنوعی» است که در آن رقبای اصلیاش OpenAI (با حمایت Microsoft) و Meta هستند.
- رقابت با OpenAI: اگرچه Google در بسیاری از فناوریهای بنیادی (از جمله Transformer) پیشگام بود، راهاندازی ChatGPT در اواخر سال 2022 Google را وادار کرد تا روند عرضه محصولاتش را (مثلاً Bard) شتاب دهد. رقابت در زمینه کیفیت مدلها (Gemini Ultra در برابر GPT-4)، اندازه پنجره زمینه و کاربرپسندی API در جریان است.
- تمایز با Meta: Meta بر متنباز بودن (مدلهای LLaMA) تمرکز کرده و جایگزین قدرتمندی در برابر مدلهای بسته Google و OpenAI ایجاد کرده است. در پاسخ به این موضع، Google نیز شروع به انتشار مدلهای باز مانند Gemma کرد تا جامعه توسعهدهندگان را حمایت کند و اکوسیستم را به Meta واگذار نکند.
- اتحادهای استراتژیک: Google در بازیگران دیگری سرمایهگذاری میکند، از جمله استارتاپ Anthropic (سازندگان مدل Claude)، تا رویکردها را متنوع سازد و جایگاه خود را در رقابت ابری تقویت کند.
پیوندها
- درگاه رسمی Google AI
- وبسایت رسمی Google DeepMind
منابع
- Vaswani, A. et al. (2017). Attention Is All You Need. NIPS.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. JMLR.
- Thoppilan, R. et al. (2022). LaMDA: Language Models for Dialog Applications. arXiv:2201.08239.
- Hoffmann, R. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. JMLR.
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.