PaLM (Pathways Language Model) (FA)
PaLM (Pathways Language Model) — خانوادهای از مدلهای زبانی بزرگ (LLM) است که توسط شرکت Google توسعه یافته است. نخستین نسخه این مدل که در آوریل ۲۰۲۲ معرفی شد، دارای ۵۴۰ میلیارد پارامتر بود و در زمان خود یکی از بزرگترین مدلهای زبانی جهان به شمار میرفت و قابلیتهای نوآورانهای را که حاصل مقیاسگذاری گسترده بود، به نمایش گذاشت[1].
پایه فناورانه اصلی PaLM، سیستم Pathways بود — معماری جدید سیستمهای Machine Learning از Google که امکان هماهنگی مؤثر محاسبات توزیعشده بر روی هزاران تراشه شتابدهنده را فراهم میکند[2]. PaLM نخستین نمایش بزرگمقیاس این سیستم بود و کارایی بیسابقهای در آموزش در مقیاسهای عظیم از خود نشان داد.
سیستم Pathways: پایهای برای مقیاسگذاری
مفهوم Pathways، که در سال ۲۰۲۱ توسط Google معرفی شد، ایجاد یک شبکه عصبی واحد را پیشبینی میکرد که قادر باشد بهطور مؤثر دانش را در حوزههای مختلف تعمیم دهد و هزاران وظیفه را بهطور همزمان انجام دهد. PaLM نخستین کاربرد بزرگمقیاس این سیستم بود: آموزش آن بر روی ۶۱۴۴ پردازنده تخصصی TPU v4 موازیسازی شد که در دو خوشه ابری (TPU v4 Pods) با هم ترکیب شده بودند[1].
در زمان ساخت، این بزرگترین پیکربندی TPU بود که تاکنون برای آموزش یک مدل واحد بهکار رفته بود. این سیستم به بهرهوری رکوردشکن در استفاده از ظرفیتهای سختافزاری (۵۷٫۸٪ FLOPs) دست یافت که امکان پیشی گرفتن چشمگیر از پروژههای پیشین را فراهم کرد و آموزش موفق مدلی با بیش از نیمتریلیون پارامتر را ممکن ساخت[3].
معماری و دادههای آموزشی
معماری مدل
PaLM یک مدل زبانی متراکم (غیرپراکنده) با معماری «decoder-only» است که مشابه مدلهای سری GPT میباشد. این معماری بر وظایف پیشبینی token بعدی متمرکز است و برای تولید متن بسیار مناسب است. برخلاف معماری استاندارد transformer، PaLM از چندین اصلاح کلیدی برای افزایش کارایی استفاده میکند[1]:
- لایههای موازی: مکانیزمهای attention و لایههای fully-connected بهصورت موازی محاسبه میشوند که آموزش را تقریباً ۱۵٪ تسریع کرده است.
- فعالسازی SwiGLU: استفاده از تابع فعالسازی SwiGLU بهجای ReLU استاندارد که کیفیت مدل را بهطور قابل توجهی بهبود داده است.
دادههای آموزشی
PaLM بر روی یک مجموعه داده باکیفیت با حجم ۷۸۰ میلیارد token آموزش دید. این مجموعه داده چندزبانه و متنوع بود و شامل موارد زیر میشد[1]:
- اسناد وب و کتابهای باکیفیت.
- مقالات ویکیپدیا.
- مکالمات از شبکههای اجتماعی (۵۰٪ مجموعه داده).
- کد منبع از GitHub (۵٪ مجموعه داده).
حدود ۷۸٪ دادهها به زبان انگلیسی بود و ۲۲٪ باقیمانده مجموعهای چندزبانه بود. برای tokenization از روشی خاص «بدون اتلاف» استفاده شد که تمام فاصلهها را حفظ میکرد (که برای کد حیاتی است) و نمادهای ناشناخته Unicode را به بایت تبدیل میکرد.
قابلیتها و نتایج
تواناییهای Emergent و few-shot learning
PaLM نشان داد که افزایش مقیاس مدل، حجم دادهها و توان محاسباتی میتواند به تواناییهای emergent (بهطور غیرمنتظره پدیدار شونده) منجر شود. در بسیاری از وظایف، عملکرد مدل تنها پس از رسیدن به حداکثر مقیاس بهطور تند و غیرخطی افزایش مییافت که نشاندهنده ظهور قابلیتهای جدیدی بود که پیشتر مشاهده نشده بودند[3].
مدل در حالت few-shot learning (بدون fine-tuning، با چند نمونه در prompt) ارزیابی شد و از مدلهای بزرگ پیشین (مانند GPT-3 و LaMDA) در ۲۸ از ۲۹ benchmark محبوب NLP پیشی گرفت. در مجموعه وظایف جامع BIG-bench، PaLM نخستین مدلی بود که نتایجش از سطح متوسط آزموندهندگان انسانی فراتر رفت[1].
استدلال زنجیرهای (Chain-of-Thought)
یکی از چشمگیرترین دستاوردهای PaLM توانایی استدلال منطقی چندمرحلهای با استفاده از تکنیک «chain-of-thought prompting» بود[1]. این روش شامل ارائه نمونههایی به مدل است که در آنها حل مسئله گام به گام شرح داده شده است. پس از یادگیری از این نمونهها، PaLM توانست «زنجیره تفکر» خود را برای حل مسائل پیچیده جدید تولید کند، از جمله:
- مسائل ریاضی: در آزمون GSM8K (مسائل سطح دبستان) PaLM ۵۸٪ مسائل را حل کرد که از نتیجه پیشین state-of-the-art حاصل از یک مدل fine-tune شده پیشی گرفت.
- مسائل استدلال عمومی: مدل توانست توضیحات مفصلی برای مسائل غیرمعمول ارائه دهد، مثلاً تفسیر شوخیهایی که پیشتر ندیده بود.
این توانایی فرآیند «تفکر» مدل را شفافتر و شبیهتر به تفکر انسانی کرد.
تولید کد و چندزبانگی
علیرغم اینکه کد منبع تنها ۵٪ از دادههای آموزشی را تشکیل میداد، PaLM در وظایف تولید و تبدیل کد سطحی قابل مقایسه با مدل تخصصی OpenAI Codex از خود نشان داد. مدل همچنین تواناییهای قوی در وظایف چندزبانه از جمله ترجمه نشان داد[3].
تکامل و جانشینان: خانواده PaLM
PaLM پایهای برای یک خانواده کامل از مدلهای توسعهیافته توسط Google شد.
PaLM 2
PaLM 2 که در مه ۲۰۲۳ معرفی شد، جانشینی کارآمدتر و چندزبانهتر بود. بهجای تعقیب تعداد پارامترها، تمرکز بر کیفیت دادههای آموزشی و کارایی معماری قرار گرفت. PaLM 2 بر روی متون به بیش از ۱۰۰ زبان آموزش دیده و تواناییهای بهبودیافتهای در منطق، برنامهنویسی و ترجمه نشان میدهد[4]. این مدل در چهار اندازه (از کوچکترین به بزرگترین) عرضه میشود: Gecko، Otter، Bison و Unicorn. کوچکترین نسخه (Gecko) بهاندازه کافی سبک است که بتواند بر روی دستگاههای موبایل در حالت آفلاین کار کند.
نسخههای تخصصی
بر اساس PaLM و PaLM 2، نسخههایی برای حوزههای خاص ایجاد شدند:
- Med-PaLM 2: مدل تخصصی برای پزشکی. نخستین سیستم هوش مصنوعی بود که در سؤالات آزمون صدور مجوز پزشکی ایالات متحده (USMLE) به سطح متخصص دست یافت[4].
- Sec-PaLM 2: مدلی متمرکز بر امنیت سایبری که برای شناسایی آسیبپذیریها و تحلیل کدهای مخرب آموزش دیده است[5].
PaLM-E: نسخه Multimodal
PaLM-E (Pathways Language Model Embodied) یک مدل multimodal است که مدل زبانی PaLM را با دادههای بصری از Vision Transformer (ViT) ترکیب میکند. این امکان را به مدل میدهد که هم متن و هم تصویر را پردازش کند و وظایف مرتبط با دنیای فیزیکی را حل کند، برای مثال برای کنترل رباتها[6].
جنبههای اخلاقی و محدودیتها
سازندگان PaLM بر ضرورت رویکردی مسئولانه در توسعه مدلهای زبانی بزرگ تأکید میکنند. در مقاله علمی رسمی، تحلیلی از سوگیریها و سمیت احتمالی در متن تولیدشده انجام شد. برای تضمین شفافیت، Google یک کارت مدل (Model Card) و مشخصات داده (Datasheet) برای PaLM منتشر کرد که در آنها ویژگیهای dataset، نتایج آزمونها و محدودیتهای شناساییشده مستند شدهاند[1]. این اقدامات با شیوههای نوین هوش مصنوعی مسئول همخوانی دارند و هدفشان کاهش خطرات مرتبط با تعصبات و تولید محتوای مضر است.
پیوندها
- وبلاگ رسمی Google درباره PaLM
- PaLM API برای توسعهدهندگان
منابع
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
- Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
- Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
- Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [۱]
- ↑ «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [۲]
- ↑ 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [۳]
- ↑ 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [۴]
- ↑ «New AI capabilities that can help address your security challenges». Google Cloud Blog. [۵]
- ↑ «PaLM-E: An embodied multimodal language model». Google Research Blog. [۶]