PaLM (Pathways Language Model) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) — خانواده‌ای از مدل‌های زبانی بزرگ (LLM) است که توسط شرکت Google توسعه یافته است. نخستین نسخه این مدل که در آوریل ۲۰۲۲ معرفی شد، دارای ۵۴۰ میلیارد پارامتر بود و در زمان خود یکی از بزرگ‌ترین مدل‌های زبانی جهان به شمار می‌رفت و قابلیت‌های نوآورانه‌ای را که حاصل مقیاس‌گذاری گسترده بود، به نمایش گذاشت[1].

پایه فناورانه اصلی PaLM، سیستم Pathways بود — معماری جدید سیستم‌های Machine Learning از Google که امکان هماهنگی مؤثر محاسبات توزیع‌شده بر روی هزاران تراشه شتاب‌دهنده را فراهم می‌کند[2]. PaLM نخستین نمایش بزرگ‌مقیاس این سیستم بود و کارایی بی‌سابقه‌ای در آموزش در مقیاس‌های عظیم از خود نشان داد.

سیستم Pathways: پایه‌ای برای مقیاس‌گذاری

مفهوم Pathways، که در سال ۲۰۲۱ توسط Google معرفی شد، ایجاد یک شبکه عصبی واحد را پیش‌بینی می‌کرد که قادر باشد به‌طور مؤثر دانش را در حوزه‌های مختلف تعمیم دهد و هزاران وظیفه را به‌طور همزمان انجام دهد. PaLM نخستین کاربرد بزرگ‌مقیاس این سیستم بود: آموزش آن بر روی ۶۱۴۴ پردازنده تخصصی TPU v4 موازی‌سازی شد که در دو خوشه ابری (TPU v4 Pods) با هم ترکیب شده بودند[1].

در زمان ساخت، این بزرگ‌ترین پیکربندی TPU بود که تاکنون برای آموزش یک مدل واحد به‌کار رفته بود. این سیستم به بهره‌وری رکوردشکن در استفاده از ظرفیت‌های سخت‌افزاری (۵۷٫۸٪ FLOPs) دست یافت که امکان پیشی گرفتن چشمگیر از پروژه‌های پیشین را فراهم کرد و آموزش موفق مدلی با بیش از نیم‌تریلیون پارامتر را ممکن ساخت[3].

معماری و داده‌های آموزشی

معماری مدل

PaLM یک مدل زبانی متراکم (غیرپراکنده) با معماری «decoder-only» است که مشابه مدل‌های سری GPT می‌باشد. این معماری بر وظایف پیش‌بینی token بعدی متمرکز است و برای تولید متن بسیار مناسب است. برخلاف معماری استاندارد transformer، PaLM از چندین اصلاح کلیدی برای افزایش کارایی استفاده می‌کند[1]:

  • لایه‌های موازی: مکانیزم‌های attention و لایه‌های fully-connected به‌صورت موازی محاسبه می‌شوند که آموزش را تقریباً ۱۵٪ تسریع کرده است.
  • فعال‌سازی SwiGLU: استفاده از تابع فعال‌سازی SwiGLU به‌جای ReLU استاندارد که کیفیت مدل را به‌طور قابل توجهی بهبود داده است.

داده‌های آموزشی

PaLM بر روی یک مجموعه داده باکیفیت با حجم ۷۸۰ میلیارد token آموزش دید. این مجموعه داده چندزبانه و متنوع بود و شامل موارد زیر می‌شد[1]:

  • اسناد وب و کتاب‌های باکیفیت.
  • مقالات ویکی‌پدیا.
  • مکالمات از شبکه‌های اجتماعی (۵۰٪ مجموعه داده).
  • کد منبع از GitHub (۵٪ مجموعه داده).

حدود ۷۸٪ داده‌ها به زبان انگلیسی بود و ۲۲٪ باقی‌مانده مجموعه‌ای چندزبانه بود. برای tokenization از روشی خاص «بدون اتلاف» استفاده شد که تمام فاصله‌ها را حفظ می‌کرد (که برای کد حیاتی است) و نمادهای ناشناخته Unicode را به بایت تبدیل می‌کرد.

قابلیت‌ها و نتایج

توانایی‌های Emergent و few-shot learning

PaLM نشان داد که افزایش مقیاس مدل، حجم داده‌ها و توان محاسباتی می‌تواند به توانایی‌های emergent (به‌طور غیرمنتظره پدیدار شونده) منجر شود. در بسیاری از وظایف، عملکرد مدل تنها پس از رسیدن به حداکثر مقیاس به‌طور تند و غیرخطی افزایش می‌یافت که نشان‌دهنده ظهور قابلیت‌های جدیدی بود که پیش‌تر مشاهده نشده بودند[3].

مدل در حالت few-shot learning (بدون fine-tuning، با چند نمونه در prompt) ارزیابی شد و از مدل‌های بزرگ پیشین (مانند GPT-3 و LaMDA) در ۲۸ از ۲۹ benchmark محبوب NLP پیشی گرفت. در مجموعه وظایف جامع BIG-bench، PaLM نخستین مدلی بود که نتایجش از سطح متوسط آزمون‌دهندگان انسانی فراتر رفت[1].

استدلال زنجیره‌ای (Chain-of-Thought)

یکی از چشمگیرترین دستاوردهای PaLM توانایی استدلال منطقی چندمرحله‌ای با استفاده از تکنیک «chain-of-thought prompting» بود[1]. این روش شامل ارائه نمونه‌هایی به مدل است که در آن‌ها حل مسئله گام به گام شرح داده شده است. پس از یادگیری از این نمونه‌ها، PaLM توانست «زنجیره تفکر» خود را برای حل مسائل پیچیده جدید تولید کند، از جمله:

  • مسائل ریاضی: در آزمون GSM8K (مسائل سطح دبستان) PaLM ۵۸٪ مسائل را حل کرد که از نتیجه پیشین state-of-the-art حاصل از یک مدل fine-tune شده پیشی گرفت.
  • مسائل استدلال عمومی: مدل توانست توضیحات مفصلی برای مسائل غیرمعمول ارائه دهد، مثلاً تفسیر شوخی‌هایی که پیش‌تر ندیده بود.

این توانایی فرآیند «تفکر» مدل را شفاف‌تر و شبیه‌تر به تفکر انسانی کرد.

تولید کد و چندزبانگی

علی‌رغم اینکه کد منبع تنها ۵٪ از داده‌های آموزشی را تشکیل می‌داد، PaLM در وظایف تولید و تبدیل کد سطحی قابل مقایسه با مدل تخصصی OpenAI Codex از خود نشان داد. مدل همچنین توانایی‌های قوی در وظایف چندزبانه از جمله ترجمه نشان داد[3].

تکامل و جانشینان: خانواده PaLM

PaLM پایه‌ای برای یک خانواده کامل از مدل‌های توسعه‌یافته توسط Google شد.

PaLM 2

PaLM 2 که در مه ۲۰۲۳ معرفی شد، جانشینی کارآمدتر و چندزبانه‌تر بود. به‌جای تعقیب تعداد پارامترها، تمرکز بر کیفیت داده‌های آموزشی و کارایی معماری قرار گرفت. PaLM 2 بر روی متون به بیش از ۱۰۰ زبان آموزش دیده و توانایی‌های بهبودیافته‌ای در منطق، برنامه‌نویسی و ترجمه نشان می‌دهد[4]. این مدل در چهار اندازه (از کوچک‌ترین به بزرگ‌ترین) عرضه می‌شود: Gecko، Otter، Bison و Unicorn. کوچک‌ترین نسخه (Gecko) به‌اندازه کافی سبک است که بتواند بر روی دستگاه‌های موبایل در حالت آفلاین کار کند.

نسخه‌های تخصصی

بر اساس PaLM و PaLM 2، نسخه‌هایی برای حوزه‌های خاص ایجاد شدند:

  • Med-PaLM 2: مدل تخصصی برای پزشکی. نخستین سیستم هوش مصنوعی بود که در سؤالات آزمون صدور مجوز پزشکی ایالات متحده (USMLE) به سطح متخصص دست یافت[4].
  • Sec-PaLM 2: مدلی متمرکز بر امنیت سایبری که برای شناسایی آسیب‌پذیری‌ها و تحلیل کدهای مخرب آموزش دیده است[5].

PaLM-E: نسخه Multimodal

PaLM-E (Pathways Language Model Embodied) یک مدل multimodal است که مدل زبانی PaLM را با داده‌های بصری از Vision Transformer (ViT) ترکیب می‌کند. این امکان را به مدل می‌دهد که هم متن و هم تصویر را پردازش کند و وظایف مرتبط با دنیای فیزیکی را حل کند، برای مثال برای کنترل ربات‌ها[6].

جنبه‌های اخلاقی و محدودیت‌ها

سازندگان PaLM بر ضرورت رویکردی مسئولانه در توسعه مدل‌های زبانی بزرگ تأکید می‌کنند. در مقاله علمی رسمی، تحلیلی از سوگیری‌ها و سمیت احتمالی در متن تولیدشده انجام شد. برای تضمین شفافیت، Google یک کارت مدل (Model Card) و مشخصات داده (Datasheet) برای PaLM منتشر کرد که در آن‌ها ویژگی‌های dataset، نتایج آزمون‌ها و محدودیت‌های شناسایی‌شده مستند شده‌اند[1]. این اقدامات با شیوه‌های نوین هوش مصنوعی مسئول همخوانی دارند و هدفشان کاهش خطرات مرتبط با تعصبات و تولید محتوای مضر است.

پیوندها

  • وبلاگ رسمی Google درباره PaLM
  • PaLM API برای توسعه‌دهندگان

منابع

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [۱]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [۲]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [۳]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [۴]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [۵]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [۶]