Multimodal large language models — مدل‌های زبانی بزرگ چندوجهی

From Systems analysis Wiki
Jump to navigation Jump to search

مدل‌های زبانی بزرگ چندوجهی (به انگلیسی: Multimodal Large Language Models, MLLMs) — دسته‌ای از مدل‌های هوش مصنوعی هستند که قادر به پردازش و تولید اطلاعات در قالب‌های مختلف، از جمله متن، تصویر، صدا و ویدیو می‌باشند[1]. برخلاف مدل‌های زبانی تک‌وجهی که صرفاً با متن کار می‌کنند، MLLM اطلاعات را از منابع گوناگون یکپارچه می‌سازند تا وظایف پیچیده‌ی درک و تولید محتوا را حل کنند.

مفهوم اصلی MLLM بر پایه‌ی ایجاد یک embedding یکپارچه برای قالب‌های مختلف استوار است. این امر به مدل اجازه می‌دهد تا پیوندهای معنایی میان، برای مثال، یک تصویر و توصیف متنی آن برقرار کند[2]. پیشرفت کلیدی که پایه‌های MLLM مدرن را بنا نهاد، استفاده از یادگیری تضادی برای هم‌راستاسازی بازنمایی‌های تصویری و متنی در فضای مشترک ویژگی‌ها بود، آن‌گونه که در مدل CLIP پیاده‌سازی شد[3].

تاریخچه‌ی توسعه

دوره‌ی اولیه (۲۰۱۳–۲۰۲۰)

مبانی مفهومی هوش مصنوعی چندوجهی در سال ۲۰۱۳ پایه‌گذاری شد، زمانی که پژوهشگران دانشگاه Stanford امکان یادگیری با نمونه‌ی صفر (zero-shot learning) با استفاده از بازنمایی‌های برداری کلمات را نشان دادند[4]. در سال ۲۰۱۶، تیم FAIR (Meta AI) اثربخشی استفاده از توصیفات زبان طبیعی برای آموزش مدل‌های بینایی ماشین را به اثبات رساند و بدون آموزش مستقیم به دقت ۱۱٫۵٪ بر روی ImageNet دست یافت[5].

دوران CLIP (۲۰۲۱)

لحظه‌ای انقلابی با انتشار مدل CLIP (Contrastive Language-Image Pre-training) توسط OpenAI در ژانویه‌ی ۲۰۲۱ رقم خورد. این مدل که بر روی ۴۰۰ میلیون جفت تصویر-متن آموزش دیده بود، توانایی دسته‌بندی تصاویر بدون آموزش تخصصی بر روی وظایف خاص را نشان داد. CLIP پایه و اساس بسیاری از MLLM‌های بعدی قرار گرفت[6].

مقیاس‌بندی و نوآوری (۲۰۲۲–۲۰۲۴)

پس از موفقیت CLIP، مدل‌های کلیدی متعددی پدیدار شدند:

  • Flamingo (DeepMind، ۲۰۲۲) — مدلی با ۸۰ میلیارد پارامتر که توانایی‌های برجسته‌ای در یادگیری با نمونه‌های اندک نشان داد.
  • BLIP (Salesforce، ۲۰۲۲) — معماری یکپارچه برای درک و تولید محتوا.
  • GPT-4V (OpenAI، ۲۰۲۳) — اولین مدل چندوجهی تجاری در این مقیاس.
  • LLaVA (Microsoft، ۲۰۲۳) — جایگزین متن‌باز محبوب برای GPT-4V.
  • Gemini (Google، ۲۰۲۳) — معماری بوماً چندوجهی که از ابتدا برای کار با انواع مختلف داده طراحی شده است.
  • GPT-4o (OpenAI، ۲۰۲۴) — مدلی که قادر به پردازش متن، صدا و ویدیو به صورت بلادرنگ با تأخیر پایین است[1].
  • Claude 3.5 Sonnet (Anthropic، ۲۰۲۴) — مدلی با قابلیت‌های بهبودیافته در تحلیل اطلاعات تصویری.

رویکردهای معماری

معماری دوگانه‌انکودر (Dual-Encoder)

از انکودرهای جداگانه برای هر قالب استفاده می‌کند که داده‌ها را به فضای مشترک بازنمایی فرافکنی می‌نمایند. نمونه‌ی بارز آن CLIP است که در آن یک transformer تصویری، تصاویر را پردازش می‌کند و یک transformer متنی، داده‌های زبانی را. مزایای این رویکرد ماژولار بودن و بهره‌وری محاسباتی است، و نقص آن تعامل محدود میان قالب‌هاست[7].

معماری انکودر-دکودر

یک انکودر یکپارچه ورودی چندوجهی را پردازش می‌کند و دکودر خروجی متنی تولید می‌نماید. مدل Flamingo از مکانیزم Perceiver Resampler برای پردازش ورودی‌های تصویری با طول متغیر و لایه‌های توجه متقاطع بین قالب‌ها استفاده می‌کند. این رویکرد تعامل غنی بین قالب‌ها را فراهم می‌سازد، اما به منابع محاسباتی بیشتری نیاز دارد[8].

معماری هم‌راستاسازی (Alignment)

این رویکرد از انکودرهای پیش‌آموخته‌ی منجمد استفاده می‌کند که از طریق یک ماژول هم‌راستاسازی آموزش‌پذیر کوچک به هم متصل می‌شوند. برای نمونه، BLIP-2 از Q-Former (Querying Transformer) به عنوان یک عنصر اتصال سبک میان انکودر تصویری منجمد و مدل زبانی استفاده می‌کند و به پارامترهای آموزش‌پذیر به مراتب کمتری نیاز دارد[9].

مدل‌های اصلی

GPT-4V / GPT-4o (OpenAI)

خانواده‌ی مدل‌های GPT-4 بر اساس تخمین‌ها تا ۱٫۸ تریلیون پارامتر دارند (در معماری mixture of experts). مدل GPT-4o که در مه ۲۰۲۴ منتشر شد، از پردازش متن، تصویر، صدا و ویدیو به صورت بلادرنگ پشتیبانی می‌کند. این مدل بر روی benchmark MMMU به دقت ۶۹٫۱٪ دست می‌یابد[10].

Gemini (Google)

معماری بوماً چندوجهی که از ابتدا بر روی متن، تصویر، صدا و ویدیو آموزش دیده است. Gemini 1.5 Pro از پنجره‌ی زمینه‌ای تا ۱۰ میلیون token پشتیبانی می‌کند و در ۳۰ مورد از ۳۲ benchmark محبوب از GPT-4 پیشی می‌گیرد[11].

Claude 3 (Anthropic)

خانواده‌ای از مدل‌ها (Haiku، Sonnet، Opus) با پنجره‌ی زمینه‌ای تا ۲۰۰٬۰۰۰ token. Claude 3 Opus بر روی benchmark MMMU به ۵۸٫۵٪ دست می‌یابد. برای افزایش ایمنی مدل‌ها از رویکرد Constitutional AI استفاده می‌شود[12].

LLaVA (مدل متن‌باز)

انکودر تصویری CLIP را با مدل زبانی Vicuna ترکیب می‌کند. نسخه‌هایی با ۷، ۱۳ و ۳۴ میلیارد پارامتر در دسترس هستند. این مدل به ۸۵٫۱٪ از عملکرد نسبی GPT-4 بر روی وظایف مصنوعی دست می‌یابد[13].

حوزه‌های کاربرد

  • پرسش و پاسخ تصویری (VQA): به کاربران اجازه می‌دهد درباره‌ی محتوای تصویری سؤال بپرسند.
  • تحلیل اسناد: MLLM‌های مدرن قادرند تا ۲۰۰۰ صفحه در دقیقه پردازش کنند.
  • تصویربرداری پزشکی: مدل‌هایی مانند Med-PaLM M (Google) تصاویر پزشکی و داده‌های بالینی را تحلیل می‌کنند.
  • رباتیک: مدل‌هایی مانند RT-2 (Google DeepMind) به ربات‌ها امکان می‌دهند محیط تصویری را درک کرده و دستورات به زبان طبیعی را اجرا کنند.

محدودیت‌های کنونی

  • توهم‌زایی: نرخ توهم‌زایی در محتوای تولیدشده بین ۲۷ تا ۴۶ درصد تخمین زده می‌شود. مدل‌ها ممکن است اشیاء ناموجود را توصیف کنند یا اطلاعات تصویری را نادرست تفسیر نمایند[14].
  • نیازهای محاسباتی بالا: آموزش و استفاده از MLLM به زیرساخت محاسباتی قابل توجهی نیاز دارد.
  • تعصب داده: نمایندگی ناکافی گروه‌های جمعیتی، زبان‌ها و فرهنگ‌ها در داده‌های آموزشی منجر به خطاهای سیستماتیک می‌شود.

پیوندها

  • A Comprehensive Guide to Multimodal LLMs (Encord Blog)
  • Multimodal LLMs: The Complete Guide (Viso.ai)

منابع

  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
  • Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
  • Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
  • Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
  • Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
  • Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
  • Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
  • Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
  • Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.

یادداشت‌ها

  1. 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [۱]
  2. «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [۲]
  3. Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [۳]
  4. DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [۴]
  5. «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [۵]
  6. «Understanding CLIP». Stanford CS231n. [۶]
  7. «Multimodal LLMs: The Complete Guide». Viso.ai. [۷]
  8. «The Architectures of Multimodal Language Models». Determined AI. [۸]
  9. «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [۹]
  10. «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [۱۰]
  11. «Google Gemini: A Deep Dive». DaveAI Blog. [۱۱]
  12. «Introducing the Claude 3 Family». Anthropic. [۱۲]
  13. Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [۱۳]
  14. «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [۱۴]