Multimodal large language models — مدلهای زبانی بزرگ چندوجهی
مدلهای زبانی بزرگ چندوجهی (به انگلیسی: Multimodal Large Language Models, MLLMs) — دستهای از مدلهای هوش مصنوعی هستند که قادر به پردازش و تولید اطلاعات در قالبهای مختلف، از جمله متن، تصویر، صدا و ویدیو میباشند[1]. برخلاف مدلهای زبانی تکوجهی که صرفاً با متن کار میکنند، MLLM اطلاعات را از منابع گوناگون یکپارچه میسازند تا وظایف پیچیدهی درک و تولید محتوا را حل کنند.
مفهوم اصلی MLLM بر پایهی ایجاد یک embedding یکپارچه برای قالبهای مختلف استوار است. این امر به مدل اجازه میدهد تا پیوندهای معنایی میان، برای مثال، یک تصویر و توصیف متنی آن برقرار کند[2]. پیشرفت کلیدی که پایههای MLLM مدرن را بنا نهاد، استفاده از یادگیری تضادی برای همراستاسازی بازنماییهای تصویری و متنی در فضای مشترک ویژگیها بود، آنگونه که در مدل CLIP پیادهسازی شد[3].
تاریخچهی توسعه
دورهی اولیه (۲۰۱۳–۲۰۲۰)
مبانی مفهومی هوش مصنوعی چندوجهی در سال ۲۰۱۳ پایهگذاری شد، زمانی که پژوهشگران دانشگاه Stanford امکان یادگیری با نمونهی صفر (zero-shot learning) با استفاده از بازنماییهای برداری کلمات را نشان دادند[4]. در سال ۲۰۱۶، تیم FAIR (Meta AI) اثربخشی استفاده از توصیفات زبان طبیعی برای آموزش مدلهای بینایی ماشین را به اثبات رساند و بدون آموزش مستقیم به دقت ۱۱٫۵٪ بر روی ImageNet دست یافت[5].
دوران CLIP (۲۰۲۱)
لحظهای انقلابی با انتشار مدل CLIP (Contrastive Language-Image Pre-training) توسط OpenAI در ژانویهی ۲۰۲۱ رقم خورد. این مدل که بر روی ۴۰۰ میلیون جفت تصویر-متن آموزش دیده بود، توانایی دستهبندی تصاویر بدون آموزش تخصصی بر روی وظایف خاص را نشان داد. CLIP پایه و اساس بسیاری از MLLMهای بعدی قرار گرفت[6].
مقیاسبندی و نوآوری (۲۰۲۲–۲۰۲۴)
پس از موفقیت CLIP، مدلهای کلیدی متعددی پدیدار شدند:
- Flamingo (DeepMind، ۲۰۲۲) — مدلی با ۸۰ میلیارد پارامتر که تواناییهای برجستهای در یادگیری با نمونههای اندک نشان داد.
- BLIP (Salesforce، ۲۰۲۲) — معماری یکپارچه برای درک و تولید محتوا.
- GPT-4V (OpenAI، ۲۰۲۳) — اولین مدل چندوجهی تجاری در این مقیاس.
- LLaVA (Microsoft، ۲۰۲۳) — جایگزین متنباز محبوب برای GPT-4V.
- Gemini (Google، ۲۰۲۳) — معماری بوماً چندوجهی که از ابتدا برای کار با انواع مختلف داده طراحی شده است.
- GPT-4o (OpenAI، ۲۰۲۴) — مدلی که قادر به پردازش متن، صدا و ویدیو به صورت بلادرنگ با تأخیر پایین است[1].
- Claude 3.5 Sonnet (Anthropic، ۲۰۲۴) — مدلی با قابلیتهای بهبودیافته در تحلیل اطلاعات تصویری.
رویکردهای معماری
معماری دوگانهانکودر (Dual-Encoder)
از انکودرهای جداگانه برای هر قالب استفاده میکند که دادهها را به فضای مشترک بازنمایی فرافکنی مینمایند. نمونهی بارز آن CLIP است که در آن یک transformer تصویری، تصاویر را پردازش میکند و یک transformer متنی، دادههای زبانی را. مزایای این رویکرد ماژولار بودن و بهرهوری محاسباتی است، و نقص آن تعامل محدود میان قالبهاست[7].
معماری انکودر-دکودر
یک انکودر یکپارچه ورودی چندوجهی را پردازش میکند و دکودر خروجی متنی تولید مینماید. مدل Flamingo از مکانیزم Perceiver Resampler برای پردازش ورودیهای تصویری با طول متغیر و لایههای توجه متقاطع بین قالبها استفاده میکند. این رویکرد تعامل غنی بین قالبها را فراهم میسازد، اما به منابع محاسباتی بیشتری نیاز دارد[8].
معماری همراستاسازی (Alignment)
این رویکرد از انکودرهای پیشآموختهی منجمد استفاده میکند که از طریق یک ماژول همراستاسازی آموزشپذیر کوچک به هم متصل میشوند. برای نمونه، BLIP-2 از Q-Former (Querying Transformer) به عنوان یک عنصر اتصال سبک میان انکودر تصویری منجمد و مدل زبانی استفاده میکند و به پارامترهای آموزشپذیر به مراتب کمتری نیاز دارد[9].
مدلهای اصلی
GPT-4V / GPT-4o (OpenAI)
خانوادهی مدلهای GPT-4 بر اساس تخمینها تا ۱٫۸ تریلیون پارامتر دارند (در معماری mixture of experts). مدل GPT-4o که در مه ۲۰۲۴ منتشر شد، از پردازش متن، تصویر، صدا و ویدیو به صورت بلادرنگ پشتیبانی میکند. این مدل بر روی benchmark MMMU به دقت ۶۹٫۱٪ دست مییابد[10].
Gemini (Google)
معماری بوماً چندوجهی که از ابتدا بر روی متن، تصویر، صدا و ویدیو آموزش دیده است. Gemini 1.5 Pro از پنجرهی زمینهای تا ۱۰ میلیون token پشتیبانی میکند و در ۳۰ مورد از ۳۲ benchmark محبوب از GPT-4 پیشی میگیرد[11].
Claude 3 (Anthropic)
خانوادهای از مدلها (Haiku، Sonnet، Opus) با پنجرهی زمینهای تا ۲۰۰٬۰۰۰ token. Claude 3 Opus بر روی benchmark MMMU به ۵۸٫۵٪ دست مییابد. برای افزایش ایمنی مدلها از رویکرد Constitutional AI استفاده میشود[12].
LLaVA (مدل متنباز)
انکودر تصویری CLIP را با مدل زبانی Vicuna ترکیب میکند. نسخههایی با ۷، ۱۳ و ۳۴ میلیارد پارامتر در دسترس هستند. این مدل به ۸۵٫۱٪ از عملکرد نسبی GPT-4 بر روی وظایف مصنوعی دست مییابد[13].
حوزههای کاربرد
- پرسش و پاسخ تصویری (VQA): به کاربران اجازه میدهد دربارهی محتوای تصویری سؤال بپرسند.
- تحلیل اسناد: MLLMهای مدرن قادرند تا ۲۰۰۰ صفحه در دقیقه پردازش کنند.
- تصویربرداری پزشکی: مدلهایی مانند Med-PaLM M (Google) تصاویر پزشکی و دادههای بالینی را تحلیل میکنند.
- رباتیک: مدلهایی مانند RT-2 (Google DeepMind) به رباتها امکان میدهند محیط تصویری را درک کرده و دستورات به زبان طبیعی را اجرا کنند.
محدودیتهای کنونی
- توهمزایی: نرخ توهمزایی در محتوای تولیدشده بین ۲۷ تا ۴۶ درصد تخمین زده میشود. مدلها ممکن است اشیاء ناموجود را توصیف کنند یا اطلاعات تصویری را نادرست تفسیر نمایند[14].
- نیازهای محاسباتی بالا: آموزش و استفاده از MLLM به زیرساخت محاسباتی قابل توجهی نیاز دارد.
- تعصب داده: نمایندگی ناکافی گروههای جمعیتی، زبانها و فرهنگها در دادههای آموزشی منجر به خطاهای سیستماتیک میشود.
پیوندها
- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)
منابع
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
- Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
- Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
- Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
- Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
- Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
یادداشتها
- ↑ 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [۱]
- ↑ «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [۲]
- ↑ Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [۳]
- ↑ DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [۴]
- ↑ «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [۵]
- ↑ «Understanding CLIP». Stanford CS231n. [۶]
- ↑ «Multimodal LLMs: The Complete Guide». Viso.ai. [۷]
- ↑ «The Architectures of Multimodal Language Models». Determined AI. [۸]
- ↑ «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [۹]
- ↑ «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [۱۰]
- ↑ «Google Gemini: A Deep Dive». DaveAI Blog. [۱۱]
- ↑ «Introducing the Claude 3 Family». Anthropic. [۱۲]
- ↑ Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [۱۳]
- ↑ «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [۱۴]