Multimodal large language models — मल्टीमॉडल बड़े भाषा मॉडल

From Systems analysis Wiki
Jump to navigation Jump to search

मल्टीमॉडल बड़े भाषा मॉडल (अंग्रेज़ी: Multimodal Large Language Models, MLLMs) — यह कृत्रिम बुद्धिमत्ता के मॉडलों का एक वर्ग है, जो विभिन्न modalities में जानकारी को संसाधित और उत्पन्न करने में सक्षम है, जिसमें टेक्स्ट, चित्र, ऑडियो और वीडियो शामिल हैं[1]। केवल टेक्स्ट के साथ काम करने वाले unimodal भाषा मॉडलों के विपरीत, MLLM जटिल सामग्री-समझ और सामग्री-उत्पादन कार्यों को हल करने के लिए विभिन्न स्रोतों की जानकारी को एकीकृत करते हैं।

MLLM की मूल अवधारणा विभिन्न modalities के लिए एकीकृत vector representation (embedding) बनाने में निहित है। इससे मॉडल को, उदाहरण के लिए, किसी चित्र और उसके टेक्स्ट विवरण के बीच शब्दार्थ संबंध स्थापित करने की सुविधा मिलती है[2]। आधुनिक MLLM की नींव रखने वाली प्रमुख उपलब्धि, साझा feature space में दृश्य और पाठ्य representations के संरेखण के लिए contrastive learning का उपयोग था, जैसा कि CLIP मॉडल में लागू किया गया था[3]

विकास का इतिहास

प्रारंभिक काल (2013–2020)

मल्टीमॉडल AI की वैचारिक नींव 2013 में रखी गई, जब स्टैनफोर्ड के शोधकर्ताओं ने शब्द vector representations का उपयोग करते हुए zero-shot learning की संभावना प्रदर्शित की[4]। 2016 में FAIR (Meta AI) की टीम ने computer vision मॉडलों को प्रशिक्षित करने के लिए प्राकृतिक भाषा विवरणों के उपयोग की प्रभावशीलता दिखाई, और बिना प्रत्यक्ष प्रशिक्षण के ImageNet पर 11.5% सटीकता प्राप्त की[5]

CLIP का युग (2021)

जनवरी 2021 में OpenAI द्वारा CLIP (Contrastive Language-Image Pre-training) मॉडल का विमोचन एक क्रांतिकारी क्षण बना। 40 करोड़ image-text जोड़ों पर प्रशिक्षित इस मॉडल ने विशिष्ट कार्यों पर विशेष प्रशिक्षण के बिना चित्रों को वर्गीकृत करने की क्षमता प्रदर्शित की। CLIP अनेक बाद के MLLM का आधार बनी[6]

विस्तार और नवाचार (2022–2024)

CLIP की सफलता के बाद अनेक महत्वपूर्ण मॉडल सामने आए:

  • Flamingo (DeepMind, 2022) — 80 अरब पैरामीटर वाला मॉडल, जिसने कम उदाहरणों के साथ सीखने में उत्कृष्ट क्षमता दिखाई।
  • BLIP (Salesforce, 2022) — समझ और उत्पादन के लिए एकीकृत architecture।
  • GPT-4V (OpenAI, 2023) — इस पैमाने का पहला व्यावसायिक मल्टीमॉडल मॉडल।
  • LLaVA (Microsoft, 2023) — GPT-4V का लोकप्रिय open-source विकल्प।
  • Gemini (Google, 2023) — स्वाभाविक रूप से मल्टीमॉडल architecture, जो मूल रूप से विभिन्न प्रकार के डेटा के साथ काम करने के लिए डिज़ाइन की गई।
  • GPT-4o (OpenAI, 2024) — ऐसा मॉडल जो कम विलंबता के साथ वास्तविक समय में टेक्स्ट, ऑडियो और वीडियो संसाधित कर सकता है[1]
  • Claude 3.5 Sonnet (Anthropic, 2024) — दृश्य जानकारी के विश्लेषण में उन्नत क्षमताओं वाला मॉडल।

architectural दृष्टिकोण

Dual-Encoder Architecture - द्वि-एन्कोडर Architecture

प्रत्येक modality के लिए अलग-अलग encoders का उपयोग करता है, जो डेटा को साझा representation space में प्रक्षेपित करते हैं। इसका प्रमुख उदाहरण CLIP है, जहाँ visual transformer चित्रों को और text transformer भाषाई डेटा को संसाधित करता है। इसके लाभ हैं modularity और computational दक्षता, जबकि सीमित cross-modal interaction इसकी कमज़ोरी है[7]

Encoder-Decoder Architecture - एन्कोडर-डीकोडर Architecture

एक एकल encoder मल्टीमॉडल इनपुट को संसाधित करता है, जबकि decoder टेक्स्ट आउटपुट उत्पन्न करता है। Flamingo मॉडल परिवर्तनशील लंबाई के दृश्य इनपुट को संसाधित करने के लिए Perceiver Resampler तंत्र और cross-modal attention layers का उपयोग करता है। यह दृष्टिकोण समृद्ध inter-modal interaction प्रदान करता है, लेकिन अधिक computational संसाधनों की आवश्यकता होती है[8]

Alignment Architecture - संरेखण Architecture

यह दृष्टिकोण frozen pre-trained encoders का उपयोग करता है, जो एक छोटे trainable alignment module के माध्यम से जुड़े होते हैं। उदाहरण के लिए, BLIP-2 frozen visual encoder और भाषा मॉडल के बीच एक हल्के connecting element के रूप में Q-Former (Querying Transformer) का उपयोग करता है, जिसके लिए काफी कम trainable parameters की आवश्यकता होती है[9]

प्रमुख मॉडल

GPT-4V / GPT-4o (OpenAI)

GPT-4 मॉडल परिवार में अनुमानतः 1.8 ट्रिलियन तक पैरामीटर हैं (mixture of experts architecture में)। मई 2024 में जारी GPT-4o मॉडल वास्तविक समय में टेक्स्ट, चित्र, ऑडियो और वीडियो की प्रोसेसिंग का समर्थन करता है। MMMU benchmark पर यह 69.1% सटीकता प्राप्त करता है[10]

Gemini (Google)

स्वाभाविक रूप से मल्टीमॉडल architecture, जिसे टेक्स्ट, चित्र, ऑडियो और वीडियो पर शुरू से प्रशिक्षित किया गया है। Gemini 1.5 Pro 1 करोड़ tokens तक के context window का समर्थन करता है और 32 लोकप्रिय benchmarks में से 30 पर GPT-4 से बेहतर प्रदर्शन करता है[11]

Claude 3 (Anthropic)

200,000 tokens तक के context window वाले मॉडलों का परिवार (Haiku, Sonnet, Opus)। Claude 3 Opus MMMU benchmark पर 58.5% अंक दर्शाता है। मॉडलों की सुरक्षा बढ़ाने के लिए Constitutional AI दृष्टिकोण का उपयोग किया जाता है[12]

LLaVA (open-source मॉडल)

CLIP visual encoder को Vicuna भाषा मॉडल के साथ संयोजित करता है। 7, 13 और 34 अरब पैरामीटर वाले संस्करण उपलब्ध हैं। यह मॉडल synthetic कार्यों पर GPT-4 की तुलनात्मक performance का 85.1% प्राप्त करता है[13]

उपयोग के क्षेत्र

  • Visual Question Answering (VQA): उपयोगकर्ताओं को दृश्य सामग्री के बारे में प्रश्न पूछने की सुविधा देता है।
  • दस्तावेज़ विश्लेषण: आधुनिक MLLM प्रति मिनट 2000 पृष्ठों तक संसाधित करने में सक्षम हैं।
  • चिकित्सा imaging: Med-PaLM M (Google) जैसे मॉडल चिकित्सा चित्रों और नैदानिक डेटा का विश्लेषण करते हैं।
  • रोबोटिक्स: RT-2 (Google DeepMind) जैसे मॉडल रोबोट को दृश्य वातावरण समझने और प्राकृतिक भाषा में आदेशों का पालन करने में सक्षम बनाते हैं।

वर्तमान सीमाएँ

  • Hallucinations: उत्पन्न सामग्री में hallucination का स्तर 27–46% आंका गया है। मॉडल अस्तित्वहीन वस्तुओं का वर्णन कर सकते हैं या दृश्य जानकारी की गलत व्याख्या कर सकते हैं[14]
  • उच्च computational आवश्यकताएँ: MLLM के प्रशिक्षण और उपयोग के लिए महत्वपूर्ण computational infrastructure की आवश्यकता होती है।
  • डेटा पूर्वाग्रह: प्रशिक्षण डेटा में जनसांख्यिकीय समूहों, भाषाओं और संस्कृतियों का अपर्याप्त प्रतिनिधित्व व्यवस्थित त्रुटियों को जन्म देता है।

संदर्भ

  • A Comprehensive Guide to Multimodal LLMs (Encord Blog)
  • Multimodal LLMs: The Complete Guide (Viso.ai)

साहित्य

  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
  • Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
  • Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
  • Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
  • Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
  • Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
  • Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
  • Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
  • Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.

टिप्पणियाँ

  1. 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [१]
  2. «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [२]
  3. Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [३]
  4. DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [४]
  5. «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [५]
  6. «Understanding CLIP». Stanford CS231n. [६]
  7. «Multimodal LLMs: The Complete Guide». Viso.ai. [७]
  8. «The Architectures of Multimodal Language Models». Determined AI. [८]
  9. «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [९]
  10. «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [१०]
  11. «Google Gemini: A Deep Dive». DaveAI Blog. [११]
  12. «Introducing the Claude 3 Family». Anthropic. [१२]
  13. Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [१३]
  14. «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [१४]