Multimodal large language models — মাল্টিমোডাল বৃহৎ ভাষা মডেল
মাল্টিমোডাল বৃহৎ ভাষা মডেল (ইংরেজি: Multimodal Large Language Models, MLLMs) — এটি কৃত্রিম বুদ্ধিমত্তা মডেলের একটি শ্রেণি, যা টেক্সট, চিত্র, অডিও এবং ভিডিও সহ বিভিন্ন মোডালিটিতে তথ্য প্রক্রিয়া করতও তৈরি করতে সক্ষম[1]। শুধুমাত্র টেক্সট নিয়ে কাজ করে এমন ইউনিমোডাল ভাষা মডেলের বিপরীতে, MLLM বিভিন্ন উৎস থেকে তথ্য একত্রিত করে জটিল বোঝাপড়া ও কন্টেন্ট তৈরির কাজ সম্পন্ন করে।
MLLM-এর মূল ধারণাটি হলো বিভিন্ন মোডালিটির জন্য একটি একক ভেক্টর উপস্থাপনা (embedding) তৈরি করা। এটি মডেলকে উদাহরণস্বরূপ একটি চিত্র এবং তার টেক্সট বিবরণের মধ্যে অর্থগত সম্পর্ক স্থাপন করতে দেয়[2]। আধুনিক MLLM-এর ভিত্তি স্থাপনকারী মূল অগ্রগতি ছিল সাধারণ feature space-এ ভিজ্যুয়াল ও টেক্সট উপস্থাপনা সারিবদ্ধ করতে contrastive learning-এর ব্যবহার, যা CLIP মডেলে বাস্তবায়িত হয়েছিল[3]।
ইতিহাসের বিকাশ
প্রাথমিক পর্যায় (২০১৩–২০২০)
মাল্টিমোডাল AI-এর ধারণাগত ভিত্তি ২০১৩ সালে স্থাপিত হয়েছিল, যখন স্ট্যানফোর্ডের গবেষকরা শব্দ ভেক্টর উপস্থাপনা ব্যবহার করে zero-shot learning-এর সম্ভাবনা প্রদর্শন করেন[4]। ২০১৬ সালে FAIR (Meta AI) টিম কম্পিউটার ভিশন মডেল প্রশিক্ষণে প্রাকৃতিক ভাষার বিবরণ ব্যবহারের কার্যকারিতা দেখায় এবং সরাসরি প্রশিক্ষণ ছাড়াই ImageNet-এ ১১.৫% নির্ভুলতা অর্জন করে[5]।
CLIP-এর যুগ (২০২১)
একটি বিপ্লবী মুহূর্ত ছিল ২০২১ সালের জানুয়ারিতে OpenAI কর্তৃক CLIP (Contrastive Language-Image Pre-training) মডেলের প্রকাশ। ৪০০ মিলিয়ন চিত্র-টেক্সট জোড়ায় প্রশিক্ষিত এই মডেলটি নির্দিষ্ট কাজে বিশেষায়িত প্রশিক্ষণ ছাড়াই চিত্র শ্রেণিবদ্ধ করার ক্ষমতা প্রদর্শন করে। CLIP পরবর্তী অনেক MLLM-এর ভিত্তি হয়ে ওঠে[6]।
স্কেলিং ও উদ্ভাবন (২০২২–২০২৪)
CLIP-এর সাফল্যের পর অনেক গুরুত্বপূর্ণ মডেল আবির্ভূত হয়:
- Flamingo (DeepMind, ২০২২) — ৮০ বিলিয়ন প্যারামিটারের মডেল, যা অল্প সংখ্যক উদাহরণ দিয়ে শেখার ক্ষেত্রে অসাধারণ ক্ষমতা প্রদর্শন করে।
- BLIP (Salesforce, ২০২২) — বোঝাপড়া ও তৈরির জন্য একটি একীভূত আর্কিটেকচার।
- GPT-4V (OpenAI, ২০২৩) — এই মাত্রার প্রথম বাণিজ্যিক মাল্টিমোডাল মডেল।
- LLaVA (Microsoft, ২০২৩) — GPT-4V-এর একটি জনপ্রিয় ওপেন বিকল্প।
- Gemini (Google, ২০২৩) — নেটিভলি মাল্টিমোডাল আর্কিটেকচার, মূলত বিভিন্ন ধরনের ডেটা নিয়ে কাজ করার জন্য ডিজাইন করা।
- GPT-4o (OpenAI, ২০২৪) — কম বিলম্বে রিয়েল টাইমে টেক্সট, অডিও ও ভিডিও প্রক্রিয়া করতে সক্ষম মডেল[1]।
- Claude 3.5 Sonnet (Anthropic, ২০২৪) — ভিজ্যুয়াল তথ্য বিশ্লেষণে উন্নত ক্ষমতাসম্পন্ন মডেল।
আর্কিটেকচারাল পদ্ধতি
Dual-Encoder আর্কিটেকচার
প্রতিটি মোডালিটির জন্য আলাদা encoder ব্যবহার করে, যা ডেটাকে একটি সাধারণ উপস্থাপনা space-এ প্রজেক্ট করে। এর উজ্জ্বল উদাহরণ হলো CLIP, যেখানে একটি ভিজ্যুয়াল transformer চিত্র প্রক্রিয়া করে এবং একটি টেক্সট transformer ভাষা ডেটা প্রক্রিয়া করে। সুবিধাগুলো হলো মডুলারিটি ও গণনামূলক দক্ষতা, আর সীমাবদ্ধতা হলো সীমিত cross-modal মিথস্ক্রিয়া[7]।
Encoder-Decoder আর্কিটেকচার
একটি একক encoder মাল্টিমোডাল ইনপুট প্রক্রিয়া করে এবং decoder টেক্সট আউটপুট তৈরি করে। Flamingo মডেলটি পরিবর্তনশীল দৈর্ঘ্যের ভিজ্যুয়াল ইনপুট প্রক্রিয়ার জন্য Perceiver Resampler প্রক্রিয়া এবং cross-modal attention স্তর ব্যবহার করে। এই পদ্ধতি সমৃদ্ধ cross-modal মিথস্ক্রিয়া নিশ্চিত করে, কিন্তু বেশি গণনামূলক সম্পদ প্রয়োজন[8]।
Alignment আর্কিটেকচার
এই পদ্ধতি একটি ছোট প্রশিক্ষণযোগ্য alignment মডিউলের মাধ্যমে সংযুক্ত frozen পূর্ব-প্রশিক্ষিত encoder ব্যবহার করে। উদাহরণস্বরূপ, BLIP-2 একটি frozen ভিজ্যুয়াল encoder এবং ভাষা মডেলের মধ্যে হালকা সংযোগকারী উপাদান হিসেবে Q-Former (Querying Transformer) ব্যবহার করে, যার জন্য উল্লেখযোগ্যভাবে কম প্রশিক্ষণযোগ্য প্যারামিটার প্রয়োজন[9]।
প্রধান মডেলগুলো
GPT-4V / GPT-4o (OpenAI)
GPT-4 মডেল পরিবারে অনুমানত ১.৮ ট্রিলিয়ন পর্যন্ত প্যারামিটার রয়েছে (mixture of experts আর্কিটেকচারে)। ২০২৪ সালের মে মাসে প্রকাশিত GPT-4o মডেলটি রিয়েল টাইমে টেক্সট, চিত্র, অডিও ও ভিডিও প্রক্রিয়া সমর্থন করে। MMMU benchmark-এ এটি ৬৯.১% নির্ভুলতা অর্জন করে[10]।
Gemini (Google)
টেক্সট, চিত্র, অডিও ও ভিডিওতে শুরু থেকে প্রশিক্ষিত একটি নেটিভলি মাল্টিমোডাল আর্কিটেকচার। Gemini 1.5 Pro ১০ মিলিয়ন token পর্যন্ত context window সমর্থন করে এবং ৩২টি জনপ্রিয় benchmark-এর মধ্যে ৩০টিতে GPT-4-কে ছাড়িয়ে যায়[11]।
Claude 3 (Anthropic)
২০০,০০০ token পর্যন্ত context window সহ মডেল পরিবার (Haiku, Sonnet, Opus)। Claude 3 Opus MMMU benchmark-এ ৫৮.৫% স্কোর করে। নিরাপত্তা বাড়াতে মডেলগুলো Constitutional AI পদ্ধতি ব্যবহার করে[12]।
LLaVA (ওপেন মডেল)
CLIP ভিজ্যুয়াল encoder-কে Vicuna ভাষা মডেলের সাথে একত্রিত করে। ৭, ১৩ এবং ৩৪ বিলিয়ন প্যারামিটারের রূপ পাওয়া যায়। মডেলটি সিন্থেটিক কাজে GPT-4-এর তুলনায় ৮৫.১% আপেক্ষিক কর্মক্ষমতা অর্জন করে[13]।
প্রয়োগের ক্ষেত্র
- ভিজ্যুয়াল প্রশ্নোত্তর (VQA): ব্যবহারকারীদের ভিজ্যুয়াল কন্টেন্ট সম্পর্কে প্রশ্ন করতে দেয়।
- ডকুমেন্ট বিশ্লেষণ: আধুনিক MLLM প্রতি মিনিটে ২০০০ পৃষ্ঠা পর্যন্ত প্রক্রিয়া করতে সক্ষম।
- মেডিকেল ইমেজিং: Med-PaLM M (Google)-এর মতো মডেলগুলো মেডিকেল চিত্র ও ক্লিনিকাল ডেটা বিশ্লেষণ করে।
- রোবোটিক্স: RT-2 (Google DeepMind)-এর মতো মডেলগুলো রোবটকে ভিজ্যুয়াল পরিবেশ বুঝতে এবং প্রাকৃতিক ভাষায় নির্দেশ পালন করতে সক্ষম করে।
বর্তমান সীমাবদ্ধতা
- হ্যালুসিনেশন: তৈরি করা কন্টেন্টে হ্যালুসিনেশনের মাত্রা ২৭–৪৬% হিসেবে মূল্যায়ন করা হয়। মডেলগুলো অবিদ্যমান বস্তু বর্ণনা করতে বা ভিজ্যুয়াল তথ্য ভুলভাবে ব্যাখ্যা করতে পারে[14]।
- উচ্চ গণনামূলক চাহিদা: MLLM প্রশিক্ষণ ও ব্যবহারের জন্য উল্লেখযোগ্য গণনামূলক অবকাঠামো প্রয়োজন।
- ডেটা পক্ষপাত: প্রশিক্ষণ ডেটায় জনতাত্ত্বিক গোষ্ঠী, ভাষা ও সংস্কৃতির অপর্যাপ্ত প্রতিনিধিত্ব পদ্ধতিগত ত্রুটির দিকে নিয়ে যায়।
তথ্যসূত্র
- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)
সাহিত্য
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
- Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
- Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
- Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
- Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
- Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
টীকা
- ↑ 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [১]
- ↑ «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [২]
- ↑ Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [৩]
- ↑ DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [৪]
- ↑ «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [৫]
- ↑ «Understanding CLIP». Stanford CS231n. [৬]
- ↑ «Multimodal LLMs: The Complete Guide». Viso.ai. [৭]
- ↑ «The Architectures of Multimodal Language Models». Determined AI. [৮]
- ↑ «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [৯]
- ↑ «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [১০]
- ↑ «Google Gemini: A Deep Dive». DaveAI Blog. [১১]
- ↑ «Introducing the Claude 3 Family». Anthropic. [১২]
- ↑ Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [১৩]
- ↑ «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [১৪]