---
title: "Multimodal reasoning — মাল্টিমোডাল রিজনিং"
source: "https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82"
wiki: "systems-analysis.info/int"
article: "Multimodal_reasoning_—_মাল্টিমোডাল_রিজনিং"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4787
wiki_created_at: 2026-09-06T23:39:54Z
wiki_modified_at: 2026-09-06T23:39:54Z
downloaded_at: 2026-09-07T23:04:37Z
---

# Multimodal reasoning — মাল্টিমোডাল রিজনিং

**মাল্টিমোডাল রিজনিং** (ইংরেজি: *Multimodal Reasoning*) — এটি কৃত্রিম বুদ্ধিমত্তার, বিশেষত বৃহৎ ভাষা মডেলের (LLM), একটি সক্ষমতা, যার মাধ্যমে বিভিন্ন ধরনের ডেটা (মোডালিটি) — যেমন **টেক্সট, ছবি, অডিও** এবং **ভিডিও** — থেকে একসাথে তথ্য প্রক্রিয়া করা, ব্যাখ্যা করা এবং যৌক্তিকভাবে সংযুক্ত করা সম্ভব হয়, যা জটিল সমস্যা সমাধানে কাজে আসে<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-survey_perception-1)</sup>। এই প্রক্রিয়াটি বহুমাত্রিক মানবীয় উপলব্ধির অনুকরণ করে এবং আরও সার্বজনীন ও অভিযোজিত সাধারণ কৃত্রিম বুদ্ধিমত্তা (AGI) তৈরির পথে একটি মূল পদক্ষেপ হিসেবে বিবেচিত<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-ms_kosmos1-2)</sup>।

যেসব মডেল এই সক্ষমতা রাখে, তাদের **মাল্টিমোডাল বৃহৎ ভাষা মডেল** (**MLLM** বা LMRM — *Large Multimodal Reasoning Models*) বলা হয়। এগুলো প্রচলিত LLM-এর সীমা অতিক্রম করে — যেগুলো শুধুমাত্র টেক্সট দিয়ে প্রশিক্ষিত হয়েছিল — এবং ছবির বিষয়বস্তু বোঝা, ভিডিও বিশ্লেষণ করা, রোবট নিয়ন্ত্রণ করা এবং দৃশ্যমান তথ্যের ভিত্তিতে সংলাপ পরিচালনা করার সুযোগ দেয়।

## পদ্ধতির বিবর্তন

মাল্টিমোডাল রিজনিং-এর পদ্ধতিগুলো মডুলার সিস্টেম থেকে একীভূত, ভাষা-কেন্দ্রিক আর্কিটেকচারে দ্রুত বিকশিত হয়েছে।

- **প্রারম্ভিক সিস্টেম**: আলাদা আলাদা পাইপলাইনের উপর নির্ভরশীল ছিল, যেখানে একটি অংশ দৃষ্টিশক্তি এবং অন্য অংশ টেক্সট প্রক্রিয়া করত, এবং চূড়ান্ত পর্যায়ে তাদের উপস্থাপনা একত্রিত করা হত। এই পদ্ধতির জন্য প্রতিটি নির্দিষ্ট কাজের জন্য সূক্ষ্ম ডিজাইন প্রয়োজন ছিল।
- **আধুনিক সিস্টেম**: একীভূত, ভাষা-কেন্দ্রিক মডেলে রূপান্তরিত হয়েছে। এতে বৃহৎ ভাষা মডেল কেন্দ্রীয় ভূমিকায় অথবা রিজনিং-এর «ইঞ্জিন» হিসেবে কাজ করে, যা সমস্ত মোডালিটির তথ্য একটি একীভূত ফরম্যাটে প্রক্রিয়া করে। এটি সম্ভব হয়েছে এমন পদ্ধতির মাধ্যমে যা ভাষা মডেলকে বিশেষ token-এর আকারে দৃশ্যমান ও অন্যান্য ডেটা বুঝতে «শিখিয়েছে»<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-survey_perception-1)</sup>।

এই রূপান্তরের একটি গুরুত্বপূর্ণ মাইলফলক হল **«মাল্টিমোডাল চেইন অব থট»** (*Multimodal Chain-of-Thought, MCoT*) ধারণা, যেখানে মডেলটি ধারাবাহিক প্রম্পট পায় যা ধাপে ধাপে বিভিন্ন মোডালিটি ব্যবহার করে যুক্তিসঙ্গত পদক্ষেপের মধ্য দিয়ে এগিয়ে যায়।

## মাল্টিমোডাল LLM-এর আর্কিটেকচার

ভাষা মডেলের সাথে বিভিন্ন মোডালিটি একত্রিত করার দুটি প্রধান আর্কিটেকচারাল কৌশল রয়েছে<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-raschka_understanding-3)</sup>:

### ১. Token স্তরে একীভূত আর্কিটেকচার

এই পদ্ধতিতে সমস্ত মোডালিটি LLM-এর সাথে সামঞ্জস্যপূর্ণ একটি সাধারণ উপস্থাপনায় রূপান্তরিত হয়। উদাহরণস্বরূপ, একটি ছবিকে টুকরো (প্যাচ) করে ভিজ্যুয়াল এনকোডারের (যেমন Vision Transformer (ViT)) মধ্য দিয়ে পাঠানো হয় এবং একটি ভেক্টর embedding-এর ধারায় রূপান্তরিত করা হয় — যাকে **ভিজ্যুয়াল token** বলে। তারপর এই ভিজ্যুয়াল token-গুলো টেক্সট token-এর সাথে যুক্ত (concatenate) করা হয় এবং বৃহৎ ভাষা মডেলে ইনপুট হিসেবে দেওয়া হয়, যা সেগুলো একটি একক স্রোতে প্রক্রিয়া করে।

- **সুবিধা**: এই পদ্ধতিতে LLM আর্কিটেকচারে প্রায় কোনো পরিবর্তন প্রয়োজন হয় না এবং সহজেই স্কেল করা যায়।
- **উদাহরণ**: OpenAI-এর GPT-4, Google-এর **PaLM-E**।

### ২. ক্রস-মোডাল attention আর্কিটেকচার

এখানে ভাষা মডেল এবং ভিজ্যুয়াল এনকোডার আলাদা সাব-সিস্টেম হিসেবে থাকে, তবে বিশেষ **ক্রস-মোডাল attention** (*cross-attention*) স্তর দিয়ে সংযুক্ত থাকে। এই স্তরগুলো টেক্সট ও ভিজ্যুয়াল উপস্থাপনাকে জেনারেশন প্রক্রিয়ায় একে অপরকে প্রভাবিত করতে দেয়। মডেলটি যেন টেক্সট উত্তর তৈরির প্রতিটি ধাপে ভিজ্যুয়াল বৈশিষ্ট্যগুলো «দেখে নেয়»।

- **সুবিধা**: ইতোমধ্যে বিদ্যমান, পূর্ব-প্রশিক্ষিত এবং frozen মডেলগুলোর (যেমন একটি বৃহৎ LLM এবং শক্তিশালী ViT) শক্তি কার্যকরভাবে ব্যবহার করতে সক্ষম করে, কেবলমাত্র সংযোগকারী স্তরগুলো প্রশিক্ষণ দিয়ে।
- **উদাহরণ**: DeepMind-এর **Flamingo**।

আধুনিক গবেষণায় একীভূত *decoder-only* আর্কিটেকচারগুলো প্রভাবশালী হয়ে উঠেছে, কারণ এগুলো সহজে স্কেল করা যায় এবং বিদ্যমান LLM-এর সক্ষমতা আরও ভালোভাবে কাজে লাগায়<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-raschka_understanding-3)</sup>।

## মূল মডেল ও গবেষণা

২০২২–২০২৪ সালে MLLM-এর বিকাশ বিশেষভাবে ত্বরান্বিত হয়েছে।

- **Flamingo (DeepMind, ২০২২)**: প্রথম বড় ভিজ্যুয়াল-ল্যাঙ্গুয়েজ মডেলগুলোর (VLM) একটি, যা few-shot learning মোডে অতিরিক্ত fine-tuning ছাড়াই বিভিন্ন মাল্টিমোডাল কাজ সমাধান করতে সক্ষম। Flamingo প্রমাণ করেছে যে একটি একক মডেল প্রম্পটে মাত্র কয়েকটি উদাহরণ পেয়ে নতুন কাজে দ্রুত অভিযোজন করতে পারে<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-deepmind_flamingo-4)</sup>।

<!-- -->

- **Kosmos-1 (Microsoft Research, ২০২৩)**: প্রথম MLLM যা ওয়েব ডেটা থেকে শুরু থেকে প্রশিক্ষিত। এটি টেক্সট ও ছবিকে «সাধারণ মোডালিটি» হিসেবে গ্রহণ করতে পারে এবং ছবিসহ টেক্সট কাজ সমাধানে (OCR), মাল্টিমোডাল সংলাপে এবং এমনকি অ-মৌখিক যৌক্তিক চিন্তার কাজে (Raven's matrices) শক্তিশালী ফলাফল দেখিয়েছে<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-ms_kosmos1-2)</sup>।

<!-- -->

- **GPT-4 (OpenAI, ২০২৩)**: একটি ফ্ল্যাগশিপ মডেল, যাকে «বৃহৎ মাল্টিমোডাল মডেল» হিসেবে উপস্থাপন করা হয়, যা টেক্সট ও ছবি ইনপুট হিসেবে নিতে পারে। এর আর্কিটেকচার প্রকাশিত না হলেও, এটি ছবির বিষয়বস্তু বিশ্লেষণ করতে, গ্রাফ বর্ণনা করতে এবং ভিজ্যুয়াল মিম ব্যাখ্যা করতে পারে বলে জানা গেছে। এর মাল্টিমোডাল সক্ষমতার অ্যাক্সেস সীমিতভাবে দেওয়া হয়েছিল, যেমন দৃষ্টি প্রতিবন্ধী ব্যক্তিদের সহায়তায় BeMyEyes অ্যাপের সাথে সহযোগিতায়<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-openai_gpt4-5)</sup>।

<!-- -->

- **PaLM-E (Google, ২০২৩)**: তথাকথিত «এমবোডিড» (*embodied*) মাল্টিমোডাল মডেল, যা রোবটের শারীরিক কার্যক্রমের সাথে ভিজ্যুয়াল উপলব্ধি একীভূত করতে তৈরি। PaLM-E ক্যামেরার ছবি ও সেন্সরের রিডিং-এর সমন্বয় ইনপুট হিসেবে নিয়ে রোবট নিয়ন্ত্রণের জন্য ধাপে ধাপে পরিকল্পনা তৈরি করতে পারে। এটি «ইতিবাচক ট্রান্সফার» প্রভাব প্রদর্শন করেছে: সাধারণ «ভিজ্যুয়ালাইজেশন+ভাষা» কাজে প্রশিক্ষণ রোবোটিক দক্ষতার কার্যকারিতা উন্নত করেছে<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-google_palm-e-6)</sup>।

<!-- -->

- **LLAMA 3.2 (Meta, ২০২৪)**: উন্মুক্ত মডেলের একটি সিরিজ, যেখানে মাল্টিমোডাল সংস্করণও যুক্ত হয়েছে। এগুলোর আগমন MLLM প্রযুক্তিগুলোকে বিস্তৃত গবেষণা সম্প্রদায়ের কাছে আরও পরীক্ষা-নিরীক্ষার জন্য সহজলভ্য করে তোলে<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-raschka_understanding-3)</sup>।

## সমস্যা ও সীমাবদ্ধতা

চমৎকার অর্জন সত্ত্বেও, MLLM বেশ কিছু গুরুতর সমস্যার মুখোমুখি হয়:

- **হ্যালুসিনেশন**: তাদের টেক্সট-ভিত্তিক পূর্বসূরিদের মতো, MLLM বিশ্বাসযোগ্যভাবে শোনায় কিন্তু বাস্তবে ভুল এমন বক্তব্য তৈরি করতে পারে। ভিজ্যুয়াল তথ্য এই সমস্যা দূর করে না, বরং কখনো কখনো ছবির ভুল ব্যাখ্যার মাধ্যমে তা আরও জটিল করে তোলে<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-acl_multimodal_kg-7)</sup>।
- **সাধারণীকরণ ক্ষমতা ও রিজনিং-এর গভীরতা**: মডেলগুলো প্রায়ই নতুন ধরনের ডেটায় (অমনি-মোডাল সাধারণীকরণ) নির্ভরযোগ্যভাবে সিদ্ধান্ত স্থানান্তর করতে পারে না এবং তাদের রিজনিং অগভীর হতে পারে। তারা একটি ছবি বর্ণনা করতে পারলেও, যদি কাজটিতে টেক্সট ও ছবি বিবেচনা করে বহুধাপী পরিকল্পনার প্রয়োজন হয়, তখন ব্যর্থ হতে পারে<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-survey_perception-1)</sup>।
- **প্রযুক্তিগত জটিলতা**: MLLM প্রশিক্ষণে বিশাল গণনামূলক সম্পদ এবং বড়, সতর্কতার সাথে প্রস্তুত মাল্টিমোডাল dataset প্রয়োজন। এই ধরনের মডেলগুলোর মান মূল্যায়নও জটিল, কারণ এতে বোঝাপড়া ও রিজনিং উভয়ই বিবেচনা করে বিশেষ benchmark প্রয়োজন।

## ভবিষ্যৎ সম্ভাবনা

প্রবণতাগুলো দেখায় যে মাল্টিমোডাল মডেলগুলো ক্রমশ আরও **«নেটিভ» মাল্টিমোডাল** (*Native Large Multimodal Models*) হয়ে উঠবে, অর্থাৎ শুরু থেকেই সমস্ত মোডালিটির সাথে কাজ করার জন্য ডিজাইন করা হবে। চূড়ান্ত লক্ষ্য হল একটি **সার্বজনীন বুদ্ধিমত্তা** তৈরি করা, যা মানুষের মতোই সমৃদ্ধভাবে বিশ্বকে উপলব্ধি করতে ও বুঝতে পারবে। এই লক্ষ্যে গবেষকরা লেবেলযুক্ত ডেটার উপর নির্ভরতা কমাতে, মডেলগুলোকে আরও বিমূর্ত, কার্যকারণ-ভিত্তিক চিন্তার প্রশিক্ষণ দিতে এবং এই শক্তিশালী সিস্টেমগুলোর নিরাপদ নিয়ন্ত্রণ নিশ্চিত করতে কাজ করছেন। সহায়ক পদ্ধতির বিকাশ, যেমন **HuggingGPT** — যেখানে LLM একটি সমন্বয়কারী হিসেবে বিশেষজ্ঞ মডেলগুলোতে কাজ বিতরণ করে — আরও নির্ভরযোগ্য মাল্টিমোডাল AI-এর পথ তৈরি করছে<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_note-hugging_gpt-8)</sup>।

## তথ্যসূত্র

- সমীক্ষা নিবন্ধ: A Survey on Large Multimodal Reasoning Models (২০২৫)
- সেবাস্তিয়ান রাশকার মাল্টিমোডাল LLM বোঝার বিষয়ক নিবন্ধ

## সাহিত্য

- Li, Y. et al. (2025). *Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models*. arXiv:2505.04921.
- Lee, J. et al. (2024). *Multimodal Reasoning with Multimodal Knowledge Graph*. ACL 2024.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models*. arXiv:2302.14045.
- Shen, Y. et al. (2023). *HuggingGPT: Solving AI Tasks with ChatGPT and Its Friends in Hugging Face*. arXiv:2303.17580.
- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Driess, D. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- OpenAI (2023). *GPT-4 Technical Report*. arXiv:2303.08774.
- Chen, X. et al. (2023). *PaLI-X: On Scaling Up a Multilingual Vision and Language Model*. arXiv:2305.18565.
- Alayrac, J-B. et al. (2022). *Flamingo: A Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Chen, X. et al. (2022). *PaLI: A Jointly-Scaled Multilingual Language-Image Model*. arXiv:2209.06794.
- Huang, S. et al. (2022). *Multimodal Chain-of-Thought Prompting in Large Language Models*. arXiv:2302.00923.

## টীকা

1.  <span id="cite_note-survey_perception-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-survey_perception_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-survey_perception_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-survey_perception_1-2)</sup> Yang, Z., et al. «Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models». *arXiv:2505.04921* \[cs.AI\], 8 мая 2025 г. <a href="https://arxiv.org/html/2505.04921v1" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-ms_kosmos1-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-ms_kosmos1_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-ms_kosmos1_2-1)</sup> Huang, S., et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045* \[cs.CL\], 28 февр. 2023 г. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-raschka_understanding-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-raschka_understanding_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-raschka_understanding_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-raschka_understanding_3-2)</sup> Raschka, Sebastian. «Understanding Multimodal LLMs». *Ahead of AI Magazine*. <a href="https://magazine.sebastianraschka.com/p/understanding-multimodal-ilms" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-deepmind_flamingo-4">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-deepmind_flamingo_4-0) Alayrac, Jean-Baptiste, et al. «Tackling multiple tasks with a single visual language model». *DeepMind Blog*. <a href="https://deepmind.google/discover/blog/tackling-multiple-tasks-with-a-single-visual-language-model/" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-openai_gpt4-5">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-openai_gpt4_5-0) «GPT-4». *OpenAI*. <a href="https://openai.com/index/gpt-4-research/" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-google_palm-e-6">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-google_palm-e_6-0) Driess, Danny, et al. «PaLM-E: An embodied multimodal language model». *Google Research Blog*. <a href="https://research.google/blog/palm-e-an-embodied-multimodal-language-model/" class="external autonumber" rel="nofollow">[৬]</a></span>
7.  <span id="cite_note-acl_multimodal_kg-7">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-acl_multimodal_kg_7-0) Lee, D., et al. «Multimodal Reasoning with Multimodal Knowledge Graph». *ACL Anthology*, 2024. <a href="https://aclanthology.org/2024.acl-long.579/" class="external autonumber" rel="nofollow">[৭]</a></span>
8.  <span id="cite_note-hugging_gpt-8">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%B0%E0%A6%BF%E0%A6%9C%E0%A6%A8%E0%A6%BF%E0%A6%82#cite_ref-hugging_gpt_8-0) Shen, Y., et al. «HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face». *OpenReview*. <a href="https://openreview.net/forum?id=yHdTscY6Ci" class="external autonumber" rel="nofollow">[৮]</a></span>
