---
title: "Multimodal reasoning (CS)"
source: "https://systems-analysis.info/int/Multimodal_reasoning_(CS)"
wiki: "systems-analysis.info/int"
article: "Multimodal_reasoning_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4770
wiki_created_at: 2026-09-06T23:39:40Z
wiki_modified_at: 2026-09-06T23:39:40Z
downloaded_at: 2026-09-07T23:04:31Z
---

# Multimodal reasoning (CS)

**Multimodální uvažování** (angl. *Multimodal Reasoning*) — je schopnost umělé inteligence, zejména velkých jazykových modelů (LLM), současně zpracovávat, interpretovat a logicky propojovat informace z různých typů dat (modalit), jako jsou **text, obrázky, audio** a **video**, za účelem řešení složitých úkolů<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-survey_perception-1)</sup>. Tento proces napodobuje mnohostranné lidské vnímání a představuje klíčový krok na cestě k vytvoření univerzálnější a adaptivnější obecné umělé inteligence (AGI)<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-ms_kosmos1-2)</sup>.

Modely disponující touto schopností se nazývají **multimodální velké jazykové modely** (**MLLM** nebo LMRM — *Large Multimodal Reasoning Models*). Rozšiřují možnosti tradičních LLM, které byly trénovány pouze na textu, a umožňují jim rozumět obsahu obrázků, analyzovat videa, ovládat roboty a vést dialog na základě vizuálních dat.

## Evoluce přístupů

Přístupy k multimodálnímu uvažování prošly rychlou evolucí od modulárních systémů k unifikovaným, jazykově centrickým architekturám.

- **Rané systémy**: Byly založeny na oddělených procesních řetězcích, kde samostatné komponenty zpracovávaly zrak, jiné text, a na závěrečné fázi byla jejich reprezentace spojena. Tento přístup vyžadoval pečlivý návrh pro každý konkrétní úkol.
- **Moderní systémy**: Přešly k unifikovaným, jazykově centrickým modelům. V nich velký jazykový model vystupuje jako centrální článek neboli „engine" uvažování, který zpracovává informace ze všech modalit v jednotném formátu. To bylo umožněno metodami, které jazykový model „naučily" rozumět vizuálním a dalším datům tím, že je reprezentovaly ve formě speciálních tokenů<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-survey_perception-1)</sup>.

Důležitým milníkem v tomto přechodu se stala koncepce **„multimodálního řetězce uvažování"** (*Multimodal Chain-of-Thought, MCoT*), kde model dostává posloupnost výzev, které ho krok za krokem vedou logickými kroky zahrnujícími různé modality.

## Architektury multimodálních LLM

Existují dvě základní architektonické strategie pro kombinování různých modalit s jazykovým modelem<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-raschka_understanding-3)</sup>:

### 1. Unifikovaná architektura na úrovni tokenů

V tomto přístupu jsou všechny modality převedeny do společné reprezentace kompatibilní s LLM. Například obrázek je rozdělen na fragmenty (patche), prochází vizuálním enkodérem (například Vision Transformer (ViT)) a je převeden na posloupnost vektorových embeddingů — **vizuálních tokenů**. Tyto vizuální tokeny jsou poté zřetězeny (spojeny) s textovými tokeny a předány jako vstup velkému jazykovému modelu, který je zpracovává jediným datovým proudem.

- **Výhody**: Toto schéma téměř nevyžaduje změny v architektuře LLM a snadno se škáluje.
- **Příklady**: GPT-4 od OpenAI, **PaLM-E** od Google.

### 2. Architektura s křížovou modální pozorností

Zde jazykový model a vizuální enkodér zůstávají oddělenými subsystémy, ale jsou propojeny speciálními vrstvami **křížové modální pozornosti** (*cross-attention*). Tyto vrstvy umožňují textovým a vizuálním reprezentacím vzájemně se ovlivňovat v průběhu generování. Model jako by „nahlížel" do vizuálních příznaků při každém kroku tvorby textové odpovědi.

- **Výhody**: Umožňuje efektivně využívat sílu již existujících, předem natrénovaných a zmrazených modelů (například velkého LLM a výkonného ViT) trénováním pouze spojovacích vrstev.
- **Příklad**: **Flamingo** od DeepMind.

V moderním výzkumu se unifikované architektury *decoder-only* staly dominantními, protože se snadněji škálují a lépe využívají možnosti existujících LLM<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-raschka_understanding-3)</sup>.

## Klíčové modely a výzkumy

Rozvoj MLLM se výrazně zrychlil v letech 2022–2024.

- **Flamingo (DeepMind, 2022)**: Jeden z prvních velkých vizuálně-jazykových modelů (VLM), schopný v režimu few-shot learning řešit různorodé multimodální úkoly bez dalšího dolaďování. Flamingo ukázala, že jediný model se může rychle přizpůsobit novým úkolům poté, co obdrží pouze několik příkladů ve výzvě<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-deepmind_flamingo-4)</sup>.

<!-- -->

- **Kosmos-1 (Microsoft Research, 2023)**: První MLLM natrénovaná od nuly na webových datech. Je schopna vnímat text a obrázky jako „obecné modality" a dosáhla silných výsledků při řešení textových úkolů s obrázky (OCR), multimodálním dialogu a dokonce i v úlohách neverbálního logického myšlení (Ravenovy matice)<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-ms_kosmos1-2)</sup>.

<!-- -->

- **GPT-4 (OpenAI, 2023)**: Vlajkový model prezentovaný jako „velký multimodální model", schopný přijímat na vstupu text i obrázky. Přestože jeho architektura není zveřejněna, je známo, že dokáže analyzovat obsah obrázků, popisovat grafy a vysvětlovat vizuální memy. Přístup k jeho multimodálním schopnostem byl poskytnut omezeně, například ve spolupráci s aplikací BeMyEyes pro pomoc nevidomým a slabozrakým<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-openai_gpt4-5)</sup>.

<!-- -->

- **PaLM-E (Google, 2023)**: Takzvaný „vtělený" (*embodied*) multimodální model, vytvořený pro integraci vizuálního vnímání s fyzickými akcemi robota. PaLM-E je schopen generovat postupné plány pro ovládání robotů, přičemž na vstupu dostává kombinaci obrázků z kamer a hodnot ze senzorů. To prokázalo efekt „pozitivního transferu": trénink na obecných úkolech „vizualizace+jazyk" zlepšil efektivitu robotických dovedností<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-google_palm-e-6)</sup>.

<!-- -->

- **LLAMA 3.2 (Meta, 2024)**: Otevřená série modelů, ve které se objevily i multimodální verze. Jejich vznik zpřístupňuje technologie MLLM širší výzkumné komunitě pro další experimenty<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-raschka_understanding-3)</sup>.

## Problémy a omezení

Navzdory působivým úspěchům čelí MLLM řadě závažných problémů:

- **Halucinace**: Stejně jako jejich textové předchůdkyně mohou i MLLM generovat přesvědčivě znějící, ale fakticky nesprávná tvrzení. Vizuální informace tento problém neodstraňují, ale někdy ho prohlubují a vedou k nesprávným interpretacím obrázků<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-acl_multimodal_kg-7)</sup>.
- **Schopnost zobecňování a hloubka uvažování**: Modely často nedokáží spolehlivě přenášet závěry na nové typy dat (omni-modální zobecnění) a jejich uvažování může být povrchní. Mohou popsat obrázek, ale selhat, pokud úkol vyžaduje vícekrokové plánování zahrnující text i obrázek<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-survey_perception-1)</sup>.
- **Technické obtíže**: Trénink MLLM vyžaduje obrovské výpočetní zdroje a velké, pečlivě připravené multimodální datasety. Hodnocení kvality takových modelů je také obtížné, protože vyžaduje speciální benchmarky zohledňující jak porozumění, tak uvažování.

## Perspektivy rozvoje

Trendy ukazují, že multimodální modely budou stále více **„nativně" multimodální** (*Native Large Multimodal Models*), tedy od počátku navržené pro práci se všemi modalitami. Konečným cílem je vytvoření **univerzální inteligence** schopné vnímat a chápat svět stejně bohatě jako člověk. Za tímto účelem výzkumníci pracují na snižování závislosti na anotovaných datech, trénování modelů k abstraktnějšímu, kauzálnímu myšlení a zajišťování bezpečné kontroly nad takovými výkonnými systémy. Rozvoj podpůrných přístupů, jako je **HuggingGPT** — kde LLM vystupuje jako koordinátor rozdělující úkoly mezi specializované modely — rovněž připravuje půdu pro spolehlivější multimodální AI<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_note-hugging_gpt-8)</sup>.

## Odkazy

- Přehledový článek: A Survey on Large Multimodal Reasoning Models (2025)
- Článek Sebastiana Rashky o porozumění multimodálním LLM

## Literatura

- Li, Y. et al. (2025). *Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models*. arXiv:2505.04921.
- Lee, J. et al. (2024). *Multimodal Reasoning with Multimodal Knowledge Graph*. ACL 2024.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models*. arXiv:2302.14045.
- Shen, Y. et al. (2023). *HuggingGPT: Solving AI Tasks with ChatGPT and Its Friends in Hugging Face*. arXiv:2303.17580.
- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Driess, D. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- OpenAI (2023). *GPT-4 Technical Report*. arXiv:2303.08774.
- Chen, X. et al. (2023). *PaLI-X: On Scaling Up a Multilingual Vision and Language Model*. arXiv:2305.18565.
- Alayrac, J-B. et al. (2022). *Flamingo: A Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Chen, X. et al. (2022). *PaLI: A Jointly-Scaled Multilingual Language-Image Model*. arXiv:2209.06794.
- Huang, S. et al. (2022). *Multimodal Chain-of-Thought Prompting in Large Language Models*. arXiv:2302.00923.

## Poznámky

1.  <span id="cite_note-survey_perception-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-survey_perception_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-survey_perception_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-survey_perception_1-2)</sup> Yang, Z., et al. «Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models». *arXiv:2505.04921* \[cs.AI\], 8 мая 2025 г. <a href="https://arxiv.org/html/2505.04921v1" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-ms_kosmos1-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-ms_kosmos1_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-ms_kosmos1_2-1)</sup> Huang, S., et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045* \[cs.CL\], 28 февр. 2023 г. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-raschka_understanding-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-raschka_understanding_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-raschka_understanding_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-raschka_understanding_3-2)</sup> Raschka, Sebastian. «Understanding Multimodal LLMs». *Ahead of AI Magazine*. <a href="https://magazine.sebastianraschka.com/p/understanding-multimodal-ilms" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deepmind_flamingo-4">[↑](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-deepmind_flamingo_4-0) Alayrac, Jean-Baptiste, et al. «Tackling multiple tasks with a single visual language model». *DeepMind Blog*. <a href="https://deepmind.google/discover/blog/tackling-multiple-tasks-with-a-single-visual-language-model/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_gpt4-5">[↑](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-openai_gpt4_5-0) «GPT-4». *OpenAI*. <a href="https://openai.com/index/gpt-4-research/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-google_palm-e-6">[↑](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-google_palm-e_6-0) Driess, Danny, et al. «PaLM-E: An embodied multimodal language model». *Google Research Blog*. <a href="https://research.google/blog/palm-e-an-embodied-multimodal-language-model/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-acl_multimodal_kg-7">[↑](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-acl_multimodal_kg_7-0) Lee, D., et al. «Multimodal Reasoning with Multimodal Knowledge Graph». *ACL Anthology*, 2024. <a href="https://aclanthology.org/2024.acl-long.579/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hugging_gpt-8">[↑](https://systems-analysis.info/int/Multimodal_reasoning_(CS)#cite_ref-hugging_gpt_8-0) Shen, Y., et al. «HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face». *OpenReview*. <a href="https://openreview.net/forum?id=yHdTscY6Ci" class="external autonumber" rel="nofollow">[8]</a></span>
