---
title: "Мультимодальные LLM"
source: "https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM"
wiki: "systems-analysis.info/wiki"
article: "Мультимодальные_LLM"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 307
wiki_created_at: 2026-09-06T22:06:54Z
wiki_modified_at: 2026-09-06T22:06:54Z
downloaded_at: 2026-09-07T22:18:59Z
---

# Мультимодальные LLM

**Мультимодальные [большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")** (англ. **Multimodal Large Language Models, MLLMs**) — это класс моделей искусственного интеллекта, способных обрабатывать и генерировать информацию в различных модальностях, включая текст, изображения, аудио и видео<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-encord_intro-1)</sup>. В отличие от унимодальных языковых моделей, работающих исключительно с текстом, MLLM интегрируют информацию из разных источников для решения комплексных задач понимания и генерации контента.

Основная концепция MLLM заключается в создании единого векторного представления ([embedding](https://systems-analysis.info/wiki/Embedding "Embedding")) для разных модальностей. Это позволяет модели устанавливать семантические связи между, например, изображением и его текстовым описанием<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-acm_survey-2)</sup>. Ключевым прорывом, заложившим основу современных MLLM, стало использование контрастивного обучения для выравнивания визуальных и текстовых представлений в общем пространстве признаков, как это было реализовано в модели **CLIP**<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-radford2021-3)</sup>.

## История развития

### Ранний период (2013–2020)

Концептуальные основы мультимодального ИИ были заложены в 2013 году, когда исследователи из Стэнфорда продемонстрировали возможность обучения с нулевой выборкой (zero-shot learning) с использованием векторных представлений слов<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-deoldify2013-4)</sup>. В 2016 году команда **FAIR** (Meta AI) показала эффективность использования естественноязыковых описаний для обучения моделей компьютерного зрения, достигнув 11,5% точности на ImageNet без прямого обучения<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-openai_fair_2016-5)</sup>.

### Эра CLIP (2021)

Революционным моментом стал выпуск модели **CLIP** (*Contrastive Language-Image Pre-training*) компанией OpenAI в январе 2021 года. Модель, обученная на 400 миллионах пар изображение-текст, продемонстрировала способность классифицировать изображения без специализированного обучения на конкретных задачах. CLIP стала основой для многих последующих MLLM<sup>[\[6\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-stanford_cs_clip-6)</sup>.

### Масштабирование и инновации (2022–2024)

После успеха CLIP появилось множество ключевых моделей:

- **Flamingo** (DeepMind, 2022) — 80-миллиардная модель, показавшая выдающиеся способности к обучению с малым количеством примеров.
- **BLIP** (Salesforce, 2022) — унифицированная архитектура для понимания и генерации.
- **GPT-4V** (OpenAI, 2023) — первая коммерческая мультимодальная модель такого масштаба.
- **LLaVA** (Microsoft, 2023) — популярная открытая альтернатива GPT-4V.
- **[Gemini](https://systems-analysis.info/wiki/Gemini "Gemini")** (Google, 2023) — нативно мультимодальная архитектура, изначально спроектированная для работы с разными типами данных.
- **[GPT-4o](https://systems-analysis.info/wiki/GPT-4o "GPT-4o")** (OpenAI, 2024) — модель, способная обрабатывать текст, аудио и видео в реальном времени с низкой задержкой<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) — модель с улучшенными способностями к анализу визуальной информации.

## Архитектурные подходы

### Двухэнкодерная архитектура (Dual-Encoder)

Использует отдельные энкодеры для каждой модальности, которые проецируют данные в общее пространство представлений. Ярким представителем является **CLIP**, где визуальный трансформер обрабатывает изображения, а текстовый — языковые данные. Преимуществами являются модульность и вычислительная эффективность, недостатком — ограниченное кросс-модальное взаимодействие<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-viso_ai_mllm-7)</sup>.

### Архитектура энкодер-декодер

Единый энкодер обрабатывает мультимодальный вход, а декодер генерирует текстовый выход. Модель **Flamingo** использует механизм *Perceiver Resampler* для обработки визуальных входов переменной длины и кросс-модальные слои внимания. Этот подход обеспечивает богатое межмодальное взаимодействие, но требует больших вычислительных ресурсов<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-determined_ai_arch-8)</sup>.

### Архитектура выравнивания (Alignment)

Этот подход использует замороженные предобученные энкодеры, соединённые через небольшой обучаемый модуль выравнивания. Например, **BLIP-2** использует **Q-Former** (*Querying Transformer*) как лёгкий связующий элемент между замороженным визуальным энкодером и языковой моделью, требуя значительно меньше обучаемых параметров<sup>[\[9\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-clarifai_blip2-9)</sup>.

## Основные модели

### GPT-4V / GPT-4o (OpenAI)

Семейство моделей GPT-4, по оценкам, насчитывает до **1,8 триллиона** параметров (в архитектуре смеси экспертов). Модель **GPT-4o**, выпущенная в мае 2024, поддерживает обработку текста, изображений, аудио и видео в реальном времени. На бенчмарке **MMMU** она достигает **69,1%** точности<sup>[\[10\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Нативно мультимодальная архитектура, обученная с нуля на тексте, изображениях, аудио и видео. **Gemini 1.5 Pro** поддерживает [контекстное окно](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE "Контекстное окно") до **10 миллионов [токенов](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен")** и превосходит GPT-4 на 30 из 32 популярных бенчмарков<sup>[\[11\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Семейство моделей (Haiku, Sonnet, Opus) с контекстным окном до 200 000 токенов. **[Claude](https://systems-analysis.info/wiki/Claude "Claude") 3 Opus** показывает **58,5%** на бенчмарке MMMU. Для повышения безопасности модели используется подход [Constitutional AI](https://systems-analysis.info/wiki/Constitutional_AI "Constitutional AI")<sup>[\[12\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (открытая модель)

Комбинирует визуальный энкодер CLIP с языковой моделью Vicuna. Доступны варианты с 7, 13 и 34 миллиардами параметров. Модель достигает 85,1% относительной производительности GPT-4 на синтетических задачах<sup>[\[13\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-llava_paper-13)</sup>.

## Области применения

- **Визуальные вопросы-ответы (VQA)**: Позволяют пользователям задавать вопросы о визуальном контенте.
- **Анализ документов**: Современные MLLM способны обрабатывать до 2000 страниц в минуту.
- **Медицинская визуализация**: Модели, такие как **Med-PaLM M** (Google), анализируют медицинские изображения и клинические данные.
- **Робототехника**: Модели, как **RT-2** (Google DeepMind), позволяют роботам понимать визуальную среду и выполнять команды на естественном языке.

## Текущие ограничения

- **[Галлюцинации](https://systems-analysis.info/wiki/%D0%93%D0%B0%D0%BB%D0%BB%D1%8E%D1%86%D0%B8%D0%BD%D0%B0%D1%86%D0%B8%D0%B8_%D0%B8_%D0%BD%D0%B5%D0%BA%D0%BE%D1%80%D1%80%D0%B5%D0%BA%D1%82%D0%BD%D1%8B%D0%B5_%D0%BE%D1%82%D0%B2%D0%B5%D1%82%D1%8B_LLM "Галлюцинации и некорректные ответы LLM")**: Уровень галлюцинаций в генерируемом контенте оценивается в 27–46%. Модели могут описывать несуществующие объекты или неверно интерпретировать визуальную информацию<sup>[\[14\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_note-arxiv_hallucinations-14)</sup>.
- **Высокие вычислительные требования**: Обучение и использование MLLM требует значительной вычислительной инфраструктуры.
- **Предвзятость данных**: Недостаточная представленность демографических групп, языков и культур в обучающих данных приводит к систематическим ошибкам.

## См. также

- [Галлюцинации и некорректные ответы LLM](https://systems-analysis.info/wiki/%D0%93%D0%B0%D0%BB%D0%BB%D1%8E%D1%86%D0%B8%D0%BD%D0%B0%D1%86%D0%B8%D0%B8_%D0%B8_%D0%BD%D0%B5%D0%BA%D0%BE%D1%80%D1%80%D0%B5%D0%BA%D1%82%D0%BD%D1%8B%D0%B5_%D0%BE%D1%82%D0%B2%D0%B5%D1%82%D1%8B_LLM "Галлюцинации и некорректные ответы LLM")
- [Мультимодальное рассуждение](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5 "Мультимодальное рассуждение")
- [Constitutional AI](https://systems-analysis.info/wiki/Constitutional_AI "Constitutional AI")
- [LLM‑as‑a‑Judge](https://systems-analysis.info/wiki/LLM%E2%80%91as%E2%80%91a%E2%80%91Judge "LLM‑as‑a‑Judge")
- [Архитектуры LLM](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D1%8B_LLM "Архитектуры LLM")

## Ссылки

- <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external text" rel="nofollow">A Comprehensive Guide to Multimodal LLMs (Encord Blog)</a>
- <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external text" rel="nofollow">Multimodal LLMs: The Complete Guide (Viso.ai)</a>

## Литература

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. <a href="https://arxiv.org/abs/2201.12086" class="external text" rel="nofollow">arXiv:2201.12086</a>.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. <a href="https://arxiv.org/abs/2301.12597" class="external text" rel="nofollow">arXiv:2301.12597</a>.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. <a href="https://arxiv.org/abs/2304.08485" class="external text" rel="nofollow">arXiv:2304.08485</a>.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. <a href="https://arxiv.org/abs/2307.15818" class="external text" rel="nofollow">arXiv:2307.15818</a>.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. <a href="https://arxiv.org/abs/2311.16502" class="external text" rel="nofollow">arXiv:2311.16502</a>.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. <a href="https://arxiv.org/abs/2106.13884" class="external text" rel="nofollow">arXiv:2106.13884</a>.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. <a href="https://arxiv.org/abs/2305.09617" class="external text" rel="nofollow">arXiv:2305.09617</a>.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. <a href="https://arxiv.org/abs/2306.13549" class="external text" rel="nofollow">arXiv:2306.13549</a>.

## Примечания

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-encord_intro_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
