---
title: "Мултимодални големи езикови модели"
source: "https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8"
wiki: "systems-analysis.info/int"
article: "Мултимодални_големи_езикови_модели"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 8715
wiki_created_at: 2026-09-07T01:21:34Z
wiki_modified_at: 2026-09-07T01:21:34Z
downloaded_at: 2026-09-07T23:26:58Z
---

# Мултимодални големи езикови модели

**Мултимодални големи езикови модели** (англ. **Multimodal Large Language Models, MLLMs**) — това е клас модели на изкуствен интелект, способни да обработват и генерират информация в различни модалности, включително текст, изображения, аудио и видео<sup>[\[1\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-encord_intro-1)</sup>. За разлика от унимодалните езикови модели, работещи единствено с текст, MLLM интегрират информация от различни източници за решаване на комплексни задачи за разбиране и генериране на съдържание.

Основната концепция на MLLM се състои в създаването на единно векторно представяне (embedding) за различни модалности. Това позволява на модела да установява семантични връзки между, например, изображение и неговото текстово описание<sup>[\[2\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-acm_survey-2)</sup>. Ключов пробив, положил основата на съвременните MLLM, беше използването на контрастивно обучение за изравняване на визуалните и текстовите представяния в общо пространство от признаци, както беше реализирано в модела **CLIP**<sup>[\[3\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-radford2021-3)</sup>.

## История на развитието

### Ранен период (2013–2020)

Концептуалните основи на мултимодалния ИИ бяха положени през 2013 година, когато изследователи от Станфорд демонстрираха възможността за обучение с нулева извадка (zero-shot learning) с използване на векторни представяния на думи<sup>[\[4\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-deoldify2013-4)</sup>. През 2016 година екипът **FAIR** (Meta AI) показа ефективността на използването на описания на естествен език за обучение на модели за компютърно зрение, постигайки 11,5% точност на ImageNet без пряко обучение<sup>[\[5\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-openai_fair_2016-5)</sup>.

### Ерата на CLIP (2021)

Революционен момент стана пускането на модела **CLIP** (*Contrastive Language-Image Pre-training*) от компанията OpenAI през януари 2021 година. Моделът, обучен върху 400 милиона двойки изображение-текст, демонстрира способност да класифицира изображения без специализирано обучение за конкретни задачи. CLIP се превърна в основа за много от следващите MLLM<sup>[\[6\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-stanford_cs_clip-6)</sup>.

### Мащабиране и иновации (2022–2024)

След успеха на CLIP се появиха множество ключови модели:

- **Flamingo** (DeepMind, 2022) — 80-милиарден модел, показал изключителни способности за обучение с малко примери.
- **BLIP** (Salesforce, 2022) — унифицирана архитектура за разбиране и генериране.
- **GPT-4V** (OpenAI, 2023) — първият търговски мултимодален модел от такъв мащаб.
- **LLaVA** (Microsoft, 2023) — популярна отворена алтернатива на GPT-4V.
- **Gemini** (Google, 2023) — нативно мултимодална архитектура, първоначално проектирана за работа с различни типове данни.
- **GPT-4o** (OpenAI, 2024) — модел, способен да обработва текст, аудио и видео в реално време с ниска латентност<sup>[\[1\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) — модел с подобрени способности за анализ на визуална информация.

## Архитектурни подходи

### Двуенкодерна архитектура (Dual-Encoder)

Използва отделни енкодери за всяка модалност, които проектират данните в общо пространство от представяния. Ярък представител е **CLIP**, при който визуален transformer обработва изображенията, а текстов — езиковите данни. Предимствата са модулност и изчислителна ефективност, а недостатъкът — ограничено крос-модално взаимодействие<sup>[\[7\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-viso_ai_mllm-7)</sup>.

### Архитектура енкодер-декодер

Единен енкодер обработва мултимодалния вход, а декодерът генерира текстов изход. Моделът **Flamingo** използва механизъм *Perceiver Resampler* за обработка на визуални входове с променлива дължина и крос-модални слоеве на attention. Този подход осигурява богато междумодално взаимодействие, но изисква по-големи изчислителни ресурси<sup>[\[8\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-determined_ai_arch-8)</sup>.

### Архитектура на изравняване (Alignment)

Този подход използва замразени предобучени енкодери, свързани чрез малък обучаем модул за изравняване. Например, **BLIP-2** използва **Q-Former** (*Querying Transformer*) като лек свързващ елемент между замразения визуален енкодер и езиковия модел, изисквайки значително по-малко обучаеми параметри<sup>[\[9\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-clarifai_blip2-9)</sup>.

## Основни модели

### GPT-4V / GPT-4o (OpenAI)

Семейството модели GPT-4, по оценки, наброява до **1,8 трилиона** параметъра (в архитектура на смес от експерти). Моделът **GPT-4o**, пуснат през май 2024, поддържа обработка на текст, изображения, аудио и видео в реално време. На benchmark-а **MMMU** той постига **69,1%** точност<sup>[\[10\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Нативно мултимодална архитектура, обучена от нулата върху текст, изображения, аудио и видео. **Gemini 1.5 Pro** поддържа контекстен прозорец до **10 милиона токена** и превъзхожда GPT-4 на 30 от 32 популярни benchmark-а<sup>[\[11\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Семейство модели (Haiku, Sonnet, Opus) с контекстен прозорец до 200 000 токена. **Claude 3 Opus** показва **58,5%** на benchmark-а MMMU. За повишаване на безопасността на моделите се използва подходът Constitutional AI<sup>[\[12\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (отворен модел)

Комбинира визуален енкодер CLIP с езиков модел Vicuna. Налични са варианти с 7, 13 и 34 милиарда параметъра. Моделът постига 85,1% относителна производителност спрямо GPT-4 на синтетични задачи<sup>[\[13\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-llava_paper-13)</sup>.

## Области на приложение

- **Визуални въпроси-отговори (VQA)**: Позволяват на потребителите да задават въпроси за визуално съдържание.
- **Анализ на документи**: Съвременните MLLM са способни да обработват до 2000 страници в минута.
- **Медицинска визуализация**: Модели като **Med-PaLM M** (Google) анализират медицински изображения и клинични данни.
- **Роботика**: Модели като **RT-2** (Google DeepMind) позволяват на роботите да разбират визуалната среда и да изпълняват команди на естествен език.

## Текущи ограничения

- **Халюцинации**: Нивото на халюцинациите в генерираното съдържание се оценява на 27–46%. Моделите могат да описват несъществуващи обекти или неправилно да интерпретират визуална информация<sup>[\[14\]](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-arxiv_hallucinations-14)</sup>.
- **Високи изчислителни изисквания**: Обучението и използването на MLLM изисква значителна изчислителна инфраструктура.
- **Предубеденост на данните**: Недостатъчното представяне на демографски групи, езици и култури в обучаващите данни води до систематични грешки.

## Препратки

- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)

## Литература

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. arXiv:2201.12086.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. arXiv:2301.12597.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. arXiv:2304.08485.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. arXiv:2307.15818.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. arXiv:2106.13884.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.

## Бележки

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/%D0%9C%D1%83%D0%BB%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D0%BD%D0%B8_%D0%B3%D0%BE%D0%BB%D0%B5%D0%BC%D0%B8_%D0%B5%D0%B7%D0%B8%D0%BA%D0%BE%D0%B2%D0%B8_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
