---
title: "Multimodal large language models — Πολυτροπικά Μεγάλα Γλωσσικά Μοντέλα"
source: "https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1"
wiki: "systems-analysis.info/int"
article: "Multimodal_large_language_models_—_Πολυτροπικά_Μεγάλα_Γλωσσικά_Μοντέλα"
language: "el"
categories:
  - "Category:Greek"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4758
wiki_created_at: 2026-09-06T23:39:30Z
wiki_modified_at: 2026-09-06T23:39:30Z
downloaded_at: 2026-09-07T23:04:26Z
---

# Multimodal large language models — Πολυτροπικά Μεγάλα Γλωσσικά Μοντέλα

**Πολυτροπικά μεγάλα γλωσσικά μοντέλα** (αγγλ. **Multimodal Large Language Models, MLLMs**) — είναι μια κατηγορία μοντέλων τεχνητής νοημοσύνης που είναι ικανά να επεξεργάζονται και να παράγουν πληροφορίες σε διάφορες τροπικότητες, συμπεριλαμβανομένων κειμένου, εικόνων, ήχου και βίντεο<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-encord_intro-1)</sup>. Σε αντίθεση με τα μονοτροπικά γλωσσικά μοντέλα που λειτουργούν αποκλειστικά με κείμενο, τα MLLM ενσωματώνουν πληροφορίες από διαφορετικές πηγές για την επίλυση σύνθετων εργασιών κατανόησης και παραγωγής περιεχομένου.

Η βασική ιδέα των MLLM έγκειται στη δημιουργία ενός ενιαίου διανυσματικού αναπαριστώμενου (embedding) για διαφορετικές τροπικότητες. Αυτό επιτρέπει στο μοντέλο να δημιουργεί σημασιολογικές συνδέσεις μεταξύ, για παράδειγμα, μιας εικόνας και της κειμενικής της περιγραφής<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-acm_survey-2)</sup>. Η κύρια돌οκαινοτομία που έθεσε τα θεμέλια των σύγχρονων MLLM ήταν η χρήση contrastive learning για την ευθυγράμμιση οπτικών και κειμενικών αναπαραστάσεων σε κοινό χώρο χαρακτηριστικών, όπως υλοποιήθηκε στο μοντέλο **CLIP**<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-radford2021-3)</sup>.

## Ιστορία ανάπτυξης

### Πρώιμη περίοδος (2013–2020)

Τα εννοιολογικά θεμέλια του πολυτροπικού ΤΝ τέθηκαν το 2013, όταν ερευνητές από το Στάνφορντ απέδειξαν τη δυνατότητα εκπαίδευσης zero-shot learning με χρήση διανυσματικών αναπαραστάσεων λέξεων<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-deoldify2013-4)</sup>. Το 2016, η ομάδα **FAIR** (Meta AI) έδειξε την αποτελεσματικότητα της χρήσης περιγραφών φυσικής γλώσσας για την εκπαίδευση μοντέλων υπολογιστικής όρασης, επιτυγχάνοντας ακρίβεια 11,5% στο ImageNet χωρίς άμεση εκπαίδευση<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-openai_fair_2016-5)</sup>.

### Εποχή CLIP (2021)

Επαναστατική στιγμή αποτέλεσε η κυκλοφορία του μοντέλου **CLIP** (*Contrastive Language-Image Pre-training*) από την OpenAI τον Ιανουάριο του 2021. Το μοντέλο, εκπαιδευμένο σε 400 εκατομμύρια ζεύγη εικόνας-κειμένου, επέδειξε την ικανότητα ταξινόμησης εικόνων χωρίς εξειδικευμένη εκπαίδευση σε συγκεκριμένες εργασίες. Το CLIP έγινε η βάση για πολλά επόμενα MLLM<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-stanford_cs_clip-6)</sup>.

### Κλιμάκωση και καινοτομίες (2022–2024)

Μετά την επιτυχία του CLIP εμφανίστηκαν πολλά βασικά μοντέλα:

- **Flamingo** (DeepMind, 2022) — μοντέλο 80 δισεκατομμυρίων παραμέτρων που επέδειξε εξαιρετικές ικανότητες few-shot learning.
- **BLIP** (Salesforce, 2022) — ενοποιημένη αρχιτεκτονική για κατανόηση και παραγωγή.
- **GPT-4V** (OpenAI, 2023) — το πρώτο εμπορικό πολυτροπικό μοντέλο αυτής της κλίμακας.
- **LLaVA** (Microsoft, 2023) — δημοφιλής ανοιχτή εναλλακτική του GPT-4V.
- **Gemini** (Google, 2023) — εγγενώς πολυτροπική αρχιτεκτονική, σχεδιασμένη εξαρχής για εργασία με διαφορετικούς τύπους δεδομένων.
- **GPT-4o** (OpenAI, 2024) — μοντέλο ικανό να επεξεργάζεται κείμενο, ήχο και βίντεο σε πραγματικό χρόνο με χαμηλή καθυστέρηση<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) — μοντέλο με βελτιωμένες ικανότητες ανάλυσης οπτικών πληροφοριών.

## Αρχιτεκτονικές προσεγγίσεις

### Αρχιτεκτονική διπλού encoder (Dual-Encoder)

Χρησιμοποιεί ξεχωριστούς encoders για κάθε τροπικότητα, οι οποίοι προβάλλουν τα δεδομένα σε κοινό χώρο αναπαραστάσεων. Χαρακτηριστικό παράδειγμα αποτελεί το **CLIP**, όπου ένας οπτικός transformer επεξεργάζεται εικόνες και ένας κειμενικός — γλωσσικά δεδομένα. Τα πλεονεκτήματα είναι η αρθρωτότητα και η υπολογιστική αποδοτικότητα, ενώ μειονέκτημα αποτελεί η περιορισμένη διατροπική αλληλεπίδραση<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-viso_ai_mllm-7)</sup>.

### Αρχιτεκτονική encoder-decoder

Ένας ενιαίος encoder επεξεργάζεται την πολυτροπική είσοδο, ενώ ο decoder παράγει κειμενική έξοδο. Το μοντέλο **Flamingo** χρησιμοποιεί τον μηχανισμό *Perceiver Resampler* για την επεξεργασία οπτικών εισόδων μεταβλητού μήκους και στρώματα διατροπικής attention. Αυτή η προσέγγιση παρέχει πλούσια διατροπική αλληλεπίδραση, αλλά απαιτεί μεγαλύτερους υπολογιστικούς πόρους<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-determined_ai_arch-8)</sup>.

### Αρχιτεκτονική ευθυγράμμισης (Alignment)

Αυτή η προσέγγιση χρησιμοποιεί παγωμένους προεκπαιδευμένους encoders, συνδεδεμένους μέσω ενός μικρού εκπαιδεύσιμου module ευθυγράμμισης. Για παράδειγμα, το **BLIP-2** χρησιμοποιεί το **Q-Former** (*Querying Transformer*) ως ελαφρύ συνδετικό στοιχείο μεταξύ του παγωμένου οπτικού encoder και του γλωσσικού μοντέλου, απαιτώντας σημαντικά λιγότερες εκπαιδεύσιμες παραμέτρους<sup>[\[9\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-clarifai_blip2-9)</sup>.

## Κύρια μοντέλα

### GPT-4V / GPT-4o (OpenAI)

Η οικογένεια μοντέλων GPT-4 εκτιμάται ότι διαθέτει έως **1,8 τρισεκατομμύρια** παραμέτρους (σε αρχιτεκτονική mixture of experts). Το μοντέλο **GPT-4o**, που κυκλοφόρησε τον Μάιο του 2024, υποστηρίζει επεξεργασία κειμένου, εικόνων, ήχου και βίντεο σε πραγματικό χρόνο. Στο benchmark **MMMU** επιτυγχάνει ακρίβεια **69,1%**<sup>[\[10\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Εγγενώς πολυτροπική αρχιτεκτονική, εκπαιδευμένη από την αρχή σε κείμενο, εικόνες, ήχο και βίντεο. Το **Gemini 1.5 Pro** υποστηρίζει παράθυρο συγκειμένου έως **10 εκατομμύρια tokens** και υπερέχει του GPT-4 σε 30 από τα 32 δημοφιλή benchmarks<sup>[\[11\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Οικογένεια μοντέλων (Haiku, Sonnet, Opus) με παράθυρο συγκειμένου έως 200.000 tokens. Το **Claude 3 Opus** επιτυγχάνει **58,5%** στο benchmark MMMU. Για την ενίσχυση της ασφάλειας των μοντέλων χρησιμοποιείται η προσέγγιση Constitutional AI<sup>[\[12\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (ανοιχτό μοντέλο)

Συνδυάζει τον οπτικό encoder CLIP με το γλωσσικό μοντέλο Vicuna. Διατίθενται παραλλαγές με 7, 13 και 34 δισεκατομμύρια παραμέτρους. Το μοντέλο επιτυγχάνει 85,1% σχετικής απόδοσης του GPT-4 σε συνθετικές εργασίες<sup>[\[13\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-llava_paper-13)</sup>.

## Τομείς εφαρμογής

- **Οπτικές ερωτήσεις-απαντήσεις (VQA)**: Επιτρέπουν στους χρήστες να υποβάλλουν ερωτήσεις σχετικά με οπτικό περιεχόμενο.
- **Ανάλυση εγγράφων**: Τα σύγχρονα MLLM είναι ικανά να επεξεργάζονται έως 2.000 σελίδες ανά λεπτό.
- **Ιατρική απεικόνιση**: Μοντέλα όπως το **Med-PaLM M** (Google) αναλύουν ιατρικές εικόνες και κλινικά δεδομένα.
- **Ρομποτική**: Μοντέλα όπως το **RT-2** (Google DeepMind) επιτρέπουν στα ρομπότ να κατανοούν το οπτικό περιβάλλον και να εκτελούν εντολές σε φυσική γλώσσα.

## Τρέχοι περιορισμοί

- **Ψευδαισθήσεις (Hallucinations)**: Το επίπεδο ψευδαισθήσεων στο παραγόμενο περιεχόμενο εκτιμάται σε 27–46%. Τα μοντέλα ενδέχεται να περιγράφουν ανύπαρκτα αντικείμενα ή να ερμηνεύουν εσφαλμένα οπτικές πληροφορίες<sup>[\[14\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_note-arxiv_hallucinations-14)</sup>.
- **Υψηλές υπολογιστικές απαιτήσεις**: Η εκπαίδευση και η χρήση MLLM απαιτεί σημαντική υπολογιστική υποδομή.
- **Προκατάληψη δεδομένων**: Η ανεπαρκής εκπροσώπηση δημογραφικών ομάδων, γλωσσών και πολιτισμών στα δεδομένα εκπαίδευσης οδηγεί σε συστηματικά σφάλματα.

## Σύνδεσμοι

- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)

## Βιβλιογραφία

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. arXiv:2201.12086.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. arXiv:2301.12597.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. arXiv:2304.08485.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. arXiv:2307.15818.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. arXiv:2106.13884.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.

## Παραπομπές

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%CE%A0%CE%BF%CE%BB%CF%85%CF%84%CF%81%CE%BF%CF%80%CE%B9%CE%BA%CE%AC_%CE%9C%CE%B5%CE%B3%CE%AC%CE%BB%CE%B1_%CE%93%CE%BB%CF%89%CF%83%CF%83%CE%B9%CE%BA%CE%AC_%CE%9C%CE%BF%CE%BD%CF%84%CE%AD%CE%BB%CE%B1#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
