Multimodale grote taalmodellen

From Systems analysis Wiki
Jump to navigation Jump to search

Multimodale grote taalmodellen (Engels: Multimodal Large Language Models, MLLMs) — dit is een klasse van kunstmatige-intelligentiemodellen die informatie in verschillende modaliteiten kunnen verwerken en genereren, waaronder tekst, afbeeldingen, audio en video[1]. In tegenstelling tot unimodale taalmodellen die uitsluitend met tekst werken, integreren MLLM informatie uit verschillende bronnen om complexe taken op het gebied van begrip en contentgeneratie op te lossen.

Het kernconcept van MLLM is het creëren van een uniforme vectorrepresentatie (embedding) voor verschillende modaliteiten. Dit stelt het model in staat semantische verbanden te leggen tussen, bijvoorbeeld, een afbeelding en de bijbehorende tekstuele beschrijving[2]. De cruciale doorbraak die de basis legde voor moderne MLLM was het gebruik van contrastief leren om visuele en tekstuele representaties uit te lijnen in een gemeenschappelijke feature-ruimte, zoals geïmplementeerd in het model CLIP[3].

Geschiedenis van de ontwikkeling

Vroege periode (2013–2020)

De conceptuele grondslagen van multimodale AI werden gelegd in 2013, toen onderzoekers van Stanford aantoonden dat zero-shot learning mogelijk was met behulp van vectorrepresentaties van woorden[4]. In 2016 toonde het FAIR-team (Meta AI) de effectiviteit aan van het gebruik van beschrijvingen in natuurlijke taal voor het trainen van computer vision-modellen, waarbij een nauwkeurigheid van 11,5% op ImageNet werd bereikt zonder directe training[5].

Het CLIP-tijdperk (2021)

Een revolutionair moment was de release van het model CLIP (Contrastive Language-Image Pre-training) door OpenAI in januari 2021. Het model, getraind op 400 miljoen beeld-tekstparen, toonde de mogelijkheid om afbeeldingen te classificeren zonder gespecialiseerde training op specifieke taken. CLIP werd de basis voor veel latere MLLM[6].

Opschaling en innovaties (2022–2024)

Na het succes van CLIP verscheen een groot aantal sleutelmodellen:

  • Flamingo (DeepMind, 2022) — een model van 80 miljard parameters met uitstekende few-shot learning-capaciteiten.
  • BLIP (Salesforce, 2022) — een uniforme architectuur voor begrip en generatie.
  • GPT-4V (OpenAI, 2023) — het eerste commerciële multimodale model op deze schaal.
  • LLaVA (Microsoft, 2023) — een populair open alternatief voor GPT-4V.
  • Gemini (Google, 2023) — een van nature multimodale architectuur, van meet af aan ontworpen voor het werken met verschillende datatypes.
  • GPT-4o (OpenAI, 2024) — een model dat tekst, audio en video in realtime kan verwerken met lage latentie[1].
  • Claude 3.5 Sonnet (Anthropic, 2024) — een model met verbeterde capaciteiten voor de analyse van visuele informatie.

Architecturale benaderingen

Dual-Encoder-architectuur

Maakt gebruik van afzonderlijke encoders voor elke modaliteit, die de gegevens projecteren in een gemeenschappelijke representatieruimte. Een prominent voorbeeld is CLIP, waarbij een visuele transformer afbeeldingen verwerkt en een tekstuele transformer taalgegevens. De voordelen zijn modulariteit en rekentechnische efficiëntie; het nadeel is beperkte cross-modale interactie[7].

Encoder-decoder-architectuur

Een enkele encoder verwerkt de multimodale invoer, terwijl een decoder tekstuele uitvoer genereert. Het model Flamingo gebruikt het Perceiver Resampler-mechanisme voor het verwerken van visuele invoer van variabele lengte en cross-modale aandachtslagen. Deze benadering biedt rijke intermodale interactie, maar vereist meer rekenbronnen[8].

Alignment-architectuur

Deze benadering maakt gebruik van bevroren voorgetrainde encoders die via een klein trainbaar uitlijnmodule zijn verbonden. Zo gebruikt BLIP-2 een Q-Former (Querying Transformer) als lichtgewicht verbindingselement tussen de bevroren visuele encoder en het taalmodel, waarbij aanzienlijk minder trainbare parameters nodig zijn[9].

Belangrijkste modellen

GPT-4V / GPT-4o (OpenAI)

De GPT-4-modelfamilie telt naar schatting tot 1,8 biljoen parameters (in een mixture-of-experts-architectuur). Het model GPT-4o, uitgebracht in mei 2024, ondersteunt realtime verwerking van tekst, afbeeldingen, audio en video. Op de benchmark MMMU bereikt het een nauwkeurigheid van 69,1%[10].

Gemini (Google)

Een van nature multimodale architectuur, van scratch getraind op tekst, afbeeldingen, audio en video. Gemini 1.5 Pro ondersteunt een contextvenster van tot 10 miljoen tokens en overtreft GPT-4 op 30 van de 32 populaire benchmarks[11].

Claude 3 (Anthropic)

Een modelfamilie (Haiku, Sonnet, Opus) met een contextvenster van tot 200.000 tokens. Claude 3 Opus scoort 58,5% op de MMMU-benchmark. Voor het verbeteren van de veiligheid van de modellen wordt de Constitutional AI-benadering gebruikt[12].

LLaVA (open model)

Combineert de visuele encoder van CLIP met het taalmodel Vicuna. Beschikbaar in varianten met 7, 13 en 34 miljard parameters. Het model bereikt 85,1% van de relatieve prestaties van GPT-4 op synthetische taken[13].

Toepassingsgebieden

  • Visuele vraag-en-antwoord (VQA): Stelt gebruikers in staat vragen te stellen over visuele content.
  • Documentanalyse: Moderne MLLM kunnen tot 2000 pagina's per minuut verwerken.
  • Medische beeldvorming: Modellen zoals Med-PaLM M (Google) analyseren medische beelden en klinische gegevens.
  • Robotica: Modellen zoals RT-2 (Google DeepMind) stellen robots in staat de visuele omgeving te begrijpen en opdrachten in natuurlijke taal uit te voeren.

Huidige beperkingen

  • Hallucinaties: Het hallucinatieniveau in gegenereerde content wordt geschat op 27–46%. Modellen kunnen niet-bestaande objecten beschrijven of visuele informatie onjuist interpreteren[14].
  • Hoge rekenvereisten: Het trainen en gebruiken van MLLM vereist een aanzienlijke rekeninfrastructuur.
  • Gegevensbias: Onvoldoende vertegenwoordiging van demografische groepen, talen en culturen in de trainingsdata leidt tot systematische fouten.

Verwijzingen

  • A Comprehensive Guide to Multimodal LLMs (Encord Blog)
  • Multimodal LLMs: The Complete Guide (Viso.ai)

Literatuur

  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
  • Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
  • Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
  • Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
  • Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
  • Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
  • Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
  • Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
  • Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.

Noten

  1. 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [1]
  2. «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [2]
  3. Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [3]
  4. DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [4]
  5. «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [5]
  6. «Understanding CLIP». Stanford CS231n. [6]
  7. «Multimodal LLMs: The Complete Guide». Viso.ai. [7]
  8. «The Architectures of Multimodal Language Models». Determined AI. [8]
  9. «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [9]
  10. «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [10]
  11. «Google Gemini: A Deep Dive». DaveAI Blog. [11]
  12. «Introducing the Claude 3 Family». Anthropic. [12]
  13. Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [13]
  14. «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [14]