LLaMA (Meta AI) (DE)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) ist eine Familie von überwiegend quelloffenen großen Sprachmodellen (LLM), die von der Forschungsabteilung Meta AI entwickelt wird. Die LLaMA-Modelle basieren auf einer modifizierten Transformer-Architektur und sind auf hohe Recheneffizienz, die Demokratisierung des Zugangs zu fortschrittlichen KI-Technologien und eine einfache Anpassung an spezialisierte Aufgaben ausgerichtet. Die Familie hat sich von der ursprünglichen Forschungsveröffentlichung LLaMA 1 (Februar 2023) bis zu den multimodalen Modellen von LLaMA 4 (geplante Veröffentlichung 2025) entwickelt.

Name

Die Abkürzung LLaMA steht für Large Language Model Meta AI (Großes Sprachmodell Meta AI).

  • Large Language Model – unterstreicht den Umfang der Modelle, deren Parameter von Milliarden bis Billionen reichen.
  • Meta AI – verweist auf den Entwickler, die Forschungsgruppe von Meta.

Entstehungsgeschichte

Die Entwicklung von LLaMA begann Ende 2022 als strategische Antwort von Meta auf den Erfolg von ChatGPT von OpenAI. Mark Zuckerberg stellte ein interdisziplinäres Team zusammen, dem auch Forscher aus dem Labor FAIR (Facebook AI Research) angehörten. Eine Schlüsselrolle in der Philosophie des Projekts spielte Yann LeCun, der Leiter von FAIR, der seit 2013 das Prinzip der vollständigen Offenheit aller Forschungen des Labors vertrat.

Die erste Version, LLaMA 1, wurde im Februar 2023 unter einer Forschungslizenz veröffentlicht. Kurz nach der Veröffentlichung, im März 2023, gelangten die Modellgewichte über BitTorrent ins Netz. Dieses Ereignis bremste die Entwicklung des Projekts entgegen den Befürchtungen nicht, sondern beschleunigte sie sogar, da es unabhängigen Forschern und Enthusiasten weltweit die Möglichkeit gab, mit dem Modell zu experimentieren. Infolgedessen erschienen Zehntausende von abgeleiteten Modellen auf der Plattform Hugging Face. Nachfolgende Versionen, beginnend mit LLaMA 2, wurden bereits mit einer kommerziellen Lizenz[1] herausgegeben, was den Status von LLaMA als wichtigen Akteur auf dem Markt für offene KI-Modelle festigte.

Evolution der Modelle und Chronologie der Veröffentlichungen

Chronologie der Entwicklung der LLaMA-Modelle
Version Veröffentlichungsdatum Parameterbereich Wichtige Innovationen und Merkmale
LLaMA 1 Februar 2023 7B – 65B Grundlegende Architektur (RMSNorm, SwiGLU, RoPE). Training mit 1,4 Billionen Token. Kontextfenster von 2048 Token. Forschungslizenz.
LLaMA 2 Juli 2023 7B – 70B Feinabstimmung für Dialoge (RLHF). Einführung von Grouped-Query Attention (GQA). Kontextfenster von 4096 Token. Erste kommerzielle Lizenz.
Code Llama August 2023 7B – 70B Spezialisierte Version für Code. Nachtraining mit 500 Mrd. Code-Token. Varianten: Basis, Python-spezifisch, Instruction-Tuned.
LLaMA 3 April 2024 8B, 70B Training mit 15 Billionen Token. Verbesserter Tokenizer mit einem Vokabular von 128.000 Token. Hohe Leistung (82 % bei MMLU).
LLaMA 3.1 Juli 2024[2] 8B, 70B, 405B Flaggschiff-Modell 405B mit einer Leistung auf dem Niveau von GPT-4o. Kontextfenster von bis zu 128.000 Token. Möglichkeit zur Bildverarbeitung wurde eingeführt.
LLaMA 4 (geplant: April 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) Mixture-of-Experts (MoE)-Architektur. Native Multimodalität (Text, Bilder, Video). Kontextfenster von bis zu 10 Millionen Token.

Architektur

LLaMA verwendet eine autoregressive Transformer-Decoder-Architektur, führt jedoch eine Reihe wichtiger Verbesserungen ein, die die Recheneffizienz und die Qualität des generierten Textes erhöhen:

  • Pre-Normalization (Vornormierung). Die Normalisierung wird am Eingang jeder Teilschicht des Transformers angewendet, nicht am Ausgang. Dieser Ansatz stabilisiert das Training sehr tiefer Netzwerke und beugt Problemen mit Gradienten vor.
  • RMSNorm (Root Mean Square Layer Normalization). Anstelle der Standard-LayerNorm wird RMSNorm verwendet. Diese Normalisierungstechnik eliminiert die Subtraktion des Mittelwerts, was die Berechnungen bei gleichbleibender Stabilität um 10–50 % beschleunigt.
  • SwiGLU (Swish-Gated Linear Unit). Als Aktivierungsfunktion wird anstelle von ReLU oder GELU SwiGLU verwendet. Dieser Gating-Mechanismus erzeugt einen glatteren Gradientenfluss und verbessert die Modellqualität.
  • RoPE (Rotary Position Embeddings). Zur Kodierung der Token-Positionen werden relative Positionseinbettungen (RoPE) verwendet, die es dem Modell ermöglichen, besser auf Sequenzen zu extrapolieren, die länger sind als die beim Training verwendeten.
  • GQA (Grouped-Query Attention). Diese in LLaMA 2 eingeführte Technik ist eine Optimierung der Multi-Head-Attention, die den Speicherbedarf erheblich reduziert und die Textgenerierung beschleunigt.
  • Mixture-of-Experts (MoE) (geplant für LLaMA 4). Eine Architektur, die die Modellparameter in „Experten“-Unternetzwerke aufteilt und für jede Anfrage nur einen kleinen Teil davon aktiviert. Dies reduziert den Rechenaufwand für die Inferenz drastisch.

Konfigurationen von LLaMA 1

Architekturparameter der LLaMA 1-Modelle
Modell Parameter Dimension des verborgenen Zustands Anzahl der Schichten Anzahl der Attention-Heads Umfang der Trainingsdaten
7B 6.7B 4096 32 32 1.0T Token
13B 13.0B 5120 40 40 1.0T Token
33B 32.5B 6656 60 52 1.4T Token
65B 65.2B 8192 80 64 1.4T Token

Trainingsdaten

Der Umfang der Trainingskorpora wuchs von 1,4 Billionen Token für LLaMA 1 auf 15 Billionen für LLaMA 3. Für das Training werden öffentlich zugängliche Quellen genutzt, darunter Common Crawl (macht bis zu 67 % der Daten aus), C4, GitHub, Wikipedia, Books, ArXiv und Stack Exchange. Für LLaMA 3 wurden zusätzlich hochwertige private Daten verwendet.

Leistung und Vergleich

  • In Benchmarks: Das Modell LLaMA 3.1 (405B) zeigt Ergebnisse, die denen von GPT-4o nahekommen: Im MMLU-Test erreicht es 88,6 % und liegt damit nur 0,1 Prozentpunkte hinter GPT-4o. Bei der Codegenerierungsaufgabe HumanEval erreicht LLaMA 3.1 89 % (GPT-4o – 90,2 %).
  • Parametereffizienz: LLaMA-Modelle mit einer geringeren Anzahl von Parametern übertreffen oft größere Modelle von Wettbewerbern. Beispielsweise übertraf LLaMA 1 (13B) GPT-3 (175B) in den meisten Tests.
  • Kosten: Beim lokalen Hosting können die Inferenzkosten von LLaMA bis zu 50-mal niedriger sein als bei der Nutzung proprietärer APIs, was die Technologie für kleine und mittlere Unternehmen zugänglich macht.

Lizenzierung

  • LLaMA 1 wurde unter einer nicht-kommerziellen Forschungslizenz vertrieben, wobei der Zugang auf Anfrage gewährt wurde.
  • LLaMA 2 und spätere Versionen werden unter der Llama Community License vertrieben, die die kommerzielle Nutzung und Modifikation erlaubt. Die Lizenz enthält jedoch Einschränkungen: Unternehmen mit mehr als 700 Millionen monatlich aktiven Nutzern müssen eine spezielle Genehmigung von Meta einholen. Dies führt zu Diskussionen darüber, ob LLaMA ein vollständig offenes Modell ist.

Anwendung

Die LLaMA-Modelle sind in die Produkte Tausender von Unternehmen integriert und werden in verschiedenen Bereichen eingesetzt:

  • Unternehmenssektor: Zoom verwendet LLaMA in seinem AI Companion für die Zusammenfassung von Meetings; Shopify nutzt es zur Verarbeitung von 40–60 Millionen Anfragen pro Tag zur Anreicherung von Produktmetadaten; Instacart setzt es im internen Assistenten Ava ein.
  • Wissenschaft und Gesellschaft: Meditron (eine Anpassung von LLaMA) wird zur medizinischen Diagnose in ressourcenarmen Regionen eingesetzt.
  • Öffentlicher Sektor und Industrie: Meta hat Partnerschaften mit Lockheed Martin und Palantir geschlossen. Die NASA verwendet LLaMA 3 auf der Internationalen Raumstation (ISS) als Offline-Assistenten zur Durchführung kritischer Operationen ohne Verbindung zur Erde.

Einschränkungen und Kritik

  • Voreingenommenheit und Sicherheit: Unabhängige Audits zeigen, dass LLaMA-Modelle trotz Sicherheitsmaßnahmen schädliche Stereotypen reproduzieren können. Das Leck der LLaMA-1-Gewichte warf Fragen über den potenziellen missbräuchlichen Einsatz der Technologie auf.
  • Wissenslücken: In hochspezialisierten Bereichen kann LLaMA Wissenslücken aufweisen. Beispielsweise lag die Genauigkeit im medizinischen Test nephSAP bei 17–30 % im Vergleich zu 73 % bei GPT-4.
  • Energieverbrauch: Das Training großer Modelle erfordert enorme Ressourcen. Das Training von LLaMA 1 verbrauchte 2.638 MWh, was einem Ausstoß von 1.015 Tonnen CO₂ entspricht.

Zukunft

Meta plant, bis 2025 bis zu 65 Milliarden US-Dollar in die KI-Infrastruktur zu investieren. In der Entwicklung befindet sich das Modell LLaMA 4 Behemoth mit 2 Billionen Parametern, das über 200 Sprachen unterstützen und eine tiefe Integration in die Produkte des Metaversums erhalten wird.

Siehe auch

  • GPT
  • Große Sprachmodelle
  • Transformer (Architektur neuronaler Netze)

Literatur

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Einzelnachweise

  1. Die LLaMA-Lizenz erfüllt nicht alle Kriterien für Open-Source-Software, da sie Beschränkungen für die kommerzielle Nutzung durch die größten Unternehmen auferlegt und die Offenlegung von Informationen über Modifikationen verlangt.
  2. LLaMA 3.1 wurde im Juli 2024 angekündigt und veröffentlicht. Siehe die offizielle Ankündigung von Meta.