Falcon (Sprachmodellfamilie)
Falcon ist eine Familie von Open-Source-Großen Sprachmodellen (LLM), die vom Technology Innovation Institute (TII) in Abu Dhabi, VAE, entwickelt wurde[1]. Die Falcon-Modelle sind zu einem bedeutenden Beitrag zur Entwicklung zugänglicher künstlicher Intelligenz geworden und belegen regelmäßig Spitzenplätze in Leistungs-Rankings wie dem Open LLM Leaderboard von Hugging Face[2].
Die Familie umfasst Modelle verschiedener Größen und Spezialisierungen, von kompakten Versionen für den Einsatz auf Consumer-Hardware bis hin zu den größten Modellen, die mit den Entwicklungen führender Technologieunternehmen konkurrieren. Die Hauptmerkmale von Falcon sind eine fortschrittliche Architektur, das Training auf dem hochwertigen Datensatz RefinedWeb und eine überwiegend offene Apache-2.0-Lizenz[3].
Geschichte und Entwicklung
Die erste Version der Falcon-Modelle wurde im Juni 2023 vorgestellt. Im September 2023 wurde das Modell Falcon-180B veröffentlicht, das zu diesem Zeitpunkt das weltweit größte und leistungsstärkste offene LLM war und Llama 2 70B von Meta in der Anzahl der Parameter übertraf[4][5].
Die weitere Entwicklung der Familie umfasste die Veröffentlichung neuer Generationen und spezialisierter Versionen:
- Falcon 2 (2024): Die zweite Iteration mit verbesserten Fähigkeiten, einschließlich einer multimodalen Version, Falcon 2 11B VLM (Vision Language Model)[6].
- Falcon 3 (Dezember 2024): Die neueste Generation, trainiert auf 14 Billionen Token, mit erweiterten multimodalen Funktionen und optimiert für den Betrieb auf ressourcenschonender Hardware, einschließlich Laptops[7][8].
- Spezialisierte Modelle: Es wurden Modelle veröffentlicht, die für spezifische Aufgaben angepasst sind, wie Falcon Arabic und Falcon Mamba.
| Modell | Parameter (Mrd.) | Hauptmerkmale | Lizenz |
|---|---|---|---|
| Falcon-180B | 180 | Größtes Modell der ersten Generation; trainiert auf 3,5 Billionen Token; übertrifft GPT-3.5[4]. | TII Falcon License 1.0 (mit kommerziellen Einschränkungen)[5] |
| Falcon-40B | 40 | Leistungsstarkes Basismodell; trainiert auf 1 Billion Token. | Apache 2.0 |
| Falcon-7B | 7 | Kompaktes Modell, benötigt ~15 GB GPU-Speicher; geeignet für Consumer-Hardware[2]. | Apache 2.0 |
| Falcon-1.3B | 1.3 | Kleinstes Modell für Geräte mit begrenzten Ressourcen. | Apache 2.0 |
| Falcon 2 11B | 11 | Zweite Generation; konkurriert mit Llama 3 8B und Gemma 7B; multimodale Version (VLM) verfügbar[6]. | Apache 2.0 |
| Falcon 3 | N/A | Trainiert auf 14 Billionen Token; Multimodalität (Text, Bild, Audio, Video); läuft auf Laptops[7]. | Apache 2.0 |
| Falcon Arabic | 7 | Spezialisiertes Modell für die arabische Sprache (Standard und Dialekte); Falcon-3-Architektur[9]. | Apache 2.0 |
| Falcon Mamba | N/A | Experimentelles Modell auf Mamba-Architektur (SSM) anstelle eines Transformers[10]. | Apache 2.0 |
Architektur und technische Merkmale
Transformer-Architektur
Die meisten Falcon-Modelle basieren auf einer reinen Decoder-Transformer-Architektur. Zu den wichtigsten Architekturentscheidungen gehören:
- Multi-Query Attention (MQA): Im Gegensatz zur standardmäßigen Multi-Head Attention, bei der jeder „Kopf“ über einen eigenen Satz von Schlüssel-Wert-Paaren (Key/Value) verfügt, teilen sich bei MQA alle Attention-Köpfe einen einzigen Satz von Schlüssel und Wert. Dies reduziert den Speicherverbrauch erheblich und beschleunigt die Inferenz ohne nennenswerten Qualitätsverlust[2].
- Rotary Positional Embeddings (RoPE): Zur Kodierung von Positionsinformationen der Token wird RoPE verwendet, wie auch in anderen modernen LLMs.
- FlashAttention: Wird zur Optimierung der Berechnungen des Attention-Mechanismus eingesetzt.
Mamba-Architektur (State Space Model)
Das Modell Falcon Mamba ist innovativ, da es von der traditionellen Transformer-Architektur abweicht und stattdessen auf einem State Space Model (SSM) basiert. Die Mamba-Architektur verarbeitet Daten sequenziell und linear, was sie bei der Arbeit mit sehr langen Kontexten deutlich effizienter macht und im Vergleich zu Transformern weniger Rechenressourcen erfordert[10].
Trainingsdaten
Die Grundlage für das Training der Falcon-Modelle bildet der hochwertige Datensatz RefinedWeb, der von TII erstellt wurde[5]. Er besteht aus Billionen von Token, die aus dem Common Crawl extrahiert und durch strenge Filterung und Deduplizierung qualitativ verbessert wurden.
- Für Falcon-180B wurde ein erweiterter Datensatz mit 3,5 Billionen Token verwendet, der zu ca. 85 % aus RefinedWeb bestand und zusätzlich ausgewählte Daten aus Büchern, Dialogen und Code enthielt[4].
- Falcon Arabic wurde auf einem hochwertigen, nativen (nicht übersetzten) arabischen Datensatz trainiert, der sowohl modernes Hocharabisch als auch regionale Dialekte abdeckt[11].
Spezialisierte Modelle
Falcon Arabic
Falcon Arabic ist ein Modell mit 7 Milliarden Parametern, das speziell für die Verarbeitung der arabischen Sprache optimiert wurde. Es zeigt herausragende Ergebnisse in arabischen Benchmarks (Open Arabic LLM Leaderboard) und kann sowohl Modernes Hocharabisch (MSA) als auch eine Vielzahl regionaler Dialekte verstehen. Dadurch kann das Modell kultursensible und präzise Antworten für arabischsprachige Benutzer liefern[9]. In Bezug auf die Leistung übertrifft es Modelle, die bis zu 10-mal größer sind[12].
Multimodale Fähigkeiten
- Falcon 2 11B VLM war das erste multimodale Modell der Familie, das sowohl Text als auch Bilder verarbeiten kann[6].
- Falcon 3 erweiterte diese Fähigkeiten erheblich durch die Unterstützung von Video und Audio. Es ist geplant, dass im Januar 2025 ein vollwertiger Sprachmodus verfügbar sein wird[7].
Leistung und Probleme
Vergleich mit Konkurrenzmodellen
Die Falcon-Modelle zeigen durchweg eine hohe Leistung.
- Falcon-180B übertrifft GPT-3.5 und Llama 2 70B in den meisten akademischen Benchmarks wie MMLU, HellaSwag und LAMBADA, liegt jedoch hinter GPT-4 zurück[4].
- Falcon 2 11B zeigt eine Leistung, die mit der von Meta Llama 3 8B und Google Gemma 7B vergleichbar oder sogar höher ist[6].
- Zum Zeitpunkt seiner Veröffentlichung belegte Falcon 3 den ersten Platz im globalen Ranking von Hugging Face für Modelle seiner Größenklasse[7].
Einschränkungen und Probleme
- Qualität in verschiedenen Sprachen: Der Großteil der Trainingsdaten ist englischsprachig[13]. Aus diesem Grund kann die Leistung der Modelle in anderen Sprachen, einschließlich Russisch, erheblich geringer sein.[14].
- Halluzinationen: Wie alle LLMs neigen auch die Falcon-Modelle zur Generierung ungenauer oder fiktiver Informationen (Halluzinationen), was bei der Anwendung in kritischen Bereichen einen vorsichtigen Ansatz erfordert[15].
- Lizenzbeschränkungen: Obwohl die meisten Modelle unter der Apache-2.0-Lizenz vertrieben werden, hat das Flaggschiffmodell Falcon-180B eine eigene Lizenz, die TII Falcon LLM License. Diese verpflichtet bei kommerzieller Nutzung und einem Umsatz von über 1 Million US-Dollar zur Zahlung von Lizenzgebühren, was seine Anwendung im Geschäftsumfeld einschränkt[5][16].
Weblinks
Literatur
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Almazrouei, E. et al. (2023). The Falcon Series of Open Language Models. arXiv:2311.16867.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Penedo, G. et al. (2023). The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only. arXiv:2306.01116.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
Einzelnachweise
- ↑ „VAE stellen großes Sprachmodell Falcon 2 vor“. Interfax. [1]
- ↑ 2.0 2.1 2.2 „Falcon: The "T-shirt-sized" 7B and 40B models that are democratizing the LLM landscape“. Hugging Face Blog. [2]
- ↑ „Falcon Model“. Hugging Face Transformers documentation. [3]
- ↑ 4.0 4.1 4.2 4.3 „Falcon 180B open-source language model outperforms GPT-3.5 and Llama 2“. The Decoder. [4]
- ↑ 5.0 5.1 5.2 5.3 „Falcon 180B: das größte offene Sprachmodell der Welt“. Neurohive. [5]
- ↑ 6.0 6.1 6.2 6.3 „Falcon 2: Das Technology Innovation Institute der VAE veröffentlicht eine neue Serie von KI-Modellen, die Llama 3 von Meta übertrifft“. AETOSWire. [6]
- ↑ 7.0 7.1 7.2 7.3 „Falcon 3: Das Technology Innovation Institute der VAE startet die weltweit leistungsstärksten kleinen KI-Modelle“. AETOSWire. [7]
- ↑ „Technology Innovation Institute launches Falcon 3 model to enhance access to AI through light infrastructures“. Abu Dhabi Media Office. [8]
- ↑ 9.0 9.1 „Falcon Arabic“. FalconLLM TII. [9]
- ↑ 10.0 10.1 „Falcon Mamba – ein neuer Schritt in der Entwicklung von Sprachmodellen ohne Aufmerksamkeitsmechanismus“. Pikabu. [10]
- ↑ „Middle East's Leading AI Powerhouse TII Launches Two New AI Models“. TII News. [11]
- ↑ „Middle East's leading AI powerhouse, TII,launches two new AI models“. Falcon Foundation. [12]
- ↑ Almazrouei, Ebtesam, Hamza Alobeidli, Abdulaziz Alshamsi, Alessandro Cappelli, Ruxandra Cojocaru, Mérouane Debbah, Étienne Goffinet, et al. „The Falcon Series of Open Language Models“. arXiv, 29. November 2023. https://doi.org/10.48550/arXiv.2311.16867.[13]
- ↑ „Führender KI-Entwickler im Nahen Osten, TII, startet zwei neue KI-Modelle“. AETOSWire. [14]
- ↑ „Falcon-180B: Überblick, Start und erste Eindrücke“. Habr. [15]
- ↑ „Falcon 180B License Discussion“. Hugging Face. [16]