Qwen (Alibaba) (DE)

From Systems analysis Wiki
Jump to navigation Jump to search

Qwen (chin. 通义千问, Tongyi Qianwen) ist eine Familie von großen Sprachmodellen (LLM), die von der Cloud-Computing-Sparte der Alibaba Group – Alibaba Cloud – entwickelt wurde[1]. Die Qwen-Modelle stellen einen bedeutenden Beitrag des chinesischen Technologieriesen im Bereich der künstlichen Intelligenz dar. Die erste Version wurde im April 2023 als Beta-Version vorgestellt, die öffentliche Veröffentlichung erfolgte im September 2023[1].

Die Qwen-Familie hat eine rasante Entwicklung durchlaufen und bietet sowohl Open-Source-Lösungen als auch proprietäre, leistungsstärkere Varianten an. Zu den Hauptmerkmalen von Qwen gehören eine breite Palette an Modellgrößen (von Hunderten von Millionen bis zu Hunderten von Milliarden Parametern), fortschrittliche multimodale Fähigkeiten (Verarbeitung von Text, Bildern, Audio und Video), die Unterstützung einer großen Anzahl von Sprachen sowie innovative Architekturlösungen wie Mixture-of-Experts (MoE) und ein „Denkmodus“ zur Lösung komplexer Aufgaben[2].

Auf dem globalen Markt positioniert sich Qwen als ernstzunehmender Konkurrent für führende Modelle von OpenAI, Meta, Anthropic und Mistral AI. Die Strategie von Alibaba Cloud legt den Schwerpunkt sowohl auf hohe Leistung als auch auf Zugänglichkeit, was sich in der regelmäßigen Veröffentlichung von Open-Source-Modellen, vorwiegend unter der Apache-2.0-Lizenz, widerspiegelt[3].

Geschichte und Entwicklung

Die Entwicklung der Qwen-Familie ist durch ein hohes Tempo und strategische Entscheidungen gekennzeichnet, die sowohl auf die Open-Source-Community als auch auf kommerzielle Nutzer abzielen. Von einer ursprünglichen Architektur, die der von LLaMA ähnelte, ging Alibaba Cloud zur Entwicklung eigener einzigartiger Lösungen über, darunter komplexe MoE-Architekturen und fortschrittliche multimodale Systeme.

Wichtige Veröffentlichungen der Qwen-Modelle
Veröffentlichungsdatum Modell Parameter (Mrd.) Wesentliche Merkmale Lizenz
August 2023 Qwen-7B 7 Erstes Open-Source-Modell; vortrainiert auf ~2,4 Billionen Token; Kontextfenster von 32k Token[4]. Tongyi Qianwen License (erfordert Genehmigung für kommerzielle Nutzung)[5]
September 2023 Qwen-14B 14 Training auf ~3,0 Billionen Token; verbesserte Genauigkeit bei komplexen Aufgaben; Kontextfenster von 8k[6]. Tongyi Qianwen License
November 2023 Qwen-72B 72 Flaggschiff-Modell, trainiert auf ~3,0 Billionen Token; 32k Kontext; Leistung auf dem Niveau der besten Modelle seiner Zeit. Tongyi Qianwen License
November 2023 Qwen-1.8B 1.8 Kompaktes Modell für den lokalen Einsatz; vortrainiert auf ~2,2 Billionen Token; 32k Kontext. Tongyi Qianwen License
Juni/September 2024 Qwen 2 0.5–72 Zweite Generation; Training auf ~7 Billionen Token; Einführung von MoE-Modellen (z.B. 57B-A14B); Kontext auf 128k erweitert mit YaRN-Technologie[7]. Apache 2.0 (für die meisten Modelle)
September 2024 Qwen 2.5 3–32 Zwischen-Update; Datensatz auf ~18 Billionen Token erweitert; verbesserte Fähigkeiten zur Lösung von Code- und Mathematikaufgaben[8]. Apache 2.0 (außer 72B)
November 2024 QwQ-32B (Preview) 32 Experimentelles Modell „Qwen with Questions“ für komplexes schrittweises Denken; 32k Kontext. Apache 2.0 (nur Gewichte)
Januar 2025 Qwen2.5-VL 3–72 Multimodale Modelle (Text + Bild); Analyse von Bildern beliebiger Auflösung; Kontext bis zu 128k[9]. Apache 2.0 (außer 72B)
März 2025 Qwen2.5-Omni-7B 7 Universelles multimodales Modell: Eingabe (Text, Bild, Video, Audio), Ausgabe (Text, Sprache). „Thinker-Talker“-Architektur[10]. Apache 2.0
April 2025 Qwen 3 0.6–235 (MoE) Dritte Generation; Training auf ~36 Billionen Token in 119 Sprachen; MoE-Varianten (30B-A3B, 235B-A22B); integrierter „Laut-Denken“-Modus (<think>); 128k Kontext[11]. Apache 2.0 (alle Modelle)

Architektur und technische Merkmale

Die Qwen-Modelle basieren auf einer Decoder-only-Transformatorarchitektur, ähnlich wie LLaMA und GPT. Jedes Modell ist ein autoregressiver Decoder mit einem Multi-Head-Attention-Mechanismus und Feed-Forward-Blöcken.

Wichtige Architekturkomponenten

  • Grundlegende Elemente: Qwen verwendet Standardlösungen moderner LLMs: RMSNorm-Normalisierung für die Stabilität des Trainings und die Aktivierungsfunktion SwiGLU in den Fully-Connected-Schichten zur Leistungsverbesserung[4].
  • Positionale Kodierung: Es werden Rotary Positional Embeddings (RoPE) verwendet, um Positionsinformationen der Token zu kodieren, was eine effiziente Verarbeitung langer Sequenzen ermöglicht[8].
  • Effiziente Attention: Zur Beschleunigung der Berechnungen und zur Speichereinsparung im Attention-Mechanismus wird der FlashAttention-Algorithmus eingesetzt[2].

Dense Modelle und Mixture-of-Experts (MoE)

Die Qwen-Familie umfasst Modelle mit zwei Architekturtypen:

  • Dense Modelle: Alle Parameter des Modells sind bei der Verarbeitung jedes Tokens aktiv. Beispiele: Qwen-72B, Qwen2.5-32B. Diese Modelle sind einfacher bereitzustellen, erfordern jedoch bei zunehmender Größe mehr Rechenressourcen[11].
  • Mixture-of-Experts (MoE) Modelle: In diesen Modellen wird anstelle einer großen Fully-Connected-Schicht eine Reihe kleinerer, spezialisierter „Experten“ verwendet. Für jedes Token wählt eine spezielle Routing-Schicht (Gating-Netzwerk) dynamisch eine kleine Untergruppe von Experten für die Verarbeitung aus. Dies ermöglicht die Erstellung von Modellen mit einer riesigen Gesamtzahl von Parametern bei deutlich geringerem Rechenaufwand während der Inferenz.
    • Qwen2-57B-A14B enthält 57 Mrd. Gesamtparameter, aktiviert aber bei jeder Anfrage nur 14 Mrd.[7].
    • Qwen3-235B-A22B enthält 235 Mrd. Gesamtparameter, von denen 22 Mrd. aktiv sind[11].

Innovationen für langen Kontext

Die Unterstützung für lange Kontexte ist eine der Stärken von Qwen.

  • Die ersten Modelle unterstützten bis zu 32k Token.
  • In der Qwen 2-Generation wurde das Kontextfenster dank der YaRN-Methode (Yet Another RoPE Extension) auf 128k Token erweitert, was eine Vergrößerung des Kontexts ohne signifikanten Qualitätsverlust ermöglicht[7].
  • Das experimentelle Modell Qwen2.5-Turbo demonstrierte die Fähigkeit, mit einem Kontext von bis zu 1 Million Token zu arbeiten[2].

„Thinking Mode“ in Qwen 3

In der dritten Generation von Qwen wurde ein Mechanismus des „hybriden Denkens“ (hybrid thinking) implementiert. Das Modell kann explizit eine Denk-Kette (Chain-of-Thought) formulieren, bevor es die endgültige Antwort ausgibt.

  • Standardmäßig fügt Qwen 3 in die Ausgabe einen speziellen Block <think>...</think> ein, in dem es die schrittweise logische Argumentation darlegt.
  • Der Benutzer kann diesen Modus deaktivieren, indem er den Befehl /no_think zur Anfrage hinzufügt.

Dieser Mechanismus verbessert die Fähigkeit des Modells, komplexe Aufgaben zu lösen, die mehrstufige Schlussfolgerungen erfordern[3].

Mehrsprachiger Tokenizer

Qwen verwendet ein erweitertes Token-Vokabular (etwa 151.000 Token), das auf dem BPE-Vokabular von OpenAI GPT-4 (cl100k) basiert und zusätzlich für Chinesisch und andere Sprachen optimiert ist. Dies ermöglicht eine effiziente Kodierung von Hieroglyphen, lateinischen Buchstaben und Programmcode, was die mehrsprachigen Fähigkeiten des Modells verbessert[4].

Multimodale Fähigkeiten

Die Qwen-Familie wird aktiv in Richtung Multimodalität weiterentwickelt und bietet Modelle, die mit verschiedenen Datentypen arbeiten können:

  • Qwen-VL: Kombiniert einen Vision Transformer (zur Bildverarbeitung) mit einem Sprachmodell, was die Beantwortung von Fragen zu Bildern und die Erstellung von Beschreibungen ermöglicht. Die Version Qwen2.5-VL kann Bilder beliebiger Auflösung analysieren und strukturierte Daten (z. B. aus Tabellen und Formularen) extrahieren[9].
  • Qwen-Audio: Ein spezialisiertes Modell zur Verarbeitung von Audioinformationen, das Sprache, Musik und andere Klänge erkennen und erzeugen kann[12].
  • Qwen2.5-Omni: Ein universelles End-to-End-Multimodell, das gleichzeitig Text, Bilder, Audio und Video verarbeitet und Antworten in Form von Text oder natürlicher Sprache im Streaming-Modus generiert. Es basiert auf der „Thinker-Talker“-Architektur, bei der der „Thinker“ (LLM) den Textinhalt generiert und der „Talker“ (ein zweispuriges autoregressives Modell) das Audio synthetisiert[10].
  • Spezialisierte Modelle: Es wurden auch Modelle für spezifische Aufgaben veröffentlicht, wie Qwen-Coder (Programmierung) und Qwen-Math (Lösen mathematischer Probleme).

Trainingsdaten und Skalierung

Die Qwen-Modelle werden auf extrem großen Datenkorpora trainiert, die Texte aus dem Internet, Bücher, wissenschaftliche Artikel, Programmcode und mathematische Daten umfassen.

  • Qwen 1.0 (7B): ~2,4 Billionen Token.
  • Qwen 1.0 (72B): ~3,0 Billionen Token.
  • Qwen 2.0: ~7 Billionen Token.
  • Qwen 2.5: ~18 Billionen Token.
  • Qwen 3.0: ~36 Billionen Token, die 119 Sprachen und Dialekte abdecken.

Zur Verbesserung der Datenqualität werden fortschrittliche Filtermethoden und die Generierung hochwertiger synthetischer Daten eingesetzt, insbesondere für Bereiche wie Mathematik und Programmierung[8].

Lizenzierung und Verfügbarkeit

Die Lizenzierungspolitik für Qwen-Modelle hat sich im Laufe der Zeit weiterentwickelt.

  • Frühe Modelle (Qwen 1): Wurden unter der eigenen Tongyi Qianwen License vertrieben. Diese erlaubte die akademische Nutzung, erforderte jedoch einen Antrag und eine separate Genehmigung für die kommerzielle Anwendung[5].
  • Spätere Modelle (Qwen 2, 2.5, 3): Ab der zweiten Generation verfolgten die Entwickler eine offenere Politik. Die meisten neuen Modelle wurden unter der freizügigen Apache License 2.0 veröffentlicht, was ihre freie Nutzung sowohl in wissenschaftlichen als auch in kommerziellen Projekten ermöglicht[7]. Mit der Veröffentlichung der Qwen 3-Familie wurden alle Modelle dieser Generation vollständig unter Apache 2.0 ohne zusätzliche Einschränkungen freigegeben[3].
  • Proprietäre und eingeschränkte Modelle: Trotz des allgemeinen Trends zur Offenheit bleiben die größten oder strategisch wichtigsten Modelle (z.B. Qwen2.5-Max, Qwen2.5-VL-72B) proprietär und sind über kostenpflichtige APIs der Alibaba Cloud verfügbar oder werden unter strengeren Forschungslizenzen vertrieben.

Vergleich mit Wettbewerbern und Leistung

Die Qwen-Modelle werden aktiv auf dem hart umkämpften Markt positioniert und regelmäßig mit den Entwicklungen führender globaler Unternehmen verglichen.

  • vs. Llama (Meta): In technischen Berichten zeigt Qwen oft eine Überlegenheit gegenüber Llama-Modellen ähnlicher Größe. Beispielsweise erzielt Qwen2-72B auf den Benchmarks MMLU, HumanEval und GSM8K bessere Ergebnisse als Llama-3-70B.
  • vs. GPT (OpenAI): Die Flaggschiff-Modelle von Qwen zielen darauf ab, den Abstand zu den GPT-Modellen zu verringern. Alibaba Cloud gibt an, dass Qwen2.5-Max GPT-4o bei einigen akademischen Benchmarks übertrifft und Qwen2-72B-Instruct eine Wettbewerbsfähigkeit mit GPT-4-Turbo zeigt.
  • vs. Mistral AI: Beide Unternehmen legen einen Schwerpunkt auf Open-Source-Modelle. Tests zeigen, dass Qwen2-72B Mixtral-8x22B auf wichtigen Benchmarks übertrifft[7].

Ergebnisse auf Benchmarks

Leistungsvergleich der Flaggschiff-Modelle von Qwen mit Wettbewerbern (Daten von Mitte 2024)[7]
Modell MMLU (5-shot) HumanEval (0-shot) GSM8K (8-shot) MT-Bench
Qwen2-72B (Basis) 84.2 64.6 89.5 N/A
Qwen2-72B-Instruct 82.3 86.0 93.2 9.12
Llama-3-70B (Basis) 79.5 48.2 83.0 N/A
Llama-3-70B-Instruct 82.0 81.7 93.0 8.95
Mixtral-8x22B (Basis) 77.8 46.3 83.7 N/A
Mixtral-8x22B-Instruct 74.0 73.8 89.1 8.66

Hinweis: N/A — nicht anwendbar oder Daten in den angegebenen Quellen nicht verfügbar.

Ökosystem und Anwendung

Die Qwen-Familie wird in verschiedene Produkte und Plattformen integriert und bildet so ein wachsendes Ökosystem.

  • Alibaba Cloud Plattformen: Der Zugang zu den Modellen, insbesondere zu den leistungsstärksten proprietären Versionen, wird über die API-Schnittstellen von Model Studio bereitgestellt. Die Plattform PAI-EAS (Platform for AI - Elastic Algorithm Service) ermöglicht das Deployment, Fine-Tuning und die Anpassung von Qwen-Modellen.
  • Open-Source-Community: Die Open-Source-Versionen der Modelle, ihre Gewichte und der Code werden aktiv auf Plattformen wie Hugging Face, ModelScope und GitHub gehostet[6], was ihre weite Verbreitung und Nutzung durch Forscher und Entwickler weltweit fördert.
  • Anwendungen: Die Modelle werden für ein breites Spektrum von Aufgaben eingesetzt, von der Content-Generierung und Datenanalyse bis hin zur Erstellung von KI-Agenten. Beispielsweise unterstützen die Qwen3-Modelle das Model Context Protocol (MCP), das ihnen eine effizientere Interaktion mit anderen Anwendungen und Werkzeugen ermöglicht.

Literatur

  • Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Bai, Jinze; et al. (2023). Qwen Technical Report. arXiv:2309.16609.
  • Peng, B.; et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Qwen Team (2024). Qwen2 Technical Report. arXiv:2407.10671.
  • Qwen Team (2024). Qwen2‑Audio Technical Report. arXiv:2407.10759.
  • Qwen Team (2025). Qwen2.5 Technical Report. arXiv:2412.15115.
  • Bai, Jinze; et al. (2025). Qwen2.5‑VL: A Versatile Vision‑Language Model for Real‑World Agent Tasks. arXiv:2502.13923.
  • Wang, Wen; et al. (2025). Qwen2.5‑Omni: A Streaming End‑to‑End Multimodal Model. arXiv:2503.20215.
  • Yang, An; et al. (2025). Qwen3 Technical Report. arXiv:2505.09388.

Einzelnachweise

  1. 1.0 1.1 „Qwen“. In Wikipedia [1]
  2. 2.0 2.1 2.2 „Qwen Models: Alibaba's Next-Generation AI Family for Text, Vision, and Beyond“. Inferless. [2]
  3. 3.0 3.1 3.2 „Qwen 3 offers a case study in how to effectively release a model“. Simon Willison's Weblog. [3]
  4. 4.0 4.1 4.2 Bai, Jinze; et al. (2023). Qwen Technical Report. arXiv:2309.16609.
  5. 5.0 5.1 „Qwen/Qwen-7B“. Hugging Face. [4]
  6. 6.0 6.1 „GitHub - QwenLM/Qwen: The official repo of Qwen“. GitHub. [5]
  7. 7.0 7.1 7.2 7.3 7.4 7.5 Qwen Team (2024). Qwen2 Technical Report. arXiv:2407.10671.
  8. 8.0 8.1 8.2 Qwen Team (2025). Qwen2.5 Technical Report. arXiv:2412.15115.
  9. 9.0 9.1 Bai, Jinze; et al. (2025). Qwen2.5-VL: A Versatile Vision-Language Model for Real-World Agent Tasks. arXiv:2502.13923.
  10. 10.0 10.1 Wang, Wen; et al. (2025). Qwen2.5-Omni: A Streaming End-to-End Multimodal Model. arXiv:2503.20215.
  11. 11.0 11.1 11.2 Yang, An; et al. (2025). Qwen3 Technical Report. arXiv:2505.09388.
  12. Gao, Shidong; et al. (2024). Qwen2-Audio Technical Report. arXiv:2407.10759.