Qwen (Alibaba) (FR)

From Systems analysis Wiki
Jump to navigation Jump to search

Qwen (chinois : 通义千问, Tongyi Qianwen) est une famille de grands modèles de langage (LLM) développée par Alibaba Cloud, la division de cloud computing du groupe Alibaba[1]. Les modèles Qwen représentent une contribution significative du géant technologique chinois dans le domaine de l'intelligence artificielle. La première version a été présentée en version bêta en avril 2023, et la sortie publique a eu lieu en septembre 2023[1].

La famille Qwen a connu une évolution rapide, proposant sur le marché des solutions open source ainsi que des variantes propriétaires plus puissantes. Les caractéristiques clés de Qwen incluent une large gamme de tailles de modèles (de centaines de millions à des centaines de milliards de paramètres), des capacités multimodales avancées (traitement du texte, des images, de l'audio et de la vidéo), la prise en charge d'un grand nombre de langues et des solutions architecturales innovantes telles que le mélange d'experts (MoE) et un mode de « pensée » pour la résolution de tâches complexes[2].

Sur le marché mondial, Qwen se positionne comme un concurrent sérieux des principaux modèles d'OpenAI, Meta, Anthropic et Mistral AI. La stratégie d'Alibaba Cloud met l'accent à la fois sur la haute performance et sur l'accessibilité, ce qui se traduit par la publication régulière de modèles ouverts, principalement sous la licence Apache 2.0[3].

Histoire et développement

Le développement de la famille Qwen se caractérise par un rythme rapide et des décisions stratégiques visant à la fois la communauté open source et les utilisateurs commerciaux. Partant d'une architecture initiale proche de LLaMA, Alibaba Cloud est passé à la création de ses propres solutions uniques, y compris des architectures MoE complexes et des systèmes multimodaux avancés.

Principales versions des modèles Qwen
Date de sortie Modèle Paramètres (milliards) Caractéristiques clés Licence
Août 2023 Qwen-7B 7 Premier modèle open source ; pré-entraîné sur ~2,4 billions de tokens ; fenêtre de contexte de 32k tokens[4]. Licence Tongyi Qianwen (autorisation requise pour un usage commercial)[5]
Septembre 2023 Qwen-14B 14 Entraîné sur ~3,0 billions de tokens ; précision améliorée sur les tâches complexes ; fenêtre de contexte de 8k[6]. Licence Tongyi Qianwen
Novembre 2023 Qwen-72B 72 Modèle phare, entraîné sur ~3,0 billions de tokens ; contexte de 32k ; performances au niveau des meilleurs modèles de l'époque. Licence Tongyi Qianwen
Novembre 2023 Qwen-1.8B 1.8 Modèle compact pour déploiement local ; pré-entraîné sur ~2,2 billions de tokens ; contexte de 32k. Licence Tongyi Qianwen
Juin/Septembre 2024 Qwen 2 0.5–72 Deuxième génération ; entraîné sur ~7 billions de tokens ; introduction de modèles MoE (par ex., 57B-A14B) ; contexte étendu à 128k avec la technologie YaRN[7]. Apache 2.0 (pour la plupart des modèles)
Septembre 2024 Qwen 2.5 3–32 Mise à jour intermédiaire ; jeu de données étendu à ~18 billions de tokens ; compétences améliorées en résolution de problèmes de code et de mathématiques[8]. Apache 2.0 (sauf le 72B)
Novembre 2024 QwQ-32B (Preview) 32 Modèle expérimental « Qwen with Questions » pour un raisonnement complexe étape par étape ; contexte de 32k. Apache 2.0 (poids uniquement)
Janvier 2025 Qwen2.5-VL 3–72 Modèles multimodaux (texte + image) ; analyse d'images de résolution arbitraire ; contexte jusqu'à 128k[9]. Apache 2.0 (sauf le 72B)
Mars 2025 Qwen2.5-Omni-7B 7 Modèle multimodal universel : entrée (texte, image, vidéo, audio), sortie (texte, voix). Architecture « Thinker-Talker »[10]. Apache 2.0
Avril 2025 Qwen 3 0.6–235 (MoE) Troisième génération ; entraîné sur ~36 billions de tokens dans 119 langues ; variantes MoE (30B-A3B, 235B-A22B) ; mode de « pensée à voix haute » intégré (<think>) ; contexte de 128k[11]. Apache 2.0 (tous les modèles)

Architecture et caractéristiques techniques

Les modèles Qwen sont basés sur une architecture de type transformeur décodeur-seul (decoder-only), similaire à LLaMA et GPT. Chaque modèle est un décodeur autorégressif avec un mécanisme d'attention multi-têtes et des blocs feed-forward.

Composants architecturaux clés

  • Éléments de base : Qwen utilise des solutions standard pour les LLM modernes : la normalisation RMSNorm pour la stabilité de l'entraînement et la fonction d'activation SwiGLU dans les couches entièrement connectées pour améliorer les performances[4].
  • Encodage positionnel : Utilise les Rotary Positional Embeddings (RoPE) pour encoder l'information de position des tokens, ce qui permet de traiter efficacement les séquences longues[8].
  • Attention efficace : Pour accélérer les calculs et économiser la mémoire, le mécanisme d'attention utilise l'algorithme FlashAttention[2].

Modèles denses et Mélange d'experts (MoE)

La famille Qwen comprend des modèles avec deux types d'architectures :

  • Modèles denses (Dense) : Tous les paramètres du modèle sont actifs lors du traitement de chaque token. Exemples : Qwen-72B, Qwen2.5-32B. Ces modèles sont plus simples à déployer, mais nécessitent plus de ressources de calcul à mesure que leur taille augmente[11].
  • Modèles « Mélange d'experts » (Mixture-of-Experts, MoE) : Dans ces modèles, au lieu d'une seule grande couche entièrement connectée, plusieurs « experts » plus petits et spécialisés sont utilisés. Pour chaque token, une couche de routage spéciale (gating network) sélectionne dynamiquement un petit sous-ensemble d'experts pour le traitement. Cela permet de créer des modèles avec un nombre total de paramètres très élevé tout en réduisant considérablement les coûts de calcul lors de l'inférence.
    • Qwen2-57B-A14B contient 57 milliards de paramètres au total, mais n'en active que 14 milliards à chaque requête[7].
    • Qwen3-235B-A22B contient 235 milliards de paramètres au total, dont 22 milliards sont actifs[11].

Innovations pour le contexte long

La prise en charge du contexte long est l'un des points forts de Qwen.

  • Les premiers modèles prenaient en charge jusqu'à 32k tokens.
  • Dans la génération Qwen 2, la fenêtre de contexte a été étendue à 128k tokens grâce à la méthode YaRN (Yet Another RoPE Extension), qui permet d'élargir le contexte sans perte de qualité significative[7].
  • Le modèle expérimental Qwen2.5-Turbo a démontré sa capacité à fonctionner avec un contexte allant jusqu'à 1 million de tokens[2].

Mode « Thinking » dans Qwen 3

La troisième génération de Qwen met en œuvre un mécanisme de « pensée hybride » (hybrid thinking). Le modèle peut formuler explicitement une chaîne de pensée (chain-of-thought) avant de donner sa réponse finale.

  • Par défaut, Qwen 3 intègre dans sa sortie un bloc spécial <think>...</think>, où il expose son raisonnement logique étape par étape.
  • L'utilisateur peut désactiver ce mode en ajoutant la commande /no_think à sa requête.

Ce mécanisme améliore la capacité du modèle à résoudre des problèmes complexes nécessitant une inférence en plusieurs étapes[3].

Tokenizer multilingue

Qwen utilise un vocabulaire de tokens étendu (environ 151 000 tokens), basé sur le vocabulaire BPE de GPT-4 d'OpenAI (cl100k) avec des optimisations supplémentaires pour le chinois et d'autres langues. Cela permet d'encoder efficacement les caractères chinois, l'alphabet latin et le code informatique, améliorant ainsi les capacités multilingues du modèle[4].

Capacités multimodales

La famille Qwen se développe activement dans le domaine de la multimodalité, en proposant des modèles capables de travailler avec différents types de données :

  • Qwen-VL : Combine un transformeur de vision (pour le traitement d'images) avec un modèle de langage, permettant de répondre à des questions sur des images et de générer des descriptions. La version Qwen2.5-VL est capable d'analyser des images de résolution arbitraire et d'extraire des données structurées (par exemple, à partir de tableaux et de formulaires)[9].
  • Qwen-Audio : Un modèle spécialisé pour le traitement de l'information audio, capable de reconnaître et de générer de la parole, de la musique et d'autres sons[12].
  • Qwen2.5-Omni : Un modèle multimodal universel de bout en bout (end-to-end) qui perçoit simultanément le texte, les images, l'audio et la vidéo, et génère des réponses sous forme de texte ou de parole naturelle en mode streaming. Il est basé sur l'architecture « Thinker-Talker », où le « Thinker » (LLM) génère le contenu textuel et le « Talker » (un modèle autorégressif à deux pistes) synthétise l'audio[10].
  • Modèles spécialisés : Des modèles axés sur des tâches spécifiques ont également été publiés, tels que Qwen-Coder (programmation) et Qwen-Math (résolution de problèmes mathématiques).

Données d'entraînement et échelle

Les modèles Qwen sont entraînés sur des corpus de données extrêmement volumineux, qui comprennent des textes provenant d'Internet, des livres, des articles scientifiques, du code de programmation et des données mathématiques.

  • Qwen 1.0 (7B) : ~2,4 billions de tokens.
  • Qwen 1.0 (72B) : ~3,0 billions de tokens.
  • Qwen 2.0 : ~7 billions de tokens.
  • Qwen 2.5 : ~18 billions de tokens.
  • Qwen 3.0 : ~36 billions de tokens, couvrant 119 langues et dialectes.

Pour améliorer la qualité des données, des méthodes avancées de filtrage et la génération de données synthétiques de haute qualité sont utilisées, en particulier pour des domaines tels que les mathématiques et la programmation[8].

Licences et disponibilité

La politique de licence des modèles Qwen a évolué au fil du temps.

  • Premiers modèles (Qwen 1) : Ils étaient distribués sous leur propre licence, la Licence Tongyi Qianwen. Elle autorisait un usage académique, mais exigeait une demande et une autorisation distincte pour une utilisation commerciale[5].
  • Modèles récents (Qwen 2, 2.5, 3) : À partir de la deuxième génération, les développeurs ont adopté une politique plus ouverte. La plupart des nouveaux modèles ont été publiés sous la licence permissive Apache License 2.0, ce qui permet leur utilisation libre dans des projets scientifiques et commerciaux[7]. Avec la sortie de la famille Qwen 3, tous les modèles de cette génération sont devenus entièrement open source sous Apache 2.0 sans restrictions supplémentaires[3].
  • Modèles propriétaires et restreints : Malgré une tendance générale à l'ouverture, les modèles les plus grands ou stratégiquement importants (par exemple, Qwen2.5-Max, Qwen2.5-VL-72B) restent propriétaires et sont accessibles via les API payantes d'Alibaba Cloud ou distribués sous des licences de recherche plus strictes.

Comparaison avec les concurrents et performances

Les modèles Qwen sont activement positionnés sur un marché très concurrentiel et sont régulièrement comparés aux développements des plus grandes entreprises mondiales.

  • vs. Llama (Meta) : Dans les rapports techniques, Qwen démontre souvent une supériorité sur les modèles Llama de taille comparable. Par exemple, Qwen2-72B obtient de meilleurs résultats sur les benchmarks MMLU, HumanEval et GSM8K par rapport à Llama-3-70B.
  • vs. GPT (OpenAI) : Les modèles phares de Qwen visent à combler l'écart avec les modèles GPT. Alibaba Cloud affirme que Qwen2.5-Max surpasse GPT-4o sur certains benchmarks académiques, et que Qwen2-72B-Instruct fait preuve de compétitivité face à GPT-4-Turbo.
  • vs. Mistral AI : Les deux entreprises mettent l'accent sur les modèles open source. Les tests montrent que Qwen2-72B surpasse Mixtral-8x22B sur les benchmarks clés[7].

Résultats sur les benchmarks

Comparaison des performances des modèles phares de Qwen avec leurs concurrents (données de mi-2024)[7]
Modèle MMLU (5-shot) HumanEval (0-shot) GSM8K (8-shot) MT-Bench
Qwen2-72B (base) 84,2 64,6 89,5 N/A
Qwen2-72B-Instruct 82,3 86,0 93,2 9,12
Llama-3-70B (base) 79,5 48,2 83,0 N/A
Llama-3-70B-Instruct 82,0 81,7 93,0 8,95
Mixtral-8x22B (base) 77,8 46,3 83,7 N/A
Mixtral-8x22B-Instruct 74,0 73,8 89,1 8,66

Note : N/A — non applicable ou données non disponibles dans les sources citées.

Écosystème et applications

La famille Qwen est intégrée dans divers produits et plateformes, formant autour d'elle un écosystème en développement.

  • Plateformes Alibaba Cloud : L'accès aux modèles, en particulier aux versions propriétaires les plus puissantes, est fourni via les API de Model Studio. La plateforme PAI-EAS (Platform for AI - Elastic Algorithm Service) permet de déployer, de spécialiser (fine-tuning) et de personnaliser les modèles Qwen.
  • Communauté Open Source : Les versions open source des modèles, leurs poids et leur code sont activement hébergés sur les plateformes Hugging Face, ModelScope et GitHub[6], ce qui favorise leur large diffusion et leur utilisation par les chercheurs et les développeurs du monde entier.
  • Applications : Les modèles sont utilisés pour un large éventail de tâches, de la génération de contenu et l'analyse de données à la création d'agents d'IA. Par exemple, les modèles Qwen3 prennent en charge le protocole Model Context Protocol (MCP), qui leur permet d'interagir plus efficacement avec d'autres applications et outils.

Publications

Liens externes

Bibliographie

  • Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Bai, Jinze; et al. (2023). Qwen Technical Report. arXiv:2309.16609.
  • Peng, B.; et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Qwen Team (2024). Qwen2 Technical Report. arXiv:2407.10671.
  • Qwen Team (2024). Qwen2‑Audio Technical Report. arXiv:2407.10759.
  • Qwen Team (2025). Qwen2.5 Technical Report. arXiv:2412.15115.
  • Bai, Jinze; et al. (2025). Qwen2.5‑VL: A Versatile Vision‑Language Model for Real‑World Agent Tasks. arXiv:2502.13923.
  • Wang, Wen; et al. (2025). Qwen2.5‑Omni: A Streaming End‑to‑End Multimodal Model. arXiv:2503.20215.
  • Yang, An; et al. (2025). Qwen3 Technical Report. arXiv:2505.09388.

Références

  1. 1.0 1.1 « Qwen ». Dans Wikipedia [1]
  2. 2.0 2.1 2.2 «Qwen Models: Alibaba's Next-Generation AI Family for Text, Vision, and Beyond». Inferless. [2]
  3. 3.0 3.1 3.2 «Qwen 3 offers a case study in how to effectively release a model». Simon Willison's Weblog. [3]
  4. 4.0 4.1 4.2 Bai, Jinze; et al. (2023). Qwen Technical Report. arXiv:2309.16609.
  5. 5.0 5.1 «Qwen/Qwen-7B». Hugging Face. [4]
  6. 6.0 6.1 «GitHub - QwenLM/Qwen: The official repo of Qwen». GitHub. [5]
  7. 7.0 7.1 7.2 7.3 7.4 7.5 Qwen Team (2024). Qwen2 Technical Report. arXiv:2407.10671.
  8. 8.0 8.1 8.2 Qwen Team (2025). Qwen2.5 Technical Report. arXiv:2412.15115.
  9. 9.0 9.1 Bai, Jinze; et al. (2025). Qwen2.5-VL: A Versatile Vision-Language Model for Real-World Agent Tasks. arXiv:2502.13923.
  10. 10.0 10.1 Wang, Wen; et al. (2025). Qwen2.5-Omni: A Streaming End-to-End Multimodal Model. arXiv:2503.20215.
  11. 11.0 11.1 11.2 Yang, An; et al. (2025). Qwen3 Technical Report. arXiv:2505.09388.
  12. Gao, Shidong; et al. (2024). Qwen2-Audio Technical Report. arXiv:2407.10759.