En bref
En avril 2023, Alibaba Cloud présente Tongyi Qianwen — en mandarin 通义千问, « réponse universelle aux mille questions » — d’abord en bêta fermée sur ses propres services. Moins de trois ans plus tard, la famille Qwen est devenue le premier producteur de modèles dérivés sur HuggingFace au monde, devant Meta et ses Llama : 113 000 modèles directement dérivés de Qwen, représentant 69 % des nouveaux fine-tunes déposés sur la plateforme en février 2026. [triangulé — HuggingFace State of Open Source Spring 2026 + Xinhua janvier 2026 + ATOM Report arXiv 2604.07190]
Ce parcours est le résultat d’une stratégie cohérente : publier des modèles open-weight sous licence Apache 2.0, couvrir toute la gamme des tailles (de 0,6 milliard à 235 milliards de paramètres), et intégrer dans un même modèle des capacités qui chez les concurrents exigent plusieurs systèmes distincts — raisonnement, vision, code, audio.
Trois entités à ne pas confondre
Avant de plonger dans les modèles, une clarification s’impose : plusieurs organisations distinctes sont impliquées dans la chaîne de production Qwen, et les confondre mène à des erreurs d’interprétation stratégique.
Vocabulaire organisationnel
- Alibaba Group : le groupe holding coté en bourse (NYSE : BABA, HKEX : 9988), fondé en 1999 par Jack Ma à Hangzhou. La maison mère.
- Alibaba Cloud (Aliyun) : la division cloud computing d’Alibaba, lancée en 2009. C’est l’entité commerciale qui héberge, distribue et monétise les modèles Qwen via API.
- DAMO Academy (Academy for Discovery, Adventure, Momentum and Outlook) : le laboratoire de recherche fondamentale établi par Alibaba en 2017, avec des implantations à Hangzhou, Pékin, San Mateo, Singapour et Moscou. Son mandat couvre des domaines larges : IoT, fintech, quantique, IA. DAMO était l’entité de recherche initiale avant la restructuration. [triangulé — Alibaba Group officiel + MIT Technology Review 2018]
- Tongyi Laboratory (通义实验室, rebaptisé Tongyi Large Model Business Unit) : l’unité opérationnelle directement responsable du développement Qwen depuis la restructuration interne d’Alibaba. En mars 2026, une nouvelle consolidation a créé « Alibaba Token Hub » sous la direction du PDG Eddie Wu, regroupant l’ensemble des opérations IA. [triangulé — Wikipedia Qwen + Xinhua]
La relation pratique est la suivante : Tongyi Lab développe les modèles, Alibaba Cloud les commercialise via DashScope (API) et Model Studio (interface SaaS), et Alibaba Group porte la stratégie et les investissements. Qwen n’est pas un projet de recherche isolé — c’est l’axe central de la compétition d’Alibaba Cloud face à AWS, Azure et Google Cloud sur le marché du cloud IA.
En clair : quand on lit « Alibaba sort un nouveau modèle », l’équipe qui l’a produit est Tongyi Lab, la plateforme qui le distribue est Alibaba Cloud, et le groupe qui en supporte le coût est Alibaba Group. Trois entités, un seul produit visible.
Fiche d’identité
| Champ | Valeur |
|---|---|
| Organisation | Tongyi Laboratory / Alibaba Cloud |
| Première version publique | Septembre 2023 (Qwen 1, grand public) |
| Type | Famille multi-architecture (dense + MoE) |
| Accès | Open-weight Apache 2.0 (modèles publics) + API propriétaire (Qwen3-Max, Qwen3.5-Plus) |
| Tailles disponibles | De 0,6B à 235B paramètres (Qwen3, avril 2025) |
| Langues | 119 langues (Qwen3, corpus 36 trillions de tokens) |
| Licence | Apache 2.0 (open-weight depuis Qwen3, avril 2025) |
Historique : de la bêta fermée à la domination écosystème (2023-2026)
2023 — Les premiers pas réglementés
Avril 2023 : Tongyi Qianwen est présenté lors d’un événement presse à Pékin, déployé en bêta fermée sur DingTalk (messagerie professionnelle Alibaba) et Tmall Genie (assistant vocal). L’accès est réservé aux entreprises clientes. [triangulé — SiliconAngle + Wikipedia + Tongyi Qianwen AI Wiki]
L’étape de la bêta n’est pas anodine : en Chine, tout service IA conversationnel grand public doit obtenir l’approbation de la Cyberspace Administration of China (CAC). Tongyi Qianwen obtient cette approbation en septembre 2023, et ouvre simultanément au grand public chinois. Les premiers poids sont publiés sous la licence propriétaire Tongyi Qianwen : 7B, 14B, 72B et 1,8B paramètres. [triangulé — SiliconAngle + Wikipedia + Skywork.ai]
2024 — La montée en puissance multimodale
Juin 2024 — Qwen2 : architecture mixte dense et MoE, avec les premières variantes multimodales sérieuses (Qwen-Audio, Qwen-VL). Les benchmarks publiés indiquent des performances supérieures à Llama 2 70B sur les tâches mathématiques et de code. La licence passe partiellement à Apache 2.0 pour les modèles en dessous de 72B. [répliqué — Wikipedia + arXiv Qwen2 Technical Report]
Septembre 2024 — Qwen2.5 : le corpus préentraînement passe de 7 à 18 trillions de tokens. Le Qwen2.5-72B-Instruct revendique des performances comparables au Llama 3.1-405B — un modèle cinq fois plus grand — sur les benchmarks de raisonnement général. Six tailles de Qwen2.5-Coder (code, 92 langages de programmation) et trois tailles de Qwen2.5-VL (vision-langage : 3B, 7B, 72B) sont lancées simultanément. [triangulé — arXiv 2412.15115 + HuggingFace papers + Qwen readthedocs]
2024-2025 — L’émergence du raisonnement
Novembre 2024 — QwQ-32B-Preview : premier modèle de raisonnement pur de la famille Qwen, utilisant l’apprentissage par renforcement avec récompenses basées sur les résultats (outcome-based rewards). L’approche s’inspire directement de DeepSeek-R1, sorti peu après. [répliqué — GitHub QwenLM/QwQ + VentureBeat]
Mars 2025 — QwQ-32B (version finale) : 32 milliards de paramètres. Les benchmarks publiés indiquent des performances proches de DeepSeek-R1 (671B total, 37B actifs) sur AIME et LiveCodeBench, et supérieures à OpenAI o1-mini. Open-weight sous Apache 2.0. [triangulé — GitHub QwenLM/QwQ + BDTechTalks + HuggingFace QwQ-32B card]
En clair : QwQ-32B est la démonstration qu’un modèle de 32 milliards de paramètres, entraîné intelligemment, peut égaler sur certaines tâches de raisonnement un modèle vingt fois plus grand. C’est le même signal que DeepSeek-R1 quelques semaines plus tôt : la taille brute n’est pas le seul levier.
Avril 2025 — Qwen3, la release pivot
Qwen3 est la release la plus structurante de la famille. Publiée le 28-29 avril 2025, elle introduit plusieurs changements majeurs simultanément : [triangulé — qwenlm.github.io + arXiv 2505.09388 + Alibaba Cloud blog]
- Deux architectures : six modèles denses (0,6B, 1,7B, 4B, 8B, 14B, 32B) et deux MoE (30B-A3B et 235B-A22B).
- Apache 2.0 universel pour tous les open-weight — fin de l’hétérogénéité de licence.
- Corpus de 36 trillions de tokens sur 119 langues (contre 18T pour Qwen2.5).
- Raisonnement intégré : les modes thinking (raisonnement enchaîné) et non-thinking (réponse directe) sont disponibles dans le même modèle, sans switch de modèle.
Ce dernier point mérite attention : là où Mistral a sorti des modèles Magistral séparés pour le raisonnement, et où OpenAI distingue o1/o3 de GPT-4o, Qwen3 intègre les deux modes dans un seul poids. [répliqué — qwenlm.github.io + Alibaba Cloud blog]
2026 — Consolidation et nouvelles séries
Qwen3.5 (Qwen3.5-Plus, API propriétaire) et Qwen3-Coder-Next apparaissent en février 2026. Qwen3.6 est en cours de déploiement en avril 2026. [répliqué — Wikipedia Qwen + GitHub QwenLM/Qwen3.6, une seule source]
Juin 2026 — Qwen3.7-Plus : modèle agentique multimodal unifiant vision et langage, présenté comme une remise à niveau des capacités vision-langage sans perte sur le code, l’usage d’outils et les tâches de productivité. [source unique — Alibaba Cloud Community]
3 août 2026 — Qwen3.8-Max : le plus gros modèle jamais publié par la famille — 2 400 milliards de paramètres, fenêtre de contexte d’un million de tokens, multimodal. Alibaba annonce une cinquième place au Text Arena et une deuxième au Vision Arena. Le modèle est d’abord accessible par API sur Alibaba Cloud Model Studio, les poids étant annoncés pour plus tard. [source unique — Alibaba Cloud, communiqué et fiche modèle qwen3.8-2.4t-a95b]
Qwen3.8-Flash-Next, modèle MoE multimodal, est présenté par Alibaba comme un aperçu de l’architecture retenue pour Qwen4.
En clair : en seize mois, la famille est passée de Qwen3 (235 milliards de paramètres au plus haut) à Qwen3.8-Max (2 400 milliards), soit un facteur dix. Mais le modèle phare est repassé derrière une API propriétaire, alors que Qwen3 avait fait de l’Apache 2.0 universel son argument. Les poids de Qwen3.8-Max sont annoncés, pas publiés — c’est une promesse, pas encore un fait.
Les branches de la famille
La famille Qwen n’est pas un modèle unique mais un écosystème multi-branches. Comprendre leur rôle respectif évite la confusion.
Modèles de langage denses (LLM base)
Les six modèles denses de Qwen3 — 0,6B, 1,7B, 4B, 8B, 14B, 32B — couvrent une gamme exceptionnelle. Le 0,6B est conçu pour les appareils edge (smartphone, microcontrôleur). Le 32B cible les serveurs GPU professionnels. Tous sont sous Apache 2.0 et disponibles sur HuggingFace et ModelScope. [triangulé — qwenlm.github.io + arXiv 2505.09388 + bestcodes.dev]
Modèles MoE (Mixture of Experts)
Vocabulaire
- MoE (Mixture of Experts) : architecture où le modèle est divisé en sous-réseaux spécialisés (“experts”). Pour chaque token traité, seul un petit sous-ensemble d’experts est activé. Résultat : la taille totale du modèle est grande (beaucoup de paramètres disponibles) mais le coût par token reste celui d’un modèle bien plus petit.
- Paramètres actifs : le nombre de paramètres effectivement utilisés lors du calcul d’un token. Dans un MoE, ce chiffre est bien inférieur au total.
Qwen3-30B-A3B : 30 milliards de paramètres totaux, 3 milliards actifs par token. 128 experts, 8 activés par inférence. C’est le MoE “production-ready” : efficace à déployer, performant pour sa taille activée.
Qwen3-235B-A22B : le flagship MoE. 235 milliards de paramètres totaux, 22 milliards actifs. Les benchmarks publiés par l’équipe Qwen le comparent favorablement à DeepSeek-R1, GPT-o1 et Gemini-2.5-Pro sur le code, les mathématiques et le raisonnement général. L’ATOM Report (arXiv 2604.07190) fournit une validation tierce partielle — mais pas systématique sur l’ensemble des claims. [source officielle pour les comparaisons directes ; répliqué ATOM Report]
En clair : Qwen3-235B-A22B a 235B paramètres au total, mais n’en “pense” qu’avec 22B à chaque instant. Cela le rend moins coûteux à l’inférence qu’un dense 235B, tout en disposant d’une “bibliothèque de connaissances” potentiellement plus riche.
QwQ — la branche raisonnement (Qwen2 uniquement)
QwQ-32B est le modèle dédié au raisonnement chaîne-de-pensée de la génération Qwen2. Depuis Qwen3, le raisonnement est directement intégré dans les modèles standard — la branche QwQ est donc spécifique à la transition Qwen2→Qwen3 et ne sera pas prolongée comme famille autonome.
Qwen2.5-VL et Qwen3-VL — vision-langage
Qwen2.5-VL (janvier 2025) : traitement d’images, documents, graphiques, et vidéos jusqu’à une heure. Disponible en 3B, 7B et 72B. Capable d’agents visuels (computer use) — compréhension de l’interface d’un ordinateur ou d’un téléphone. [triangulé — arXiv 2502.13923 + HuggingFace Qwen2.5-VL + Hackster.io]
Qwen3-VL : la version multimodale de Qwen3, en cours de déploiement mi-2025. [répliqué — GitHub QwenLM/Qwen3-VL]
Qwen2.5-Coder — spécialiste code
Six tailles (de 0,5B à 32B), 92 langages de programmation. La version 32B Instruct revendique des performances comparables à GPT-4o sur EvalPlus, LiveCodeBench et BigCodeBench, avec un score Aider de 73,7 (contre 72,9 pour GPT-4o). [triangulé — arXiv 2409.12186 + Ollama library + HuggingFace Qwen2.5-Coder card]
Qwen2.5-Omni — multimodal complet
Annoncé en mars 2026 : traitement texte, images, vidéo et audio en entrée, génération texte et audio en sortie. [répliqué — Wikipedia Qwen + CNBC 2026]
Positionnement stratégique
Open-weight Apache 2.0 vs propriétaire
Depuis Qwen3 (avril 2025), tous les open-weight sont sous licence Apache 2.0 — utilisation commerciale libre sans restriction de taille d’audience. C’est une convergence vers la stratégie de Meta avec Llama 4. Les versions propriétaires (Qwen3-Max, Qwen3.5-Plus) restent API-only via DashScope. [triangulé — GitHub Qwen LICENSE + HuggingFace Qwen2.5-72B-Instruct + qwenimage.art blog]
En clair : la règle Qwen3 est simple — si le modèle est open-weight, il est Apache 2.0. Si ce n’est pas Apache 2.0, c’est API uniquement. Pas d’ambiguïté de licence comme dans les premières générations.
ModelScope vs HuggingFace
ModelScope (modelscope.cn) est la plateforme open-model d’Alibaba, positionnée comme alternative à HuggingFace pour les développeurs en Chine (où l’accès à HuggingFace peut être limité). Les modèles Qwen y sont disponibles en priorité ou simultanément avec HuggingFace. L’intégration avec l’infrastructure Alibaba Cloud (PAI-EAS, DashScope) est native. [répliqué — Alibaba Cloud documentation + GitHub QwenLM]
L’infrastructure enterprise Alibaba Cloud
Le triplet commercial : DashScope (API OpenAI-compatible), Model Studio (interface SaaS de gestion), PAI-EAS (déploiement one-click avec vLLM et autoscaling). Cette pile constitue une alternative à Azure OpenAI Service ou AWS Bedrock pour les entreprises qui opèrent principalement sur Alibaba Cloud. [triangulé — Alibaba Cloud help docs + PAI-EAS blog + DashScope SDK doc]
Portée internationale
L’adoption internationale commence à se concrétiser. AI Singapore a choisi Qwen (plutôt que Llama) comme base de son modèle régional — signal d’adoption par un acteur gouvernemental non chinois. [triangulé — SiliconAngle + MIT Technology Review 2026 + Xinhua]
| Contexte | Recommandation | Pourquoi |
|---|---|---|
| Déploiement local sur smartphone ou edge device | Qwen3-0.6B ou 1.7B | La gamme la plus basse du marché open-weight en termes de taille, avec des performances raisonnables pour des tâches simples. |
| Fine-tuning ou adaptation domaine sur GPU unique | Qwen3-8B ou 14B | Taille gérable sur un A100 ou deux RTX 4090 ; base entraînée 36T tokens, bonne transferabilité. |
| Production enterprise, équilibre performance/coût | Qwen3-30B-A3B (MoE) | 30B total, 3B actifs : performances proches du 32B dense, coût inférence d’un petit modèle. |
| Raisonnement mathématique ou de code intensif | Qwen3-235B-A22B ou QwQ-32B | Le flagship MoE pour les capacités maximales ; QwQ-32B pour le raisonnement dans une enveloppe plus modeste. |
| Intégration cloud via API, sans hébergement propre | Qwen3-Max ou Qwen3.5-Plus (DashScope) | Propriétaires API-only, réservés aux usages où on ne peut pas gérer l’infrastructure. |
Forces
Couverture gamme inégalée
Qwen3 couvre de 0,6B à 235B paramètres en open-weight, avec deux architectures (dense/MoE). C’est la gamme ouverte la plus complète disponible en 2025 : edge (0,6B sur smartphone) jusqu’à enterprise (235B MoE sur cluster GPU). Ni Llama 4 ni Mistral Large 3 ne couvrent l’ensemble de ce spectre sous licence ouverte. [triangulé — qwenlm.github.io + arXiv 2505.09388 + datasciencedojo.com]
Domination de l’écosystème dérivé
En mars 2026, Qwen cumule 942,1 millions de téléchargements sur HuggingFace (contre 476 millions pour Llama). La part de Qwen dans les nouveaux fine-tunes HuggingFace est passée de 1 % en janvier 2024 à 69 % en février 2026. Alibaba dispose de plus de modèles dérivés que Google et Meta combinés. [triangulé — HuggingFace State of Open Source Spring 2026 + Xinhua + ATOM Report arXiv 2604.07190]
La métrique des 113 000 dérivés directs est déjà couverte dans l’article Écosystème acteurs — nous ne la développons pas davantage ici.
Raisonnement intégré sans switch de modèle
L’intégration des modes thinking et non-thinking dans un seul modèle Qwen3 est une innovation architecturale notable. Elle simplifie le déploiement : une seule infrastructure, une seule API, deux comportements configurables par paramètre. [répliqué — qwenlm.github.io + Alibaba Cloud blog]
Corpus préentraînement massif et multilingue
36 trillions de tokens pour Qwen3 (contre 18T pour Qwen2.5, 7T pour Qwen2), sur 119 langues — incluant des données synthétiques générées par Qwen2.5-Math et Qwen2.5-Coder pour les domaines STEM. [triangulé — arXiv 2505.09388 + qwenlm.github.io]
Limites connues
Benchmarks auto-publiés
Les comparaisons de performance de Qwen (avec DeepSeek-R1, Gemini-2.5-Pro, GPT-o1) sont publiées par l’équipe Qwen elle-même. L’ATOM Report (arXiv 2604.07190) fournit une validation tierce partielle, pas systématique. Cette limite est partagée avec Llama (Meta) et Mistral — ce n’est pas une exception Qwen, mais elle mérite d’être signalée. [répliqué — arXiv 2604.07190 + BDTechTalks QwQ article]
Datasets non divulgués
Les rapports techniques Qwen2.5 (arXiv 2412.15115) et Qwen3 (arXiv 2505.09388) décrivent les volumes de tokens et les domaines couverts, mais pas la composition précise des datasets : sources exactes, ratio données synthétiques/naturelles, métriques de déduplication ou de fairness sur les 119 langues. Contrairement à DeepSeek, Alibaba n’a pas publié de chiffre de coût d’entraînement. [triangulé — arXiv 2412.15115 + arXiv 2505.09388 + TechRxiv Qwen2.5 review]
Licensing historique hétérogène (résolu en Qwen3)
Les générations Qwen1 et Qwen2 utilisaient la licence propriétaire Tongyi Qianwen — avec une clause réservant l’usage commercial aux services en dessous de 100 millions d’utilisateurs actifs mensuels, similaire à la clause Llama 2. Seuls les modèles en dessous de 72B étaient en Apache 2.0. Cette hétérogénéité a été résolue avec Qwen3 (avril 2025). [triangulé — GitHub Qwen issues #778 + HuggingFace Qwen2.5-72B discussions + CometAPI blog]
Géopolitique et contraintes export
Les modèles Qwen sont entraînés en Chine dans un contexte de contrôles d’export américains sur les puces H100 et suivantes. Alibaba a répondu, comme DeepSeek, par l’optimisation algorithmique plutôt que l’acquisition de compute. Le format open-weight Apache 2.0 complique toute restriction d’accès post-distribution : une fois le modèle publié, son usage mondial ne peut plus être contrôlé. [triangulé — MIT Technology Review 2026 + Congress.gov CRS R48642 + AI Frontiers]
Instabilité organisationnelle récente
La restructuration de mars 2026 (création d‘“Alibaba Token Hub”) et des changements de direction signalent une période de transition. L’impact sur la cadence de développement et l’engagement open-source n’est pas encore évaluable. [une seule source — Wikipedia Qwen, à confirmer]
Ce qu’il faut retenir
En trois ans, Qwen est passé d’un produit captif dans l’écosystème Alibaba à la famille de modèles open-weight la plus dérivée au monde. Quatre éléments expliquent cette trajectoire :
- La gamme : aucun autre acteur ne couvre en open-weight 0,6B à 235B avec deux architectures sous Apache 2.0.
- La cadence : des releases majeures tous les six à neuf mois, avec des rapports techniques arXiv à chaque génération.
- La stratégie Apache 2.0 : en ouvrant totalement la licence sur les open-weight depuis Qwen3, Alibaba a supprimé la principale friction à l’adoption commerciale.
- L’intégration verticale : ModelScope + DashScope + PAI-EAS crée une chaîne complète du poids brut au déploiement cloud managé, à l’image de ce qu’AWS ou Azure proposent avec les modèles de leurs partenaires respectifs.
Ce qui reste incertain : la durabilité de l’engagement open-weight face aux pressions commerciales, la qualité de l’alignement sur les 119 langues (non publiée), et les conséquences de la restructuration organisationnelle de 2026.