Ce qui est annoncé¶
Les revendications d'Alibaba, numérotées, avec ce qui les appuie et ce qui leur manque.
Les sources de l'annonce¶
Trois documents, du plus institutionnel au plus technique :
| Document | Contenu |
|---|---|
| Communiqué Alibaba Group | annonce institutionnelle, 3 août 2026 |
| Billet Qwen | « A New Bar for Coding and Cowork », démonstrations |
| Carte de modèle Hugging Face | architecture, tableau de benchmarks, licence |
Aucun rapport technique. Aucune publication arXiv. Aucune description de la recette d'entraînement.
R1 · L'architecture¶
« 2.4 trillion parameters (95B active) », « built upon the architectural foundation of Qwen 3.5 », « a cutting-edge Sparse Mixture-of-Experts (MoE) architecture combined with a hybrid attention mechanism ».
| Statut | Vérifié. Le décompte à partir de config.json donne 2,4198 T de paramètres et 95,29 G actifs — écarts de 0,83 % et 0,30 %. |
| Ce qui manque | Toute justification. Aucune ablation, aucune loi d'échelle, aucune comparaison avec une variante non hybride. On sait ce que c'est, pas pourquoi c'est mieux. |
Détail : Vérification des paramètres.
R2 · Le contexte d'un million de jetons¶
« context window of up to 1 million tokens ».
| Statut | Partiellement exact, et l'imprécision compte. La carte de modèle dit : « 262,144 natively and extensible up to 1,010,000 tokens ». |
| Nuance | Le contexte natif est de 262 144 jetons. Le million s'obtient par extension — vraisemblablement YaRN, comme sur Qwen3.6-27B, mais la carte ne le précise pas. config.json confirme max_position_embeddings: 262144. |
Contexte natif et contexte étendu ne sont pas équivalents
Un contexte étendu fonctionne, mais la qualité de rappel s'y dégrade généralement. Aucune mesure publiée ne documente l'écart pour ce modèle. Le seul benchmark long contexte du tableau officiel, MRCR v2, est évalué à 256 K — c'est-à-dire dans le contexte natif, pas dans l'extension.
R3 · La multimodalité¶
« natively supports visual intelligence » (communiqué) ; 2ᵉ rang en Vision Arena.
| Statut | Vrai pour l'API, faux pour les poids. |
| Preuve | La carte de modèle du dépôt indique un modèle textuel, sans entrée visuelle. La documentation de l'API, elle, liste texte, images et vidéos en entrée. |
C'est l'écart le plus important entre la communication et l'artefact livré, et il est traité en détail dans Licence et disponibilité.
R4 · Le codage autonome sur 16 jours¶
Le modèle a piloté seul le développement du projet
oh-my-clipendant environ seize jours, produisant 265 commits, 127 pull requests et 151 issues, avec des traces publiques sur GitHub.
| Statut | Revendication documentée mais non contrôlée. |
| Ce qui appuie | L'existence de traces publiques est un plus rare : la plupart des démonstrations agentiques ne sont pas inspectables. |
| Ce qui manque | Aucune information sur les interventions humaines, le harnais utilisé, le nombre de tentatives échouées, ni le coût. Un dépôt de 265 commits n'est pas en soi une preuve de qualité. |
R5 · La reproduction d'un article de recherche¶
En environ cinq jours de travail autonome, le modèle a écrit ~7 600 lignes de code, effectué plus de 1 100 actions et lancé 33 séries d'entraînement GPU pour reproduire un article — puis a dépassé sa méthode de +2,7 points sur AIME24.
| Statut | Non vérifiable en l'état. |
| Ce qui manque | Le nom de l'article reproduit, la référence exacte de la mesure, la ligne de base. Un gain de 2,7 points sur AIME24 — 30 questions — représente moins d'une question de différence. |
AIME24 comporte 30 questions
Sur un benchmark de 30 items, un écart de 2,7 points correspond à 0,8 question. C'est en dessous du bruit d'échantillonnage d'une simple variation de graine aléatoire. Cette revendication ne peut pas porter le poids qu'on lui donne.
R6 · La compétition contre des humains¶
Dans un concours en ligne de 24 heures réunissant 526 équipes humaines, le modèle a fait mieux que 458 d'entre elles, soit le 87ᵉ centile.
| Statut | Non vérifiable. |
| Ce qui manque | Le nom du concours, la date, la nature des équipes, et si la soumission a été faite en conditions réelles. Un modèle qui dispose de 24 h de calcul intensif n'est pas comparable à une équipe humaine sur le même chronomètre. |
R7 · La conception de puce¶
Sur plus de 500 tours, le modèle a réduit le nombre de portes logiques d'un circuit de 8 298 à 678, soit 81 % de réduction de surface.
| Statut | Impressionnant si exact, invérifiable en l'état. |
| Ce qui manque | Le circuit de départ, l'outil de synthèse, et surtout : le circuit initial était-il déjà optimisé ? Une réduction de 92 % du nombre de portes suggère un point de départ délibérément naïf. |
R8 · La gestion d'une boutique pendant un an¶
Sur une simulation de 365 jours d'exploitation e-commerce, le modèle atteint un solde de 416 252 ¥, soit 4,16× le capital initial, et dépasse les concurrents de 38 %.
| Statut | Simulation, non marché réel. |
| Ce qui manque | Le simulateur, ses règles, et qui l'a conçu. Un environnement conçu en interne récompense ce que son concepteur a jugé important. |
R9 · Les scores de benchmarks¶
Trente et une lignes comparant Qwen3.8-Max à Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol et Qwen3.7-Max.
| Statut | Mesures du constructeur. |
| Point notable | Le tableau est honnête sur les défaites : il montre Qwen3.8-Max nettement derrière Fable 5 sur SWE-bench Pro (67,7 contre 80,0) et FrontierSWE (73,5 contre 88,8). C'est inhabituel et cela crédibilise le reste. |
| Réserve | Six lignes sur trente et une portent sur des benchmarks conçus par Qwen. |
Tableau intégral et analyse : Le tableau officiel.
R10 · Le prix¶
2,00 $ par million de jetons en entrée, 6,00 $ en sortie, 0,25 $ pour l'entrée relue en cache — tarif unique sur toute la fenêtre.
| Statut | Vérifiable, et effectivement bas. |
| Nuance | Le raisonnement xhigh par défaut est facturé en sortie et ne peut pas être coupé. Le coût par tâche mesuré par Artificial Analysis — 1,13 $ — est plus révélateur que le tarif affiché. |
Synthèse¶
| # | Revendication | Statut |
|---|---|---|
| R1 | Architecture 2,4 T / 95 G actifs | vérifié |
| R2 | Contexte 1 M | partiellement — 262 K natif |
| R3 | Multimodal | vrai pour l'API, faux pour les poids |
| R4 | 16 jours de codage autonome | documenté, non contrôlé |
| R5 | Reproduction d'article, +2,7 pts | non vérifiable, écart sous le bruit |
| R6 | 87ᵉ centile en concours | non vérifiable |
| R7 | Puce à 678 portes | non vérifiable |
| R8 | Boutique gérée un an | simulation interne |
| R9 | Benchmarks | mesures constructeur, tableau honnête sur les échecs |
| R10 | Prix 2 $/6 $ | vérifiable, bas |
Le tableau détaillé des niveaux de preuve est en Affirmations à vérifier.
Chapitre suivant : Fiche technique.