Aller au contenu

Ce qui est annoncé

Les revendications d'Alibaba, numérotées, avec ce qui les appuie et ce qui leur manque.


Les sources de l'annonce

Trois documents, du plus institutionnel au plus technique :

Document Contenu
Communiqué Alibaba Group annonce institutionnelle, 3 août 2026
Billet Qwen « A New Bar for Coding and Cowork », démonstrations
Carte de modèle Hugging Face architecture, tableau de benchmarks, licence

Aucun rapport technique. Aucune publication arXiv. Aucune description de la recette d'entraînement.


R1 · L'architecture

« 2.4 trillion parameters (95B active) », « built upon the architectural foundation of Qwen 3.5 », « a cutting-edge Sparse Mixture-of-Experts (MoE) architecture combined with a hybrid attention mechanism ».

Statut Vérifié. Le décompte à partir de config.json donne 2,4198 T de paramètres et 95,29 G actifs — écarts de 0,83 % et 0,30 %.
Ce qui manque Toute justification. Aucune ablation, aucune loi d'échelle, aucune comparaison avec une variante non hybride. On sait ce que c'est, pas pourquoi c'est mieux.

Détail : Vérification des paramètres.


R2 · Le contexte d'un million de jetons

« context window of up to 1 million tokens ».

Statut Partiellement exact, et l'imprécision compte. La carte de modèle dit : « 262,144 natively and extensible up to 1,010,000 tokens ».
Nuance Le contexte natif est de 262 144 jetons. Le million s'obtient par extension — vraisemblablement YaRN, comme sur Qwen3.6-27B, mais la carte ne le précise pas. config.json confirme max_position_embeddings: 262144.

Contexte natif et contexte étendu ne sont pas équivalents

Un contexte étendu fonctionne, mais la qualité de rappel s'y dégrade généralement. Aucune mesure publiée ne documente l'écart pour ce modèle. Le seul benchmark long contexte du tableau officiel, MRCR v2, est évalué à 256 K — c'est-à-dire dans le contexte natif, pas dans l'extension.


R3 · La multimodalité

« natively supports visual intelligence » (communiqué) ; 2ᵉ rang en Vision Arena.

Statut Vrai pour l'API, faux pour les poids.
Preuve La carte de modèle du dépôt indique un modèle textuel, sans entrée visuelle. La documentation de l'API, elle, liste texte, images et vidéos en entrée.

C'est l'écart le plus important entre la communication et l'artefact livré, et il est traité en détail dans Licence et disponibilité.


R4 · Le codage autonome sur 16 jours

Le modèle a piloté seul le développement du projet oh-my-cli pendant environ seize jours, produisant 265 commits, 127 pull requests et 151 issues, avec des traces publiques sur GitHub.

Statut Revendication documentée mais non contrôlée.
Ce qui appuie L'existence de traces publiques est un plus rare : la plupart des démonstrations agentiques ne sont pas inspectables.
Ce qui manque Aucune information sur les interventions humaines, le harnais utilisé, le nombre de tentatives échouées, ni le coût. Un dépôt de 265 commits n'est pas en soi une preuve de qualité.

R5 · La reproduction d'un article de recherche

En environ cinq jours de travail autonome, le modèle a écrit ~7 600 lignes de code, effectué plus de 1 100 actions et lancé 33 séries d'entraînement GPU pour reproduire un article — puis a dépassé sa méthode de +2,7 points sur AIME24.

Statut Non vérifiable en l'état.
Ce qui manque Le nom de l'article reproduit, la référence exacte de la mesure, la ligne de base. Un gain de 2,7 points sur AIME24 — 30 questions — représente moins d'une question de différence.

AIME24 comporte 30 questions

Sur un benchmark de 30 items, un écart de 2,7 points correspond à 0,8 question. C'est en dessous du bruit d'échantillonnage d'une simple variation de graine aléatoire. Cette revendication ne peut pas porter le poids qu'on lui donne.


R6 · La compétition contre des humains

Dans un concours en ligne de 24 heures réunissant 526 équipes humaines, le modèle a fait mieux que 458 d'entre elles, soit le 87ᵉ centile.

Statut Non vérifiable.
Ce qui manque Le nom du concours, la date, la nature des équipes, et si la soumission a été faite en conditions réelles. Un modèle qui dispose de 24 h de calcul intensif n'est pas comparable à une équipe humaine sur le même chronomètre.

R7 · La conception de puce

Sur plus de 500 tours, le modèle a réduit le nombre de portes logiques d'un circuit de 8 298 à 678, soit 81 % de réduction de surface.

Statut Impressionnant si exact, invérifiable en l'état.
Ce qui manque Le circuit de départ, l'outil de synthèse, et surtout : le circuit initial était-il déjà optimisé ? Une réduction de 92 % du nombre de portes suggère un point de départ délibérément naïf.

R8 · La gestion d'une boutique pendant un an

Sur une simulation de 365 jours d'exploitation e-commerce, le modèle atteint un solde de 416 252 ¥, soit 4,16× le capital initial, et dépasse les concurrents de 38 %.

Statut Simulation, non marché réel.
Ce qui manque Le simulateur, ses règles, et qui l'a conçu. Un environnement conçu en interne récompense ce que son concepteur a jugé important.

R9 · Les scores de benchmarks

Trente et une lignes comparant Qwen3.8-Max à Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol et Qwen3.7-Max.

Statut Mesures du constructeur.
Point notable Le tableau est honnête sur les défaites : il montre Qwen3.8-Max nettement derrière Fable 5 sur SWE-bench Pro (67,7 contre 80,0) et FrontierSWE (73,5 contre 88,8). C'est inhabituel et cela crédibilise le reste.
Réserve Six lignes sur trente et une portent sur des benchmarks conçus par Qwen.

Tableau intégral et analyse : Le tableau officiel.


R10 · Le prix

2,00 $ par million de jetons en entrée, 6,00 $ en sortie, 0,25 $ pour l'entrée relue en cache — tarif unique sur toute la fenêtre.

Statut Vérifiable, et effectivement bas.
Nuance Le raisonnement xhigh par défaut est facturé en sortie et ne peut pas être coupé. Le coût par tâche mesuré par Artificial Analysis — 1,13 $ — est plus révélateur que le tarif affiché.

Synthèse

# Revendication Statut
R1 Architecture 2,4 T / 95 G actifs vérifié
R2 Contexte 1 M partiellement — 262 K natif
R3 Multimodal vrai pour l'API, faux pour les poids
R4 16 jours de codage autonome documenté, non contrôlé
R5 Reproduction d'article, +2,7 pts non vérifiable, écart sous le bruit
R6 87ᵉ centile en concours non vérifiable
R7 Puce à 678 portes non vérifiable
R8 Boutique gérée un an simulation interne
R9 Benchmarks mesures constructeur, tableau honnête sur les échecs
R10 Prix 2 $/6 $ vérifiable, bas

Le tableau détaillé des niveaux de preuve est en Affirmations à vérifier.


Chapitre suivant : Fiche technique.