Aller au contenu

Limites

Sept limites, dont trois que la communication d'Alibaba ne mentionne pas.


1. Le codage à l'échelle du dépôt

Le titre du billet officiel est « A New Bar for Coding and Cowork ». Le tableau du constructeur lui-même ne le soutient pas sur la partie la plus exigeante.

Benchmark Qwen3.8-Max Meilleur Écart
DeepSWE 1.1 56,6 73,0 −16,4
FrontierSWE 73,5 88,8 −15,3
NL2Repo-Bench 55,9 69,4 −13,5
SWE-bench Pro 67,7 80,0 −12,3

Les quatre benchmarks les plus réalistes sont les quatre plus mauvais résultats

SWE-bench Pro, FrontierSWE, DeepSWE et NL2Repo sont ceux qui ressemblent le plus au travail réel : de vrais dépôts, de vraies issues, des tests qui doivent passer.

Le modèle y est de 12 à 16 points derrière. Sur les tâches de codage plus courtes — front-end, terminal, génération isolée — il est en revanche compétitif.

Un usage de type « agent qui travaille dans un dépôt existant » n'est pas ce que ce modèle fait de mieux, quel que soit le titre du billet.


2. La vitesse

Mesure Qwen3.8-Max Médiane
Vitesse de sortie 47,0 j/s 67,7 j/s
Rang 119ᵉ / 184 —
Délai au premier jeton 2,72 s —

Trois causes cumulées :

  1. Raisonnement forcé à xhigh — des dizaines de milliers de jetons invisibles par requête ;
  2. Bande passante mémoire — 95 G de paramètres actifs rechargés par jeton ;
  3. Communication all-to-all du routage MoE, 92 fois par passe avant.

En agentique, la lenteur coûte plus que le prix

Sur une tâche de 200 tours, 30 % de vitesse en moins se traduit en heures. L'avantage tarifaire de 2 $/6 $ ne compense pas une session qui prend une demi-journée au lieu de trois heures.

C'est la limite la plus sous-estimée du modèle, parce qu'elle n'apparaît dans aucune communication d'Alibaba.


3. Aucune documentation technique

Élément Kimi K3 Qwen3.8-Max
Rapport technique 80 pages, arXiv aucun
Recette d'entraînement détaillée rien
Jetons d'entraînement publié rien
Ablations fournies aucune
Lois d'échelle publiées rien
Post-entraînement décrit rien
Évaluation de sécurité oui aucune

Ce que l'absence de rapport empêche

  • Aucune attribution. On ne sait pas si les gains viennent de l'architecture, des données ou du post-entraînement.
  • Aucune ablation. Rien ne justifie 3:1 plutôt que 2:1, ni 512 experts plutôt que 256.
  • Aucune reproductibilité. Une équipe ne peut pas rebâtir ce modèle.
  • Aucune évaluation de risque. Pas une ligne sur les capacités dangereuses, contrairement à plusieurs concurrents.

La formule officielle — « bâti sur la fondation architecturale de Qwen 3.5 » — est l'unique explication fournie pour un modèle de 2,4 billions de paramètres.

C'est un recul par rapport à la norme établie par Kimi K3 trois semaines plus tôt.


4. Les poids sont inexploitables par presque tout le monde

Précision GPU H100 nécessaires GPU B200 nécessaires
BF16 74 33
FP8 38 17
4 bits 20 9

Le plancher absolu est de neuf B200. Aucun particulier, aucune PME, aucun laboratoire universitaire moyen n'y accède.

Ce n'est pas un reproche, c'est une clarification

La publication a une valeur réelle — audit, permanence, distillation, souveraineté. Voir Forces.

Mais l'expression « poids ouverts » évoque spontanément l'exécution locale, et ce n'est pas ce qui est offert. La couverture presse entretient largement la confusion.


5. L'écart entre l'API et les poids

Trois différences non signalées par Alibaba

API Poids
Vision ✅ ❌
Vidéo ✅ ❌
Raisonnement désactivable ✅ ❌

Le communiqué affirme que le modèle « supporte nativement l'intelligence visuelle » et met en avant un 2ᵉ rang en Vision Arena. Le checkpoint publié est textuel — son model_type porte d'ailleurs le suffixe _text.

Aucune source secondaire consultée pour ce rapport ne fait clairement la distinction.

Le second point — raisonnement non désactivable — a une conséquence pratique directe : sur une tâche simple, le modèle ouvert produira des milliers de jetons de réflexion inutiles, sans moyen de l'empêcher.


6. Le million de jetons n'est pas mesuré

Le modèle revendique 1 010 000 jetons. Les benchmarks publiés s'arrêtent à 256 K (MRCR v2), soit dans le contexte natif de 262 144.

La zone 262 K → 1 010 000 est entièrement non documentée

  • La méthode d'extension n'est pas nommée — YaRN est probable, non confirmé.
  • Aucune mesure de dégradation n'est publiée.
  • Aucune évaluation indépendante ne teste cette plage.

Le contexte étendu fonctionne au sens où il ne plante pas. Ce qu'il vaut au-delà de 262 144 jetons est une inconnue complète.


7. Les démonstrations ne prouvent rien

Les cinq études de cas — codage sur 16 jours, article reproduit, concours, puce, boutique — sont toutes non reproductibles :

Démonstration Ce qui manque
16 jours de codage interventions humaines, harnais, coût, qualité évaluée
Reproduction d'article le nom de l'article ; +2,7 pts sur 30 questions = 0,8 question
Concours le nom du concours, la nature des équipes
Puce à 678 portes le circuit initial, la ligne de base d'un outil de synthèse
Boutique sur 365 jours le simulateur et ses règles

Le paradoxe du format

Le tableau de benchmarks, malgré ses défauts, est falsifiable : un tiers peut le refaire.

Les cinq récits ne le sont pas. Ils occupent pourtant l'essentiel de l'espace du billet officiel.

Détail : Les démonstrations agentiques.


Les angles morts

Absents de toute source, publique ou officielle :

Sujet Statut
Sécurité et capacités dangereuses aucune évaluation publiée
Biais et équité non traité
Multilinguisme aucun benchmark dédié
Consommation énergétique non publiée
Provenance des données non publiée
Modèle de base non affiné non publié
Évaluation des poids ouverts eux-mêmes aucune, tous les scores tiers portent sur l'API

Le dernier point mérite d'être souligné : treize jours après l'annonce, aucune mesure indépendante ne porte sur le checkpoint téléchargeable. Rien ne garantit qu'il se comporte comme le service.


À retenir

Ce chapitre en sept points

  1. −12 à −16 points sur le codage à l'échelle du dépôt, malgré le positionnement.
  2. 119ᵉ sur 184 en vitesse — la limite la plus coûteuse en usage agentique.
  3. Aucun rapport technique : ni ablation, ni recette, ni évaluation de sécurité.
  4. Les poids exigent 9 à 74 GPU de très haut de gamme.
  5. Les poids ne font pas ce que l'API fait — pas de vision, raisonnement forcé.
  6. Le million de jetons n'est mesuré nulle part au-delà de 256 K.
  7. Les cinq démonstrations sont non reproductibles.

Chapitre suivant : Affirmations à vérifier.