Aller au contenu

Forces

Ce que Qwen3.8-Max réussit, en s'en tenant à ce qui est démontrable.


1. Le niveau de capacité est réel

Ce n'est pas une affirmation d'Alibaba, c'est le constat de deux évaluateurs indépendants :

Source Résultat
Artificial Analysis indice 58 — 10ᵉ sur 184 modèles
Vals AI 66,1 % — 2ᵉ parmi les modèles à poids ouverts
LMArena 5ᵉ en Text Arena, 4ᵉ en Frontend Code Arena

Aucun de ces trois n'a d'intérêt à flatter Alibaba, et leurs méthodologies sont publiées.

Un modèle du premier vingtième mondial

Dixième sur 184 modèles évalués, à hauteur d'Opus 4.8, devant tout ce que produisent Google, Meta et xAI. C'est un fait établi indépendamment, et c'est le point de départ de tout le reste.


2. Le respect des instructions

C'est le résultat le plus net du tableau officiel, et le moins commenté.

Modèle IFBench
Opus 4.8 62,2
Fable 5 63,5
GPT-5.6 Sol 72,7
Qwen3.7-Max 79,1
Qwen3.8-Max 82,8

+10,1 points sur le meilleur concurrent non-Qwen. Le plus grand écart favorable du tableau.

Une compétence sous-estimée

Le respect strict d'instructions contraignantes — format, longueur, contraintes négatives, structure imposée — est ce qui distingue un modèle intégrable d'un modèle qu'il faut surveiller.

En chaîne agentique, un modèle qui produit exactement le format attendu évite une couche entière de validation et de reprise. Deux points de plus en raisonnement ne compensent pas dix points de moins en obéissance.

Le prédécesseur Qwen3.7-Max était déjà premier sur cette ligne : c'est une force de lignée, pas un accident.


3. Recherche, santé, droit, finance

Benchmark Qwen3.8-Max Meilleur concurrent
PaperBench 93,0 90,5
WideSearch 81,9 81,2
HealthBench 60,2 55,3
PLawBench 73,2 72,3
PRBench-Finance 58,3 55,8

Un profil cohérent : synthèse de documents, recherche à large couverture, domaines professionnels réglementés. Ce sont des usages à forte valeur, et moins disputés que le codage.


4. L'architecture est bien conçue

Indépendamment des performances, le fichier de configuration décrit un modèle dont chaque choix se justifie par un calcul :

Choix Effet mesuré
Hybride 3:1 cache divisé par 4 à contexte long
GQA 16:1 cache divisé par 16
head_dim 256 compense la réduction des têtes clé-valeur
RoPE partiel 25 % sépare position et sémantique, facilite l'extension
512 experts étroits spécialisation combinatoire, 3,94 % d'activation
Couche MTP décodage spéculatif intégré, gratuit au chargement

Rien n'est décoratif

Combinées, GQA et l'attention hybride divisent le cache par 63 par rapport à un Transformer classique de mêmes dimensions. C'est ce qui rend le million de jetons commercialement viable à 2 $ le million.

Ce n'est pas de la recherche de rupture — chaque brique existait — mais c'est de l'ingénierie soignée, et le résultat est vérifiable.


5. Le tableau montre ses défaites

C'est suffisamment rare pour être compté comme une force.

Le tableau officiel affiche Qwen3.8-Max perdant de 15,3 points sur FrontierSWE et de 16,4 sur DeepSWE face à des concurrents nommés.

Un signal de crédibilité

La sélection des benchmarks reste favorable — huit lignes sur trente et une sont des créations maison. Mais les valeurs publiées ne sont pas maquillées.

Cela donne du poids aux lignes où le modèle gagne : une équipe qui publie ses échecs n'a pas de raison d'embellir ses réussites.


6. Le prix

Entrée Sortie
Qwen3.7-Max 2,50 $ 7,50 $
Qwen3.8-Max 2,00 $ 6,00 $

Une baisse simultanée à une montée en capacité, avec un tarif unique sur toute la fenêtre d'un million de jetons — là où plusieurs concurrents facturent double au-delà de 200 000.

L'effet dépasse le modèle : un modèle de ce niveau à ce prix contraint tout le marché à se justifier.


7. La publication des poids

C'est la première fois qu'Alibaba publie les poids d'un modèle de gamme « Max ».

Ce que cela apporte vraiment

Presque personne ne peut servir 4,89 To. La valeur est ailleurs, et elle est substantielle :

Bénéfice Illustration
Vérifiabilité ce rapport a recalculé les chiffres annoncés à partir de 4 ko de config.json — impossible sans publication
Permanence le modèle ne peut plus être retiré ni modifié en silence
Absence de verrou un déploiement peut changer de fournisseur
Distillation des modèles plus petits peuvent en être dérivés
Recherche publique une architecture hybride à 2,4 T devient étudiable
Souveraineté un déploiement national ou sectoriel devient possible

Le second modèle de classe « 3 billions » publié en poids ouverts, deux semaines après le premier. Ce n'est plus une exception, c'est une tendance.


Ce que ces forces ne disent pas

Aucune de ces sept forces ne concerne :

  • le codage à l'échelle du dépôt, où le modèle est en retrait de 12 à 16 points ;
  • la vitesse, où il est 119ᵉ sur 184 ;
  • la documentation, inexistante.

C'est l'objet du chapitre suivant.


À retenir

Ce chapitre en cinq points

  1. Le niveau frontière est établi indépendamment : indice 58, 10ᵉ sur 184.
  2. Le respect d'instructions est le point fort le plus net : +10,1 sur IFBench.
  3. Le profil réel est recherche, santé, droit, finance — pas le codage.
  4. L'architecture est vérifiable et bien conçue : cache divisé par 63.
  5. La publication des poids vaut pour l'audit, la permanence et la distillation, pas pour l'auto-hébergement.

Chapitre suivant : Limites.