Forces¶
Ce que Qwen3.8-Max réussit, en s'en tenant à ce qui est démontrable.
1. Le niveau de capacité est réel¶
Ce n'est pas une affirmation d'Alibaba, c'est le constat de deux évaluateurs indépendants :
| Source | Résultat |
|---|---|
| Artificial Analysis | indice 58 — 10ᵉ sur 184 modèles |
| Vals AI | 66,1 % — 2ᵉ parmi les modèles à poids ouverts |
| LMArena | 5ᵉ en Text Arena, 4ᵉ en Frontend Code Arena |
Aucun de ces trois n'a d'intérêt à flatter Alibaba, et leurs méthodologies sont publiées.
Un modèle du premier vingtième mondial
Dixième sur 184 modèles évalués, à hauteur d'Opus 4.8, devant tout ce que produisent Google, Meta et xAI. C'est un fait établi indépendamment, et c'est le point de départ de tout le reste.
2. Le respect des instructions¶
C'est le résultat le plus net du tableau officiel, et le moins commenté.
| Modèle | IFBench |
|---|---|
| Opus 4.8 | 62,2 |
| Fable 5 | 63,5 |
| GPT-5.6 Sol | 72,7 |
| Qwen3.7-Max | 79,1 |
| Qwen3.8-Max | 82,8 |
+10,1 points sur le meilleur concurrent non-Qwen. Le plus grand écart favorable du tableau.
Une compétence sous-estimée
Le respect strict d'instructions contraignantes — format, longueur, contraintes négatives, structure imposée — est ce qui distingue un modèle intégrable d'un modèle qu'il faut surveiller.
En chaîne agentique, un modèle qui produit exactement le format attendu évite une couche entière de validation et de reprise. Deux points de plus en raisonnement ne compensent pas dix points de moins en obéissance.
Le prédécesseur Qwen3.7-Max était déjà premier sur cette ligne : c'est une force de lignée, pas un accident.
3. Recherche, santé, droit, finance¶
| Benchmark | Qwen3.8-Max | Meilleur concurrent |
|---|---|---|
| PaperBench | 93,0 | 90,5 |
| WideSearch | 81,9 | 81,2 |
| HealthBench | 60,2 | 55,3 |
| PLawBench | 73,2 | 72,3 |
| PRBench-Finance | 58,3 | 55,8 |
Un profil cohérent : synthèse de documents, recherche à large couverture, domaines professionnels réglementés. Ce sont des usages à forte valeur, et moins disputés que le codage.
4. L'architecture est bien conçue¶
Indépendamment des performances, le fichier de configuration décrit un modèle dont chaque choix se justifie par un calcul :
| Choix | Effet mesuré |
|---|---|
| Hybride 3:1 | cache divisé par 4 à contexte long |
| GQA 16:1 | cache divisé par 16 |
head_dim 256 |
compense la réduction des têtes clé-valeur |
| RoPE partiel 25 % | sépare position et sémantique, facilite l'extension |
| 512 experts étroits | spécialisation combinatoire, 3,94 % d'activation |
| Couche MTP | décodage spéculatif intégré, gratuit au chargement |
Rien n'est décoratif
Combinées, GQA et l'attention hybride divisent le cache par 63 par rapport à un Transformer classique de mêmes dimensions. C'est ce qui rend le million de jetons commercialement viable à 2 $ le million.
Ce n'est pas de la recherche de rupture — chaque brique existait — mais c'est de l'ingénierie soignée, et le résultat est vérifiable.
5. Le tableau montre ses défaites¶
C'est suffisamment rare pour être compté comme une force.
Le tableau officiel affiche Qwen3.8-Max perdant de 15,3 points sur FrontierSWE et de 16,4 sur DeepSWE face à des concurrents nommés.
Un signal de crédibilité
La sélection des benchmarks reste favorable — huit lignes sur trente et une sont des créations maison. Mais les valeurs publiées ne sont pas maquillées.
Cela donne du poids aux lignes où le modèle gagne : une équipe qui publie ses échecs n'a pas de raison d'embellir ses réussites.
6. Le prix¶
| Entrée | Sortie | |
|---|---|---|
| Qwen3.7-Max | 2,50 $ | 7,50 $ |
| Qwen3.8-Max | 2,00 $ | 6,00 $ |
Une baisse simultanée à une montée en capacité, avec un tarif unique sur toute la fenêtre d'un million de jetons — là où plusieurs concurrents facturent double au-delà de 200 000.
L'effet dépasse le modèle : un modèle de ce niveau à ce prix contraint tout le marché à se justifier.
7. La publication des poids¶
C'est la première fois qu'Alibaba publie les poids d'un modèle de gamme « Max ».
Ce que cela apporte vraiment
Presque personne ne peut servir 4,89 To. La valeur est ailleurs, et elle est substantielle :
| Bénéfice | Illustration |
|---|---|
| Vérifiabilité | ce rapport a recalculé les chiffres annoncés à partir de 4 ko de config.json — impossible sans publication |
| Permanence | le modèle ne peut plus être retiré ni modifié en silence |
| Absence de verrou | un déploiement peut changer de fournisseur |
| Distillation | des modèles plus petits peuvent en être dérivés |
| Recherche publique | une architecture hybride à 2,4 T devient étudiable |
| Souveraineté | un déploiement national ou sectoriel devient possible |
Le second modèle de classe « 3 billions » publié en poids ouverts, deux semaines après le premier. Ce n'est plus une exception, c'est une tendance.
Ce que ces forces ne disent pas¶
Aucune de ces sept forces ne concerne :
- le codage à l'échelle du dépôt, où le modèle est en retrait de 12 à 16 points ;
- la vitesse, où il est 119ᵉ sur 184 ;
- la documentation, inexistante.
C'est l'objet du chapitre suivant.
À retenir¶
Ce chapitre en cinq points
- Le niveau frontière est établi indépendamment : indice 58, 10ᵉ sur 184.
- Le respect d'instructions est le point fort le plus net : +10,1 sur IFBench.
- Le profil réel est recherche, santé, droit, finance — pas le codage.
- L'architecture est vérifiable et bien conçue : cache divisé par 63.
- La publication des poids vaut pour l'audit, la permanence et la distillation, pas pour l'auto-hébergement.
Chapitre suivant : Limites.