Affirmations à vérifier¶
Chaque revendication, son niveau de preuve, et ce qu'il faudrait pour trancher.
L'échelle utilisée¶
| Niveau | Signification |
|---|---|
| ✅ Vérifié | recalculé ou observé directement à partir d'une source primaire |
| 🟢 Indépendant | mesuré par un tiers sans intérêt dans l'affaire |
| 🟡 Plausible | affirmation du constructeur, cohérente avec le reste, non contrôlée |
| 🟠 Invérifiable | affirmation dont les éléments nécessaires à la vérification ne sont pas publiés |
| 🔴 Contredit | une source fiable donne un résultat incompatible |
Le tableau¶
| # | Affirmation | Niveau | Note |
|---|---|---|---|
| 1 | 2,4 T de paramètres | ✅ | recalculé : 2,4198 T, écart 0,83 % |
| 2 | 95 G actifs par jeton | ✅ | recalculé : 95,29 G, écart 0,30 % |
| 3 | 92 couches, motif 3:1 | ✅ | config.json |
| 4 | 512 experts, 10 actifs + 1 partagé | ✅ | config.json |
| 5 | Taille du dépôt 4,89 To | ✅ | recalculé à 0,04 % près, MTP incluse |
| 6 | Contexte natif 262 144 | ✅ | config.json |
| 7 | Contexte étendu 1 010 000 | 🟡 | annoncé, non mesuré au-delà de 256 K |
| 8 | Méthode d'extension = YaRN | 🟠 | déduction de ce rapport, non confirmée |
| 9 | Licence qwen3.8-max, sans clause géographique |
✅ | fichier LICENSE lu |
| 10 | Poids textuels uniquement | ✅ | carte de modèle, model_type: qwen3_5_moe_text |
| 11 | Modèle multimodal | 🟡 | vrai pour l'API, faux pour les poids |
| 12 | Niveau frontière | 🟢 | Artificial Analysis : indice 58, 10ᵉ/184 |
| 13 | Vitesse 47 jetons/s | 🟢 | Artificial Analysis |
| 14 | Coût par tâche 1,13 $ | 🟢 | Artificial Analysis |
| 15 | 2ᵉ en Vision Arena | 🟢 | LMArena — sur l'API |
| 16 | Tarif 2 $ / 6 $ / 0,25 $ | ✅ | grille publiée |
| 17 | Tableau de 31 benchmarks | 🟡 | mesures constructeur, 8 lignes maison |
| 18 | Terminal-Bench 2.1 = 86,6 | 🔴 | un relevé indépendant donne 67,4 |
| 19 | IFBench 82,8, +10,1 sur le meilleur | 🟡 | mesure constructeur, cohérente avec la lignée |
| 20 | 16 jours de codage, 265 commits | 🟡 | traces publiques, non contrôlées |
| 21 | Reproduction d'article, +2,7 pts AIME24 | 🟠 | article non nommé ; 0,8 question sur 30 |
| 22 | 87ᵉ centile en concours | 🟠 | concours non nommé |
| 23 | Puce : 8 298 → 678 portes | 🟠 | ligne de base absente |
| 24 | Boutique : 4,16× sur 365 jours | 🟠 | simulateur non décrit |
| 25 | Interdiction géographique dans la licence | 🔴 | absente du fichier publié |
| 26 | Cache KV = 92 KiO/jeton | ✅ | calculé depuis config.json |
| 27 | Économie de 75 % grâce à l'hybride | ✅ | calculé, contrefactuel explicite |
| 28 | Couche MTP présente dans les poids | 🟡 | établi par l'accord à 0,04 % sur la taille |
Les trois lignes à examiner de près¶
#18 — L'écart sur Terminal-Bench 2.1¶
| Source | Score |
|---|---|
| Tableau officiel Qwen | 86,6 |
| Relevé rapporté par une veille sectorielle | 67,4 |
Dix-neuf points d'écart sur le même benchmark, le même modèle, la même période.
Hypothèses possibles, aucune documentée :
- version du harnais différente ;
- effort de raisonnement différent (
xhighcontre défaut) ; - nombre de tentatives autorisées ;
- erreur de transcription dans l'une des deux sources.
Ce rapport ne tranche pas
Aucune des deux sources ne publie ses conditions d'exécution. En attendant une reproduction indépendante documentée, traiter la ligne Terminal-Bench 2.1 comme non établie.
Artificial Analysis inclut Terminal-Bench v2.1 dans son indice sans publier le score isolé, ce qui ne permet pas d'arbitrer.
#21 — Le gain de +2,7 points sur AIME24¶
AIME24 comporte 30 questions. Un écart de 2,7 points représente 0,8 question — sous la variabilité obtenue en changeant la graine d'échantillonnage.
Une revendication qui ne peut pas porter son poids
Elle est présentée comme une démonstration que le modèle a dépassé la méthode originale d'un article de recherche. Sur 30 items, cela ne se distingue pas du bruit.
Ce serait vrai quel que soit le modèle : c'est une limite du benchmark, pas une faute d'Alibaba. Mais l'utiliser comme argument reste indéfendable.
#25 — La rumeur d'interdiction géographique¶
Avant la publication, plusieurs commentateurs ont signalé, à partir de conditions préliminaires, une interdiction visant les États-Unis, l'UE, le Royaume-Uni et la Corée.
Le fichier LICENSE publié le 12 août ne contient pas cette clause.
Correction établie
La lecture du texte publié fait apparaître des seuils commerciaux — 100 M d'utilisateurs, 20 M$ de revenu mensuel, 50 M$ annuels en MaaS — et aucune restriction géographique.
Une restriction de ce type existe en revanche dans la licence de MiniMax H3, sorti la même semaine, ce qui explique probablement la confusion.
Ce qui reste à faire¶
Pour lever les incertitudes de ce tableau, il faudrait :
| Incertitude | Ce qui la lèverait |
|---|---|
| #7, #8 — contexte au-delà de 262 K | une évaluation RULER ou MRCR à 512 K et 1 M |
| #17, #18 — benchmarks | une reproduction indépendante du tableau, conditions publiées |
| #20 à #24 — démonstrations | la publication des environnements et des harnais |
| #28 — couche MTP | l'inspection de la liste des tenseurs du dépôt |
| Poids ≠ API | une évaluation indépendante du checkpoint, pas du service |
Le dernier point est le plus urgent : à ce jour, aucune mesure indépendante ne porte sur les poids téléchargeables.
À retenir¶
Ce chapitre en cinq points
- Les affirmations architecturales sont toutes vérifiées — écarts de 0,04 % à 0,83 %.
- Les affirmations de capacité sont confirmées indépendamment par Artificial Analysis et Vals AI.
- Une ligne est contredite : Terminal-Bench 2.1, 19 points d'écart.
- Les cinq démonstrations sont toutes invérifiables faute d'éléments.
- La rumeur d'interdiction géographique est fausse pour ce modèle.
Chapitre suivant : Questions ouvertes.