Aller au contenu

Affirmations à vérifier

Chaque revendication, son niveau de preuve, et ce qu'il faudrait pour trancher.


L'échelle utilisée

Niveau Signification
✅ Vérifié recalculé ou observé directement à partir d'une source primaire
🟢 Indépendant mesuré par un tiers sans intérêt dans l'affaire
🟡 Plausible affirmation du constructeur, cohérente avec le reste, non contrôlée
🟠 Invérifiable affirmation dont les éléments nécessaires à la vérification ne sont pas publiés
🔴 Contredit une source fiable donne un résultat incompatible

Le tableau

# Affirmation Niveau Note
1 2,4 T de paramètres ✅ recalculé : 2,4198 T, écart 0,83 %
2 95 G actifs par jeton ✅ recalculé : 95,29 G, écart 0,30 %
3 92 couches, motif 3:1 ✅ config.json
4 512 experts, 10 actifs + 1 partagé ✅ config.json
5 Taille du dépôt 4,89 To ✅ recalculé à 0,04 % près, MTP incluse
6 Contexte natif 262 144 ✅ config.json
7 Contexte étendu 1 010 000 🟡 annoncé, non mesuré au-delà de 256 K
8 Méthode d'extension = YaRN 🟠 déduction de ce rapport, non confirmée
9 Licence qwen3.8-max, sans clause géographique ✅ fichier LICENSE lu
10 Poids textuels uniquement ✅ carte de modèle, model_type: qwen3_5_moe_text
11 Modèle multimodal 🟡 vrai pour l'API, faux pour les poids
12 Niveau frontière 🟢 Artificial Analysis : indice 58, 10ᵉ/184
13 Vitesse 47 jetons/s 🟢 Artificial Analysis
14 Coût par tâche 1,13 $ 🟢 Artificial Analysis
15 2ᵉ en Vision Arena 🟢 LMArena — sur l'API
16 Tarif 2 $ / 6 $ / 0,25 $ ✅ grille publiée
17 Tableau de 31 benchmarks 🟡 mesures constructeur, 8 lignes maison
18 Terminal-Bench 2.1 = 86,6 🔴 un relevé indépendant donne 67,4
19 IFBench 82,8, +10,1 sur le meilleur 🟡 mesure constructeur, cohérente avec la lignée
20 16 jours de codage, 265 commits 🟡 traces publiques, non contrôlées
21 Reproduction d'article, +2,7 pts AIME24 🟠 article non nommé ; 0,8 question sur 30
22 87ᵉ centile en concours 🟠 concours non nommé
23 Puce : 8 298 → 678 portes 🟠 ligne de base absente
24 Boutique : 4,16× sur 365 jours 🟠 simulateur non décrit
25 Interdiction géographique dans la licence 🔴 absente du fichier publié
26 Cache KV = 92 KiO/jeton ✅ calculé depuis config.json
27 Économie de 75 % grâce à l'hybride ✅ calculé, contrefactuel explicite
28 Couche MTP présente dans les poids 🟡 établi par l'accord à 0,04 % sur la taille

Les trois lignes à examiner de près

#18 — L'écart sur Terminal-Bench 2.1

Source Score
Tableau officiel Qwen 86,6
Relevé rapporté par une veille sectorielle 67,4

Dix-neuf points d'écart sur le même benchmark, le même modèle, la même période.

Hypothèses possibles, aucune documentée :

  • version du harnais différente ;
  • effort de raisonnement différent (xhigh contre défaut) ;
  • nombre de tentatives autorisées ;
  • erreur de transcription dans l'une des deux sources.

Ce rapport ne tranche pas

Aucune des deux sources ne publie ses conditions d'exécution. En attendant une reproduction indépendante documentée, traiter la ligne Terminal-Bench 2.1 comme non établie.

Artificial Analysis inclut Terminal-Bench v2.1 dans son indice sans publier le score isolé, ce qui ne permet pas d'arbitrer.

#21 — Le gain de +2,7 points sur AIME24

AIME24 comporte 30 questions. Un écart de 2,7 points représente 0,8 question — sous la variabilité obtenue en changeant la graine d'échantillonnage.

Une revendication qui ne peut pas porter son poids

Elle est présentée comme une démonstration que le modèle a dépassé la méthode originale d'un article de recherche. Sur 30 items, cela ne se distingue pas du bruit.

Ce serait vrai quel que soit le modèle : c'est une limite du benchmark, pas une faute d'Alibaba. Mais l'utiliser comme argument reste indéfendable.

#25 — La rumeur d'interdiction géographique

Avant la publication, plusieurs commentateurs ont signalé, à partir de conditions préliminaires, une interdiction visant les États-Unis, l'UE, le Royaume-Uni et la Corée.

Le fichier LICENSE publié le 12 août ne contient pas cette clause.

Correction établie

La lecture du texte publié fait apparaître des seuils commerciaux — 100 M d'utilisateurs, 20 M$ de revenu mensuel, 50 M$ annuels en MaaS — et aucune restriction géographique.

Une restriction de ce type existe en revanche dans la licence de MiniMax H3, sorti la même semaine, ce qui explique probablement la confusion.


Ce qui reste à faire

Pour lever les incertitudes de ce tableau, il faudrait :

Incertitude Ce qui la lèverait
#7, #8 — contexte au-delà de 262 K une évaluation RULER ou MRCR à 512 K et 1 M
#17, #18 — benchmarks une reproduction indépendante du tableau, conditions publiées
#20 à #24 — démonstrations la publication des environnements et des harnais
#28 — couche MTP l'inspection de la liste des tenseurs du dépôt
Poids ≠ API une évaluation indépendante du checkpoint, pas du service

Le dernier point est le plus urgent : à ce jour, aucune mesure indépendante ne porte sur les poids téléchargeables.


À retenir

Ce chapitre en cinq points

  1. Les affirmations architecturales sont toutes vérifiées — écarts de 0,04 % à 0,83 %.
  2. Les affirmations de capacité sont confirmées indépendamment par Artificial Analysis et Vals AI.
  3. Une ligne est contredite : Terminal-Bench 2.1, 19 points d'écart.
  4. Les cinq démonstrations sont toutes invérifiables faute d'éléments.
  5. La rumeur d'interdiction géographique est fausse pour ce modèle.

Chapitre suivant : Questions ouvertes.