Aller au contenu

Ce qui reste non publié

La publication a levé dix inconnues. Sept subsistent.


Ce qui a été levé

Pour mémoire, voici les inconnues que la première édition de ce rapport listait, et leur sort :

Inconnue au 13 août Résolue le 14 août
Licence Apache 2.0
Dense ou MoE dense (intermediate_size: 17408)
Type d'attention hybride 3:1
Fenêtre de contexte 262 144 natif, 1 000 000 étendu
Modalités texte, images, vidéo
Performances 30 lignes de benchmarks
Paramètres exacts 27,729 G (recalculés)
Mode raisonnement désactivable
Nom du dépôt Qwen/Qwen3.8-27B
Date de sortie 14 août 2026

Dix sur dix. Tout ce qui bloquait une décision technique est désormais connu.


Ce qui reste inconnu

1. La recette d'entraînement — rien du tout

Statut aucun rapport technique, aucune publication
Ce que cela empêche comprendre d'où viennent les gains, reproduire le modèle

Inconnues complètes :

  • nombre de jetons d'entraînement ;
  • composition du mélange de données ;
  • durée, matériel, coût ;
  • méthode de post-entraînement — SFT, apprentissage par renforcement, distillation ;
  • environnements agentiques utilisés ;
  • méthode d'extension du contexte à 1 000 000 (YaRN est nommé, ses paramètres non).

C'est l'écart majeur avec Kimi K3

Kimi K3 s'accompagne d'un rapport technique de 80 pages documentant données, lois d'échelle, recette, apprentissage par renforcement, distillation et infrastructure.

Alibaba publie les poids mais pas la méthode, pour ses deux modèles de la génération 3.8. Du point de vue de la recherche, ce n'est pas le même geste — même si, du point de vue de l'utilisateur, une licence Apache 2.0 vaut beaucoup.

2. Les ablations — aucune

Rien ne justifie le ratio 3:1 plutôt que 2:1 ou 5:1, ni les 48 têtes de valeur contre 16 têtes de clé, ni les 27 couches de l'encodeur visuel.

Le gain agentique spectaculaire sur le prédécesseur — jusqu'à +36,8 points — n'est attribué à rien : ni à l'architecture, ni aux données, ni au post-entraînement.

3. Le long contexte — jamais mesuré

Le modèle revendique 262 144 jetons natifs et 1 000 000 étendus. Aucune des trente lignes de benchmarks n'évalue le long contexte.

La question la plus intéressante est celle qui n'est pas posée

L'attention linéaire est connue pour dégrader le rappel exact à longue distance. C'est le compromis fondamental de l'architecture hybride.

Qwen publie trente benchmarks et pas un seul RULER, MRCR ou LongBench. Le Max avait au moins une ligne MRCR v2 à 256 K.

Rien ne permet donc de savoir ce que vaut réellement ce modèle sur les contextes qui justifient son architecture.

4. La sécurité — aucune évaluation

Ni capacités cyber, ni risques biologiques ou chimiques, ni robustesse aux détournements. Pour un modèle sous Apache 2.0, téléchargeable par tous et exécutable sur une carte grand public, l'absence est notable.

Kimi K3 a été évalué par l'UK AI Security Institute et le NIST CAISI. Rien d'équivalent ici.

5. Le modèle de base — non publié

Seule la version instruite est disponible. Un modèle de base non affiné est le support le plus utile pour un affinage sur données propres, et c'est précisément l'usage que permet une taille de 27 G.

Le même choix avait été fait pour le Max.

6. La dégradation par quantification — non mesurée

La quasi-totalité des utilisateurs feront tourner ce modèle en 4 bits ou en FP8. Aucune mesure ne documente ce que chaque format coûte en qualité.

Voir Quantification.

7. Les évaluations indépendantes — aucune à ce jour

Un jour après la publication, ni Artificial Analysis, ni Vals AI, ni LMArena n'ont publié de mesure.

Celle-ci se résoudra vite

Contrairement aux six précédentes, cette absence est temporaire. Un modèle sous Apache 2.0, de 27 G, multimodal, qui tient sur une carte, sera mesuré par de nombreuses équipes dans les jours qui suivent.

C'est ce qu'il faut attendre avant toute décision engageante.


Récapitulatif

# Inconnue Temporaire ? Bloque
1 Recette d'entraînement non la reproduction, l'attribution des gains
2 Ablations non comprendre pourquoi ça marche
3 Long contexte jusqu'à mesure tierce la confiance dans la fenêtre annoncée
4 Sécurité jusqu'à mesure tierce l'évaluation du risque
5 Modèle de base non l'affinage à partir d'un tronc neutre
6 Dégradation par quantification jusqu'à mesure tierce le choix du format
7 Évaluations indépendantes oui, quelques jours toute décision engageante

À retenir

Ce chapitre en cinq points

  1. La publication a levé dix inconnues sur dix parmi celles qui bloquaient une décision technique.
  2. Aucune information sur l'entraînement n'est publiée — écart majeur avec Kimi K3.
  3. Aucune ablation ne justifie les choix d'architecture.
  4. Le long contexte n'est mesuré nulle part, alors que c'est la raison d'être de l'architecture hybride.
  5. Les évaluations indépendantes manquent encore, mais c'est la seule absence qui se résoudra d'elle-même.

Partie suivante : Architecture.