Aller au contenu

Face aux concurrents

Le chapitre précédent a listé les scores. Celui-ci les met en perspective face aux trois modèles de la même génération, et face à la frontière fermée.

Les mêmes réserves s'appliquent : sauf mention contraire, tous les chiffres viennent de DeepSeek.

Les fiches côte à côte

V4.1-Flash V4-Pro Kimi K3 GLM-5.3
Éditeur, date DeepSeek, sept. 2026 DeepSeek, avr. 2026 Moonshot, juil. 2026 Zhipu, août 2026
Paramètres 552 G + 196 G Engram 1,6 T 2,8 T ≈ 744 G
Actifs par jeton 8 G / 16 G 49 G 104 G ≈ 40 G
Couches 40 (20 + 20) 61 93 n.c.
Attention CSA2 + SWA 128, 4 sources CSA ×4 / HCA ×128 alternées 69 KDA linéaires + 24 MLA gatées MLA + partage d'indices
MoE 384 routés / 6 actifs / 1 partagé 384 / 6 / 1 896 / 16 / 2, LatentMoE n.c.
Mémoire dédiée Engram 196 G — — —
Contexte 1 M 1 M 1 M 1 M
Multimodal natif (image) non natif (image + vidéo) n.c.
Cache clé-valeur FP4 FP8 — —
Optimiseur Muon par tête + Sinkhorn Muon Muon par tête Muon par tête
Licence MIT MIT MIT modifiée MIT

Trois paris différents

DeepSeek garde l'attention softmax classique et la rend creuse, puis comprime le cache à l'extrême et le partage entre couches. Pour la connaissance, il mise sur la mémoire par hachage (Engram) plutôt que sur davantage d'experts.

Moonshot remplace les trois quarts de son attention par une attention linéaire à état de taille fixe — donc sans cache clé-valeur du tout sur ces couches — et garde un quart d'attention pleine pour le global. La parcimonie MoE y est bien plus extrême (16 experts actifs sur 896).

Zhipu ne refait pas de modèle de base et concentre son effort sur le post-entraînement.

Deux façons de tuer le cache

DeepSeek et Moonshot attaquent le même problème par des voies opposées : comprimer le cache jusqu'à 890 octets, ou supprimer l'attention qui en a besoin sur les trois quarts des couches.

Les deux fonctionnent. Ce sont deux points d'un même compromis : DeepSeek conserve un accès exact aux positions sélectionnées mais doit les stocker ; Moonshot n'a rien à stocker mais son état récurrent est une compression avec perte de tout le passé.

Face à V4-Pro : le petit bat le gros

Sur les 16 benchmarks partagés du tableau du modèle instruit, V4.1-Flash bat V4-Pro sur 14. Les deux exceptions sont GPQA Diamond (90,9 contre 92,4) et HLE textuel (39,1 contre 42,7) — les deux mesures les plus liées à la connaissance stockée.

V4-Pro V4.1-Flash Écart
Terminal-Bench 3.0 11,8 30,0 ×2,5
Terminal-Bench 4.0 12,4 31,2 ×2,5
DeepSWE v1.1 62,7 74,2 +11,5
SEC-Bench Pro 56,4 62,8 +6,4
AutomationBench 43,2 54,8 +11,6
Paramètres actifs en décodage 49 G 16 G ÷ 3
Prix de sortie, heures creuses 1,98 $ 0,60 $ ÷ 3,3

L'écart n'est pas dû à l'architecture seule

Trois facteurs se cumulent et le rapport ne les sépare pas : 45 T jetons d'entraînement contre 33 T, un pipeline de données refait, et surtout un post-entraînement agentique bien plus lourd — V4-Pro était annoncé comme une préversion.

Attribuer ces +11,5 points sur DeepSWE au CED ou à CSA2 serait une erreur de lecture. Ces mécanismes réduisent le coût ; ce sont les données et le post-entraînement qui expliquent la capacité.

C'est d'ailleurs ce que DeepSeek affirme lui-même à propos du post-entraînement — voir Post-entraînement.

Face à Kimi K3

Benchmark V4.1-Flash K3 (mesuré par DeepSeek) K3 (publié par Moonshot)
GPQA Diamond 90,9 92,9 93,5
HLE texte / complet 39,1 / 36,8 43,5 43,5
Terminal-Bench 2.1 90,6 88,3 88,3
DeepSWE v1.1 74,2 67,5 67,5
Agents' Last Exam 31,8 27,6 28,3
CyberGym 88,1 80,0 —
MathArena Apex 65,6 65,6 —
BabyVision avec outils 89,6 85,7 85,7
ZeroBench, Pass@5 49,0 41,0 41,0
ProgramBench 20,3 (Almost@1) 17,5 77,8 (métrique différente)
AutomationBench 54,8 46,7 30,8 (version différente)

La lecture est nette : V4.1-Flash devant sur l'agentique code et terminal, avec 6,5 fois moins de paramètres actifs ; K3 devant sur la connaissance et le raisonnement pur.

Deux lignes qui ne veulent rien dire telles quelles

ProgramBench et AutomationBench affichent des écarts énormes entre la mesure DeepSeek et la publication Moonshot — 17,5 contre 77,8, et 46,7 contre 30,8.

Ce ne sont pas des contradictions mais des métriques et versions différentes : DeepSeek utilise Almost@1 sur ProgramBench, et le jeu public v1.0.6 d'AutomationBench. Comparer ces cases entre colonnes n'a aucun sens.

C'est le piège le plus courant dans la lecture des tableaux de benchmarks inter-laboratoires, et il est ici visible à l'œil nu parce que les deux sources sont dans le même tableau.

La couverture, ce que le tableau ne montre pas

Moonshot publie des résultats sur des familles entières que DeepSeek ne couvre pas du tout : recherche web (BrowseComp), usage d'ordinateur (OSWorld-Verified), tâches métier (GDPval, agent financier, juridique).

V4.1-Flash ne publie rien sur ces familles. Deux lectures possibles, et rien ne permet de trancher : soit ces évaluations n'ont pas été menées, soit elles ne sont pas favorables.

Face à GLM-5.3

Même génération, taille comparable (≈ 744 G contre 552 G, 40 G actifs contre 16). Sur les 13 benchmarks partagés, V4.1-Flash est devant sur 11.

GLM-5.3 conserve deux avantages : HLE textuel (42,0 contre 39,1) et surtout Terminal-Bench 4.0 (37,9 contre 31,2), le benchmark scientifique long où Zhipu a concentré son post-entraînement.

Sur la cybersécurité, domaine que Zhipu met en avant, l'écart est mince : CyberGym 88,1 contre 84,5, ExploitGym 15,3 contre 15,0.

Face à la frontière fermée

Famille de tâches Position de V4.1-Flash
Terminal et SWE quotidiens (TB 2.1, DeepSWE) au niveau ou devant
Automatisation, ALE, HLE avec outils au niveau ou devant
Cyber — CyberGym devant GPT-5.6 Sol
Cyber — SEC-Bench Pro, ExploitGym −11 à −18 points
Tâches scientifiques longues (TB 3.0/4.0, ProgramBench, NL2Repo) −10 à −20 points vs Opus-5
Connaissance experte (HLE) −17 points vs Opus-5
GPQA Diamond −3 points
Vision −5 points vs Opus-5

Le rapport formule lui-même cette frontière, et la formule est prudente : le modèle « approche de près les modèles de tout premier plan », mais « un écart de performance subsiste sur les tâches les plus difficiles », et la parité de score « n'implique pas que le modèle égale les capacités de pointe des systèmes fermés leaders ».

Le seul élément indépendant disponible

Artificial Analysis, sur la génération précédente

Les mesures d'Artificial Analysis sur V4-Flash-0731 face à Kimi K3, en août 2026, donnaient un profil très cohérent avec le positionnement de la gamme : indice d'intelligence en faveur de K3, mais 123 jetons/s contre 35, temps au premier jeton de 1,0 s contre 3,5 s, et un coût mixé de 0,23 $ contre 2,31 $ par million de jetons.

Trois précautions : ces chiffres portent sur la génération précédente, V4.1-Flash n'étant pas encore indexé au moment de la rédaction ; ils n'ont pas été revérifiés à la source pour ce rapport ; et un indice d'intelligence agrégé est une construction méthodologique discutable en soi.

Ils restent le seul élément de comparaison ne provenant pas d'un constructeur, et ils vont dans le sens du positionnement revendiqué : moins capable, nettement plus rapide, radicalement moins cher.

Où se place le modèle

Le rapport technique se termine sur une comparaison à Fable-5 et GPT-6 Astra, c'est-à-dire à la frontière absolue. Ce n'est pas là que le modèle se joue.

La proposition réelle

V4.1-Flash n'est pas le meilleur modèle disponible, et DeepSeek ne le prétend pas. Il propose autre chose : la capacité agentique du haut du panier, à un ordre de grandeur de coût en dessous, sous licence MIT et avec les poids.

Sur le cache hit à 0,003 $ par million de jetons, l'écart avec les prix publics de K3 dépasse le facteur cent. Pour une charge d'agent dominée par la relecture de contexte, c'est cet écart-là qui décide, pas les trois points de GPQA.


Partie suivante : Utilisation