Aller au contenu

Le modèle de base

Le modèle de base est le modèle avant tout post-entraînement. Le comparer renseigne sur ce que le pré-entraînement a produit, indépendamment de l'alignement.

DeepSeek le compare à ses deux prédécesseurs, dans son cadre interne, avec des réglages identiques. Les scores à moins de 0,3 d'écart sont considérés comme équivalents.

Les trois modèles comparés

V4-Flash-Base V4-Pro-Base V4.1-Flash-Base
Paramètres du squelette 284 G 1 600 G 552 G
Paramètres activés 13 G 49 G 8 G / 16 G

V4.1-Flash a donc un tiers des paramètres de V4-Pro et un quart de ses paramètres activés en décodage.

Les résultats

Connaissance du monde

Benchmark Contexte V4-Flash V4-Pro V4.1-Flash
AGIEval (EM) 3–5 coups 83,9 84,4 83,4
MMLU-Pro (EM) 5 coups 68,3 73,5 74,1
C-Eval (EM) 5 coups 92,1 93,1 92,1
MultiLoKo (juge LLM) 5 coups 42,6 50,9 45,5
SimpleQA-Verified (EM) 25 coups 30,1 55,2 42,3
SuperGPQA (EM) 5 coups 46,5 53,9 53,1

Langage et raisonnement

Benchmark Contexte V4-Flash V4-Pro V4.1-Flash
BBH (EM) 3 coups 86,9 87,5 86,1
BBEH (EM) 1 coup 25,4 29,8 27,2
DROP (F1) 1 coup 88,6 88,7 87,9
HellaSwag (EM) 0 coup 85,7 88,0 87,2

Code et mathématiques

Benchmark Contexte V4-Flash V4-Pro V4.1-Flash
BigCodeBench (Pass@1) 3 coups 56,8 59,2 60,6
HumanEval (Pass@1) 0 coup 69,5 76,8 79,4
GSM8K (EM) 8 coups 90,8 92,6 93,0
MATH (EM) 4 coups 57,4 64,5 61,1
MGSM (EM) 8 coups 85,7 84,4 80,2

Contexte long et multimodal

Benchmark Contexte V4-Flash V4-Pro V4.1-Flash
LongBench-V2 (EM) 1 coup 44,7 51,5 45,2
MMMU-Pro (EM) 4 coups — — 56,5
CVBench (EM) 4 coups — — 77,9
DocVQA (juge LLM) 4 coups — — 95,6
RefCOCO-avg (Acc@0,5) 0 coup — — 86,0

Ce que ces tableaux montrent réellement

Là où V4.1-Flash gagne

Code et mathématiques élémentaires. Il dépasse V4-Pro — trois fois plus gros — sur BigCodeBench, HumanEval et GSM8K. C'est cohérent avec l'accent mis sur le code récent dans le corpus.

MMLU-Pro. 74,1 contre 73,5, un gain net sur un benchmark de connaissance large.

Là où il perd

La connaissance factuelle brute. SimpleQA-Verified : 42,3 contre 55,2 pour V4-Pro. C'est un écart de 13 points, le plus large du tableau.

Ce n'est pas surprenant : SimpleQA mesure la connaissance stockée dans les poids. Un modèle à 16 G activés et 552 G au total ne peut pas égaler un modèle à 49 G activés et 1,6 T au total sur cette dimension, quelle que soit la qualité des données. La mémorisation demande de la capacité.

C'est d'ailleurs précisément ce que le module Engram est censé compenser — et l'écart persistant suggère qu'il ne compense que partiellement.

Le multilingue. MGSM à 80,2 contre 85,7 pour V4-Flash, son propre prédécesseur plus petit. C'est une régression de 5,5 points par rapport à un modèle deux fois plus petit, et elle n'est ni commentée ni expliquée dans le rapport. MultiLoKo, l'autre benchmark multilingue, montre aussi un retard net sur V4-Pro.

Le contexte long. LongBench-V2 à 45,2 contre 51,5 pour V4-Pro. Pour un modèle dont tout l'argument est le contexte d'un million de jetons, c'est un résultat gênant.

La nuance à apporter

LongBench-V2 ne teste pas le contexte de très longue portée : ses tâches tiennent largement en deçà du million de jetons. Ce score mesure la capacité de compréhension sur contexte long, pas la capacité d'ingestion. Un modèle plus gros y sera naturellement meilleur.

Il n'en reste pas moins qu'aucun benchmark public de ce rapport ne teste le modèle près de sa limite annoncée. La seule mesure qui approche ce régime est Terminal-Bench 3.0, où DeepSeek montre qu'étendre le contexte de 512 K à 1 M continue d'améliorer la performance — sans donner de chiffre précis pour l'écart.

Le test de perplexité sur corpus interne

C'est la mesure la plus intéressante du chapitre, et paradoxalement celle qu'on peut le moins vérifier.

DeepSeek constitue un jeu d'évaluation à partir de son travail quotidien — documentation interne, dépôts de code propriétaires, matériel académique — visant le raisonnement, l'attribution et la résolution de problèmes scientifiques complexes. Il y mesure les bits par octet (BPB), plus bas étant meilleur.

Le résultat annoncé : V4.1-Flash-Base obtient le BPB le plus bas sur toutes les tâches, devant V4-Pro-Base.

Pourquoi cette mesure est intéressante

Un corpus interne et propriétaire est par construction hors de tout jeu d'entraînement public — donc immunisé contre la contamination de benchmarks, qui est le problème central de l'évaluation des grands modèles.

La perplexité est aussi une mesure continue, sans effet de saturation : elle discrimine encore là où les benchmarks à choix multiples plafonnent.

Pourquoi elle ne vaut rien pour un tiers

Le corpus n'est pas publié et ne le sera pas. Personne ne peut reproduire la mesure, vérifier que le corpus n'a pas été involontairement inclus dans le pré-entraînement de V4.1 mais pas dans celui de V4-Pro, ni contrôler la normalisation des BPB entre tokeniseurs différents.

DeepSeek en donne la raison : « les tests de perplexité sont impossibles par API », donc la comparaison ne peut porter que sur ses propres modèles de base. C'est une limite honnêtement énoncée, mais qui rend le résultat inutilisable comme preuve externe.

Le bilan revendiqué

Section 4.3.2

« DeepSeek-V4.1-Flash-Base atteint des capacités de connaissance du monde, de raisonnement et de codage comparables à DeepSeek-V4-Pro-Base, et délivre 5 à 10 % d'amélioration sur les évaluations tenues à l'écart, en n'utilisant qu'un tiers des paramètres totaux et un quart des paramètres activés. »

Les tableaux publics soutiennent la première moitié de l'affirmation, avec les réserves ci-dessus sur la connaissance factuelle et le multilingue. La seconde moitié — les 5 à 10 % sur les évaluations tenues à l'écart — repose entièrement sur le test de perplexité interne, invérifiable.


Chapitre suivant : Le modèle instruit