Évaluations¶
Avertissement méthodologique, à lire avant les tableaux
Tous les chiffres de cette partie proviennent de DeepSeek. Le modèle ayant été publié le 10 septembre 2026, aucune évaluation indépendante n'était disponible au moment de la rédaction de ce rapport.
Les résultats du modèle de base sont produits « dans notre cadre d'évaluation interne », ce qui signifie que les scores attribués aux modèles concurrents ont eux aussi été mesurés par DeepSeek, et non repris de leurs publications respectives.
Ce ne sont donc pas des évaluations indépendantes. Ce sont les mesures d'un constructeur sur son propre modèle et sur ceux de ses concurrents.
Ce que vous allez apprendre¶
- Le modèle de base — 20 benchmarks contre DeepSeek-V4-Flash et V4-Pro, avec le point le plus intéressant du rapport : le test de perplexité sur corpus interne.
- Le modèle instruit — 17 benchmarks contre les modèles fermés de pointe, et le profil de capacités très marqué qui en ressort.
- Harnais et multi-agent — la robustesse au changement de harnais, et les résultats préliminaires en équipe d'agents.
- Limites des benchmarks — ce que ces mesures ne disent pas, y compris ce que DeepSeek en dit lui-même.
- Face aux concurrents — la comparaison avec V4-Pro, Kimi K3, GLM-5.3 et la frontière fermée, et les deux lignes de tableau qui ne veulent rien dire telles quelles.
Le résumé en trois lignes¶
- Sur le raisonnement pur, V4.1-Flash est au niveau des meilleurs modèles ouverts mais nettement derrière Opus-5 sur les tâches les plus dures.
- Sur les tâches agentiques, il égale ou dépasse les modèles fermés de pointe sur la majorité des benchmarks.
- Sur le multimodal, il dépasse le meilleur ouvert (Kimi-K3) mais reste derrière les fermés.
Ce profil est cohérent avec la conception : peu de paramètres activés, beaucoup de contexte, un post-entraînement massivement orienté agents.
Partie précédente : Entraînement