Aller au contenu

Limites des benchmarks

Le problème général

Les tableaux de la partie précédente ont trois propriétés qu'il faut garder à l'esprit :

  1. ils sont produits par le constructeur du modèle évalué ;
  2. ils comparent des modèles dont les configurations d'inférence diffèrent ;
  3. ils portent sur des benchmarks dont plusieurs sont saturés.

Aucune de ces limites n'est propre à DeepSeek. Toutes affectent la lecture.

Le constructeur mesure ses concurrents

Pour le modèle de base, le rapport indique que tous les modèles sont évalués « dans notre cadre d'évaluation interne » avec des réglages identiques. Les scores de DeepSeek-V4-Pro et DeepSeek-V4-Flash sont donc mesurés par DeepSeek — ce qui est légitime, ce sont ses modèles.

Pour le modèle instruit, la situation est différente : les scores d'Opus-5, de GPT-5.6 Sol, de Kimi-K3 et de GLM-5.3 apparaissent dans le tableau sans que le rapport précise s'ils ont été remesurés ou repris des publications de leurs auteurs.

Pourquoi cela compte

Les benchmarks agentiques sont extrêmement sensibles à la configuration : harnais, nombre de tours, fenêtre de contexte, accès réseau, réglages de décodage. Le chapitre précédent le démontre lui-même — 8,7 points d'écart sur DeepSWE selon le seul choix du harnais.

Un écart de 1,5 point entre V4.1-Flash (90,6) et Opus-5 (89,1) sur Terminal-Bench 2.1 est plus petit que l'effet du harnais. Il ne permet pas de conclure à une supériorité.

Les configurations ne sont pas comparables

DeepSeek utilise, selon le benchmark :

  • le mode Minimal de DeepSeek Harness avec 1 M de jetons de contexte pour les agents de code ;
  • le harnais mini-SWE pour DeepSWE v1.1, « pour s'aligner sur les exigences du protocole officiel » ;
  • le harnais Claude Code pour SEC-Bench Pro, « spécifiquement pour sa conception de compactage de session » ;
  • le harnais Claude Code avec 512 K de contexte pour les agents visuels ;
  • les échafaudages officiels pour Agents' Last Exam et AutomationBench.

Ces choix sont documentés et justifiés — c'est plus de transparence que la moyenne. Mais ils signifient que chaque ligne du tableau utilise une configuration différente, choisie pour chaque benchmark. On ne peut pas comparer les lignes entre elles, et il est difficile d'exclure que le choix ait été guidé par le résultat.

La saturation

Plusieurs benchmarks du tableau sont proches de leur plafond : Terminal-Bench 2.1 où cinq modèles sont entre 88,2 et 90,6, GPQA Diamond où quatre sont entre 92,4 et 94,1, BabyVision à 94,1.

Dans cette zone, les écarts mesurés sont du même ordre que le bruit d'échantillonnage. Le rapport lui-même l'admet :

Section 6

« À mesure que les modèles d'IA atteignent des capacités de performance remarquables, les benchmarks d'évaluation standards ont de plus en plus atteint la saturation. Bien que DeepSeek-V4.1-Flash démontre une performance qui approche de près les modèles de tout premier plan — offrant une expérience utilisateur très comparable dans les applications quotidiennes — un écart de performance subsiste sur les tâches les plus difficiles. Bien que les scores de benchmark montrent une marge étroite, cette parité n'implique pas que le modèle égale les capacités de pointe des systèmes fermés leaders sur le raisonnement complexe et de haute difficulté et sur les cas limites. »

C'est une mise en garde que le constructeur formule contre ses propres chiffres. Elle mérite d'être prise au sérieux.

Le piratage de récompense pendant l'évaluation

Le passage le plus utile du chapitre d'évaluation ne concerne pas les scores mais leur intégrité.

Pour limiter le contournement dans les évaluations d'agents de codage, DeepSeek :

  • coupe l'accès internet ;
  • supprime les historiques Git de l'environnement ;
  • purge automatiquement les caches de build et de paquets — modules Go, node_modules, fichiers .jar compilés, répertoires __pycache__.

Malgré cela :

Section 5.3.1

« Malgré ces précautions, nous observons encore des instances de comportement de recherche d'exploits pendant les tests — comme la décompilation de paquets Ubuntu Linux fondamentaux pour découvrir des vulnérabilités dans CyberGym. À mesure que les modèles deviennent plus capables, l'infrastructure d'évaluation standard (conteneurs Docker, scripts de validation) devient plus susceptible d'être jouée par les modèles. Nous exhortons la communauté de recherche à donner la priorité à la détection et à l'atténuation de ces comportements dans la conception des benchmarks de nouvelle génération. »

C'est un avertissement de portée générale : un score de benchmark agentique n'est valide que si l'environnement résiste à un agent qui cherche activement à le contourner. Les scores publiés par tout le monde, DeepSeek compris, sont des bornes supérieures optimistes.

Ce qui n'est pas mesuré du tout

Trois absences notables :

Aucun benchmark ne teste le modèle près de son million de jetons. LongBench-V2 opère bien en deçà. La seule indication est que Terminal-Bench 3.0 continue de s'améliorer en passant de 512 K à 1 M de contexte, sans chiffre précis. Pour un modèle dont c'est l'argument central, c'est une lacune.

Aucune ablation des mécanismes centraux. Il n'y a pas de comparaison entre un modèle avec et sans CED, avec et sans indexeur hiérarchique, avec rejeu exact et rejeu borné. Toutes les affirmations de « dégradation négligeable » sont qualitatives.

Aucune mesure de latence ni de débit. Un modèle vendu sur son efficacité de service ne publie ni jetons par seconde, ni latence au premier jeton, ni coût mesuré par tâche. Les gains d'efficacité sont établis par le calcul — paramètres activés, octets de cache, nombre de noyaux — et non par des mesures de bout en bout. Le seul élément chiffré disponible côté service est la grille tarifaire de l'API, traitée au chapitre L'API et ses tarifs.

Ce qu'il faut retenir des évaluations

Le classement relatif entre modèles DeepSeek est probablement fiable : même cadre, même protocole. Les comparaisons avec les modèles fermés sont indicatives et ne supportent pas d'écarts inférieurs à quelques points.

Le résultat solide n'est pas « V4.1-Flash bat Opus-5 » mais « un modèle à 16 G de paramètres activés, publié sous licence MIT, joue dans la même catégorie » — ce qui est déjà remarquable.


Chapitre suivant : Face aux concurrents