Aller au contenu

La campagne

Les parties précédentes expliquaient comment chaque méthode fonctionne : ce qu'est un Elo, pourquoi le Brier juge la calibration, comment on empile des familles de features. Cette partie-ci raconte ce qui s'est passé quand on les a toutes lancées en même temps sur le même problème.

Ce n'est pas un journal de bord. C'est une leçon de conduite d'expériences, écrite depuis un cas où tout a été mesuré : chaque approche a produit un report.json, chaque décision a une trace horodatée, chaque échec a un chiffre. La matière est rare — la plupart des projets de ce genre ne gardent que le gagnant.

Ce que vous allez apprendre

Trois choses, dans cet ordre.

Comment on organise une recherche parallèle sans se mentir. Six approches lancées en même temps sur un protocole commun, un jeu de test que personne ne touche, une règle d'admission au classement. C'est le dispositif qui rend les résultats comparables — et c'est lui, pas les modèles, qui a produit le classement final.

Ce que le classement dit vraiment. Onze approches, un écart total de 0.0381 point de Brier entre la baseline et le leader, et une décomposition honnête de qui a apporté quoi. Vous verrez que le gros du gain ne vient d'aucune astuce d'algorithme.

Où le jeu est prévisible et où il ne l'est pas. Le résultat le plus intéressant de la campagne n'est pas le leader : c'est la carte des segments. Un match de LAN et un Bo3 en ligne entre deux équipes connues ne sont pas le même problème de prédiction, et l'écart entre les deux est plus grand que tout ce qu'on a gagné en modélisation.

Quand arrêter une campagne. La fin de celle-ci n'a pas été décidée : elle a été mesurée. Trois chantiers d'affilée où un gain de validation ne survit pas au jeu de test, et le signal extractible des données est déclaré épuisé — avec des chiffres à l'appui.

Ordre de lecture

Les cinq chapitres se lisent dans l'ordre, mais chacun tient debout seul.

  1. Chronologie de la campagne — le concours, les familles découvertes, les six fusions successives, la phase finale où trois chantiers d'affilée échouent, et les trois incidents qui ont coûté du temps et rapporté des règles.
  2. Le palmarès — le classement commenté ligne par ligne, la décomposition des gains en points de Brier, et la lecture honnête de ce qui nous sépare encore des bookmakers.
  3. La carte de prévisibilité — l'analyse par segments : LAN, Bo1, horloges froides, et le noyau dur Bo3-online-informé où le modèle plafonne, calibré, à 64,3 % d'exactitude.
  4. Leçons généralisables — les huit enseignements qui survivent au changement de domaine, dont le critère d'arrêt.
  5. Épilogue — le verdict contre les cibles, ce qui reste en production, et les trois voies au-delà avec leur statut exact — dont l'une, les cotes des bookmakers, a été ouverte depuis.

La partie suivante, Contre le marché, prolonge ce récit : elle raconte les six chantiers qui ont transformé la comparaison aux bookmakers, jusque-là purement théorique, en mesure appariée sur nos matchs.

Intuition — pourquoi une partie « récit » dans un cours technique

Une méthode isolée est un outil. Une campagne est une suite de décisions sous incertitude : quoi essayer ensuite, quand s'arrêter, à quoi accorder du crédit. Les chapitres de méthode vous donnent les outils ; celui-ci vous donne les réflexes de sélection — la partie du métier qui ne s'écrit généralement nulle part.

Les repères chiffrés à garder en tête

Tous les chiffres de cette partie sont mesurés sur le même jeu de test : les 1 146 matchs des 42 derniers jours, jamais utilisés pour entraîner ni pour choisir quoi que ce soit.

Repère Brier Exactitude
Pièce lancée 0.250 50 %
Glicko de Valve (baseline) 0.2422 56,0 %
Champion de départ (XGBoost v2) 0.2330 60,4 %
Leader final (segmodel) 0.2041 67,9 %
Bookmakers (littérature, tier 1) 0.198 68,7 %

Limite importante — les 0.198 ne viennent pas du même pool

Le repère bookmaker est un résultat de littérature, mesuré sur des matchs de tier 1. Notre pool mélange tier 1 à tier 3, où les écarts de force sont plus larges et les matchs mécaniquement plus prévisibles. La comparaison qui compte vraiment est interne : nos modèles les uns contre les autres, sur les mêmes 1 146 matchs. Ce rappel revient à chaque fois que le chiffre 0.198 apparaît — il est trop pratique pour qu'on oublie ce qu'il vaut.

Cette réserve a fini par être levée, après la clôture de la campagne : des cotes réelles ont été retrouvées sur nos propres matchs, et le marché y fait 0.2094 et 65,6 %, pas 0.198 et 68,7 %. Toute la partie Contre le marché est consacrée à cette re-mesure — lisez-la après cette partie-ci, elle en est la suite directe.

Où sont les preuves

Chaque chiffre cité ici est reproductible depuis le dépôt du projet. Les chemins exacts (rapports par approche, journaux horodatés, artefacts) sont rassemblés dans les sources ; le vocabulaire est défini dans le glossaire ; tous les tableaux de référence sont dans le tableau récapitulatif.


Retour à l'accueil du cours · Chapitre suivant : Chronologie de la campagne · Partie suivante : Contre le marché