La campagne¶
Les parties précédentes expliquaient comment chaque méthode fonctionne : ce qu'est un Elo, pourquoi le Brier juge la calibration, comment on empile des familles de features. Cette partie-ci raconte ce qui s'est passé quand on les a toutes lancées en même temps sur le même problème.
Ce n'est pas un journal de bord. C'est une leçon de conduite d'expériences,
écrite depuis un cas où tout a été mesuré : chaque approche a produit un
report.json, chaque décision a une trace horodatée, chaque échec a un chiffre.
La matière est rare — la plupart des projets de ce genre ne gardent que le
gagnant.
Ce que vous allez apprendre¶
Trois choses, dans cet ordre.
Comment on organise une recherche parallèle sans se mentir. Six approches lancées en même temps sur un protocole commun, un jeu de test que personne ne touche, une règle d'admission au classement. C'est le dispositif qui rend les résultats comparables — et c'est lui, pas les modèles, qui a produit le classement final.
Ce que le classement dit vraiment. Onze approches, un écart total de 0.0381 point de Brier entre la baseline et le leader, et une décomposition honnête de qui a apporté quoi. Vous verrez que le gros du gain ne vient d'aucune astuce d'algorithme.
Où le jeu est prévisible et où il ne l'est pas. Le résultat le plus intéressant de la campagne n'est pas le leader : c'est la carte des segments. Un match de LAN et un Bo3 en ligne entre deux équipes connues ne sont pas le même problème de prédiction, et l'écart entre les deux est plus grand que tout ce qu'on a gagné en modélisation.
Quand arrêter une campagne. La fin de celle-ci n'a pas été décidée : elle a été mesurée. Trois chantiers d'affilée où un gain de validation ne survit pas au jeu de test, et le signal extractible des données est déclaré épuisé — avec des chiffres à l'appui.
Ordre de lecture¶
Les cinq chapitres se lisent dans l'ordre, mais chacun tient debout seul.
- Chronologie de la campagne — le concours, les familles découvertes, les six fusions successives, la phase finale où trois chantiers d'affilée échouent, et les trois incidents qui ont coûté du temps et rapporté des règles.
- Le palmarès — le classement commenté ligne par ligne, la décomposition des gains en points de Brier, et la lecture honnête de ce qui nous sépare encore des bookmakers.
- La carte de prévisibilité — l'analyse par segments : LAN, Bo1, horloges froides, et le noyau dur Bo3-online-informé où le modèle plafonne, calibré, à 64,3 % d'exactitude.
- Leçons généralisables — les huit enseignements qui survivent au changement de domaine, dont le critère d'arrêt.
- Épilogue — le verdict contre les cibles, ce qui reste en production, et les trois voies au-delà avec leur statut exact — dont l'une, les cotes des bookmakers, a été ouverte depuis.
La partie suivante, Contre le marché, prolonge ce récit : elle raconte les six chantiers qui ont transformé la comparaison aux bookmakers, jusque-là purement théorique, en mesure appariée sur nos matchs.
Intuition — pourquoi une partie « récit » dans un cours technique
Une méthode isolée est un outil. Une campagne est une suite de décisions sous incertitude : quoi essayer ensuite, quand s'arrêter, à quoi accorder du crédit. Les chapitres de méthode vous donnent les outils ; celui-ci vous donne les réflexes de sélection — la partie du métier qui ne s'écrit généralement nulle part.
Les repères chiffrés à garder en tête¶
Tous les chiffres de cette partie sont mesurés sur le même jeu de test : les 1 146 matchs des 42 derniers jours, jamais utilisés pour entraîner ni pour choisir quoi que ce soit.
| Repère | Brier | Exactitude |
|---|---|---|
| Pièce lancée | 0.250 | 50 % |
| Glicko de Valve (baseline) | 0.2422 | 56,0 % |
| Champion de départ (XGBoost v2) | 0.2330 | 60,4 % |
| Leader final (segmodel) | 0.2041 | 67,9 % |
| Bookmakers (littérature, tier 1) | 0.198 | 68,7 % |
Limite importante — les 0.198 ne viennent pas du même pool
Le repère bookmaker est un résultat de littérature, mesuré sur des matchs de tier 1. Notre pool mélange tier 1 à tier 3, où les écarts de force sont plus larges et les matchs mécaniquement plus prévisibles. La comparaison qui compte vraiment est interne : nos modèles les uns contre les autres, sur les mêmes 1 146 matchs. Ce rappel revient à chaque fois que le chiffre 0.198 apparaît — il est trop pratique pour qu'on oublie ce qu'il vaut.
Cette réserve a fini par être levée, après la clôture de la campagne : des cotes réelles ont été retrouvées sur nos propres matchs, et le marché y fait 0.2094 et 65,6 %, pas 0.198 et 68,7 %. Toute la partie Contre le marché est consacrée à cette re-mesure — lisez-la après cette partie-ci, elle en est la suite directe.
Où sont les preuves¶
Chaque chiffre cité ici est reproductible depuis le dépôt du projet. Les chemins exacts (rapports par approche, journaux horodatés, artefacts) sont rassemblés dans les sources ; le vocabulaire est défini dans le glossaire ; tous les tableaux de référence sont dans le tableau récapitulatif.
Retour à l'accueil du cours · Chapitre suivant : Chronologie de la campagne · Partie suivante : Contre le marché