Fondations¶
Cette partie pose les trois choses sans lesquelles rien de ce qui suit n'a de sens : ce qu'on cherche à produire, comment on le note, et quelles règles on s'interdit d'enfreindre en le mesurant.
Elle ne suppose aucun prérequis en apprentissage automatique. Elle suppose seulement que vous acceptiez une idée un peu contre-intuitive : le livrable d'un prédicteur de match n'est pas un vainqueur, c'est un nombre entre 0 et 1. Tout le reste — les onze approches de la campagne, leurs échecs, le classement final — découle de ce choix.
Ce que vous allez apprendre¶
À la fin de cette partie, vous saurez :
- pourquoi la sortie du modèle est une probabilité et pas un pronostic, et ce que le simulateur Monte Carlo en aval en fait exactement ;
- à quoi ressemble le pool réel de matchs — combien, de quel niveau, sur quelle fenêtre — et pourquoi sa composition interdit certaines comparaisons ;
- ce qui rend la prédiction structurellement difficile : l'information qui manque le jour du match, et le bruit qu'aucun modèle ne peut effacer ;
- comment on note un prédicteur avec accuracy, score de Brier et log-loss, ce que chacun voit et surtout ce que chacun est incapable de voir ;
- pourquoi le Brier a été choisi comme juge de paix de toute la campagne, et comment se lit une courbe de calibration ;
- le protocole de mesure : un holdout temporel de 42 jours mesuré une seule fois, une validation interne pour toutes les décisions, et une intégrité temporelle stricte des features.
Pourquoi commencer par là¶
La tentation, sur ce genre de projet, est d'attaquer directement par les modèles : quel algorithme, quelles variables, quel réglage. C'est l'ordre qui produit des résultats invérifiables.
Un chiffre de performance n'a de sens que rapporté à trois éléments : la population sur laquelle il est calculé, la métrique qui le produit, et le protocole qui garantit qu'il n'a pas été fabriqué. Ces trois éléments sont précisément les trois chapitres qui suivent.
La campagne a fourni au moins deux démonstrations coûteuses de ce principe. Un gain net et net obtenu en validation — \(-0{,}0012\) de Brier — s'est révélé strictement nul une fois mesuré sur le holdout. Et pendant une matinée entière, un instrument de mesure interne a rendu des chiffres irreproductibles selon l'heure à laquelle on le lançait, pour une raison qui n'avait rien à voir avec les modèles. Les deux histoires sont racontées au chapitre 3 : ce sont des leçons de méthode payées comptant.
Ordre de lecture¶
- Le problème — prédire un match, c'est produire une probabilité ; ce que le pool contient réellement ; ce qui rend l'exercice dur.
- Les métriques — accuracy, Brier, log-loss : formules, intuitions, exemples chiffrés sur nos propres mesures, et lecture d'une courbe de calibration.
- Le protocole — le holdout intouchable, la validation interne, l'intégrité temporelle des features, et la fragilité des instruments de mesure.
Si vous connaissez déjà le score de Brier et la notion de calibration, le chapitre 2 peut se lire en diagonale — mais le chapitre 3 est incompressible. C'est celui qui détermine si les chiffres du reste du cours valent quelque chose.
Les cinq chiffres à emporter
Sur un holdout commun de 1 146 matchs (les 42 derniers jours de la campagne, mesurés une seule fois) :
| Repère | Brier | Accuracy |
|---|---|---|
| pièce lancée | 0,250 | 50 % |
| Glicko de Valve (baseline) | 0,2422 | 56,0 % |
| champion de départ (XGBoost v2) | 0,2330 | 60,4 % |
leader final (segmodel) |
0,2041 | 67,9 % |
| bookmakers (littérature, tier 1) | 0,198 | 68,7 % |
La dernière ligne n'est pas mesurée sur notre pool : elle vient de la littérature, sur du tier 1 seul. La comparaison est indicative, jamais conclusive — le chapitre 1 explique pourquoi.
Vocabulaire¶
Les termes techniques employés ici — holdout, calibration, feature, logit, Glicko, TrueSkill, fuite du futur — sont définis au fil du texte à leur première apparition, et rassemblés dans le glossaire pour consultation rapide.