Aller au contenu

Prédire les matchs de CS2 — un cours complet par la pratique

Ce cours raconte et enseigne une campagne réelle de machine learning : construire un modèle qui prédit l'issue des matchs professionnels de Counter-Strike 2, à partir de données publiques, avec des probabilités auxquelles on peut se fier.

Le point de départ était un modèle naïf à 56 % de réussite. Le point d'arrivée est un modèle à 67,9 % de réussite et 0,2041 de score de Brier, mesuré sur 1 146 matchs jamais vus. Tout ce qui a été essayé entre les deux — ce qui a marché, ce qui a échoué, et pourquoi — constitue la matière de ce cours.

Et une fois la campagne close, le modèle a été confronté à de vraies cotes de bookmaker sur ses propres matchs : à égalité d'entraînement et à pleine force, les deux sont statistiquement indiscernables. Ce duel, ses trois retournements et ce qu'il n'autorise pas à conclure forment la dernière partie du cours.

Objectif du cours

Comprendre en profondeur chaque méthode utilisée ou écartée pendant la campagne :

  • les systèmes de rating (Elo, Glicko, TrueSkill, pi-ratings) avec leurs mathématiques complètes et leurs paramétrages réels ;
  • les modèles d'apprentissage (régression logistique, gradient boosting, mélanges par segment) et la raison mesurée pour laquelle le plus simple a gagné ;
  • la construction des features et l'intégrité temporelle qui conditionne tout ;
  • l'ingénierie d'acquisition des données — la moitié cachée du travail ;
  • la méthodologie expérimentale qui empêche de se mentir à soi-même ;
  • la confrontation à un adversaire extérieur — lire une cote, la dévigoriser, et égaliser une comparaison qui ne l'est pas spontanément.

Public visé et prérequis

Lecteur curieux et technique, sans formation mathématique poussée. Chaque formule est introduite par son intuition, chaque symbole est défini, chaque concept passe par un exemple numérique tiré des données réelles de la campagne. Aucun prérequis en machine learning ; savoir ce qu'est une probabilité suffit pour commencer.

Temps de lecture et difficulté

Environ 9 à 11 heures pour l'intégralité, découpables partie par partie. Difficulté progressive : les fondations et la campagne se lisent sans effort ; les horloges et les modèles demandent de dérouler les formules ; le glossaire sert de filet à tout moment.

Parcours de lecture recommandé

  1. Fondations — le problème, les métriques (Brier, log-loss, calibration), et le protocole expérimental. À lire en premier : tout le reste s'y réfère.
  2. Les horloges de force — les systèmes de rating, d'Elo à TrueSkill, jusqu'au démarrage à froid dont la résolution a produit le plus gros gain de la campagne.
  3. Les modèles — régression logistique, gradient boosting, mélanges par segment… et le cimetière des méthodes mortes, chapitre le plus formateur.
  4. Features et données — d'où vient chaque colonne du modèle, et l'ingénierie d'acquisition qui l'a rendue possible.
  5. La campagne — le récit méthodologique : chronologie, palmarès commenté, carte de prévisibilité, leçons généralisables.
  6. Contre le marché — la confrontation aux cotes réelles : définir la vraie barre, dévigoriser une cote, reconnaître une fuite du futur à une calibration trop parfaite, et mesurer un duel à armes égales.
  7. Annexes — glossaire (~125 termes), tableau récapitulatif, sources.

Un lecteur pressé peut lire Fondations puis Campagne (≈ 2 h 30) et revenir ensuite aux parties techniques selon sa curiosité. La partie « Contre le marché » se lit après la campagne et suppose seulement les métriques du chapitre 2 des fondations.

Ce que ce cours n'est pas

Ce n'est ni un tutoriel d'outil, ni un guide de paris. Les probabilités produites par le modèle servent un simulateur d'invitations au Major (hors du périmètre de ce cours) ; les performances rapportées sont des mesures sur un pool précis, mélangeant tous les niveaux du CS2 professionnel — les comparaisons aux bookmakers, qui opèrent surtout sur l'élite, sont systématiquement accompagnées de cette réserve.

La partie « Contre le marché » ne fait pas exception : elle mesure une qualité probabiliste, jamais un rendement. Aucune stratégie de mise n'a été simulée, et la marge de 6 à 8 % prélevée par l'opérateur reste entière entre « égaler le marché » et « gagner de l'argent ».

La thèse du cours, en une phrase

Les gains sont venus des données — horloges réchauffées, économie par round, rang daté — jamais des algorithmes : le modèle final est une régression logistique, la méthode la plus simple du plateau, nourrie des meilleures features de six familles.

Provenance et fiabilité

Chaque chiffre du cours provient des rapports d'expérience de la campagne (référencés dans les sources) ; les affirmations issues de la littérature sont citées avec leurs liens. Les résultats non reproductibles ou non testés sont signalés comme tels — y compris les erreurs commises pendant la campagne, qui ont leurs propres chapitres.

  • Créé le : 2026-08-25
  • Dernière révision : 2026-08-25 (ajout de la partie « Contre le marché »)
  • Campagne source : août 2026, dépôt cs2-vrs-major-predictor