Aller au contenu

Entraînement

Cette partie couvre le pré-entraînement sur 45 T jetons, les choix d'optimisation, et un post-entraînement dont l'intérêt principal est l'absence revendiquée d'innovation algorithmique.

Ce que vous allez apprendre

  • Données et pré-entraînement — le corpus, le calendrier d'apprentissage, l'extension du contexte à un million de jetons.
  • Optimiseurs — Muon par tête, équilibrage de Sinkhorn pour les tables Engram, et pourquoi ces choix existent.
  • Post-entraînement — la synthèse automatisée de tâches d'agent, l'infrastructure DSec, l'apprentissage par renforcement asynchrone.
  • L'effort de raisonnement — le réglage 1–100, sa construction pendant l'apprentissage par renforcement, et son rapport coût/qualité mesuré.

La thèse centrale du post-entraînement

Le rapport technique est explicite, et c'est l'affirmation la plus intéressante de tout le document :

Section 5.1

« Nous constatons que, sous une procédure d'optimisation fixe et banale, les améliorations systématiques de l'échelle, de la diversité et de la vérifiabilité des données et environnements synthétisés expliquent essentiellement tous les gains observés. Cette observation fait écho à une leçon plus large : au stade actuel, le rendement marginal de l'ingénierie du pipeline de données et d'environnements dépasse substantiellement celui de la nouveauté algorithmique en post-entraînement. »

Autrement dit : SFT → RL → distillation sur politique, sans aucune modification. Tout l'effort est passé dans ce sur quoi le modèle s'entraîne, pas dans comment il est optimisé.

C'est une affirmation forte, invérifiable de l'extérieur, mais dont la formulation même — refuser de revendiquer une innovation — a une valeur informative.


Partie précédente : Déploiement