Aller au contenu

Fondations

Cette partie construit tout le vocabulaire nécessaire pour comprendre la question « comment atteindre 10 millions de tokens de contexte ? ». Elle ne suppose aucun prérequis.

Ce que vous allez apprendre

À la fin de cette partie, vous saurez :

  • ce qu'est une fenêtre de contexte et pourquoi elle est limitée ;
  • pourquoi le contexte coûte cher, en mémoire comme en calcul — les deux coûts sont distincts et se heurtent à des murs différents ;
  • quelles sont les grandes familles de solutions publiquement connues, et ce que chacune sacrifie ;
  • comment on mesure un long contexte, et pourquoi la plupart des mesures sont trop faciles ;
  • ce qui s'est passé la dernière fois qu'un modèle a été annoncé avec 10 M de tokens — car Pokee-Isaac n'est pas le premier.

Ces cinq chapitres sont ce qui permet, dans la partie Architecture, de transformer trois chiffres publiés en contraintes exploitables.

Ordre recommandé

  1. Qu'est-ce qu'une fenêtre de contexte
  2. Le double coût du contexte
  3. Les familles de solutions connues
  4. Mesurer un long contexte
  5. Le précédent Llama 4 Scout

Si vous connaissez déjà le cache clé-valeur et l'attention linéaire, passez directement au chapitre 4, puis à Architecture · 02.