Fondations¶
Cette partie construit tout le vocabulaire nécessaire pour comprendre la question « comment atteindre 10 millions de tokens de contexte ? ». Elle ne suppose aucun prérequis.
Ce que vous allez apprendre¶
À la fin de cette partie, vous saurez :
- ce qu'est une fenêtre de contexte et pourquoi elle est limitée ;
- pourquoi le contexte coûte cher, en mémoire comme en calcul — les deux coûts sont distincts et se heurtent à des murs différents ;
- quelles sont les grandes familles de solutions publiquement connues, et ce que chacune sacrifie ;
- comment on mesure un long contexte, et pourquoi la plupart des mesures sont trop faciles ;
- ce qui s'est passé la dernière fois qu'un modèle a été annoncé avec 10 M de tokens — car Pokee-Isaac n'est pas le premier.
Ces cinq chapitres sont ce qui permet, dans la partie Architecture, de transformer trois chiffres publiés en contraintes exploitables.
Ordre recommandé¶
- Qu'est-ce qu'une fenêtre de contexte
- Le double coût du contexte
- Les familles de solutions connues
- Mesurer un long contexte
- Le précédent Llama 4 Scout
Si vous connaissez déjà le cache clé-valeur et l'attention linéaire, passez directement au chapitre 4, puis à Architecture · 02.