L'arithmétique du calcul¶
Le chapitre précédent a contraint la mémoire. Celui-ci contraint le temps, à partir du seul chiffre de performance publié par Pokee :
Up to 137K tokens/s prefill on one B200 with 10M-token context.
Ce chiffre est bien plus contraignant qu'il n'y paraît. Il élimine deux possibilités d'un coup.
Le budget de temps¶
À 137 200 tokens/s, lire 10 M de tokens prend :
Tout ce que le modèle fait pendant le préfill doit tenir dans ces 73 secondes.
Le budget de calcul correspondant¶
Puissance de crête d'une B200 (calcul dense, spécifications constructeur approximatives) :
| Précision | FLOPs/s de crête |
|---|---|
| FP16 | \(2{,}25 \times 10^{15}\) |
| FP8 | \(4{,}5 \times 10^{15}\) |
| FP4 | \(9{,}0 \times 10^{15}\) |
Aucun système réel n'atteint la crête. Un rendement (MFU) de 50 % est généreux pour du préfill ; 40 à 60 % est la fourchette usuelle en production.
| Précision | Budget par token |
|---|---|
| FP16 @ 50 % | 8,2 GFLOPs |
| FP8 @ 50 % | 16,4 GFLOPs |
| FP4 @ 50 % | 32,8 GFLOPs |
Résultat 1 — Le modèle ne peut pas être dense¶
Le coût des couches linéaires (projections + réseaux à propagation avant) d'un modèle à \(N\) paramètres actifs est de \(2N\) FLOPs par token — indépendamment de toute attention.
Pour \(N = 28 \times 10^9\) :
Comparons :
| Configuration | Budget | Coût dense 28 G | Verdict |
|---|---|---|---|
| FP16 @ 50 % | 8,2 | 56 | ×6,8 hors budget |
| FP8 @ 50 % | 16,4 | 56 | ×3,4 hors budget |
| FP4 @ 50 % | 32,8 | 56 | ×1,7 hors budget |
Premier résultat
Un modèle dense de 28 milliards de paramètres ne peut pas atteindre 137 200 tokens/s de préfill sur une seule B200, même en FP4, et même avant de compter la moindre opération d'attention.
Les paramètres réellement actifs par token sont donc bien inférieurs à 28 milliards :
| Précision | Paramètres actifs maximaux |
|---|---|
| FP16 @ 50 % | 4,1 G |
| FP8 @ 50 % | 8,2 G |
| FP4 @ 50 % | 16,4 G |
Conclusion : Isaac est presque certainement un mélange d'experts (MoE), avec 28 milliards de paramètres au total et de l'ordre de 3 à 8 milliards actifs par token — ou bien le chiffre de 137 200 tokens/s ne correspond pas au régime décrit.
C'est la première information architecturale substantielle qu'on obtient sans que Pokee l'ait dite.
Résultat 2 — Aucune couche ne peut faire d'attention globale¶
Coût d'une attention causale dense sur \(n\) tokens, pour une couche :
Avec \(n = 10^7\) et \(d_q = 8\,192\) :
À \(2{,}25 \times 10^{15}\) FLOPs/s effectifs (FP8 à 50 %) :
| Couches globales | FLOPs | Temps de préfill |
|---|---|---|
| 1 | \(1{,}64 \times 10^{18}\) | 12,1 minutes |
| 8 | \(1{,}31 \times 10^{19}\) | 1 h 37 |
| 64 | \(1{,}05 \times 10^{20}\) | 12 h 57 |
Le budget total est de 73 secondes.
Deuxième résultat
Une seule couche d'attention globale dense sur 10 M de tokens consomme dix fois le budget de temps du préfill complet.
Il est donc impossible qu'une seule couche d'Isaac effectue une attention dense sur l'intégralité du contexte. Les 8 couches d'attention que la mémoire autorise (chapitre 02) doivent nécessairement être restreintes : fenêtre glissante, attention creuse sélective, ou attention sur une mémoire déjà compressée.
Ce qui, en revanche, tient largement dans le budget¶
Pour montrer que les contraintes ne sont pas absurdes, calculons le coût des mécanismes compatibles.
Une couche à état de taille fixe¶
Mise à jour et lecture de l'état \(S\) de dimension \(d_h \times d_h\) par tête :
Sur 56 couches : \(2{,}9 \times 10^7\) FLOPs/token, soit 0,03 GFLOPs. C'est 0,2 % du budget FP8. Négligeable.
Une couche d'attention à fenêtre glissante de 4 096 tokens¶
Sur 8 couches : \(5{,}4 \times 10^8\) FLOPs/token, soit 0,54 GFLOPs. 3 % du budget FP8. Confortable.
À retenir
| Mécanisme | Coût/token | Part du budget FP8 |
|---|---|---|
| 56 couches à état fixe | 0,03 GFLOPs | 0,2 % |
| 8 couches à fenêtre de 4 096 | 0,54 GFLOPs | 3 % |
| Couches linéaires, 6 G actifs | 12 GFLOPs | 73 % |
| (1 couche d'attention globale) | 164 GFLOPs | 1 000 % |
Le budget est entièrement dominé par les couches linéaires — c'est-à-dire par le nombre de paramètres actifs. Le mélange de tokens, dans une architecture hybride, est quasi gratuit.
C'est précisément la signature d'un modèle à contexte long bien conçu : à 10 M de tokens, l'attention ne doit plus être le poste dominant.
Synthèse des contraintes¶
| Contrainte | Ce qu'elle élimine |
|---|---|
| 962 octets/token sur 4090 | 10 M sur RTX 4090, pour toute architecture à cache croissant |
| 17 601 octets/token sur B200 | Plus de ~8 couches d'attention réelle |
| 73 s de préfill | Toute attention globale, même sur une seule couche |
| 16,4 GFLOPs/token | Tout modèle dense de 28 G actifs |
Ce qui survit à ces quatre contraintes simultanément : un modèle à activation creuse, dont la grande majorité des couches ont un état de taille fixe, et dont les rares couches d'attention sont restreintes à une fenêtre ou à une sélection.
C'est l'objet du chapitre suivant.
Chapitre suivant : Les hypothèses plausibles