Aller au contenu

Glossaire

Tous les termes techniques employés dans ce rapport, par ordre alphabétique.


Attention — Mécanisme par lequel chaque token d'une séquence consulte les autres pour construire sa représentation. Formule : \(\operatorname{softmax}(QK^\top/\sqrt{d_k})V\). Son coût est quadratique en nombre de tokens. Voir Fondations · 02.

Attention creuse (sparse attention) — Attention où chaque token ne consulte qu'un sous-ensemble des autres, choisi selon un motif fixe (blocs, bandes) ou appris (sélection dynamique).

Attention globale — Attention où chaque token consulte réellement tous les tokens précédents. À 10 M de tokens, une seule couche coûterait ≈ 12 minutes de calcul sur une B200.

Attention groupée (GQA, Grouped-Query Attention) — Optimisation où plusieurs têtes de requête partagent une même paire clé/valeur, réduisant le cache d'un facteur 4 à 8 sans perte notable.

Attention latente (MLA, Multi-head Latent Attention) — Compression des clés et valeurs dans un espace de faible dimension avant stockage. Gain typique de 5 à 10 sur le cache.

Attention linéaire — Famille de mécanismes qui remplacent l'attention par une récurrence sur un état de taille fixe, rendant le coût linéaire en longueur et la mémoire constante. Voir Fondations · 03.

BFCL (Berkeley Function-Calling Leaderboard) — Benchmark mesurant la justesse de l'appel d'outils : choix de la fonction, des arguments, des types.

Cache clé-valeur (KV cache) — Mémoire où le modèle conserve les clés et valeurs des tokens déjà traités, pour éviter de les recalculer. Sa taille croît linéairement avec le nombre de tokens. C'est le principal obstacle au contexte long.

Contexte adressable / utile / économique — Trois notions distinctes : ce que le modèle accepte, ce qu'il exploite réellement, et ce qu'il est raisonnable de payer. Voir Fondations · 01.

Décodeur seul (decoder-only) — Architecture standard des modèles de langage depuis 2020 : une pile unique de blocs identiques traitant entrée et sortie de la même façon. Pokee revendique d'en sortir.

DTAP — Benchmark de sécurité mesurant le taux de succès d'attaques contre un agent. Plus le score est bas, mieux c'est.

Encodeur–décodeur — Architecture originelle du transformeur : un encodeur lit l'entrée et produit une représentation, un décodeur produit la sortie en la consultant par attention croisée. Redevenue pertinente pour le contexte long car l'encodeur peut traiter les blocs en parallèle.

Extrapolation de contexte — Capacité d'un modèle à fonctionner au-delà des longueurs vues à l'entraînement. Naturelle pour les architectures à état de taille fixe.

fiction.liveBench — Benchmark indépendant de compréhension de contexte long, fondé sur des récits de fiction : il faut suivre l'intrigue et relier des éléments dispersés, pas seulement retrouver un fait. Beaucoup plus dur que l'aiguille dans une botte de foin. C'est lui qui a révélé l'effondrement de Llama 4 Scout à 15,6 % dès 128 K tokens.

FLOP (floating-point operation) — Une opération arithmétique. Unité de mesure du coût de calcul. Un GFLOP vaut \(10^9\) opérations, un PFLOP \(10^{15}\).

FP16 / FP8 / FP4 — Formats de nombres à virgule flottante sur 16, 8 ou 4 bits. Réduire la précision divise la mémoire et augmente le débit, au prix d'une perte de précision numérique.

Harness d'agent — Couche logicielle qui orchestre le modèle : planification, appel d'outils, vérification, reprise sur erreur. Pokee livre le sien (Plan · Act · Verify · Cite) avec Isaac.

Chunked attention — Attention restreinte à des blocs de taille fixe. Chez Llama 4 Scout, 36 couches sur 48 sont limitées à des blocs de 8 192 tokens, ce qui rend leur cache constant quelle que soit la longueur du contexte.

iRoPE (interleaved RoPE) — Architecture employée par Llama 4 Scout pour atteindre 10 M de tokens. Trois ingrédients : 3 couches sur 4 en RoPE avec chunked attention de 8 192 tokens ; 1 couche sur 4 en NoPE — sans aucun encodage de position — qui voit tout le contexte ; et un temperature tuning logarithmique appliqué aux requêtes des couches NoPE. Le « i » évoque aussi l'objectif de contexte infini.

Retirer l'encodage de position rend l'extrapolation possible — pas nécessairement bonne, et cela ne fait rien contre le mur mémoire. Voir Fondations · 05.

NoPE (No Positional Encoding) — Couche d'attention sans aucun encodage de position. Son calcul est identique quelle que soit la position des tokens, ce qui lui permet de fonctionner bien au-delà des longueurs vues à l'entraînement.

Temperature tuning — Amplification des requêtes en fonction de leur position, pour compenser la dilution des scores d'attention par le softmax sur les longues séquences. Chez Llama 4 : \(\alpha(t) = 0{,}1 \cdot \log(\lfloor (t+1)/8192 \rfloor + 1) + 1\), soit un facteur allant de 1,0 à seulement 1,72 sur toute la plage de 10 M.

Linéarisation (architecture distillation) — Technique consistant à partir d'un transformeur pré-entraîné, remplacer ses couches d'attention par des couches à état de taille fixe, et ne ré-entraîner que ces dernières. Coût de l'ordre de 0,1 à 1 % d'un pré-entraînement complet. C'est vraisemblablement la méthode employée pour Isaac. Voir Entraînement · 01.

Mélange d'experts (MoE, Mixture of Experts) — Architecture où seule une fraction des paramètres est activée pour chaque token. Permet d'avoir beaucoup de paramètres pour un coût de calcul réduit. Distinguer paramètres totaux et paramètres actifs.

MFU (Model FLOPs Utilization) — Fraction de la puissance de crête d'un GPU réellement exploitée. 40 à 60 % est la fourchette usuelle ; ce rapport retient 50 %.

Modèle d'espace d'états (SSM, State Space Model) — Famille de couches (Mamba, RWKV, DeltaNet…) qui maintiennent un état de taille fixe mis à jour token par token. Mémoire constante, coût linéaire.

MRCR (Multi-Round Co-reference Resolution) — Benchmark de contexte long nettement plus dur que RULER : il faut restituer la \(i\)-ème occurrence d'une réponse parmi plusieurs quasi identiques. Isaac y perd 22 points par rapport à RULER à longueur égale.

Non-decoder-only — Formule employée par Pokee pour décrire son architecture, sans autre précision. Voir Architecture · 01.

Préfill — Phase de lecture de l'entrée, avant la génération. Parallélisable, contrairement à la génération. Pokee annonce 137 200 tokens/s de préfill sur B200.

RULER — Benchmark de contexte long (NVIDIA, 2024) généralisant l'« aiguille dans une botte de foin » à plusieurs catégories de difficulté. N'est pas standardisé au-delà de quelques centaines de milliers de tokens.

Token — Unité de découpage du texte pour un modèle de langage. En français, environ 3 à 4 caractères en moyenne.

τ³-bench — Benchmark de conversations multi-tours avec usage d'outils, dans plusieurs domaines simulés.

Terminal-Bench — Benchmark de tâches réelles dans un terminal Linux, vérifiées par exécution. Le plus difficile à truquer des benchmarks agentiques.

VRAM — Mémoire vidéo d'un GPU. RTX 4090 : 24 Gio. B200 : 192 Gio.