Aller au contenu

Qu'est-ce qu'une fenêtre de contexte

Le token, l'unité de base

Un modèle de langage ne lit pas des lettres ni des mots, mais des tokens : des fragments de texte issus d'un découpage appris.

Intuition

« anticonstitutionnellement » sera découpé en plusieurs tokens, alors que « chat » n'en fera qu'un. En français, un token vaut en moyenne 3 à 4 caractères.

Ordres de grandeur utiles :

Contenu Tokens (approximatif)
Une phrase 15 – 30
Une page A4 500 – 700
Un roman de 300 pages 150 000 – 200 000
Le code d'un projet logiciel moyen 500 000 – 3 000 000
10 millions de tokens ≈ 50 à 65 romans, ou une bibliothèque d'entreprise entière

C'est l'échelle revendiquée par Pokee-Isaac.

La fenêtre de contexte

La fenêtre de contexte est le nombre maximal de tokens que le modèle peut avoir simultanément « sous les yeux » lors d'un appel : l'instruction, les documents fournis, l'historique de conversation, et le texte qu'il est en train de produire.

\[ n_{\text{contexte}} = n_{\text{entrée}} + n_{\text{sortie}} \]
Symbole Signification Unité
\(n_{\text{contexte}}\) Taille de la fenêtre de contexte tokens
\(n_{\text{entrée}}\) Tokens fournis au modèle tokens
\(n_{\text{sortie}}\) Tokens produits par le modèle tokens

Chez Pokee-Isaac, \(n_{\text{contexte}} = 10^7\) et \(n_{\text{sortie}} \le 60\,000\).

Erreur fréquente

La fenêtre de contexte n'est pas une mémoire persistante. Elle est vidée à chaque appel. Ce qui la remplit doit être renvoyé à chaque fois — d'où l'importance du prix par million de tokens en entrée, et des mécanismes de cache de préfixe.

Pourquoi le contexte long est le sujet de 2026

Deux usages en dépendent directement.

Les agents. Un agent qui exécute une tâche longue accumule des traces d'exécution : sorties de commandes, résultats d'outils, journaux d'erreurs. Cette accumulation est mécanique et rapide. Un agent qui doit oublier son propre historique perd le fil ; c'est le principal mode d'échec des agents longs.

L'entreprise. Poser une question sur l'intégralité d'un code source, d'un corpus juridique ou d'un dossier médical suppose de tout mettre dans la fenêtre. L'alternative — la recherche documentaire assistée (RAG) — n'apporte que les morceaux jugés pertinents avant de savoir ce qui l'est.

C'est précisément le positionnement d'Isaac : Pokee le décrit comme « un agent qui planifie, exécute et vérifie des tâches à long horizon dans votre périmètre » — donc déployé chez le client.

Fenêtre annoncée ≠ fenêtre utile

Un point central pour la suite du rapport.

Un modèle peut accepter 1 M de tokens sans savoir s'en servir. Il suffit d'étendre l'encodage de position pour que le modèle ne plante pas ; il ne s'ensuit pas qu'il retrouve une information au token 900 000.

À retenir

Trois notions distinctes :

  • contexte adressable : le modèle accepte l'entrée sans erreur ;
  • contexte utile : le modèle retrouve effectivement l'information ;
  • contexte économique : le faire coûte un prix et un délai acceptables.

L'argument marketing d'Isaac est précisément que les trois coïncident chez lui (« usable end to end ») et pas chez ses concurrents. C'est cet argument que la partie Évaluations examine.


Chapitre suivant : Le double coût du contexte