Déploiement¶
L'architecture divise le cache en mémoire vive graphique. Cette partie traite du second cache, celui qui vit sur SSD et en mémoire hôte entre deux tours de conversation — et du mécanisme qui le réduit à un huitième.
C'est la partie la plus intéressante du rapport technique sur un plan méthodologique, parce qu'elle assume un compromis rarement écrit noir sur blanc : échanger de l'exactitude mathématique contre du stockage.
Ce que vous allez apprendre¶
- SWA Bounded Replay — pourquoi reconstruire approximativement un état est plus rentable que le stocker, et ce que l'approximation coûte réellement.
- Cache persistant et noyaux — la politique de rétention à deux vitesses, la fusion de noyaux, et la désagrégation encodeur/préremplissage/décodage.
Le principe¶
Le rapport technique formule le raisonnement en une phrase :
Section 3.2.1
« Persister le cache de fenêtre glissante est à la fois coûteux et inefficace, parce que son schéma d'accès ne correspond pas à la politique de rétention longue du cache persistant. »
Le cache global a une réutilisation à longue traîne : un préfixe peut resservir des heures plus tard. Le cache de fenêtre glissante, lui, n'est réutilisé que dans une fenêtre de quelques minutes à l'intérieur d'une session active, et devient mort dès que la session se termine ou que le tour suivant commence.
Deux durées de vie différentes appellent deux politiques différentes. C'est tout le sujet de cette partie.
Partie précédente : Architecture