Modèles d'IA¶
Analyses détaillées de modèles d'intelligence artificielle.
Chaque analyse part des sources primaires — rapport technique, fichiers de configuration publiés, licences, dépôts de code — et recalcule ce qui peut l'être plutôt que de recopier les chiffres annoncés.
Analyses disponibles¶
DeepSeek-V4.1-Flash¶
DeepSeek-AI · 10 septembre 2026 · licence MIT · poids ouverts
Un Mixture-of-Experts multimodal de 552 milliards de paramètres dont 8 seulement sont activés par jeton au préremplissage, avec un million de jetons de contexte. Son objectif n'est pas la performance brute mais une grandeur que presque personne ne met en avant : la taille du cache clé-valeur, ramenée à 890 octets par jeton.
Ce que couvre l'analyse :
- un cours d'entrée sur le cache clé-valeur, l'attention creuse, le Mixture-of-Experts et la quantification FP4, sans prérequis ;
- les quatre mécanismes de compression, chacun avec son coût : l'encodeur- décodeur causal, CSA2 et ses trois modes, l'indexeur hiérarchique, le cache FP4 ;
- SWA Bounded Replay, le compromis assumé qui échange l'exactitude mathématique contre du stockage — et ce que DeepSeek en dit lui-même ;
- l'entraînement : 45 T jetons, Muon par tête, équilibrage de Sinkhorn, et un post-entraînement qui revendique explicitement aucune innovation algorithmique ;
- les évaluations, avec ce que révèle le contraste entre 36,8 sur HLE sans outils et 63,9 avec ;
- une lecture critique classant chaque affirmation par niveau de preuve.
Vérifications indépendantes réalisées pour cette analyse
Un script Python autonome part du seul config.json et des formats de
quantification lus dans le code d'inférence publié :
- les 551,93 G de paramètres reconstruits — écart de 0,01 % ;
- les 890,0 octets de cache par jeton, retrouvés au dixième d'octet près, ce qui identifie la composition exacte du cache : quatre couches sources sur quarante, et deux formats FP4 distincts ;
- les 389 120 octets par jeton qu'une figure officielle attribue à
« DeepSeek-V1 » sans nommer le modèle — retrouvés à l'octet près, ce qui
l'identifie :
deepseek-llm-67b; - 95 % de la taille du dépôt expliqués, ce qui établit que les 196 G de paramètres Engram sont bien inclus dans les poids publiés.
Et une divergence relevée entre les deux documents officiels du modèle : NL2Repo-Bench vaut 64,0 sur la carte Hugging Face et 65,4 dans le rapport technique.
8 parties · 33 chapitres · 5 à 7 h de lecture · niveau débutant → avancé
Kimi K3¶
Moonshot AI · 27 juillet 2026 · poids ouverts
Le premier modèle d'IA de la classe des 3 billions de paramètres publié en poids ouverts. Un Mixture-of-Experts de 2,78 T de paramètres dont 104 G sont actifs par jeton, nativement multimodal, avec une fenêtre de contexte de 1 048 576 jetons.
Ce que couvre l'analyse :
- un cours complet sur les LLM en 13 chapitres, sans aucun prérequis ;
- l'architecture en détail : Kimi Delta Attention, Attention Residuals, Stable LatentMoE, SiTU-GLU, Quantile Balancing, MoonViT-V2 ;
- l'entraînement et le post-entraînement : RL sur 9 experts, distillation multi-professeurs, 51 millions de sandboxes ;
- l'infrastructure : MoonEP, KDA Context Parallelism, cache de préfixe hybride, ordonnancement de flotte ;
- les évaluations, en séparant strictement les mesures de Moonshot des évaluations indépendantes ;
- une lecture critique notant le niveau de preuve de chaque revendication ;
- un guide de réimplémentation avec du code vérifié et un modèle jouet.
Vérifications indépendantes réalisées pour cette analyse
- Reconstruction des 2,779 T de paramètres depuis le seul
config.json— écart de 0,2 % avec le chiffre annoncé. - Vérification numérique de l'identité de composition de KCP à \(6{,}94\times10^{-18}\) près.
- Vérification de la borne de SiTU-GLU sur 200 000 tirages.
- Correction d'une erreur récurrente de la presse sur la taille du dépôt (1,56 To, et non 594 Go).
9 parties · 60 chapitres · 15 à 25 h de lecture · niveau débutant → avancé
Pokee-Isaac 28B¶
Pokee AI · 4 août 2026 · poids fermés
Un modèle agentique de 28 milliards de paramètres revendiquant une fenêtre de contexte de 10 millions de tokens — dix fois la limite courante — grâce à une « architecture propriétaire non purement décodeur » dont rien n'est publié.
Ce que couvre l'analyse :
- un cours sur le contexte long : cache clé-valeur, mur quadratique, et les cinq familles d'architectures connues qui les attaquent ;
- la réponse à « comment ont-ils fait ? » — Pokee ne le dit pas, mais les chiffres publiés imposent des contraintes physiques qui éliminent la quasi-totalité des architectures possibles ;
- la reconstruction de la méthode d'entraînement à partir de la seule mention d'un affinage partiel depuis Qwen3.6-27B ;
- une lecture critique des benchmarks, notamment de ce que signifient réellement les « 0,0 » attribués aux concurrents ;
- un tableau de niveaux de preuve pour chaque affirmation de Pokee.
Vérifications indépendantes réalisées pour cette analyse
Un script Python autonome recalcule les contraintes physiques et établit que :
- le cache clé-valeur d'un décodeur classique à 10 M de tokens pèserait 2,62 To, et 524 Go même après la compression ×5 annoncée ;
- une RTX 4090 ne peut pas héberger une seule couche d'attention complète à 10 M de tokens — la revendication « 10 M sur RTX 4090 » est arithmétiquement fausse ;
- une seule couche d'attention globale à 10 M coûterait 12 minutes de calcul sur B200, soit dix fois le budget du préfill annoncé ;
- un modèle dense de 28 G ne peut pas atteindre le débit annoncé, même en FP4 — Isaac est donc à activation creuse.
8 parties · 24 chapitres · 2 à 3 h de lecture · niveau débutant → avancé
Qwen3.8-Max¶
Alibaba · 12 août 2026 · poids ouverts
Le premier modèle de la gamme « Max » d'Alibaba dont les poids sont publiés. Un Mixture-of-Experts de 2,42 T de paramètres dont 95 G sont actifs par jeton, bâti sur une alternance de 3 couches d'attention linéaire pour 1 couche d'attention complète, avec 262 144 jetons de contexte natif extensibles à 1 010 000.
Ce que couvre l'analyse :
- un cours complet sur les LLM en 6 chapitres, sans prérequis ;
- l'architecture reconstruite entièrement depuis
config.json, faute de rapport technique : Gated DeltaNet, attention complète gatée, MoE à 513 experts, prédiction multi-jetons ; - les 31 lignes du tableau officiel reproduites et lues, benchmarks maison identifiés ;
- les évaluations indépendantes — dont la vitesse et le coût par tâche, que le constructeur ne publie pas ;
- ce qu'il faut pour exécuter les poids, et pourquoi presque personne ne le peut ;
- une lecture critique notant le niveau de preuve de chaque revendication.
Vérifications indépendantes réalisées pour cette analyse
Un script Python autonome part du seul config.json et reconstruit :
- les 2,4198 T de paramètres — écart de 0,83 % avec l'annonce ;
- les 95,29 G actifs par jeton — écart de 0,30 %, ce qui établit au passage la convention de comptage utilisée par Qwen ;
- la taille du dépôt à 0,04 % près, ce qui prouve que la couche de prédiction multi-jetons est livrée dans les poids — information absente de la documentation ;
- le cache clé-valeur à 92 KiO par jeton, soit 95 Go au million de jetons contre 381 Go sans architecture hybride — 75 % d'économie, un chiffre publié nulle part.
Et deux corrections : les poids ouverts sont textuels alors que l'API est multimodale, et la rumeur d'interdiction géographique dans la licence est fausse.
8 parties · 33 chapitres · 5 à 7 h de lecture · niveau débutant → avancé
Qwen3.8-27B¶
Alibaba · 14 août 2026 · Apache 2.0
Le petit frère du précédent, annoncé le même jour et publié deux jours après lui. C'est le seul modèle de sa génération qu'on puisse réellement faire tourner : un dense de 27,7 milliards de paramètres, nativement multimodal, bâti sur la même alternance 3 couches linéaires pour 1 complète, avec 262 144 jetons de contexte natif.
Ce que couvre l'analyse :
- l'architecture reconstruite depuis
config.json: attention hybride, voie visuelle native, mRoPE, prédiction multi-jetons ; - les 30 lignes de benchmarks — texte et vision-langage — reproduites et lues ;
- l'arithmétique matérielle : ce que chaque carte tient réellement, poids et cache ;
- la comparaison avec le prédécesseur et avec le grand frère 88 fois plus gros ;
- une particularité : les prédictions faites la veille de la sortie sont conservées et notées.
Vérifications indépendantes réalisées pour cette analyse
- Reconstruction des 27,729 G de paramètres depuis le seul
config.json, qui retrouve la taille du dépôt à 0,26 % — ce qui établit la présence de l'encodeur visuel et de la couche MTP dans les poids, non chiffrés par la documentation. - Le cache clé-valeur à 64 KiO par jeton, soit 17,18 Go au contexte natif contre 68,72 Go sans attention hybride : 75 % d'économie, publiée nulle part.
- Correction de l'omission commune à tous les tableaux « VRAM requise » : à 262 144 jetons le cache dépasse les poids, et une RTX 4090 en 4 bits ne tient que ~115 600 jetons — 44 % de la fenêtre annoncée.
Un rapport qui note ses propres prédictions
La première édition, écrite avant la publication, formulait douze hypothèses d'architecture. Neuf se vérifient exactement, deux à peu près, une était fausse.
La plus exacte d'entre elles — le cache à 64 KiO près — l'était grâce à deux erreurs qui se compensaient. Le rapport le dit.
8 parties · 26 chapitres · 2 h 30 de lecture · niveau débutant → avancé
À venir¶
Cette catégorie a vocation à accueillir d'autres analyses de modèles, suivant la même structure.