Exécuter les poids¶
Le décompte matériel honnête — et ce que « poids ouverts » veut dire quand le fichier pèse 4,89 To.
Ce que contient le dépôt¶
| Élément | Détail |
|---|---|
| Fragments safetensors | 213 |
| Taille totale | 4,89 To |
| Précision | BF16 |
config.json |
3,95 ko |
LICENSE |
3,39 ko |
README.md |
35,8 ko |
chat_template.jinja |
7,5 ko |
merges.txt |
3,35 Mo |
Le téléchargement lui-même est un projet
À 1 Gb/s soutenu, 4,89 To demandent environ 11 heures. À 100 Mb/s, quatre jours et demi. Prévoyez aussi 4,89 To de disque libre — plus la place pour une éventuelle conversion.
Le décompte mémoire¶
Trois postes, comme établi en Quantification et matériel :
Avec \(P = 2{,}446\) T et une utilisation effective de 85 % de la VRAM :
À contexte plein (1 010 000 jetons)¶
| Précision | Poids | Total | H100 80 Go | B200 180 Go |
|---|---|---|---|---|
| BF16 | 4 892 Go | 4 988 Go | 74 GPU | 33 GPU |
| FP8 | 2 446 Go | 2 542 Go | 38 GPU | 17 GPU |
| 4 bits | 1 223 Go | 1 319 Go | 20 GPU | 9 GPU |
À contexte court (32 768 jetons)¶
| Précision | Total | H100 80 Go | B200 180 Go |
|---|---|---|---|
| BF16 | 4 896 Go | 72 GPU | 32 GPU |
| FP8 | 2 450 Go | 37 GPU | 17 GPU |
| 4 bits | 1 227 Go | 19 GPU | 9 GPU |
Le plancher est de huit à neuf GPU de très haut de gamme
Même dans le scénario le plus agressif — quantification 4 bits, B200 à 180 Go, contexte réduit — il faut neuf B200.
Au prix public de 2026, cela représente un investissement matériel de l'ordre de plusieurs centaines de milliers d'euros, avant infrastructure réseau, alimentation et refroidissement.
Aucun particulier, aucune PME, aucun laboratoire universitaire moyen ne fera tourner ce modèle.
Les moteurs supportés¶
La carte de modèle recommande :
| Moteur | Statut |
|---|---|
| SGLang | recommandé |
| vLLM | recommandé |
| TokenSpeed | recommandé |
| Transformers | supporté, non recommandé en production |
transformers charge le modèle mais ne gère pas efficacement le parallélisme
d'experts ni la gestion de cache paginée nécessaires à cette échelle.
Ce qu'il faut vraiment configurer
Pour un MoE de cette taille, trois paramètres décident de tout :
- Le parallélisme d'experts — répartir les 512 experts entre GPU.
- Le parallélisme de tenseurs — découper les grandes matrices.
- La gestion du cache paginée — éviter la fragmentation à contexte long.
Une configuration naïve peut diviser le débit par cinq sans que rien ne signale l'erreur.
Les variantes disponibles¶
| Dépôt | Format | Taille approx. | Publié par |
|---|---|---|---|
Qwen/Qwen3.8-2.4T-A95B |
BF16 | 4,89 To | Qwen |
Qwen/Qwen3.8-2.4T-A95B-FP8 |
FP8 | ~2,45 To | Qwen |
RadixArk/Qwen3.8-2.4T-A95B-NVFP4 |
NVFP4 | ~1,3 To | communauté |
amd/Qwen3.8-2.4T-A95B-Quark-MXFP4 |
MXFP4 | ~1,2 To | AMD |
unsloth/Qwen3.8-2.4T-A95B-GGUF |
GGUF, plusieurs niveaux | variable | communauté |
Commencez par la FP8 officielle
Elle divise par deux la mémoire, est produite par Qwen, et était au moment de la rédaction environ quatre fois plus téléchargée que la BF16.
La BF16 sert de référence pour produire les autres quantifications, pas à être servie.
Les GGUF de cette taille sont un cas particulier
Le format GGUF vise l'exécution sur processeur ou matériel modeste, via
llama.cpp. Sur un modèle de 2,4 T, même une quantification agressive
laisse plus d'un téraoctet — au-delà de la RAM de toute machine grand
public.
Ces GGUF existent pour des serveurs à très grande mémoire vive, avec des débits de l'ordre de quelques jetons par minute. C'est utilisable pour inspecter le modèle, pas pour s'en servir.
À quoi servent réellement ces poids¶
Puisque presque personne ne peut les servir, la question mérite une réponse explicite.
| Usage | Réaliste ? |
|---|---|
| Audit et vérification | ✅ — c'est ce que fait ce rapport, avec 4 ko de config.json |
| Recherche architecturale | ✅ — étudier une architecture hybride à cette échelle |
| Distillation vers un modèle plus petit | ✅ — nécessite du calcul, mais pas de servir le grand modèle |
| Déploiement souverain par un État ou un grand groupe | ✅ |
| Hébergement par un fournisseur tiers | ✅ — plusieurs le proposent déjà |
| Auto-hébergement en entreprise moyenne | ❌ |
| Exécution locale par un particulier | ❌ |
La valeur est réelle, elle est simplement ailleurs
Publier ces poids n'offre pas l'auto-hébergement. Cela offre :
- la possibilité de vérifier les affirmations — sans
config.json, aucune des vérifications de ce rapport n'existerait ; - l'absence de verrou : un service peut migrer de fournisseur ;
- la permanence : le modèle ne peut plus être retiré ni modifié silencieusement ;
- un objet d'étude pour la recherche publique.
C'est beaucoup. Ce n'est pas ce que le terme « poids ouverts » évoque spontanément.
Si vous vouliez vraiment exécuter du Qwen localement¶
Le modèle de la gamme conçu pour cela est Qwen3.8-27B, annoncé le même jour. Il tient sur une carte unique.
Il est sorti le 14 août 2026 sous Apache 2.0 : 55,6 Go, dense, multimodal, et une carte de 24 Go en 4 bits tient environ 115 600 jetons de contexte.
| Qwen3.8-Max | Qwen3.8-27B | |
|---|---|---|
| Poids | 4,89 To | 55,6 Go |
| Matériel minimal | 9 à 74 GPU | une carte de 24 Go |
| Licence | maison, à seuils | Apache 2.0 |
| Modalités des poids | texte seul | texte, images, vidéo |
Analyse complète et arithmétique matérielle : Qwen3.8-27B.
À retenir¶
Ce chapitre en cinq points
- Le dépôt fait 4,89 To en 213 fragments — 11 heures de téléchargement à 1 Gb/s.
- Servir le modèle demande 9 à 74 GPU selon la précision et le matériel.
- Les moteurs à utiliser sont SGLang, vLLM ou TokenSpeed, jamais
transformersen production. - La variante FP8 officielle est le point de départ raisonnable.
- La valeur des poids ouverts est l'audit, la distillation et l'absence de verrou — pas l'auto-hébergement.
Chapitre suivant : Coûts.