Aller au contenu

Exécuter les poids

Le décompte matériel honnête — et ce que « poids ouverts » veut dire quand le fichier pèse 4,89 To.


Ce que contient le dépôt

Qwen/Qwen3.8-2.4T-A95B :

Élément Détail
Fragments safetensors 213
Taille totale 4,89 To
Précision BF16
config.json 3,95 ko
LICENSE 3,39 ko
README.md 35,8 ko
chat_template.jinja 7,5 ko
merges.txt 3,35 Mo

Le téléchargement lui-même est un projet

À 1 Gb/s soutenu, 4,89 To demandent environ 11 heures. À 100 Mb/s, quatre jours et demi. Prévoyez aussi 4,89 To de disque libre — plus la place pour une éventuelle conversion.


Le décompte mémoire

Trois postes, comme établi en Quantification et matériel :

\[ \text{VRAM} = \underbrace{P \times b}_{\text{poids}} + \underbrace{n \times 94\,208}_{\text{cache KV}} + \underbrace{0{,}58\ \text{Go}}_{\text{état linéaire}} + \text{marge} \]

Avec \(P = 2{,}446\) T et une utilisation effective de 85 % de la VRAM :

À contexte plein (1 010 000 jetons)

Précision Poids Total H100 80 Go B200 180 Go
BF16 4 892 Go 4 988 Go 74 GPU 33 GPU
FP8 2 446 Go 2 542 Go 38 GPU 17 GPU
4 bits 1 223 Go 1 319 Go 20 GPU 9 GPU

À contexte court (32 768 jetons)

Précision Total H100 80 Go B200 180 Go
BF16 4 896 Go 72 GPU 32 GPU
FP8 2 450 Go 37 GPU 17 GPU
4 bits 1 227 Go 19 GPU 9 GPU

Le plancher est de huit à neuf GPU de très haut de gamme

Même dans le scénario le plus agressif — quantification 4 bits, B200 à 180 Go, contexte réduit — il faut neuf B200.

Au prix public de 2026, cela représente un investissement matériel de l'ordre de plusieurs centaines de milliers d'euros, avant infrastructure réseau, alimentation et refroidissement.

Aucun particulier, aucune PME, aucun laboratoire universitaire moyen ne fera tourner ce modèle.


Les moteurs supportés

La carte de modèle recommande :

Moteur Statut
SGLang recommandé
vLLM recommandé
TokenSpeed recommandé
Transformers supporté, non recommandé en production

transformers charge le modèle mais ne gère pas efficacement le parallélisme d'experts ni la gestion de cache paginée nécessaires à cette échelle.

Ce qu'il faut vraiment configurer

Pour un MoE de cette taille, trois paramètres décident de tout :

  1. Le parallélisme d'experts — répartir les 512 experts entre GPU.
  2. Le parallélisme de tenseurs — découper les grandes matrices.
  3. La gestion du cache paginée — éviter la fragmentation à contexte long.

Une configuration naïve peut diviser le débit par cinq sans que rien ne signale l'erreur.


Les variantes disponibles

Dépôt Format Taille approx. Publié par
Qwen/Qwen3.8-2.4T-A95B BF16 4,89 To Qwen
Qwen/Qwen3.8-2.4T-A95B-FP8 FP8 ~2,45 To Qwen
RadixArk/Qwen3.8-2.4T-A95B-NVFP4 NVFP4 ~1,3 To communauté
amd/Qwen3.8-2.4T-A95B-Quark-MXFP4 MXFP4 ~1,2 To AMD
unsloth/Qwen3.8-2.4T-A95B-GGUF GGUF, plusieurs niveaux variable communauté

Commencez par la FP8 officielle

Elle divise par deux la mémoire, est produite par Qwen, et était au moment de la rédaction environ quatre fois plus téléchargée que la BF16.

La BF16 sert de référence pour produire les autres quantifications, pas à être servie.

Les GGUF de cette taille sont un cas particulier

Le format GGUF vise l'exécution sur processeur ou matériel modeste, via llama.cpp. Sur un modèle de 2,4 T, même une quantification agressive laisse plus d'un téraoctet — au-delà de la RAM de toute machine grand public.

Ces GGUF existent pour des serveurs à très grande mémoire vive, avec des débits de l'ordre de quelques jetons par minute. C'est utilisable pour inspecter le modèle, pas pour s'en servir.


À quoi servent réellement ces poids

Puisque presque personne ne peut les servir, la question mérite une réponse explicite.

Usage Réaliste ?
Audit et vérification ✅ — c'est ce que fait ce rapport, avec 4 ko de config.json
Recherche architecturale ✅ — étudier une architecture hybride à cette échelle
Distillation vers un modèle plus petit ✅ — nécessite du calcul, mais pas de servir le grand modèle
Déploiement souverain par un État ou un grand groupe ✅
Hébergement par un fournisseur tiers ✅ — plusieurs le proposent déjà
Auto-hébergement en entreprise moyenne ❌
Exécution locale par un particulier ❌

La valeur est réelle, elle est simplement ailleurs

Publier ces poids n'offre pas l'auto-hébergement. Cela offre :

  • la possibilité de vérifier les affirmations — sans config.json, aucune des vérifications de ce rapport n'existerait ;
  • l'absence de verrou : un service peut migrer de fournisseur ;
  • la permanence : le modèle ne peut plus être retiré ni modifié silencieusement ;
  • un objet d'étude pour la recherche publique.

C'est beaucoup. Ce n'est pas ce que le terme « poids ouverts » évoque spontanément.


Si vous vouliez vraiment exécuter du Qwen localement

Le modèle de la gamme conçu pour cela est Qwen3.8-27B, annoncé le même jour. Il tient sur une carte unique.

Il est sorti le 14 août 2026 sous Apache 2.0 : 55,6 Go, dense, multimodal, et une carte de 24 Go en 4 bits tient environ 115 600 jetons de contexte.

Qwen3.8-Max Qwen3.8-27B
Poids 4,89 To 55,6 Go
Matériel minimal 9 à 74 GPU une carte de 24 Go
Licence maison, à seuils Apache 2.0
Modalités des poids texte seul texte, images, vidéo

Analyse complète et arithmétique matérielle : Qwen3.8-27B.


À retenir

Ce chapitre en cinq points

  1. Le dépôt fait 4,89 To en 213 fragments — 11 heures de téléchargement à 1 Gb/s.
  2. Servir le modèle demande 9 à 74 GPU selon la précision et le matériel.
  3. Les moteurs à utiliser sont SGLang, vLLM ou TokenSpeed, jamais transformers en production.
  4. La variante FP8 officielle est le point de départ raisonnable.
  5. La valeur des poids ouverts est l'audit, la distillation et l'absence de verrou — pas l'auto-hébergement.

Chapitre suivant : Coûts.