Utilisation¶
Comment le servir correctement, et quand l'auto-hébergement a du sens.
Les deux chapitres¶
01 · Servir le modèle¶
Les moteurs, les réglages qui comptent, les deux jeux de paramètres d'échantillonnage, et le contrôle du raisonnement.
~15 min · ★★☆
02 · Auto-hébergement ou API¶
Le calcul honnête : quand héberger soi-même a du sens, et quand c'est une fausse économie.
~15 min · ★★☆
Le démarrage le plus court¶
vllm serve Qwen/Qwen3.8-27B-FP8 \
--max-model-len 131072 \
--kv-cache-dtype fp8
Trois choix, tous délibérés :
| Choix | Pourquoi |
|---|---|
| La variante FP8 officielle | 27,7 Go au lieu de 55,5 ; produite par Qwen |
--max-model-len 131072 |
dimensionné sur votre VRAM, pas sur la fenêtre annoncée |
--kv-cache-dtype fp8 |
divise par deux le poste dominant à contexte long |
Sur une carte de 24 Go, remplacez la variante FP8 par une quantification 4 bits.
Détail des réglages : Servir le modèle.
En attendant les évaluations indépendantes¶
| Situation | Recommandation |
|---|---|
| Usage agentique, visuel, codage | migrez — le gain sur Qwen3.6-27B est massif |
| Chaîne en production, stable, validée | attendez les mesures tierces, quelques jours |
| Achat de matériel en cours | visez 48 Go si le contexte long ou l'agentique comptent |
| Projet dépendant d'une licence permissive | Apache 2.0, aucun obstacle |
Trois choses à savoir avant de commencer¶
1. La licence ne pose aucun problème
Apache 2.0, sans seuil, sans condition, sans obligation d'attribution dans l'interface. Déployez, modifiez, redistribuez, vendez.
C'est la différence majeure avec Qwen3.8-Max, sorti sous licence maison.
2. Il y a deux jeux de paramètres d'échantillonnage
| Mode | temperature |
top_p |
top_k |
|---|---|---|---|
| Raisonnement | 1,0 | 0,95 | 20 |
| Instruction directe | 0,7 | 0,80 | 20 |
Confondre les deux dégrade sensiblement le résultat. C'est l'erreur la plus fréquente sur ce modèle.
3. Le contexte annoncé n'est pas le contexte que vous aurez
262 144 jetons natifs, 1 000 000 étendus — sur le papier. Ce que votre carte tient dépend du cache, pas de la carte de modèle.
Calculez avant de configurer : L'arithmétique de la VRAM.
Commencer : Servir le modèle.