Aller au contenu

Utilisation

Comment le servir correctement, et quand l'auto-hébergement a du sens.


Les deux chapitres

01 · Servir le modèle

Les moteurs, les réglages qui comptent, les deux jeux de paramètres d'échantillonnage, et le contrôle du raisonnement.

~15 min · ★★☆

02 · Auto-hébergement ou API

Le calcul honnête : quand héberger soi-même a du sens, et quand c'est une fausse économie.

~15 min · ★★☆


Le démarrage le plus court

vllm serve Qwen/Qwen3.8-27B-FP8 \
  --max-model-len 131072 \
  --kv-cache-dtype fp8

Trois choix, tous délibérés :

Choix Pourquoi
La variante FP8 officielle 27,7 Go au lieu de 55,5 ; produite par Qwen
--max-model-len 131072 dimensionné sur votre VRAM, pas sur la fenêtre annoncée
--kv-cache-dtype fp8 divise par deux le poste dominant à contexte long

Sur une carte de 24 Go, remplacez la variante FP8 par une quantification 4 bits.

Détail des réglages : Servir le modèle.


En attendant les évaluations indépendantes

Situation Recommandation
Usage agentique, visuel, codage migrez — le gain sur Qwen3.6-27B est massif
Chaîne en production, stable, validée attendez les mesures tierces, quelques jours
Achat de matériel en cours visez 48 Go si le contexte long ou l'agentique comptent
Projet dépendant d'une licence permissive Apache 2.0, aucun obstacle

Trois choses à savoir avant de commencer

1. La licence ne pose aucun problème

Apache 2.0, sans seuil, sans condition, sans obligation d'attribution dans l'interface. Déployez, modifiez, redistribuez, vendez.

C'est la différence majeure avec Qwen3.8-Max, sorti sous licence maison.

2. Il y a deux jeux de paramètres d'échantillonnage

Mode temperature top_p top_k
Raisonnement 1,0 0,95 20
Instruction directe 0,7 0,80 20

Confondre les deux dégrade sensiblement le résultat. C'est l'erreur la plus fréquente sur ce modèle.

3. Le contexte annoncé n'est pas le contexte que vous aurez

262 144 jetons natifs, 1 000 000 étendus — sur le papier. Ce que votre carte tient dépend du cache, pas de la carte de modèle.

Calculez avant de configurer : L'arithmétique de la VRAM.


Commencer : Servir le modèle.