Utilisation par API¶
Les points d'accès, les paramètres qui comptent, et ce que l'API offre que les poids n'offrent pas.
Les points d'accès¶
| Voie | Usage | Adresse |
|---|---|---|
| Alibaba Cloud Model Studio | production, compatible OpenAI et DashScope | Model Studio |
| QwenCloud | portail développeur | qwencloud.com |
| chat.qwen.ai | interface conversationnelle | chat.qwen.ai |
| QwenWork | agents de travail intégrés | plateforme Alibaba |
L'API est compatible OpenAI : une intégration existante se redirige en changeant l'URL de base et la clé, sans réécrire le code client.
Les capacités exclusives à l'API¶
Absentes du checkpoint téléchargeable :
| Capacité | Détail |
|---|---|
| Entrée image | photos, captures, diagrammes |
| Entrée vidéo | séquences |
| Raisonnement réglable | low, medium, xhigh — dans les poids, forcé |
| Appel de fonctions | déclaration d'outils au format standard |
| Sorties structurées | JSON contraint par schéma |
| Traitement par lots | tarif réduit, latence relâchée |
| Complétion de préfixe | contraindre le début de la réponse |
| Affinage | personnalisation sur données propres |
Et quatre outils intégrés côté serveur :
- interpréteur de code ;
- recherche web ;
- extraction de page web ;
- recherche d'images.
Les outils intégrés changent la comparaison
Un modèle avec recherche web intégrée n'est pas comparable à un modèle sans.
C'est notamment ce qui distingue les lignes HLE et HLE avec outils du
tableau officiel — 43,6 contre
56,2, soit 12,6 points apportés par les outils seuls.
Les limites de la fenêtre¶
| Limite | Valeur |
|---|---|
| Contexte total | 1 010 000 jetons |
| Entrée maximale | 991 000 jetons |
| Entrée maximale, raisonnement activé | 983 000 jetons |
| Sortie maximale | 131 072 jetons |
| Budget de raisonnement | jusqu'à 262 144 jetons |
L'entrée maximale n'est pas la fenêtre
991 000 et non 1 010 000 : la différence est réservée à la sortie et au raisonnement. Une requête calibrée sur le chiffre annoncé sera rejetée.
Les limites de débit¶
| Limite | Valeur |
|---|---|
| Jetons par minute | 2 000 000 |
| Requêtes par minute | 15 000 |
Confortable pour la plupart des usages. Sur un traitement par lots massif, c'est la limite de jetons qui mord en premier — 2 M jetons/minute, c'est environ deux requêtes à contexte plein par minute.
Les réglages recommandés¶
La carte de modèle donne les valeurs d'échantillonnage :
temperature = 1.0
top_p = 0.95
top_k = 20
min_p = 0.0
Une température de 1,0 est inhabituelle
La plupart des modèles recommandent 0,6 à 0,7. Une température de 1,0 signifie un échantillonnage sans aplatissement de la distribution.
C'est cohérent avec un modèle de raisonnement : la diversité y est utile pendant la phase de réflexion, et la longue chaîne de pensée corrige les dérives. Ne pas la réduire sans mesurer : un modèle réglé pour 1,0 peut se dégrader à 0,3.
L'effort de raisonnement¶
reasoning_effort = "xhigh" # défaut
# valeurs : "low", "medium", "xhigh"
C'est le paramètre le plus important pour le coût et la latence. Ordre de grandeur de l'arbitrage :
| Effort | Jetons de raisonnement | Latence | Qualité |
|---|---|---|---|
low |
des centaines | faible | suffisante en extraction, reformulation, classification |
medium |
des milliers | moyenne | bon compromis général |
xhigh |
des dizaines de milliers | élevée | tâches difficiles, agentique longue |
Le premier réflexe d'optimisation
Descendre à medium sur les tâches simples divise souvent le coût par
trois ou plus, sans effet mesurable sur la qualité.
Le défaut xhigh est un choix de communication — il maximise les scores de
benchmark — pas un choix d'exploitation.
La mise en cache de préfixe¶
| Mode | Création | Lecture |
|---|---|---|
| Implicite | automatique | 0,25 $ / M |
| Explicite | 2,50 $ / M | 0,17 $ / M |
Le cache implicite est activé sans rien faire : si deux requêtes partagent un préfixe, la seconde le paie 0,25 $ au lieu de 2,00 $ le million.
Le cache explicite coûte plus cher à créer mais moins cher à relire. Il devient rentable au-delà d'environ quatre relectures du même préfixe.
Le calcul de bascule
Pour un préfixe de \(n\) millions de jetons relu \(r\) fois :
- implicite : \(2{,}00n + 0{,}25n(r-1)\)
- explicite : \(2{,}50n + 0{,}17n \cdot r\)
L'explicite l'emporte dès que \(r \gtrsim 4\).
Sur un agent qui rejoue à chaque tour un préambule de 100 000 jetons pendant 200 tours, l'écart se compte en centaines de dollars par session.
Un exemple minimal¶
from openai import OpenAI
client = OpenAI(
api_key="…",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
reponse = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Explique le RoPE partiel."}],
temperature=1.0,
top_p=0.95,
extra_body={"reasoning_effort": "medium"}, # ← ne pas laisser xhigh
)
print(reponse.choices[0].message.content)
Le point important est la dernière ligne du corps : sans elle, la requête part
en xhigh et coûte plusieurs fois plus cher.
À retenir¶
Ce chapitre en cinq points
- L'API est compatible OpenAI ; la migration est un changement d'URL.
- Elle offre la vision, les outils intégrés et le raisonnement réglable — absents des poids.
- L'entrée maximale est 991 000 jetons, pas 1 010 000.
- Le réglage
reasoning_effortest le levier principal de coût et de latence ; le défautxhighest rarement le bon choix en production. - La mise en cache de préfixe divise le coût d'entrée par 8 à 12 sur les usages agentiques.
Chapitre suivant : Exécuter les poids.