Aller au contenu

Utilisation par API

Les points d'accès, les paramètres qui comptent, et ce que l'API offre que les poids n'offrent pas.


Les points d'accès

Voie Usage Adresse
Alibaba Cloud Model Studio production, compatible OpenAI et DashScope Model Studio
QwenCloud portail développeur qwencloud.com
chat.qwen.ai interface conversationnelle chat.qwen.ai
QwenWork agents de travail intégrés plateforme Alibaba

L'API est compatible OpenAI : une intégration existante se redirige en changeant l'URL de base et la clé, sans réécrire le code client.


Les capacités exclusives à l'API

Absentes du checkpoint téléchargeable :

Capacité Détail
Entrée image photos, captures, diagrammes
Entrée vidéo séquences
Raisonnement réglable low, medium, xhigh — dans les poids, forcé
Appel de fonctions déclaration d'outils au format standard
Sorties structurées JSON contraint par schéma
Traitement par lots tarif réduit, latence relâchée
Complétion de préfixe contraindre le début de la réponse
Affinage personnalisation sur données propres

Et quatre outils intégrés côté serveur :

  • interpréteur de code ;
  • recherche web ;
  • extraction de page web ;
  • recherche d'images.

Les outils intégrés changent la comparaison

Un modèle avec recherche web intégrée n'est pas comparable à un modèle sans. C'est notamment ce qui distingue les lignes HLE et HLE avec outils du tableau officiel — 43,6 contre 56,2, soit 12,6 points apportés par les outils seuls.


Les limites de la fenêtre

Limite Valeur
Contexte total 1 010 000 jetons
Entrée maximale 991 000 jetons
Entrée maximale, raisonnement activé 983 000 jetons
Sortie maximale 131 072 jetons
Budget de raisonnement jusqu'à 262 144 jetons

L'entrée maximale n'est pas la fenêtre

991 000 et non 1 010 000 : la différence est réservée à la sortie et au raisonnement. Une requête calibrée sur le chiffre annoncé sera rejetée.


Les limites de débit

Limite Valeur
Jetons par minute 2 000 000
Requêtes par minute 15 000

Confortable pour la plupart des usages. Sur un traitement par lots massif, c'est la limite de jetons qui mord en premier — 2 M jetons/minute, c'est environ deux requêtes à contexte plein par minute.


Les réglages recommandés

La carte de modèle donne les valeurs d'échantillonnage :

temperature = 1.0
top_p = 0.95
top_k = 20
min_p = 0.0

Une température de 1,0 est inhabituelle

La plupart des modèles recommandent 0,6 à 0,7. Une température de 1,0 signifie un échantillonnage sans aplatissement de la distribution.

C'est cohérent avec un modèle de raisonnement : la diversité y est utile pendant la phase de réflexion, et la longue chaîne de pensée corrige les dérives. Ne pas la réduire sans mesurer : un modèle réglé pour 1,0 peut se dégrader à 0,3.

L'effort de raisonnement

reasoning_effort = "xhigh"   # défaut
# valeurs : "low", "medium", "xhigh"

C'est le paramètre le plus important pour le coût et la latence. Ordre de grandeur de l'arbitrage :

Effort Jetons de raisonnement Latence Qualité
low des centaines faible suffisante en extraction, reformulation, classification
medium des milliers moyenne bon compromis général
xhigh des dizaines de milliers élevée tâches difficiles, agentique longue

Le premier réflexe d'optimisation

Descendre à medium sur les tâches simples divise souvent le coût par trois ou plus, sans effet mesurable sur la qualité.

Le défaut xhigh est un choix de communication — il maximise les scores de benchmark — pas un choix d'exploitation.


La mise en cache de préfixe

Mode Création Lecture
Implicite automatique 0,25 $ / M
Explicite 2,50 $ / M 0,17 $ / M

Le cache implicite est activé sans rien faire : si deux requêtes partagent un préfixe, la seconde le paie 0,25 $ au lieu de 2,00 $ le million.

Le cache explicite coûte plus cher à créer mais moins cher à relire. Il devient rentable au-delà d'environ quatre relectures du même préfixe.

Le calcul de bascule

Pour un préfixe de \(n\) millions de jetons relu \(r\) fois :

  • implicite : \(2{,}00n + 0{,}25n(r-1)\)
  • explicite : \(2{,}50n + 0{,}17n \cdot r\)

L'explicite l'emporte dès que \(r \gtrsim 4\).

Sur un agent qui rejoue à chaque tour un préambule de 100 000 jetons pendant 200 tours, l'écart se compte en centaines de dollars par session.


Un exemple minimal

from openai import OpenAI

client = OpenAI(
    api_key="…",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

reponse = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Explique le RoPE partiel."}],
    temperature=1.0,
    top_p=0.95,
    extra_body={"reasoning_effort": "medium"},   # ← ne pas laisser xhigh
)

print(reponse.choices[0].message.content)

Le point important est la dernière ligne du corps : sans elle, la requête part en xhigh et coûte plusieurs fois plus cher.


À retenir

Ce chapitre en cinq points

  1. L'API est compatible OpenAI ; la migration est un changement d'URL.
  2. Elle offre la vision, les outils intégrés et le raisonnement réglable — absents des poids.
  3. L'entrée maximale est 991 000 jetons, pas 1 010 000.
  4. Le réglage reasoning_effort est le levier principal de coût et de latence ; le défaut xhigh est rarement le bon choix en production.
  5. La mise en cache de préfixe divise le coût d'entrée par 8 à 12 sur les usages agentiques.

Chapitre suivant : Exécuter les poids.