Les démonstrations agentiques¶
Seize jours de codage autonome, une puce optimisée, une boutique gérée un an. Ce que ces récits montrent, et ce qu'ils ne montrent pas.
Pourquoi ce chapitre existe séparément¶
Le billet officiel de Qwen consacre l'essentiel de son espace non pas aux benchmarks, mais à cinq démonstrations narratives. C'est un choix de communication délibéré, et il faut le traiter comme tel : ces récits ne sont ni des benchmarks ni des mensonges, ce sont des études de cas produites par le constructeur.
Chacune est examinée ici selon trois questions :
- Qu'affirme exactement Alibaba ?
- Qu'est-ce qui l'appuie ?
- Que faudrait-il pour la vérifier ?
D1 · Seize jours de développement autonome¶
L'affirmation¶
Le modèle a piloté seul le développement du projet oh-my-cli pendant
environ seize jours, dans une boucle où il ouvrait des issues, les dispatchait,
écrivait le code et fusionnait.
Résultat annoncé : 265 commits, 127 pull requests, 151 issues, avec des traces publiques sur GitHub.
Ce qui l'appuie¶
Des traces publiques, ce qui est rare
La plupart des démonstrations agentiques sont invérifiables par construction : on montre un résultat, pas le chemin. Ici, l'existence d'un dépôt public avec l'historique complet est un point positif réel.
Un lecteur motivé peut lire les diffs, juger la qualité du code, repérer les reprises.
Ce qui manque¶
| Question | Statut |
|---|---|
| Y a-t-il eu des interventions humaines ? | non précisé |
| Quel harnais pilotait la boucle ? | non précisé |
| Combien de tentatives ont échoué ? | non précisé |
| Le projet est-il fonctionnel et testé ? | non évalué |
| Combien a coûté l'opération ? | non précisé |
265 commits ne mesurent rien
Le nombre de commits est une métrique de volume, pas de qualité. Un agent qui corrige seize fois la même erreur produit seize commits.
Ce qui serait probant : une évaluation externe de la qualité du code produit, ou une comparaison avec ce qu'un développeur aurait produit dans le même temps. Ni l'une ni l'autre n'est fournie.
Statut : revendication documentée, non contrôlée.
D2 · La reproduction d'un article de recherche¶
L'affirmation¶
En environ cinq jours autonomes, le modèle a écrit ~7 600 lignes de code, effectué plus de 1 100 actions, lancé 33 séries d'entraînement GPU pour reproduire un article — puis a dépassé la méthode originale de +2,7 points sur AIME24.
L'examen¶
AIME24 comporte 30 questions
Un écart de 2,7 points sur 30 questions représente 0,8 question.
C'est en dessous de la variabilité obtenue en changeant simplement la graine d'échantillonnage. Cette revendication ne peut pas soutenir la conclusion « le modèle a amélioré l'état de l'art ».
Par ailleurs, le nom de l'article reproduit n'est pas donné. Sans lui, ni la difficulté de la reproduction, ni la ligne de base, ni le gain ne sont appréciables.
Statut : non vérifiable ; l'écart revendiqué est sous le seuil de bruit.
D3 · Le concours contre des humains¶
L'affirmation¶
Dans un concours en ligne de 24 heures réunissant 526 équipes humaines, le modèle a fait mieux que 458 d'entre elles — le 87ᵉ centile.
L'examen¶
Le concours n'est pas nommé, ni daté. Sans cela, on ignore :
- s'il s'agissait d'une compétition sérieuse ou d'un exercice ouvert ;
- si les équipes humaines étaient des professionnels ou des amateurs ;
- si la soumission a été faite en conditions réglementaires.
Un modèle n'est pas soumis aux mêmes contraintes
Une équipe humaine sur 24 heures dort, se coordonne et se fatigue. Un modèle disposant de calcul en parallèle peut explorer des dizaines de pistes simultanément.
Le 87ᵉ centile est un résultat intéressant. Il ne se lit pas comme « meilleur que 87 % des humains » dans un sens général.
Statut : non vérifiable.
D4 · La conception de puce¶
L'affirmation¶
Sur plus de 500 tours, le modèle a réduit le nombre de portes logiques d'un circuit de 8 298 à 678, avec 81 % de réduction de surface.
L'examen¶
Une réduction de 92 % du nombre de portes est spectaculaire. Trop, peut-être.
La question qui décide de tout : quel était le point de départ ?
Un circuit de 8 298 portes réductible à 678 était très mal optimisé au départ. Les outils de synthèse logique standard obtiennent couramment des réductions importantes sur du code non optimisé, sans aucune IA.
Ce que la démonstration établirait si elle était documentée : que le modèle fait mieux qu'un outil de synthèse de référence sur le même circuit. Ce point de comparaison n'est pas fourni.
Ne sont donnés ni le circuit initial, ni sa fonction, ni l'outil de synthèse employé, ni la ligne de base.
Statut : impressionnant si exact, invérifiable en l'état.
D5 · La boutique gérée pendant un an¶
L'affirmation¶
Sur une simulation de 365 jours d'exploitation e-commerce, le modèle atteint un solde de 416 252 ¥, soit 4,16× le capital initial, dépassant les concurrents de 38 %.
L'examen¶
C'est une simulation, pas un marché réel. Le simulateur n'est ni nommé ni décrit.
Un environnement conçu en interne récompense ce que son concepteur juge important
Si Alibaba a conçu le simulateur, ses règles encodent une théorie du commerce en ligne. Un modèle entraîné par Alibaba sur des données Alibaba a de fortes chances de bien épouser cette théorie.
Cela ne rend pas le résultat faux. Cela rend impossible de savoir s'il se transfère à un marché réel.
À noter tout de même : la comparaison « 38 % de mieux que les concurrents » suppose que les mêmes concurrents ont été passés dans le même simulateur — ce qui est au moins une comparaison contrôlée, à défaut d'être une comparaison réelle.
Statut : simulation interne, non transférable en l'état.
Ce que l'ensemble révèle¶
Le message est cohérent, et il est nouveau
Les cinq démonstrations partagent un thème : la durée. Seize jours, cinq jours, 500 tours, 365 jours, 1 100 actions.
Alibaba ne cherche pas à démontrer que son modèle répond mieux. Il cherche à démontrer qu'il tient la distance — qu'il peut poursuivre un objectif sur des centaines de tours sans dériver.
C'est effectivement la frontière ouverte de 2026, et c'est ce que les benchmarks classiques mesurent le plus mal. Le choix de communiquer par études de cas plutôt que par scores est, de ce point de vue, défendable.
Mais le format a un prix :
Une étude de cas non reproductible n'établit rien
Aucune des cinq n'est accompagnée de ce qu'il faudrait pour la rejouer : l'environnement, le harnais, les invites, le nombre de tentatives, le coût.
Le tableau de benchmarks, malgré ses défauts, est falsifiable — quelqu'un peut le refaire et publier un résultat différent. Ces récits ne le sont pas.
À retenir¶
Ce chapitre en cinq points
- Les cinq démonstrations sont des études de cas du constructeur, pas des évaluations.
- Celle du dépôt
oh-my-cliest la plus solide grâce à ses traces publiques — mais 265 commits ne mesurent pas la qualité. - Le gain de +2,7 points sur AIME24 représente 0,8 question : sous le bruit.
- La puce et la boutique manquent toutes deux de leur ligne de base.
- Le thème commun — tenir la distance sur des centaines de tours — est pertinent et mal mesuré ailleurs ; le format non reproductible en annule la portée probante.
Partie suivante : Utilisation.