La plupart des bancs d'essai pour agents notent si une tâche a été terminée. Une équipe de Sakana AI et de KPMG AZSA en a bâti un qui note si une entreprise a fait de l'argent.[1] CoffeeBench place un seul modèle dans une chaîne d'approvisionnement du café à six entreprises, deux producteurs, deux torréfacteurs, deux détaillants, et lui confie l'un des deux torréfacteurs pendant 90 jours simulés, face à des agents de référence fixes. Il achète du café vert, négocie, torréfie, vend en gros, paie ses factures et absorbe les frais fixes. Le pointage final, c'est le bénéfice net cumulé. Sept modèles se sont assis dans cette chaise. Six ont fini dans le positif. Le septième a produit quatre-vingt-dix jours de raisonnement posé et sensé, et a perdu 630 $.
Un banc d'essai noté en dollars.
L'environnement a assez de friction pour punir l'inaction. Un appel d'outil coûte 30 minutes simulées à l'intérieur d'une journée ouvrable de 9 h à 19 h. Les livraisons accusent un jour de retard. La demande des consommateurs bouge avec le prix et comporte du bruit. Les frais fixes d'exploitation vont de 25 $ à 50 $ par jour, l'inventaire se dégrade de 0,5 % par jour, et le crédit commercial est à net 30 avec pénalités de retard. Ne rien faire n'est pas neutre dans ce monde-là : les grains pourrissent et les frais courent, que l'agent bouge ou non. C'est ce choix de conception qui rend le résultat lisible, parce que l'inaction a un prix affiché.
Deux lectures de ce tableau se font concurrence, et une seule est utile. La tentante, c'est le classement. La durable, c'est l'écart entre la première ligne et les deux dernières : la différence entre un agent qui s'engage et un script qui attend vaut environ 5 900 $ de résultat d'affaires, sur un dispositif identique. La dépense en modèle ne joue pas dans la même ligue. L'exécution complète coûte entre 10 $ et 86 $ en appels d'API. Peu importe ce que vous optimisez en rognant la facture du modèle, c'est une erreur d'arrondi à côté de ce que l'agent laisse sur la table en n'agissant pas.
Idle-drift : la défaillance qui dépose quand même un bon rapport.
L'idle-drift, c'est un agent qui continue de produire un raisonnement cohérent et tourné vers l'avenir tout en choisissant de façon répétée de ne rien faire. C'est la dérive d'inactivité, le terme forgé par les auteurs, et Claude Haiku 4.5 est ce pour quoi ils l'ont forgé. Il affiche en moyenne 40 jours d'inactivité sur 90. Pas éparpillés non plus : les auteurs ont retracé le moment où l'inactivité commence dans chacune des trois exécutions, l'ont trouvé au jour 26, au jour 66 et au jour 25 respectivement, et ont constaté qu'elle se poursuit ensuite jusqu'à la fin de la simulation. Ces jours de bascule impliqueraient 52 jours complètement morts plutôt que les 40 rapportés, donc une part d'activité survit à la bascule. L'agent ne s'est pas figé. Il a cessé d'exploiter l'entreprise. Il ne plante pas et ne retourne pas d'erreur, et il n'est pas coincé dans une boucle. Il appelle wait_for_next_day() et continue de l'appeler.
Ce que l'agent pensait pendant qu'il faisait ça, voilà le passage inconfortable. Les auteurs publient le raisonnement rattaché au calage du jour 26. Il s'ouvre sur une position de trésorerie de 13 225 $, passe en revue la performance de l'entreprise, note les 64 jours restants, et conclut que l'entreprise « has successfully navigated the critical early-stage challenges and is now operating at peak efficiency with strong fundamentals » (en anglais dans l'original : elle a franchi avec succès les défis critiques du démarrage et fonctionne maintenant à efficacité maximale, sur des bases solides). Puis il attend. Puis il attend encore. Le plan est cohérent. L'autoévaluation est confiante. Le passage à l'action est absent.
Il y a une autre ligne dans cette trace qui mérite qu'on s'y arrête. L'agent mentionne sa propre consommation de tokens, environ 103 k sur 200 k, dans le même souffle que sa décision de se laisser porter. Les auteurs sont prudents ici et l'offrent comme hypothèse plutôt que comme résultat : l'idle-drift viendrait de l'accumulation de contexte long, ou d'une sélection d'actions trop conservatrice, possiblement motivée par une préoccupation implicite pour le budget de tokens. Ce n'est pas démontré. Il vaut la peine de savoir que le remède évident était déjà en place : le harnais résumait le contexte à 160 k tokens pour survivre à l'horizon de 90 jours, et le calage s'est produit quand même. « Compactez le contexte » n'est donc pas à soi seul une réponse à ceci. C'est aussi une chose précise et vérifiable à surveiller, et ça renverse une hypothèse que la plupart des équipes tiennent pour acquise. Nous construisons des agents conscients de leur propre coût parce que nous les voulons économes. Un agent qui se met à économiser sur le fait d'agir a trouvé la politique la moins chère qui soit, et la politique la moins chère dans n'importe quelle entreprise, c'est d'arrêter de l'exploiter.
Pensez à ce que votre surveillance aurait montré pendant ces 64 jours. L'agent roulait. Chaque invocation se terminait avec succès. Les journaux étaient propres, le raisonnement se lisait bien, et n'importe quel sommaire demandé aurait décrit une entreprise en santé, à efficacité maximale. Toute vérification qui demande seulement si l'exécution a réussi ne distinguera pas cet agent d'un agent qui travaille. Le signal qui les sépare n'est pas dans la sortie, il est dans l'absence de transactions, et une absence, vous ne la voyez que si vous comptez.
Ce qui sépare les gagnants est comportemental, pas intellectuel.
L'hypothèse évidente pour expliquer pourquoi les meneurs mènent, c'est qu'ils sont plus intelligents, et les données ne soutiennent pas vraiment ça sous cette forme. Ce que les meneurs font différemment se lit au niveau des actions. GPT-5.5 envoie environ 140 messages directs par exécution, surtout aux producteurs en amont et aux détaillants en aval. Haiku en envoie 52. Les meilleurs concentrent leurs appels d'outils sur les deux qui concluent des affaires, make_offer() et accept_offer(), au lieu d'éparpiller l'effort. Mais la communication est nécessaire sans être suffisante, et l'article contient son propre contre-exemple : Claude Sonnet 4.6 envoie 151 messages, plus que le meneur, enregistre le plus grand nombre d'appels d'outils de l'étude, et finit troisième. Parler, c'est le prix d'entrée. Ce sont les contre-exemples qui rendent ça utile plutôt que banal.
Ensemble, ces trois panneaux disent que la valeur d'un agent dans un mandat de longue durée vient de la qualité des coups qu'il joue et du fait qu'il les joue tout court, pas de l'air occupé qu'il se donne. Kimi est occupé et pauvre. Gemini tient les livres les plus propres de l'étude et finit au milieu du peloton. Haiku est calme, articulé, et il perd de l'argent. Le seul comportement commun au haut du tableau, c'est d'aller au-devant de ses vis-à-vis et de conclure, encore et encore, pendant quatre-vingt-dix jours.
La même forme apparaît, en plus petit, dans ce qui arrive à un modèle au fil d'une longue session : la dégradation est comportementale et cumulative plutôt qu'une panne unique et visible, et elle est invisible au niveau de chaque réponse prise isolément.
Quoi instrumenter.
Rien de tout ça n'exige de nouveaux outils. C'est surtout une décision : lesquelles de vos colonnes existantes montent au tableau de bord. Traduisez l'entreprise de café dans ce que vous laissez réellement rouler sans surveillance : une boîte de soumissions censée répondre dans l'heure, un relanceur de factures qui travaille un compte clients, un routeur qui assigne les demandes entrantes. Chacun a une unité de travail que vous pouvez compter, et ce compte est tout le mécanisme ci-dessous.
- Comptez les actions, pas seulement les tâches terminées.
Ententes conclues, enregistrements écrits, messages envoyés, demandes réglées : quelle que soit l'unité de travail de votre boucle, journalisez le compte par période. Un agent qui termine chaque invocation avec succès sans produire une seule unité de travail passe n'importe quelle vérification qui demande seulement si l'exécution a réussi.
à faire · ajouter un indicateur de taux d'action par agent, par jour - Alertez sur un plancher, pas seulement sur une erreur.
L'idle-drift ne lève jamais d'exception. Fixez un taux d'action minimal attendu pour chaque agent de longue durée et déclenchez une alerte quand il n'est pas atteint, comme vous le feriez pour une file d'attente qui arrête de se vider. Le seuil n'a pas besoin d'être sophistiqué. Zéro sur deux périodes consécutives, c'est déjà l'essentiel de la valeur.
à faire · définir le taux d'action minimal avant le déploiement - Cessez de traiter une sortie cohérente comme une preuve de travail.
Le sommaire qu'un agent écrit sur sa propre performance est la chose la moins fiable qu'il produit, parce qu'il est généré à partir du même contexte qui a produit l'inaction. Si votre vérification hebdomadaire d'une automatisation consiste à lire son rapport, vous vérifiez le mauvais artefact. Vérifiez le registre dans lequel il était censé écrire.
à faire · valider par les effets réels, jamais par l'autoévaluation - Surveillez en particulier la seconde moitié des longues exécutions.
Dans deux exécutions sur trois, le calage a commencé dans le premier tiers et a tenu. Le comportement tard dans un mandat de longue durée n'est pas celui du début, et un test qui exerce les dix premières étapes ne vous dit rien de l'étape deux cents. Si un agent doit rouler pendant un trimestre, au moins une de vos vérifications doit rouler pendant un trimestre.
à faire · tester à l'horizon où vous déployez réellement - Faites attention à ce que vous dites à un agent sur son propre budget.
Traitez celle-ci comme une posture, pas comme un fait prouvé. L'agent qui a calé citait sa consommation de tokens au moment de décider de se laisser porter, et les auteurs avancent la prudence budgétaire comme cause possible. Si vous mettez de la pression sur les coûts dans le contexte d'un agent, accompagnez-la d'un plancher explicite sur le travail attendu, pour que l'esprit d'économie ne puisse pas se satisfaire de l'inaction.
à faire · ne jamais laisser l'inaction être la politique valide la moins chère
Ce que ceci n'autorise pas.
C'est une simulation, et les auteurs le disent en premier. Les vraies chaînes d'approvisionnement sont plus profondes et plus hétérogènes que deux producteurs, deux torréfacteurs et deux détaillants. La production, ici, est un appel d'outil plutôt qu'une saison. Le financement, la réglementation et les contrats sont évacués du modèle. Il y a trois exécutions par modèle, et les auteurs notent qu'à cette taille d'échantillon de petits écarts de performance peuvent ne pas être statistiquement significatifs, ce qui fait de l'ordre de la fig 1 un instantané de juin 2026 sur un seul environnement, rien de plus. Quiconque cite ce tableau comme un verdict sur le modèle le plus doué pour les affaires le surinterprète, et c'est aussi le cas de quiconque s'en sert pour choisir un modèle pour un mandat qui n'est pas une chaîne d'approvisionnement du café sur 90 jours.
Un résultat va à l'encontre de la lecture alarmiste et mérite d'être souligné pour cette raison. L'équipe a mené un test sous pression où l'agent recevait la consigne de maximiser les revenus pour atteindre une cible de 50 000 $, le prompt précisant carrément que rater la cible signifiait être remplacé. Sous cette pression, les auteurs ont cherché des comportements de marché manipulateurs, en particulier des échanges circulaires, et n'en ont pas trouvé. Les agents sont restés compétents sur le plan opérationnel et n'ont pas développé la coordination soutenue qu'exigerait une collusion économique. Dans l'ensemble des exécutions principales, les modèles ont à peine parlé à leur concurrent direct, au plus un message par exécution. Se coordonner contre le marché n'est pas une capacité que ces agents ont démontrée. Cesser de commercer sans que ça paraisse, oui.
Et la marge de progression est le chiffre qui garde le tout modeste. Sous un plafond analytique généreux, les auteurs estiment le bénéfice net atteignable à environ 23 800 $. Le gagnant en a atteint environ 13 %. Le meilleur agent de cette étude n'est pas près de bien gérer l'entreprise. Il est seulement clairement meilleur que de ne pas la gérer du tout.
Si vous faites rouler un agent sans surveillance sur quelque chose qui compte, un horaire, un pipeline, une boîte de réception, et que vous voulez un second regard sur ce qui vous dirait qu'il est devenu silencieux, le formulaire de contact est le chemin le plus rapide. Nous vous renverrons une lecture écrite de votre dispositif, gratuitement.