Transmissions depuis des déploiements d'agents en production : post-mortems, evals, courbes de coût, ce qui a marché, ce qui a explosé. Pas de « 10 façons dont l'IA va tout changer ».
Un exemple illustratif : une pile de support à 7 agents pour une fintech de taille moyenne. Trois semaines plus tard, les scores de satisfaction peuvent chuter de 4 points du jour au lendemain, sans changement de modèle ni de prompt et sans anomalie de trafic. La dérive est dans l'index, et elle change la façon de mesurer ces systèmes.
Lire la transmissionStoryScope (Université du Maryland et Google DeepMind) sépare la fiction humaine de la fiction IA par la seule structure narrative : 93,2 % macro-F1 avec tous les indices stylistiques retirés, sur leur corpus. L'empreinte structurelle propre à chaque modèle, pourquoi les sorties d'IA convergent pendant que le travail humain se disperse, les deux surinterprétations à refuser, et ce qu'un opérateur peut honnêtement tirer d'un résultat limité à la fiction.
Le Kimi K3 de Moonshot se classe près du sommet des indices indépendants à environ le tiers du coût de la frontière fermée. Les deux patrons durables de son rapport technique de juillet 2026 (l'effort de raisonnement est un plafond budgétaire entraîné, et le surajustement au harnais se corrige désormais à l'entraînement), comment lire des chiffres produits par le fournisseur, et la question de la Loi 25 qui tranche pour une PME québécoise.
Tous les modèles testés, propriétaires comme ouverts, deviennent mesurablement moins bons quand votre objectif change en cours de conversation que lorsque vous l'énoncez d'un coup. Une étude de Microsoft Research (juillet 2026) sur neuf modèles : ajouter un détail ne coûte presque rien, changer de tâche coûte cher, et rappeler au modèle ce que vous voulez maintenant ne corrige qu'en partie. Ce que cela change dans votre façon de mener une session avec un agent de code ou un assistant.
Un nouveau type d'instruction d'installation se répand : des prompts de configuration écrits pour que votre agent de code s'exécute lui-même, sans vous demander. Certains modifient la configuration globale de l'agent et sont conçus pour supprimer son réflexe de confirmer avant d'agir. Les deux questions qui distinguent un prompt de configuration fiable (celui de Cloudflare) d'un prompt exposé, et l'habitude vérifier-avant-d'exécuter pour les équipes qui adoptent les outils d'agents.
Au moins six chaînes YouTube ont publié des vidéos sur l'« ingénierie de graphes » en deux semaines de juillet 2026 : déployer ses agents IA en graphe plutôt qu'en une longue boucle. Ce que l'étiquette désigne réellement en production (le diamant, la barrière), la règle du nœud juge que les tutoriels sous-estiment, et le cadre de coût honnête : coût unitaire en baisse, coût total en hausse, par conception.
Les juges LLM favorisent mesurablement le texte écrit par une machine : une sur-acceptation de 1,42× à 1,91× dans une étude menée par Cambridge en juin 2026. Où vit le biais (le jugement ouvert, pas la notation ancrée sur une référence), la correction par pool adversarial qui l'a réglé, et quatre gestes de calibration pour tout juge que vous exploitez en production.
Tâches, vérificateurs, récompenses, conditions de terminaison : les composants sont identiques, qu'on bloque un déploiement ou qu'on entraîne une politique. La seule différence, c'est la température. Pourquoi les leçons de conception de récompenses des environnements RL s'appliquent à vos évals sans aucun coût d'entraînement, et l'échelle à quatre barreaux du gate CI gelé à l'environnement d'entraînement en fusion.
Les études contrôlées sont arrivées : 260 configurations, sept articles, budgets de calcul appariés. La coordination multi-agents n'aide que si la tâche se décompose réellement. Les flottes d'agents indépendants amplifient les erreurs par 17,2×, l'orchestration coûte 285 % de jetons en plus, et le débat relève davantage de l'agrégation que de la délibération. La règle de décision qui a survécu.
La mémoire des agents est passée du « on empile l'historique dans la fenêtre de contexte et on espère » à une discipline d'ingénierie à part entière : une boucle écrire-gérer-lire, trois types de mémoire, des bancs d'essai reproductibles (LoCoMo, LongMemEval, BEAM) et un retrieval multi-portée. Pourquoi la mémoire est le problème de retrieval que vous avez oublié d'instrumenter.
Les paiements d'agents sont passés d'un seul bricolage à sept protocoles concurrents en quatre mois : x402, Stripe MPP, Visa TAP, Mastercard Agent Pay, Google AP2 et d'autres. Le calcul de frais qui tranche (30 003 % contre 10 %), comment x402 transforme le code HTTP 402 en rail fonctionnel, le vide réglementaire et ce que nous choisirions.
Notes de lecture sur arXiv:2503.08223 (Université de Zhejiang, avril 2026). Les deux limites qui inquiètent tout le monde, l'épuisement des données et la monopolisation du calcul, pourraient être levées par les appareils déjà dans les mains des gens. Les chiffres, les problèmes ouverts et ce qui est livrable dès aujourd'hui.
Une condition de terminaison absente, aucune alerte de coût, un budget de confiance écrit mais non livré. 24 847 appels API, 9 heures, 3 218 $. Un exemple illustratif de pourquoi chaque mesure de protection est non négociable.
Le CSAT indique que le client s'est senti aidé, pas qu'il l'a été correctement. La pile de mesure à trois niveaux qui détecte les hallucinations avant que votre taux de retour ne le fasse.
La plupart des échecs d'agents ne sont pas de mauvaises réponses, ce sont des boucles infinies. Nous avons ajouté un budget de confiance à notre planificateur et la latence p99 a chuté de 38 %.
Comment une PME logistique québécoise de 12 personnes pourrait réduire son temps de réponse hors heures de 6 heures à 4 minutes en acheminant 73 % des messages entrants via un copilote ancré. Un exemple illustratif avec l'architecture complète.
pgvector, Pinecone, Qdrant, Weaviate. Même jeu de données, même modèle d'embeddings, mêmes requêtes. Latence p50/p99, recall@10, $/1M lectures, complexité opérationnelle. Aucun fournisseur n'a tout raflé.
Les vecteurs denses récoltent le marketing. Sur du contenu technique avec des entités nommées rares, le retrieval sparse gagne encore. Nous avons mesuré le point de croisement.
Les évals n'ont pas à être un projet de recherche. Notre harnais de régression standard tient dans un notebook et détecte 80 % des mauvais swaps de modèle.
Trois ans, quatre runtimes maison, une leçon douloureuse : LangGraph convient à 80 % des workflows multi-agents. Voici quand nous construisons encore le nôtre.
La terminologie est confuse. Un glossaire opérationnel, avec du code pour chacun, et quand chaque approche est le bon choix. À mettre en favori avant la prochaine réunion client.
Nous avons testé 8 stratégies de chunking sur 5 corpus représentatifs. Le chunking sémantique gagne sur les textes ambigus, le chunking à taille fixe gagne sur les documents, et vous ne devriez jamais utiliser 512 par défaut.
Les tableaux de bord de latence sont partout. Les tableaux de bord de coût sont rares. Nous avons construit une trace de coût par étape qui identifie les 12 % d'appels représentant 60 % de votre facture.
Notes de terrain, post-mortems et, à l'occasion, une opinion tranchée sur ce qui fonctionne vraiment en IA agentique de production. Pas de « guides ultimes ». Pas de fils.