FLUX · EN DIRECT v3.2.1 QC · CA EN
notes-terrain/flux · 23 transmissions · cadence aux deux semaines
--:--:-- UTC
QUEBEC · 46.81°N -71.21°W
racine · notes-terrain · /flux

Notes de terrain /
en production.

Transmissions depuis des déploiements d'agents en production : post-mortems, evals, courbes de coût, ce qui a marché, ce qui a explosé. Pas de « 10 façons dont l'IA va tout changer ».

billets23
contributeurs8
dernière publication2026·08·15
temps de lecture moyen~10 min
révisé parJ.P. Levac
cadenceaux deux semaines
filtrer ·
À la une · transmission 018

Pourquoi votre pipeline RAG se dégrade en silence, et comment nous l'avons détecté à la semaine 3.

Un exemple illustratif : une pile de support à 7 agents pour une fintech de taille moyenne. Trois semaines plus tard, les scores de satisfaction peuvent chuter de 4 points du jour au lendemain, sans changement de modèle ni de prompt et sans anomalie de trafic. La dérive est dans l'index, et elle change la façon de mesurer ces systèmes.

JP Jean Pierre Levac
2026·05·14 11m de lecture ● RAG · evals
Lire la transmission
§ flux · toutes les transmissions

Récents / chronologique

22 billets · du plus récent au plus ancien
tx · 031 ops

Le signe distinctif de l'IA est structurel : enlevez le style, l'écriture reste reconnaissable.

StoryScope (Université du Maryland et Google DeepMind) sépare la fiction humaine de la fiction IA par la seule structure narrative : 93,2 % macro-F1 avec tous les indices stylistiques retirés, sur leur corpus. L'empreinte structurelle propre à chaque modèle, pourquoi les sorties d'IA convergent pendant que le travail humain se disperse, les deux surinterprétations à refuser, et ce qu'un opérateur peut honnêtement tirer d'un résultat limité à la fiction.

tx · 030 infra

Le palier ouvert coûte maintenant trois fois moins. Refaites vos calculs de modèles.

Le Kimi K3 de Moonshot se classe près du sommet des indices indépendants à environ le tiers du coût de la frontière fermée. Les deux patrons durables de son rapport technique de juillet 2026 (l'effort de raisonnement est un plafond budgétaire entraîné, et le surajustement au harnais se corrige désormais à l'entraînement), comment lire des chiffres produits par le fournisseur, et la question de la Loi 25 qui tranche pour une PME québécoise.

tx · 029 agents

Votre IA devient mesurablement moins bonne quand vous changez d'idée.

Tous les modèles testés, propriétaires comme ouverts, deviennent mesurablement moins bons quand votre objectif change en cours de conversation que lorsque vous l'énoncez d'un coup. Une étude de Microsoft Research (juillet 2026) sur neuf modèles : ajouter un détail ne coûte presque rien, changer de tâche coûte cher, et rappeler au modèle ce que vous voulez maintenant ne corrige qu'en partie. Ce que cela change dans votre façon de mener une session avec un agent de code ou un assistant.

tx · 028 agents

Le prompt de configuration s'adresse à votre IA, pas à vous.

Un nouveau type d'instruction d'installation se répand : des prompts de configuration écrits pour que votre agent de code s'exécute lui-même, sans vous demander. Certains modifient la configuration globale de l'agent et sont conçus pour supprimer son réflexe de confirmer avant d'agir. Les deux questions qui distinguent un prompt de configuration fiable (celui de Cloudflare) d'un prompt exposé, et l'habitude vérifier-avant-d'exécuter pour les équipes qui adoptent les outils d'agents.

tx · 027 agents

L'ingénierie de graphes : le nouveau nom d'un travail que nous menons déjà.

Au moins six chaînes YouTube ont publié des vidéos sur l'« ingénierie de graphes » en deux semaines de juillet 2026 : déployer ses agents IA en graphe plutôt qu'en une longue boucle. Ce que l'étiquette désigne réellement en production (le diamant, la barrière), la règle du nœud juge que les tutoriels sous-estiment, et le cadre de coût honnête : coût unitaire en baisse, coût total en hausse, par conception.

tx · 026 ops

Votre juge IA corrige sa propre copie.

Les juges LLM favorisent mesurablement le texte écrit par une machine : une sur-acceptation de 1,42× à 1,91× dans une étude menée par Cambridge en juin 2026. Où vit le biais (le jugement ouvert, pas la notation ancrée sur une référence), la correction par pool adversarial qui l'a réglé, et quatre gestes de calibration pour tout juge que vous exploitez en production.

tx · 025 ops

Votre harnais d'évaluation est un environnement RL gelé.

Tâches, vérificateurs, récompenses, conditions de terminaison : les composants sont identiques, qu'on bloque un déploiement ou qu'on entraîne une politique. La seule différence, c'est la température. Pourquoi les leçons de conception de récompenses des environnements RL s'appliquent à vos évals sans aucun coût d'entraînement, et l'échelle à quatre barreaux du gate CI gelé à l'environnement d'entraînement en fusion.

tx · 024 agents

Multiplier les agents n'a, pour l'essentiel, pas survécu à la production.

Les études contrôlées sont arrivées : 260 configurations, sept articles, budgets de calcul appariés. La coordination multi-agents n'aide que si la tâche se décompose réellement. Les flottes d'agents indépendants amplifient les erreurs par 17,2×, l'orchestration coûte 285 % de jetons en plus, et le débat relève davantage de l'agrégation que de la délibération. La règle de décision qui a survécu.

tx · 023 RAG

Votre agent est amnésique. La mémoire est devenue une discipline d'ingénierie à part entière.

La mémoire des agents est passée du « on empile l'historique dans la fenêtre de contexte et on espère » à une discipline d'ingénierie à part entière : une boucle écrire-gérer-lire, trois types de mémoire, des bancs d'essai reproductibles (LoCoMo, LongMemEval, BEAM) et un retrieval multi-portée. Pourquoi la mémoire est le problème de retrieval que vous avez oublié d'instrumenter.

tx · 022 infra

Votre agent a besoin d'un portefeuille. Sept protocoles veulent l'être.

Les paiements d'agents sont passés d'un seul bricolage à sept protocoles concurrents en quatre mois : x402, Stripe MPP, Visa TAP, Mastercard Agent Pay, Google AP2 et d'autres. Le calcul de frais qui tranche (30 003 % contre 10 %), comment x402 transforme le code HTTP 402 en rail fonctionnel, le vide réglementaire et ce que nous choisirions.

tx · 021 infra

Le mur du scaling est réel. La solution est peut-être dans votre poche.

Notes de lecture sur arXiv:2503.08223 (Université de Zhejiang, avril 2026). Les deux limites qui inquiètent tout le monde, l'épuisement des données et la monopolisation du calcul, pourraient être levées par les appareils déjà dans les mains des gens. Les chiffres, les problèmes ouverts et ce qui est livrable dès aujourd'hui.

tx · 020 agents

Post-mortem : la boucle qui a coûté 3 200 $ en une nuit.

Une condition de terminaison absente, aucune alerte de coût, un budget de confiance écrit mais non livré. 24 847 appels API, 9 heures, 3 218 $. Un exemple illustratif de pourquoi chaque mesure de protection est non négociable.

tx · 019 ops

Votre agent service client a une note de 4,2 étoiles. Son taux d'hallucination est aussi de 8 %.

Le CSAT indique que le client s'est senti aidé, pas qu'il l'a été correctement. La pile de mesure à trois niveaux qui détecte les hallucinations avant que votre taux de retour ne le fasse.

tx · 017 agents

Construire un planificateur d'agent qui sait s'arrêter.

La plupart des échecs d'agents ne sont pas de mauvaises réponses, ce sont des boucles infinies. Nous avons ajouté un budget de confiance à notre planificateur et la latence p99 a chuté de 38 %.

tx · 016 scénario

Exemple illustratif : une équipe ops de 12 personnes, une boîte de réception 24/7, un seul agent.

Comment une PME logistique québécoise de 12 personnes pourrait réduire son temps de réponse hors heures de 6 heures à 4 minutes en acheminant 73 % des messages entrants via un copilote ancré. Un exemple illustratif avec l'architecture complète.

tx · 015 infra

Comparatif bases vectorielles : quatre solutions testées sur 1,2 million de chunks.

pgvector, Pinecone, Qdrant, Weaviate. Même jeu de données, même modèle d'embeddings, mêmes requêtes. Latence p50/p99, recall@10, $/1M lectures, complexité opérationnelle. Aucun fournisseur n'a tout raflé.

tx · 014 RAG

Retrieval hybride : quand BM25 bat votre modèle d'embeddings à 400 $.

Les vecteurs denses récoltent le marketing. Sur du contenu technique avec des entités nommées rares, le retrieval sparse gagne encore. Nous avons mesuré le point de croisement.

tx · 013 ops

La suite d'éval en 6 lignes que nous livrons avec chaque agent.

Les évals n'ont pas à être un projet de recherche. Notre harnais de régression standard tient dans un notebook et détecte 80 % des mauvais swaps de modèle.

tx · 012 agents

Pourquoi nous avons (presque) arrêté de construire des orchestrateurs custom.

Trois ans, quatre runtimes maison, une leçon douloureuse : LangGraph convient à 80 % des workflows multi-agents. Voici quand nous construisons encore le nôtre.

tx · 011 agents

Tool calling, function calling, agents : les vraies différences.

La terminologie est confuse. Un glossaire opérationnel, avec du code pour chacun, et quand chaque approche est le bon choix. À mettre en favori avant la prochaine réunion client.

tx · 010 RAG

Le chunking est un hyperparamètre. Optimisez-le.

Nous avons testé 8 stratégies de chunking sur 5 corpus représentatifs. Le chunking sémantique gagne sur les textes ambigus, le chunking à taille fixe gagne sur les documents, et vous ne devriez jamais utiliser 512 par défaut.

tx · 009 infra

0,0004 $ par étape d'agent : comment nous avons fait du coût une métrique prioritaire.

Les tableaux de bord de latence sont partout. Les tableaux de bord de coût sont rares. Nous avons construit une trace de coût par étape qui identifie les 12 % d'appels représentant 60 % de votre facture.

Reçu dans votre
boîte / aux deux semaines.

Notes de terrain, post-mortems et, à l'occasion, une opinion tranchée sur ce qui fonctionne vraiment en IA agentique de production. Pas de « guides ultimes ». Pas de fils.

désabonnement en 1 clic jamais de pourriel

© 2026 Acceleratech · notes-terrain · v3.2.1 ← retour à la racine Une Stratégie de croissance numérique par Groupe de Croissance Numérique JPL.