Si vous exploitez des LLM en production, vous exploitez presque certainement un juge LLM quelque part : un modèle qui note la sortie d'un autre modèle et décide de ce qui passe. Un article de juin 2026 a mesuré ce que fait ce juge quand personne ne ventile ses verdicts par auteur, et la réponse devrait changer la façon dont vous exploitez le vôtre.
Tout le monde a un juge maintenant.
Un juge filtre les brouillons de blogue avant qu'un humain les voie. Un juge note les réponses de support pour le ton et l'exactitude. Un juge révise le code généré avant qu'il atteigne la pull request. Un juge classe des prospects, note des résumés, filtre de la prospection. Le patron s'est répandu parce qu'il fonctionne et qu'il ne coûte rien : un appel de modèle remplace une file de révision humaine.
Mais il porte une faiblesse structurelle que la plupart des équipes ne mesurent jamais : le juge et le travail qu'il juge sortent du même type de système. Et il s'avère que ça compte, dans une direction mesurable.
Un biais mesuré : 1,42× à 1,91×.
L'équipe menée par Cambridge a construit des agents rédacteurs auto-améliorants et utilisé des réviseurs LLM pour noter leur production contre un banc d'essai de vraies décisions d'acceptation et de refus d'articles scientifiques. Leur réviseur conventionnel le plus fort paraissait bien sur la précision brute. Puis ils ont ventilé son taux d'acceptation selon qui avait écrit l'article.
Le réviseur acceptait les articles générés par IA à un taux de 1,42× à 1,91× celui des articles écrits par des humains.[1] Même réviseur, même grille, même banc d'essai. Le biais a un nom dans la littérature : l'auto-préférence, documentée à NeurIPS 2024 sous le titre « LLM evaluators recognize and favor their own generations ».[2] Ce que le nouvel article ajoute, c'est ce que le biais fait à l'intérieur d'une boucle de production, et une correction qui fonctionne.
Arrêtez-vous sur ce que ça signifie en exploitation. Si votre juge filtre du contenu, son taux de passage sur les brouillons IA est gonflé par rapport à ce qu'un réviseur humain laisserait passer. Si votre juge note un agent dont vous ajustez sans cesse les prompts, l'agent apprend à plaire à un correcteur qui penche déjà vers la production à saveur machine. La boucle optimise vers le biais.
Le jugement ouvert est la surface exposée.
Le même article a fait tourner un second juge dans un autre domaine, et le contraste est le fait de conception le plus utile qu'il contient. Leur correcteur de preuves mathématiques était conditionné sur une solution de référence : il jugeait chaque preuve contre une réponse correcte connue, étape par étape. Ce correcteur montrait peu d'auto-préférence et s'est amélioré sans correction particulière. Le réviseur d'articles n'avait pas de réponse de référence. Il jugeait chaque article sur sa propre valeur, sur la plausibilité et le poli. C'est là que vivait le biais.[1]
La distinction pratique : la notation ancrée sur une référence est largement à l'abri; le jugement ouvert est exposé. « Est-ce que cette sortie respecte le devis, la réponse de référence, la liste de vérification » est une comparaison. « Est-ce que c'est bon » est une affaire de goût, et le goût d'un LLM est entraîné sur la même distribution que celle qui a généré le travail qu'il juge. La fluidité à saveur machine se lit comme de la qualité pour une machine.
La plupart des juges de production sont du genre exposé. « Note ce brouillon de 1 à 10 pour la qualité. » « Approuverais-tu cette réponse? » Si le prompt de votre juge ne contient aucun artefact de référence, présumez que le biais s'applique à vous. (C'est la même préoccupation d'indépendance du correcteur que la note sur l'environnement gelé signalait du côté RL, maintenant avec une ampleur chiffrée.)
Ancrer, récolter, renoter.
La correction de l'article a trois volets, et les trois se transposent sous l'échelle de la recherche.
D'abord, l'ancre. L'équipe n'a jamais laissé un juge se noter lui-même jusqu'au poste. Un juge n'était promu qu'en battant le juge en place sur un ensemble fixe et réservé d'étiquettes de vérité terrain : de vraies décisions humaines d'acceptation et de refus qu'aucun juge ne pouvait toucher. La précision contre l'ancre, pas l'impression, décidait quel juge menait la ronde suivante.
Ensuite, le pool adversarial. Quand un juge était remplacé, les articles générés par IA que l'ancien juge avait acceptés à tort étaient rassemblés dans un pool explicite, et le juge suivant était récompensé en plus pour les rejeter, tout en restant tenu à la précision sur l'ancre. En pratique : les fausses acceptations de votre prédécesseur deviennent votre test de régression. Le réviseur corrigé a cédé un peu de précision brute au banc d'essai et a acheté de la calibration avec : des taux d'acceptation similaires sur le texte humain et machine, 80 % de précision sur la vérité terrain conservée.[1]
Enfin, l'effacement. Quand le juge changeait, chaque verdict rendu par l'ancien juge était jeté, et le travail touché était renoté sous le nouveau juge. L'équipe a fait tourner un contrôle qui gardait les notes périmées. Il n'a jamais rien reclassé : l'ancien ordre restait figé et le nouveau critère, plus strict, ne prenait jamais effet. Les historiques de verdicts mélangés ne se fondent pas. Ils vous épinglent aux erreurs de l'ancien juge.
juge v1
pendant qu'il tourne
recueillir
production du cycle
ancre
étiquetée par humains
si elle gagne
pool adversarial
verdicts v1
mélanger les historiques
Quatre gestes pour le juge que vous exploitez déjà.
Vous n'avez pas besoin d'une boucle de recherche évolutionnaire pour utiliser tout ça. Les gestes ci-dessous sont notre traduction à l'échelle du prompt, le genre de juge qui vit dans un prompt système et une tâche cron. L'article n'a pas testé à cette échelle; la logique se transpose, les chiffres précis, non.
- Construisez une ancre avant de croire un verdict.
Vingt à cinquante exemples étiquetés par un humain dont vous défendriez le jugement, réservés à l'écart de tout. Mesurez le juge contre l'ancre, et rapportez deux chiffres, pas un : la précision, et l'écart de taux d'acceptation entre les éléments écrits par humain et écrits par IA. Le second chiffre est celui que personne ne regarde, et c'est là que se cache le 1,42× à 1,91×. Une forme illustrative : un juge qui filtre des brouillons de prospection pourrait afficher 84 % de précision sur l'ancre et un penchant machine de 1,6×. Le premier chiffre dit « livrez ». Le second dit qu'il abaisse tranquillement votre barre.
cible · précision ET ventilation par auteur, rapportées ensemble - Récoltez les fausses acceptations dans un ensemble adversarial.
Chaque fois que vous révisez le prompt du juge ou changez son modèle, rassemblez les éléments que l'ancien juge a laissés passer et qu'un humain a ensuite signalés. Les rejeter devient une partie du test d'acceptation du nouveau juge, aux côtés de l'ancre. Attendez-vous à ce que la calibration coûte un peu de précision brute. Cet échange, c'est la correction qui fonctionne, pas une régression.
cible · fausses acceptations de l'ancien juge = test de régression du nouveau - Versionnez le juge comme un modèle, parce que c'en est un.
Un juge, c'est prompt + modèle + grille. Changez l'un des trois et les anciens verdicts cessent d'être comparables aux nouveaux. Ne les moyennez pas dans un tableau de bord, ne gardez pas les seuils constants à travers le changement, et si une décision dépend d'anciennes notes, renotez sous le juge courant. La condition de contrôle de l'article est l'avertissement : les historiques mélangés ont épinglé le système aux erreurs du juge déchu, en permanence.
cible · une version de juge par historique de verdicts, aucun mélange - Donnez une référence au juge chaque fois qu'il en existe une.
Notez contre le devis, la spécification, la liste de vérification, l'exemple approuvé, pas contre « est-ce que c'est bon ». La notation ancrée sur une référence était le cas à l'abri dans les données de l'article. La notation ouverte est là où vit l'auto-préférence : réservez-la aux décisions où rien de mieux n'existe, et remettez l'humain dans la boucle à cet endroit. (Le juge inter-famille de la note sur les métriques de qualité, Haiku qui juge Sonnet, attaque le même biais par l'axe du modèle; ce geste-ci l'attaque par l'axe de la grille.)
cible · la comparaison plutôt que le goût, partout où une référence existe
Encadré : l'évaluation, c'était la facture.
Un dernier résultat qui vaut la peine de sortir de l'article : dans leur système, générer le travail coûtait peu et le juger coûtait cher, environ quatre dollars sur cinq. Quand ils ont acheminé les appels à haut volume vers un petit modèle en gardant le modèle coûteux là où le jugement se concentre, le coût à prix équivalent a chuté d'environ 13× à qualité finale presque égale.[1] Leurs chiffres, leur domaine, une seule paire de modèles. Mais la forme de la leçon se transporte, et c'est la même que la note sur le coût par étape défend du côté instrumentation : avant d'optimiser le coût de votre pipeline, mesurez où la dépense d'évaluation se concentre réellement. C'est rarement là où pointe le tableau de bord.
Ce que ce résultat n'est pas.
L'article est une prépublication préliminaire et le dit lui-même. Tout a tourné sur un seul modèle à un seul réglage, sur des horizons courts, dans des domaines d'artefacts intellectuels (articles, preuves, code), sans notation humaine de la production générée. La fourchette de 1,42× à 1,91×, c'est un réviseur sur un banc d'essai, pas une constante universelle. Le penchant de votre juge pourrait être plus petit. Il pourrait être plus grand. C'est précisément pourquoi le geste numéro un est de le mesurer plutôt que d'importer un chiffre d'un article, y compris celui-ci.
Et la correction n'est pas gratuite : le réviseur calibré a payé sa justesse en précision brute. Si votre seule métrique est la précision au banc d'essai, un juge débiaisé aura l'air d'un recul. Décidez quel échec vous coûte le plus : un juge légèrement plus sévère sur tout, ou un juge qui tient tranquillement la production machine à une barre plus basse pendant que tout votre pipeline optimise dans sa direction.
Si un juge filtre quelque chose d'important dans votre pile et que vous voulez un second regard sur sa calibration, le formulaire de contact est le chemin le plus rapide. Nous faisons des revues de 30 minutes des piles d'agents en production, gratuitement.