Les garde-fous d’agents combinent jugement LLM et validations déterministes
Un modèle juge s’insère désormais directement dans le workflow d’un agent. UiPath propose depuis le 7 septembre son garde-fou « LLM as Judge », qui évalue prompts, réponses ou appels LLM selon des instructions métier en langage naturel. Chaque contrôle devient un appel LLM distinct, mesuré et facturé séparément.
PatchBench montre pourquoi ce jugement doit être doublé de vérifications déterministes. Sur onze agents de correction de vulnérabilités, un test limité au PoC gonfle le taux de réussite de 1,83 fois : avec validation de sécurité puis de comportement, les meilleurs agents tombent d’au-dessus de 97 % à environ la moitié des tâches.
Le même déplacement apparaît côté production. MarketScale rapporte que les entreprises poussent désormais contrôles d’accès, journalisation et tests continus jusque dans la couche données, parce que connecteurs, permissions et outils évoluent après déploiement. Pour les développeurs, un score final ne suffit plus : il faut des garde-fous exécutés pendant tout le workflow.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
Agents - September 2026
UiPath ajoute en preview le garde-fou « LLM as Judge », qui évalue prompts, réponses ou appels LLM selon des instructions en langage naturel. Chaque contrôle déclenche un appel LLM distinct et sa consommation est suivie séparément, y compris pendant les runs d’évaluation.
PatchBench: Evaluating AI Agents for Vulnerability Patching
PatchBench montre que la validation d’un correctif par un seul PoC surestime fortement les performances des agents. Le benchmark ajoute des contrôles de sécurité et de correction sémantique, tout en réduisant les effets de mémorisation de correctifs historiques.
AI agents are pushing access controls and testing into the data layer
MarketScale rapporte que la gouvernance des agents se déplace vers la couche données et que les tests doivent continuer après déploiement. Les changements de connecteurs, permissions et API imposent monitoring, régressions et mécanismes de retour arrière.