Un test réussi ne prouve pas qu’un agent a bien transformé le code
Les agents de code commencent à être jugés sur la transformation réellement accomplie, pas seulement sur une suite verte. SWE Refactor Bench audite d’abord la migration, teste ensuite le comportement, puis lance six agents vérificateurs. Sur 520 essais, seuls 28 franchissent les trois étages, révélant combien un succès apparent masque encore les contournements.
Cette exigence descend aussi dans les outils quotidiens. Laravel Boost ajoute une skill qui indique aux agents quoi tester, quand s’arrêter et comment éviter les tests redondants ou fragiles. L’objectif n’est plus de produire davantage de tests, mais de transformer les critères d’acceptation en contraintes explicites avant que l’agent ne déclare sa tâche terminée.
La vérification déborde enfin du code vers l’exécution elle-même. TRACE propose un reçu signé qui relie modèle, environnement matériel, politique, classes de données et appels d’outils, vérifiable sans faire confiance à l’opérateur. Le pipeline émergent combine donc audit de transformation, tests comportementaux et preuve d’exécution, au lieu d’un verdict binaire fourni par l’agent.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
Le papier présente SWE Refactor Bench, vingt migrations complètes de dépôts évaluées en trois étapes : audit de la migration, tests comportementaux et vérification agentique. Seulement 28 des 520 exécutions testées réussissent l’ensemble, et treize tâches ne reçoivent aucune solution acceptée.
Laravel Boost now includes a skill for testing best practices
Le message de Taylor Otwell annonce une skill Laravel Boost consacrée aux bonnes pratiques de test. Elle indique aux agents ce qu’ils doivent tester, quand s’arrêter et comment éviter des tests redondants ou fragiles, en s’adaptant à Pest, PHPUnit, aux tests navigateur et aux outils déjà installés.
Show HN: A portable evidence record for what an AI agent ran
Le Show HN présente TRACE comme un format portable de preuve sur l’exécution d’un agent. La publication relie la démonstration à la documentation du projet et a recueilli 3 points et 1 commentaire lors de la veille.
Hardware-attested receipts for AI agent actions
La documentation de TRACE décrit un enregistrement signé dans un environnement matériel attesté. Il conserve le modèle, la politique, la classe de données et l’empreinte des appels d’outils, puis permet à un tiers de vérifier ces éléments sans faire confiance à l’opérateur.