← Le LiveIA CODE LIVE
ARTICLE Par

Les coding agents testent désormais leurs skills, instructions et harness comme du code

Illustration éditoriale — Les coding agents testent désormais leurs skills, instructions et harness comme du code

Anthropic traite désormais un plugin ou un skill comme une pièce testable du runtime. `claude plugin eval` rejoue des prompts réalistes avec puis sans le plugin, répète les cas, note outils et artefacts produits, puis peut bloquer la CI. Le gain doit être mesuré, pas seulement déduit du fait que l’instruction se charge.

Next.js applique déjà cette logique aux règles de projet. Ses Agent Evals exécutent les mêmes tâches avec et sans la documentation `AGENTS.md` : plusieurs agents passent de 81–90 % à 90–97 % de réussite. Les instructions deviennent ainsi un facteur de performance mesuré, aux côtés du modèle, de la durée et du coût.

HarnessDev pousse l’idée jusqu’au code du harness. Dans l’analyse publiée par MarkTechPost, seules 34 des 64 évolutions comparables améliorent les scores visibles et cachés dans la même direction. Pour les développeurs, prompts, skills, règles et orchestration deviennent donc des artefacts versionnés à soumettre à des jeux de tests, des seuils et un rollback.

Références

Sources

Chaque onglet présente la publication d’origine et son lien direct.

Claude Code Docs

Test plugins with evals

La documentation décrit `claude plugin eval` : des prompts réalistes sont exécutés plusieurs fois avec et sans plugin, notés par six types de graders, puis comparés par delta. Les suites peuvent fixer un seuil, un budget de coût et servir de gate dans la CI pour détecter les régressions d’un plugin ou d’un skill.

Ouvrir la source ↗