Le coût des agents se joue désormais dans leur harnais autant que dans leur modèle
Le coût d’un agent de code se déplace du modèle vers le logiciel qui l’entoure. Des comparaisons récentes montrent qu’un même modèle peut consommer des volumes de tokens très différents selon son agent harness, son prompt système, ses outils, son nombre de tours et la façon dont le cache est exploité.
Cette couche devient aussi entraînable. EvoHarness-RL, présenté par des chercheurs de Meta et de l’Université de l’Illinois, apprend à un modèle quand lire, mettre à jour ou consolider son état externe. Sur ALFWorld, Qwen3-8B atteint 96,9 % de réussite, contre 47,9 % pour la base ReAct.
Pour les équipes, choisir un modèle ne suffit donc plus à prévoir qualité, latence ou facture. Les benchmarks cités par The New Stack et TechGig montrent des écarts de coût par tâche réussie et de consommation de tokens selon le harness. La prochaine optimisation porte sur le contexte envoyé, le cache et les boucles d’exécution.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tag
VentureBeat présente EvoHarness-RL, développé par Meta AI et l’Université de l’Illinois. Le système apprend au modèle quand lire, mettre à jour ou consolider son état externe et rapporte 96,9 % de réussite sur ALFWorld avec Qwen3-8B.
Aider, Claude Code, and OpenClaw ran an identical model. Token use varied 70-fold.
The New Stack rapproche trois benchmarks de harnesses et montre que, modèle identique, le prompt système, le nombre de tours, le cache et le chemin de serving peuvent multiplier fortement tokens et coût par tâche réussie.
AI Coding Agent Costs: Harness Software Drives 70-Fold Token Variation
TechGig synthétise plusieurs comparaisons où le même modèle est exécuté sous différents harnesses. L’article insiste sur le coût par résultat vérifié, le poids du prompt initial, le taux de cache et les écarts de réussite entre orchestrateurs.