← Le LiveIA CODE LIVE
ARTICLE Par

Le coût des agents se joue désormais dans leur harnais autant que dans leur modèle

Illustration éditoriale — Le coût des agents se joue désormais dans leur harnais autant que dans leur modèle

Le coût d’un agent de code se déplace du modèle vers le logiciel qui l’entoure. Des comparaisons récentes montrent qu’un même modèle peut consommer des volumes de tokens très différents selon son agent harness, son prompt système, ses outils, son nombre de tours et la façon dont le cache est exploité.

Cette couche devient aussi entraînable. EvoHarness-RL, présenté par des chercheurs de Meta et de l’Université de l’Illinois, apprend à un modèle quand lire, mettre à jour ou consolider son état externe. Sur ALFWorld, Qwen3-8B atteint 96,9 % de réussite, contre 47,9 % pour la base ReAct.

Pour les équipes, choisir un modèle ne suffit donc plus à prévoir qualité, latence ou facture. Les benchmarks cités par The New Stack et TechGig montrent des écarts de coût par tâche réussie et de consommation de tokens selon le harness. La prochaine optimisation porte sur le contexte envoyé, le cache et les boucles d’exécution.

Références

Sources

Chaque onglet présente la publication d’origine et son lien direct.

VentureBeat

Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tag

VentureBeat présente EvoHarness-RL, développé par Meta AI et l’Université de l’Illinois. Le système apprend au modèle quand lire, mettre à jour ou consolider son état externe et rapporte 96,9 % de réussite sur ALFWorld avec Qwen3-8B.

Ouvrir la source ↗