← Le LiveIA CODE LIVE
ARTICLE Par

Évaluer les coding agents exige désormais des trajectoires longues et des environnements adaptatifs

Illustration éditoriale — Évaluer les coding agents exige désormais des trajectoires longues et des environnements adaptatifs

L’évaluation ne porte plus seulement sur un modèle isolé : MLPerf Inference 6.1 ajoute un benchmark Edge Agentic qui rejoue des trajectoires multi-tour de coding et un test RAG de bout en bout. Sur Jetson AGX Thor, NVIDIA montre que ce format révèle aussi les optimisations de runtime, avec 96 % des tokens de prompt servis depuis le cache.

Android Bench 2.0 déplace aussi l’évaluation vers des tâches de plusieurs jours : migrations, nouvelles fonctions, applications complètes et portages. Google abandonne le simple succès binaire au profit d’un taux d’achèvement continu ; le meilleur pass rate sur ces tâches longues tombe autour de 28 %, malgré des scores proches de 91 % sur les anciennes tâches.

EnvHarness pousse la logique un cran plus loin : l’environnement lui-même s’adapte aux faiblesses observées sans modifier le dépôt ni son vérificateur. Le framework change états initiaux, observations ou règles externes, puis valide que la tâche reste solvable. Pour les développeurs, benchmark, harness et environnement deviennent donc des composants versionnés du workflow d’évaluation.

Références

Sources

Chaque onglet présente la publication d’origine et son lien direct.

MLCommons

MLCommons Sets Participation Record with New MLPerf Inference v6.1 Benchmark Results

MLCommons annonce MLPerf Inference 6.1, qui ajoute un test RAG de bout en bout et un benchmark Edge Agentic fondé sur des trajectoires multi-tour de coding, un historique croissant, un flux single-stream, des métriques de latence et des contrôles de précision intégrés.

Ouvrir la source ↗