Évaluer les coding agents exige désormais des trajectoires longues et des environnements adaptatifs
L’évaluation ne porte plus seulement sur un modèle isolé : MLPerf Inference 6.1 ajoute un benchmark Edge Agentic qui rejoue des trajectoires multi-tour de coding et un test RAG de bout en bout. Sur Jetson AGX Thor, NVIDIA montre que ce format révèle aussi les optimisations de runtime, avec 96 % des tokens de prompt servis depuis le cache.
Android Bench 2.0 déplace aussi l’évaluation vers des tâches de plusieurs jours : migrations, nouvelles fonctions, applications complètes et portages. Google abandonne le simple succès binaire au profit d’un taux d’achèvement continu ; le meilleur pass rate sur ces tâches longues tombe autour de 28 %, malgré des scores proches de 91 % sur les anciennes tâches.
EnvHarness pousse la logique un cran plus loin : l’environnement lui-même s’adapte aux faiblesses observées sans modifier le dépôt ni son vérificateur. Le framework change états initiaux, observations ou règles externes, puis valide que la tâche reste solvable. Pour les développeurs, benchmark, harness et environnement deviennent donc des composants versionnés du workflow d’évaluation.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
MLCommons Sets Participation Record with New MLPerf Inference v6.1 Benchmark Results
MLCommons annonce MLPerf Inference 6.1, qui ajoute un test RAG de bout en bout et un benchmark Edge Agentic fondé sur des trajectoires multi-tour de coding, un historique croissant, un flux single-stream, des métriques de latence et des contrôles de précision intégrés.
TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor
NVIDIA détaille son exécution de MLPerf Edge Agentic avec Qwen3.6-27B sur Jetson AGX Thor : 1 007 tours en 24 min 36 s, 6,4 fois plus vite que la référence llama.cpp, avec environ 96 % des tokens de prompt servis depuis le cache chaud.
Android Bench 2.0: Pushing the frontier with challenging long-horizon tasks
Google ajoute à Android Bench des tâches de plusieurs jours, une évaluation des agents et un scoring continu. Le meilleur pass rate sur ces tâches longues est d’environ 28 %, contre près de 91 % sur les tâches historiques, et les résultats montrent aussi l’impact du harness sur le coût en tokens.
Google’s open source EnvHarness lets AI agents train against environments that evolve with them
VentureBeat décrit EnvHarness, framework open source de Google Cloud AI Research qui adapte état initial, observations, actions ou durée autour des faiblesses d’un agent tout en conservant l’environnement et son vérificateur. Les essais couvrent cinq benchmarks et jusqu’à neuf points de gain.