← Le LiveIA CODE LIVE
ARTICLE Par

Les coding agents se mesurent désormais sur des traces de travail, pas seulement sur des benchmarks

Illustration éditoriale — Les coding agents se mesurent désormais sur des traces de travail, pas seulement sur des benchmarks

OpenAI évalue désormais Astra sur des trajectoires proches du travail réel, pas seulement sur des benchmarks. Sa simulation rejoue 54 218 tâches internes Codex avec conversation, workspace et tool calls reconstruits : Astra reçoit 34 alertes de sévérité 3 ou plus, contre 73 pour GPT-5.6 Sol, soit 53 % de moins.

Vercel applique la même logique aux instructions d’agents. Pour construire `design.md`, l’équipe a réalisé plus de 200 runs sur sept scénarios figés, en conservant prompts, entrées, modèle, version du fichier, captures et retours humains. Dans un test de six pages, les défauts déjà connus tombent de 91 à 39, sans rendre aucune page livrable.

Meta cherche de son côté les traces d’usage qui manquent aux laboratoires. Pour Muse Spark, le tarif « contributor » réduit d’environ 95 % le prix en échange du partage des prompts et sorties. Pour les développeurs, l’évaluation utile devient donc une boucle versionnée de tâches, tool calls, erreurs et corrections réelles, plutôt qu’un score isolé.

Références

Sources

Chaque onglet présente la publication d’origine et son lien direct.

OpenAI Deployment Safety Hub

GPT-6 Astra System Card

OpenAI décrit une simulation de déploiement fondée sur 54 218 tâches internes Codex avec conversation, workspace et tool calls reconstruits. Astra y reçoit 34 alertes de sévérité 3 ou plus contre 73 pour GPT-5.6 Sol, soit 53 % de moins.

Ouvrir la source ↗