Les coding agents se mesurent désormais sur des traces de travail, pas seulement sur des benchmarks
OpenAI évalue désormais Astra sur des trajectoires proches du travail réel, pas seulement sur des benchmarks. Sa simulation rejoue 54 218 tâches internes Codex avec conversation, workspace et tool calls reconstruits : Astra reçoit 34 alertes de sévérité 3 ou plus, contre 73 pour GPT-5.6 Sol, soit 53 % de moins.
Vercel applique la même logique aux instructions d’agents. Pour construire `design.md`, l’équipe a réalisé plus de 200 runs sur sept scénarios figés, en conservant prompts, entrées, modèle, version du fichier, captures et retours humains. Dans un test de six pages, les défauts déjà connus tombent de 91 à 39, sans rendre aucune page livrable.
Meta cherche de son côté les traces d’usage qui manquent aux laboratoires. Pour Muse Spark, le tarif « contributor » réduit d’environ 95 % le prix en échange du partage des prompts et sorties. Pour les développeurs, l’évaluation utile devient donc une boucle versionnée de tâches, tool calls, erreurs et corrections réelles, plutôt qu’un score isolé.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
GPT-6 Astra System Card
OpenAI décrit une simulation de déploiement fondée sur 54 218 tâches internes Codex avec conversation, workspace et tool calls reconstruits. Astra y reçoit 34 alertes de sévérité 3 ou plus contre 73 pour GPT-5.6 Sol, soit 53 % de moins.
Vercel built a feedback loop that treats agent instructions like software
The New Stack détaille la fabrication de `design.md` chez Vercel : plus de 200 runs, sept scénarios figés et un harness qui conserve prompts, entrées, modèle, version du fichier, captures et retours humains. Un test de six pages réduit les défauts connus de 91 à 39, sans page prête à livrer.
Meta is paying to peek at how you use their latest AI model
TechCrunch rapporte que Meta propose pour Muse Spark un tarif « contributor » environ 95 % moins cher aux utilisateurs qui acceptent de partager prompts et sorties afin d’aider au développement de futurs modèles.