La recherche IA passe aux agents qui enchaînent des expériences sur plusieurs jours
Le travail de recherche assisté par agents dépasse désormais les tâches ponctuelles de code. Chez OpenAI, mi-août, l’organisation de recherche consommait 3,1 journées-agent pour une journée humaine, tandis que le nombre d’expériences par chercheur atteignait un record. Les agents prennent davantage de tâches longues, mais les humains gardent priorités, arbitrage et décisions de déploiement.
Meta teste la même logique sur une évaluation externe. AIRA₃, présenté comme son système autonome de recherche IA, a fini 8e sur environ 4 000 équipes dans un concours Kaggle de fine-tuning Nemotron, noté sur un jeu privé. Le signal important est opérationnel : l’agent ne produit plus seulement du code, il optimise une capacité mesurée.
Anthropic pousse cette autonomie jusqu’à la vérification mathématique. Des agents Claude ont formalisé le dernier théorème de Fermat en Lean en onze jours, avec 13 millions de lignes et 29 500 théorèmes intermédiaires retenus. Pour les développeurs, l’agent harness doit désormais gérer état persistant, budget de calcul, parallélisme et vérification indépendante du résultat.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
Research acceleration: The view inside OpenAI
OpenAI décrit l’usage croissant des coding agents dans son organisation de recherche. Mi-août, elle mesure 3,1 journées-agent par journée humaine ; le nombre d’expériences par chercheur atteint un record et les tâches déléguées s’allongent, tout en conservant les priorités et décisions de déploiement chez les humains.
AIRA₃ places 8th in NVIDIA’s live Kaggle reasoning challenge
Meta annonce qu’AIRA₃, son système autonome de recherche IA, a terminé 8e sur environ 4 000 équipes dans un concours Kaggle organisé par NVIDIA pour améliorer le raisonnement d’un Nemotron 30B. Tous les concurrents disposaient des mêmes informations et ont été notés sur un jeu de test privé.
Formalizing Fermat's Last Theorem
Anthropic décrit comment des agents Claude, orchestrés avec Prove2Me et un agent harness basé sur Claude Code, ont produit en onze jours une formalisation Lean de Fermat : 13 millions de lignes et 29 500 théorèmes intermédiaires utilisés, puis vérifiés par Lean et un comparateur indépendant.