Les agents de recherche prennent des tâches entières, du code scientifique aux preuves mathématiques
Anthropic quantifie un changement de rôle : Claude « mène » désormais 26 % de son travail de R&D IA, contre moins de 1 % en février, avec environ 30 000 agents actifs simultanément. Le modèle exécute l’essentiel de certaines tâches à partir d’un objectif de haut niveau, mais l’humain conserve la décision finale.
ScienceIDE transforme cette logique en environnement d’apprentissage scientifique. Des dépôts réels de simulation deviennent des épisodes conteneurisés : l’agent corrige ou réimplémente du code, puis un vérificateur recompile le programme et compare les résultats numériques aux références. La récompense vient donc d’une simulation redevenue correcte, pas d’une ressemblance avec le diff attendu.
En mathématiques, une équipe rapporte avoir obtenu avec ChatGPT-6 Astra la preuve principale d’un résultat sur la conjecture forte du secrétaire, tandis qu’un groupe concurrent trouvait presque la même construction. Pour les développeurs, la frontière se déplace : un workflow de recherche agentique doit désormais tracer provenance, vérification, attribution et contrôle humain.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
Measurements for understanding the pace of AI development inside frontier labs
Anthropic publie son R&D Automation Index : Claude « mène » 26 % du travail de R&D IA mesuré et collabore sur plus de 90 %. L’entreprise décrit aussi environ 30 000 agents actifs simultanément, tous soumis à des moniteurs en ligne et hors ligne.
ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments
ScienceIDE transforme des dépôts scientifiques réels en environnements exécutables où des agents réparent ou réimplémentent du code. Les tâches sont évaluées par recompilation et vérification numérique, puis les trajectoires validées servent au fine-tuning, au reinforcement learning et à l’évaluation.
A bittersweet secretary
Les auteurs expliquent avoir obtenu avec ChatGPT-6 Astra la preuve principale d’un résultat sur la conjecture forte du secrétaire pour les matroïdes linéaires, avant de découvrir un travail concurrent fondé sur une construction presque identique. Ils soulèvent des questions de priorité et d’attribution.