Les labos lient les progrès des modèles à des évaluateurs externes et des règles d’arrêt
Anthropic demande désormais de ralentir l’augmentation des capacités des modèles pour laisser aux évaluations de sécurité le temps de suivre. Dario Amodei propose surtout des évaluateurs indépendants avec un accès proche de celui des employés, afin de tester les systèmes avant que les gains issus de l’auto-amélioration n’accélèrent davantage.
Microsoft transforme cette prudence en règles de comportement pour ses propres modèles. Son projet de code impose de ne jamais résister à une correction ou à un arrêt, de rester compréhensible pour les humains et de considérer toute violation comme un échec. Après consultation publique, ces règles doivent servir directement à l’entraînement.
Le mouvement dépasse un laboratoire : The Guardian rapporte le soutien d’OpenAI, Google DeepMind et xAI au principe d’un ralentissement et d’évaluateurs externes. Pour les développeurs, une nouvelle version frontier pourrait donc être jugée moins seulement sur ses benchmarks que sur ses mécanismes d’arrêt, ses audits et les conditions de son déploiement.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
We Must Pace the Frontier
Dario Amodei demande de ralentir le rythme d’augmentation des capacités des modèles afin que la prévention des risques puisse suivre. Il propose notamment des évaluateurs indépendants avec un accès proche de celui des employés, une coordination entre laboratoires et des accords internationaux.
Microsoft drafts code of conduct to keep its AI under human control
Reuters détaille le projet de code de conduite de Microsoft AI : les modèles ne devraient jamais résister à une correction ou à un arrêt, devraient rester compréhensibles pour les humains et traiter toute violation du code comme un échec. Microsoft prévoit six semaines de consultation avant d’utiliser ces règles pour l’entraînement.
AI CEOs say they need to slow the pace of development. But will they?
The Guardian rapporte que Sam Altman, Demis Hassabis et Elon Musk ont publiquement soutenu l’appel de Dario Amodei à ralentir la progression des capacités. OpenAI dit vouloir adopter des évaluateurs externes avec un accès approfondi, tandis que l’article expose aussi les critiques sur l’autorégulation des laboratoires.