← Le LiveIA CODE LIVE
ARTICLE Par

Les labos lient les progrès des modèles à des évaluateurs externes et des règles d’arrêt

Illustration éditoriale — Les labos lient les progrès des modèles à des évaluateurs externes et des règles d’arrêt

Anthropic demande désormais de ralentir l’augmentation des capacités des modèles pour laisser aux évaluations de sécurité le temps de suivre. Dario Amodei propose surtout des évaluateurs indépendants avec un accès proche de celui des employés, afin de tester les systèmes avant que les gains issus de l’auto-amélioration n’accélèrent davantage.

Microsoft transforme cette prudence en règles de comportement pour ses propres modèles. Son projet de code impose de ne jamais résister à une correction ou à un arrêt, de rester compréhensible pour les humains et de considérer toute violation comme un échec. Après consultation publique, ces règles doivent servir directement à l’entraînement.

Le mouvement dépasse un laboratoire : The Guardian rapporte le soutien d’OpenAI, Google DeepMind et xAI au principe d’un ralentissement et d’évaluateurs externes. Pour les développeurs, une nouvelle version frontier pourrait donc être jugée moins seulement sur ses benchmarks que sur ses mécanismes d’arrêt, ses audits et les conditions de son déploiement.

Références

Sources

Chaque onglet présente la publication d’origine et son lien direct.

Dario Amodei

We Must Pace the Frontier

Dario Amodei demande de ralentir le rythme d’augmentation des capacités des modèles afin que la prévention des risques puisse suivre. Il propose notamment des évaluateurs indépendants avec un accès proche de celui des employés, une coordination entre laboratoires et des accords internationaux.

Ouvrir la source ↗