Les outils et la mémoire d’un agent comptent autant que son modèle
Une même base de modèle peut changer radicalement de niveau lorsque mémoire, outils, supervision et boucles de réparation sont conçus comme un système. NVIDIA affirme que son architecture AVO a terminé les 183 niveaux des 25 environnements publics d’ARC-AGI-3, avec un score RHAE de 100.
Le résultat porte sur l’ensemble public de démonstration, pas sur les épreuves semi-privées ou privées du concours. Des observateurs, dont le créateur d’ARC-AGI François Chollet, ont rappelé cette limite. La comparaison avec un modèle seul n’est donc pas une ablation contrôlée, mais elle éclaire le poids du harnais.
Sur l’optimisation de kernels, AVO a aussi enchaîné sept jours d’exploration, plus de 500 pistes et 40 versions conservées, avec des gains annoncés face à cuDNN et FlashAttention-4. La leçon utile pour le code agentique est opérationnelle : persistance, évaluation et réparation comptent autant que le modèle appelé.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
NVIDIA AVO Reaches 100% on ARC-AGI-3
NVIDIA détaille l’architecture AVO, qui combine mémoire persistante, outils, évaluateur, réparation et supervision. L’entreprise rapporte un score RHAE de 100 sur les 25 environnements publics et 183 niveaux d’ARC-AGI-3, tout en distinguant ce périmètre des ensembles de compétition.
NVIDIA AVO reportedly reaches 100% on ARC-AGI-3 demo tasks
AI Primer vérifie le périmètre du résultat : ensemble public seulement, comparaison non contrôlée avec le modèle seul et absence de coût détaillé pour l’exécution ARC. Le site décrit aussi la mémoire, la boucle d’inspection-réparation et le superviseur qui structurent AVO.
Clarification on NVIDIA AVO and ARC-AGI-3
François Chollet salue le travail de NVIDIA mais précise qu’un score parfait sur l’ensemble public de démonstration ne constitue pas un score parfait sur tout le benchmark ARC-AGI-3. Cette distinction évite de confondre les niveaux publics avec les évaluations semi-privées et privées.
AVO: Agentic Variation Operators for Autonomous Evolutionary Search
L’article scientifique décrit AVO comme une boucle agentique autonome appliquée à l’optimisation de kernels. Les auteurs rapportent sept jours d’exploration, plus de 500 directions et des performances supérieures à plusieurs implémentations expertes sur les configurations testées.