Entraîner un agent dans son environnement réel change les résultats
Une mise à jour publiée ce matin porte Agent Lightning à 1.0.1 après sa refonte complète. Son pari est décisif : entraîner un agent à travers un proxy sans réécrire son harnais, afin de conserver outils, contexte, contrôle et environnement réels pendant les trajectoires d’apprentissage.
Le résultat annoncé sur SWE-bench Verified est net : avec 6 000 exemples, Qwen3.5-9B passe de 41,8 % à 56,4 %. Mais l’enjeu dépasse le score. NeMo Gym avertit qu’un changement de harnais peut peser autant qu’un changement de modèle et impose de ne varier qu’un facteur à la fois.
La convergence avec Better Harness dessine une boucle plus rigoureuse : harnais versionné, expériences contrôlées, traces inspectables, tests de dépôt et récompenses revérifiables. Pour les équipes, le modèle n’est donc plus l’unique unité d’amélioration. La prochaine frontière consiste à prouver que les gains survivent aux tâches, outils et infrastructures de production.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
Bump version to 1.0.1
Fusionné le 24 août à 08:58 UTC, ce commit officiel porte Agent Lightning de la version 1.0.0 à la version 1.0.1 dans le paquet Python et son fichier de verrouillage. Il ancre la mise à jour de ce matin sans s’appuyer sur une page de release GitHub.
Agent Lightning v1.0: Towards Harnessed Agentic RL
Le rapport décrit un proxy qui capte les trajectoires d’agents exécutés avec leurs vrais outils, contextes et environnements. Sur SWE-bench Verified, l’entraînement de Qwen3.5-9B avec 6 000 exemples fait progresser le score de 41,8 % à 56,4 %, tout en documentant le nettoyage des données et la prévention du détournement de récompense.
Evaluate
NeMo Gym utilise les mêmes jeux de données, ressources, vérificateurs et mécanismes de trajectoire pour comparer modèles, harnais et entraînements. Sa documentation souligne qu’un changement de harnais peut modifier les métriques autant qu’un changement de modèle et recommande de ne varier qu’un facteur par expérience.
Better Harness
Better Harness évalue le système complet autour d’un agent de code : objectifs, contexte, permissions, validation et livraison. Sa méthode confronte les personnalisations de l’agent, les traces de tâches réelles et les fondations du projet, puis permet de versionner le harnais et de comparer ses variantes par expériences contrôlées.