← Le LiveIA CODE LIVE
ARTICLE Par

Le routage multi-modèle devient le contrôle de coût des coding agents

Illustration éditoriale — Le routage multi-modèle devient le contrôle de coût des coding agents

Le choix du modèle entre désormais dans le runtime des coding agents. HydraFusion, dans Copilot CLI, construit pour chaque tâche un workflow Single, Cascade ou Critique, puis choisit les modèles chargés de résoudre, relire ou escalader. Sur TerminalBench 2.1, GitHub annonce 67 % de coût estimé en moins qu’Opus 5, avec 4,9 points de qualité vérifiée en plus.

Spotify applique la même logique plus bas dans le harness. Son plugin `shunt` intercepte les lectures volumineuses de Claude Code et les délègue à un worker moins cher, ici Gemini 2.5 Flash, avant de renvoyer un résumé compact. L’équipe mesure environ 90 % de tokens en moins sur ses scénarios de lecture de gros fichiers.

CodeRabbit montre pourquoi ce routage devient une décision économique : sur son exemple de revue, GPT‑6 Astra coûte 1,50 dollar contre 0,60 pour GPT‑5.6 Sol, alors que son gain global de bugs détectés n’est que d’environ 4 %. Pour les développeurs, l’optimisation se déplace du modèle choisi vers la politique qui attribue chaque étape au bon niveau de capacité.

Références

Sources

Chaque onglet présente la publication d’origine et son lien direct.

GitHub

Project HydraFusion: Frontier quality via multi-model orchestration

GitHub présente HydraFusion, un routeur de workflows dans Copilot CLI qui choisit entre Single, Cascade et Critique puis distribue les étapes à plusieurs modèles. Les évaluations publiées comparent coût complet et qualité vérifiée, avec jusqu’à 67 % de coût estimé en moins qu’Opus 5 sur TerminalBench 2.1.

Ouvrir la source ↗