Les modèles agentiques optimisent désormais le coût d’une tâche complète
Les sorties de cette semaine déplacent la comparaison des modèles vers le coût d’une tâche agentique complète. Meta annonce que Muse Spark 1.3 utilise environ 20 % de tool calls et 25 % de tokens en moins que 1.2 sur ses comparaisons internes, tout en visant davantage de travail long-horizon.
Google maintient Gemini 3.8 Flash au tarif introductif de 0,75 $/M tokens en entrée et 3,75 $ en sortie, avec de meilleurs résultats sur le code et les tâches multi-étapes. Anthropic baisse de 75 % le prix des cache reads de Fable 5.1, estimant l’économie jusqu’à 45 % sur les workloads très agentiques.
Pour les développeurs, le prix affiché par million de tokens devient donc insuffisant. Il faut mesurer le nombre de tours, les tool calls, les relectures de contexte et le taux de réussite jusqu’au résultat vérifié. Le modèle le moins cher par token peut coûter davantage s’il boucle plus longtemps ou échoue plus souvent.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
Introducing Muse Spark 1.3
Meta présente Muse Spark 1.3, entraîné davantage sur les tâches de code longues et sur plusieurs harnesses. Dans ses comparaisons internes avec 1.2, l’entreprise mesure environ 20 % de tool calls et 25 % de tokens en moins, avec moins de tours inutiles et une meilleure tenue des workflows longs.
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Google lance Gemini 3.8 Flash avec des gains sur l’ingénierie logicielle, les tâches agentiques et le raisonnement multi-étapes, tout en conservant la vitesse et le tarif introductif de 3.7 Flash : 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie.
Claude Fable 5.1 and Mythos 5.1
Anthropic annonce Fable 5.1 et réduit fortement le prix des cache reads. L’entreprise estime le coût des workloads typiques en baisse d’environ 25 % par rapport à Fable 5 et jusqu’à 45 % pour les usages très agentiques, tout en publiant des courbes de performance en fonction du coût.