Les agents répartissent recherche, tool calling et raisonnement entre plusieurs modèles

Illustration éditoriale — Les agents répartissent recherche, tool calling et raisonnement entre plusieurs modèles

Les agents commencent à découper l’inférence par fonction au lieu d’envoyer chaque étape au même LLM. Neurometric isole le tool calling dans un petit modèle dédié, chargé uniquement de transformer une intention en appels conformes au schéma. Le raisonnement général peut ainsi rester sur un modèle plus coûteux, appelé moins souvent.

Cloudflare applique la même séparation à la recherche. AI Search permet de choisir le modèle qui réécrit une requête ou génère la réponse, et ajoute GLM-5.3 Flash à son catalogue Workers AI. La récupération de documents devient donc une étape configurable du workflow, plutôt qu’un comportement figé dans le modèle principal.

À l’autre extrême, Tencent réduit Hy4 preview à 213,66 Gio en GGUF mixte et le rend utilisable derrière un serveur local compatible OpenAI avec plusieurs agents. Pour les développeurs, l’architecture qui se dessine assemble petits modèles spécialisés, gros modèles locaux ou distants et routage par étape, selon coût, latence et mémoire.

Sources