← Le LiveIA CODE LIVE
ARTICLE Par

Les agents répartissent recherche, tool calling et raisonnement entre plusieurs modèles

Illustration éditoriale — Les agents répartissent recherche, tool calling et raisonnement entre plusieurs modèles

Les agents commencent à découper l’inférence par fonction au lieu d’envoyer chaque étape au même LLM. Neurometric isole le tool calling dans un petit modèle dédié, chargé uniquement de transformer une intention en appels conformes au schéma. Le raisonnement général peut ainsi rester sur un modèle plus coûteux, appelé moins souvent.

Cloudflare applique la même séparation à la recherche. AI Search permet de choisir le modèle qui réécrit une requête ou génère la réponse, et ajoute GLM-5.3 Flash à son catalogue Workers AI. La récupération de documents devient donc une étape configurable du workflow, plutôt qu’un comportement figé dans le modèle principal.

À l’autre extrême, Tencent réduit Hy4 preview à 213,66 Gio en GGUF mixte et le rend utilisable derrière un serveur local compatible OpenAI avec plusieurs agents. Pour les développeurs, l’architecture qui se dessine assemble petits modèles spécialisés, gros modèles locaux ou distants et routage par étape, selon coût, latence et mémoire.

Références

Sources

Chaque onglet présente la publication d’origine et son lien direct.

Neurometric

Introducing A Task Specific Tool Calling Model - Available on TrustedRouter

Neurometric présente un SLM spécialisé dans une seule tâche : convertir une intention en appels d’outils conformes à un schéma. Le modèle est proposé sur TrustedRouter à 0,01 dollar par million de tokens d’entrée et 0,10 dollar en sortie, avec un harness optimisé pour cette fonction.

Ouvrir la source ↗