Les agents locaux gagnent un moteur spécialisé, un routeur multi-PC et du matériel dédié

Illustration éditoriale — Les agents locaux gagnent un moteur spécialisé, un routeur multi-PC et du matériel dédié

Perplexity pousse l’inférence locale vers des runtimes spécialisés. Son moteur Lily, écrit en Rust et Metal pour Qwen3.6-35B-A3B sur Apple Silicon, expose une API compatible OpenAI et annonce 1,23× plus de débit en prefill et 1,35× en decode que MLX-LM sur son test M5 Max.

NVIDIA traite désormais le goulot d’étranglement suivant : plusieurs agents qui sollicitent le même GPU. PAIR répartit les requêtes indépendantes entre PC du réseau local via Ollama ou LM Studio, sans modifier l’agent harness. Dans sa démonstration à cinq subagents, trois machines réduisent le temps de 18 minutes à 8 min 48.

Le matériel suit cette évolution. ASUS présente des PC ProArt RTX Spark pensés pour les personal agents, avec jusqu’à 128 Go de mémoire unifiée et des modèles de 120 milliards de paramètres en local. Pour les développeurs, la pile devient complète : matériel dédié, runtime optimisé et routage local avant le recours au cloud.

Sources