Image et vidéo entrent dans les mêmes pipelines API que les LLM
Les modèles visuels quittent les interfaces de démonstration pour devenir des briques directement appelables dans les produits. Alibaba expose Wan 2.7 par API pour générer, éditer et combiner plusieurs images ; Vercel ajoute Muse Image à son AI Gateway. Le même workflow peut désormais choisir un modèle visuel comme il choisit un LLM.
Cette industrialisation ne concerne plus seulement l’image fixe. Kira 5.7 met à jour ses modèles vidéo Nova et Ultra, avec génération et édition renforcées et des temps annoncés d’environ une minute sur Ultra. Côté développeurs, le point commun est la réduction des étapes entre prompt, référence visuelle, génération puis nouvelle édition.
Pour les équipes produit, la conséquence est concrète : image et vidéo entrent dans les mêmes pipelines programmables que le texte. Les API acceptent des références, conservent davantage de contexte d’édition et exposent coût ou vitesse comme paramètres de choix. Il devient possible de construire un workflow multimodal sans enfermer toute la chaîne dans un seul outil créatif.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
Wan2.7 - image generation and editing
La référence API de Wan 2.7 documente génération, édition, séries d’images et références multiples. La version Pro monte à 4K en text-to-image et propose des appels synchrones ou asynchrones dans Model Studio.
Muse Image now available on AI Gateway
Vercel ajoute Muse Image de Meta à AI Gateway. Le modèle est accessible avec l’AI SDK et la gateway unifie appel, suivi des coûts, routage, règles de budget et bascule entre fournisseurs.
Kira 5.7 Nova & Ultra Video Model Update
Kira 5.7 met à jour les modèles vidéo Nova et Ultra avec de meilleures capacités de génération et d’édition, une compréhension renforcée des prompts et des temps annoncés d’environ une minute pour Ultra et cinq minutes pour Nova.