SGLang réduit presque de moitié la préparation du speculative decoding sur GPU AMD.
Le correctif DSPARK ramène draft et préparation de 6,2 à 3,65 ms et porte la longueur d’acceptation d’environ 3,8 à 5,8 tokens, avec moins de pauses côté hôte.
SGLang réduit presque de moitié la préparation du speculative decoding sur GPU AMD.
Le correctif DSPARK ramène draft et préparation de 6,2 à 3,65 ms et porte la longueur d’acceptation d’environ 3,8 à 5,8 tokens, avec moins de pauses côté hôte.