SGLang v0.5.16 带来自信驱动推测解码、Inkling 975B 多模态 MoE 支持、GLM-5.2 DSA 缓存层分割(KV 内存降 74%)、ReplaySSM 显存节省 6.4 倍等重大更新,同时移除 QServe 和 FBGEMM FP8 量化路径。
SGLang v0.5.16 于 7 月 25 日正式发布,汇集了来自 169 位贡献者的 574 个 PR。本次版本的核心亮点包括:全新 DSPARK 推测解码算法(自信驱动),在 DeepSeek-V4-Pro(TP8 on B300, bs=1)上达到 383.7 tok/s,平均接受长度约 5;同时新增 Inkling 975B 参数多模态 MoE 模型支持,拥有 1M token 上下文窗口,在 Blackwell 上可达到 71.7k tok/s 输入速度和 171.0 tok/s 单用户解码输出。此外还加入了 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等新模型,并扩展了 LongLive 2.0 的扩散支持。
值得关注的关键改进:UnifiedRadixTree 现已成为 SWA、Mamba 和 DSA 模型的默认后端,Replay SSM 和 Mamba int8 检查点也已同步;GLM-5.2 DSA 缓存层分割使得 KV 缓存按 CP 分片,每 rank 仅持有不连续层范围,在 8192 token、78 层、cp_size=4 时 KV 内存从 0.77 GB/rank 降至 0.20 GB/rank(降幅约 74%);ReplaySSM Ring Spec-Verify 通过去除每 draft SSM 快照,将推测暂存从 11.5 GB 降至 1.8 GB/GPU(6.4 倍下降,Qwen3.5-35B-A3B TP1 实测),且不影响精度和吞吐;线性注意力在 Blackwell SM100 上的 recurrent_kda 解码内核(B=64)达到 29.6 us,优于 Triton 的 36.8 us。
警告:实验性的 QServe (QoQ) W4A8 和 FBGEMM FP8 量化路径已移除,
--fp4-gemm-backend cutlass 选项及树内 NVFP4 JIT 内核也被移除,NVFP4 GEMM 现在需要依赖 FlashInfer。依赖升级至 flashinfer 0.6.14、CuTe DSL 4.6.0、sgl-kernel 0.4.5、llguidance 1.7.6。用户升级前请仔细阅读 Breaking Changes。
原文链接: https://github.com/sgl-project/sglang/releases/tag/v0.5.16