发生了什么
7 月 25 日,vLLM 项目正式发布 v0.26.0 版本。该版本包含 411 次提交,来自 212 位贡献者(其中 61 位为新贡献者),GitHub 仓库已获得 87.2k 星标。
为什么值得关注
v0.26.0 在模型支持、性能优化和基础设施上均有重大更新:
•全新 Inkling 模型族:提供完整支持栈,包括基础建模、piecewise CUDA 图、Hopper FA4 相对注意力、MTP=1 投机解码、LoRA 以及 ModelOpt NVFP4 量化。
•DeepSeek-V4 性能提升:通过专用路由内核(E2E TPOT 提升 2.94%)、fused_topk_bias(1.5-2x 内核加速)、冗余移除(TPOT 提升 1.8%)等优化,并支持 ROCm 双级压缩器和 DSpark 投机解码(AMD/XPU)。
•精度与灵活性:引入 fp32 lm_head(通过 head_dtype 参数)提升生成头精度,扩展至 LoRA 路径;注意力后端可逐 KV 缓存组选择,滑动窗口成为显式后端能力。
•KV 卸载与存储成熟:新增卸载指标、二级对象存储、DP 副本感知分层,以及编码器缓存连接器(含 CPU 卸载)。
•Rust 前端:支持多模态视频和音频,集成 Seed-OSS 工具解析器和 native vllm-bench 移植。
•新模型与迁移:新增 BertForMaskedLM、RobertaForTokenClassification 等,并将 Olmo/Olmo2、MistralLarge3、HunyuanVL 迁移至 Transformers 5.13.0 后端。
具体变更列表请查阅发布说明。
原文链接: https://github.com/vllm-project/vllm/releases/tag/v0.26.0