vLLM v0.28.0 正式发布:深度优化 Kimi-K3 与 DeepSeek V4,推理性能实现跨越式提升
开源推理框架 vLLM 发布 v0.28.0 版本,本次更新包含 584 个提交,重点针对 Kimi-K3 和 DeepSeek V4 模型进行了全栈式优化。Kimi-K3 实现了解码上下文并行及显著的显存节省,而 DeepSeek V4 则获得了稀疏 MLA 的端到端支持。此外,新版本在内核加速、投机解码及 AMD ROCm 硬件适配方面均有重大进展。
核心要点
- Kimi-K3 全栈优化:引入解码上下文并行(DCP)与融合 FlashKDA 内核,内核级速度提升达 1.5~3 倍,每张 GPU 可节省约 17 GiB 显存。
- DeepSeek V4 深度支持:实现稀疏 MLA 端到端支持,涵盖普通解码、MTP 及 DSpark 投机解码,并新增 AMD Quark NVFP4 支持。
- 投机解码性能增强:通过自适应投机令牌预算,使 DSpark 的首字响应时间(TTFT)提升约 60%。
- 硬件兼容性扩展:Kimi-K3 现支持 ROCm 运行,DeepSeek V4 增加了对 AMD gfx11 和 gfx950 架构的适配。
详细分析
Kimi-K3 的性能突破与显存优化
在 v0.28.0 版本中,vLLM 团队针对 Kimi-K3 模型进行了大规模的性能压测与优化。通过引入解码上下文并行(DCP)和融合 FlashKDA 解码及预填充内核,系统在处理复杂任务时表现出更强的吞吐能力。值得关注的是,新版本通过组合全聚合(all-gathers)技术,实现了 1.5 到 3 倍的内核级加速。在资源占用方面,可选的共享专家分片(shared-expert sharding)功能表现出色,能够为每张 GPU 节省约 17 GiB 的显存空间,这显著降低了超大规模模型部署的硬件门槛。
DeepSeek V4 的端到端集成与硬件适配
对于 DeepSeek V4,vLLM 实现了稀疏 MLA(Multi-head Latent Attention)的端到端支持,这对于提升推理效率至关重要。优化涵盖了从普通解码到 MTP(Multi-Token Prediction)以及 DSpark 投机解码的全流程。此外,针对 AMD 硬件生态,新版本不仅引入了 AMD Quark NVFP4 支持,还针对 gfx11 和 gfx950 架构进行了 ROCm 适配。通过稀疏 top-k 元数据内核优化和收窄 CUDA 图区域,DeepSeek V4 的推理延迟得到了进一步降低。
投机解码与推理效率的进化
投机解码技术在本次更新中也迎来了重要进展。通过引入自适应投机令牌预算,vLLM 能够根据实时负载动态调整资源分配,从而使 DSpark 的首字响应时间(TTFT)优化了约 60%。这种智能化的预算管理机制,配合 DFlash 等先进技术,使得 vLLM 在保持高精度的同时,大幅提升了用户交互的实时感。
行业影响
vLLM v0.28.0 的发布标志着开源推理框架在支持国产大模型(如 Kimi 和 DeepSeek)方面迈出了坚实的一步。通过深度定制的内核优化和显存节省技术,企业和开发者能够以更低的成本、更高的效率部署最前沿的模型。同时,对 AMD ROCm 架构的持续扩展,也为 AI 推理市场提供了除 NVIDIA 之外的更多高性能硬件选择,有助于构建更加多元化的算力生态。
常见问题
问题 1:v0.28.0 版本对显存优化最显著的改进是什么?
答:最显著的改进是针对 Kimi-K3 模型引入了可选的共享专家分片技术,该技术在部署时可以为每张 GPU 节省大约 17 GiB 的显存,极大地缓解了显存压力。
问题 2:DeepSeek V4 在新版本中有哪些核心优化?
答:DeepSeek V4 获得了稀疏 MLA 的端到端支持,并针对 AMD 平台进行了深度适配,包括 NVFP4 支持以及针对 gfx11/gfx950 架构的 ROCm 启用。
问题 3:如何提升首字响应时间(TTFT)?
答:新版本通过自适应投机令牌预算机制,针对 DSpark 投机解码进行了优化,实测可将 TTFT 提升约 60%。
