返回列表
vLLM v0.28.0 正式发布:深度优化 Kimi-K3 与 DeepSeek V4,推理性能实现跨越式提升
开源项目vLLM大语言模型性能优化

vLLM v0.28.0 正式发布:深度优化 Kimi-K3 与 DeepSeek V4,推理性能实现跨越式提升

开源推理框架 vLLM 发布 v0.28.0 版本,本次更新包含 584 个提交,重点针对 Kimi-K3 和 DeepSeek V4 模型进行了全栈式优化。Kimi-K3 实现了解码上下文并行及显著的显存节省,而 DeepSeek V4 则获得了稀疏 MLA 的端到端支持。此外,新版本在内核加速、投机解码及 AMD ROCm 硬件适配方面均有重大进展。

Hacker News

核心要点

  • Kimi-K3 全栈优化:引入解码上下文并行(DCP)与融合 FlashKDA 内核,内核级速度提升达 1.5~3 倍,每张 GPU 可节省约 17 GiB 显存。
  • DeepSeek V4 深度支持:实现稀疏 MLA 端到端支持,涵盖普通解码、MTP 及 DSpark 投机解码,并新增 AMD Quark NVFP4 支持。
  • 投机解码性能增强:通过自适应投机令牌预算,使 DSpark 的首字响应时间(TTFT)提升约 60%。
  • 硬件兼容性扩展:Kimi-K3 现支持 ROCm 运行,DeepSeek V4 增加了对 AMD gfx11 和 gfx950 架构的适配。

详细分析

Kimi-K3 的性能突破与显存优化

在 v0.28.0 版本中,vLLM 团队针对 Kimi-K3 模型进行了大规模的性能压测与优化。通过引入解码上下文并行(DCP)和融合 FlashKDA 解码及预填充内核,系统在处理复杂任务时表现出更强的吞吐能力。值得关注的是,新版本通过组合全聚合(all-gathers)技术,实现了 1.5 到 3 倍的内核级加速。在资源占用方面,可选的共享专家分片(shared-expert sharding)功能表现出色,能够为每张 GPU 节省约 17 GiB 的显存空间,这显著降低了超大规模模型部署的硬件门槛。

DeepSeek V4 的端到端集成与硬件适配

对于 DeepSeek V4,vLLM 实现了稀疏 MLA(Multi-head Latent Attention)的端到端支持,这对于提升推理效率至关重要。优化涵盖了从普通解码到 MTP(Multi-Token Prediction)以及 DSpark 投机解码的全流程。此外,针对 AMD 硬件生态,新版本不仅引入了 AMD Quark NVFP4 支持,还针对 gfx11 和 gfx950 架构进行了 ROCm 适配。通过稀疏 top-k 元数据内核优化和收窄 CUDA 图区域,DeepSeek V4 的推理延迟得到了进一步降低。

投机解码与推理效率的进化

投机解码技术在本次更新中也迎来了重要进展。通过引入自适应投机令牌预算,vLLM 能够根据实时负载动态调整资源分配,从而使 DSpark 的首字响应时间(TTFT)优化了约 60%。这种智能化的预算管理机制,配合 DFlash 等先进技术,使得 vLLM 在保持高精度的同时,大幅提升了用户交互的实时感。

行业影响

vLLM v0.28.0 的发布标志着开源推理框架在支持国产大模型(如 Kimi 和 DeepSeek)方面迈出了坚实的一步。通过深度定制的内核优化和显存节省技术,企业和开发者能够以更低的成本、更高的效率部署最前沿的模型。同时,对 AMD ROCm 架构的持续扩展,也为 AI 推理市场提供了除 NVIDIA 之外的更多高性能硬件选择,有助于构建更加多元化的算力生态。

常见问题

问题 1:v0.28.0 版本对显存优化最显著的改进是什么?

答:最显著的改进是针对 Kimi-K3 模型引入了可选的共享专家分片技术,该技术在部署时可以为每张 GPU 节省大约 17 GiB 的显存,极大地缓解了显存压力。

问题 2:DeepSeek V4 在新版本中有哪些核心优化?

答:DeepSeek V4 获得了稀疏 MLA 的端到端支持,并针对 AMD 平台进行了深度适配,包括 NVFP4 支持以及针对 gfx11/gfx950 架构的 ROCm 启用。

问题 3:如何提升首字响应时间(TTFT)?

答:新版本通过自适应投机令牌预算机制,针对 DSpark 投机解码进行了优化,实测可将 TTFT 提升约 60%。

相关新闻

腾讯发布并开源混元Hy4预览版:770B参数与百万级上下文,重塑生产力基准
开源项目

腾讯发布并开源混元Hy4预览版:770B参数与百万级上下文,重塑生产力基准

腾讯正式发布并开源新一代大语言模型Tencent Hy4预览版。该模型拥有7700亿总参数量及490亿激活参数,支持超过100万token的超长上下文窗口。Hy4在编程、办公及科研等实际生产力任务中表现卓越,在腾讯内部专家评估中超越了GLM-5.3和Kimi K3。目前,该模型已通过腾讯云、WorkBuddy等平台开放,并提供限时免费试用,标志着腾讯在开源大模型领域迈入顶尖梯队。

Archify:利用 AI 代理生成美观且可验证的架构与工作流图
开源项目

Archify:利用 AI 代理生成美观且可验证的架构与工作流图

Archify 是一款新兴的开源工具,专注于通过 AI 代理技能生成美观、可验证的各类技术图表。它支持架构图、工作流图、序列图、数据流图及生命周期图,并具备独特的动画效果。该工具生成的图表可导出为自包含的 HTML 文件,确保了清晰的展示效果与便捷的分享能力,为开发者提供了高效的可视化解决方案。

打造AI科学家:K-Dense-AI发布scientific-agent-skills库,赋能生物医药科研
开源项目

打造AI科学家:K-Dense-AI发布scientific-agent-skills库,赋能生物医药科研

K-Dense-AI在GitHub上推出了名为“scientific-agent-skills”的开源项目,旨在将任何AI代理转化为具备专业能力的AI科学家。该库目前已被全球超过17.5万名科学家使用,内置163项经过验证的科研技能,并整合了涵盖生物、化学、医学及药物发现领域的100多个科学数据库。该项目高度兼容Cursor、Claude Code、Codex及Pi等主流开发工具,为科研自动化提供了强有力的技术支撑。