Infra1. vLLM 0.28.0:围绕 Kimi-K3 的生产推理优化成为发布重点
摘要 / 关键细节
vLLM 最新 release v0.28.0 于 2026-08-26 发布,release note 明确把 “Kimi-K3 performance push” 列为 highlight,覆盖 Decode Context Parallel 等栈内优化。该版本包含 584 commits、270 contributors,其中 76 位为新贡献者。
为什么重要
这不是单一模型适配,而是服务端推理框架将中国大模型作为一等优化目标的信号。大 MoE/长上下文模型进入企业生产,瓶颈在 decode 并行、KV cache、routing、kernel fusion 与多卡调度。