⚡
TL;DR Verdict 开发者 3 秒速决决策指标
开源高性能推理引擎 vLLM 发布 0.28.0 大版本。汇聚 270 位开发者的 584 次代码提交,包含 Kimi-K3 全栈融合算子、DeepSeek-V4 稀疏 MLA 端到端支持、自适应投机解码预算(TTFT 提升达 65%)以及 Model Runner V2 分离架构。
核心要点速览 (Key Takeaways)
- ✓投机解码成为一等优化利器:集成 DFlash2 与 DSpark 置信度调度,使端到端首 Token 延迟缩短 55%–65%;
- ✓国产顶尖架构首日原生支持:深度适配 Kimi-K3 与 DeepSeek-V4 稀疏多头注意力机制(MLA);
- ✓硬件后端全面开花:包含 NVIDIA SM12x FlashInfer XQA、AMD ROCm 融合内核及 Intel XPU 适配。
🧭
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察