⚡
TL;DR Verdict 开发者 3 秒速决决策指标
高并发推理引擎 vLLM 迎来 0.28.0 重磅更新,汇总 270 位开发者的 584 项提交。全面优化 Kimi-K3 与 DeepSeek-V4 稀疏 MLA(覆盖 Decode、MTP 与 DSpark 推测解码),Model Runner V2 支持 E/P/D 分离与权重卸载,KV Cache 新增磁盘分层存储。
核心要点速览 (Key Takeaways)
- ✓引入自适应推测 Token 预算机制,将端到端首字延迟(TTFT)大幅降低 55–65%;
- ✓DeepSeek-V4 稀疏 MLA 实现全链路打通,Kimi-K3 共享专家分片技术使单卡节省约 17 GiB 显存;
- ✓KV Cache 引入内存-磁盘分层架构,默认批处理 Token 限制倍增至 16384,全面支持跨硬件平台(NVIDIA、AMD、Intel XPU、CPU)。
🧭
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察