开发者 3 秒速决决策指标
HuggingPapers 转发 Salesforce AI Research 的 Random Attention:在保留 prompt 的前提下,对每个注意力头均匀随机驱逐 KV token,在推理任务上可与可学习驱逐器打平,同时在 vLLM 上带来约 32%–43% 的更高 serving 吞吐。对长上下文编码与 agent 推理部署,这是一条几乎零训练开销的缓存压缩路径。
核心要点速览 (Key Takeaways)
- ✓方法:保留 prompt,按注意力头均匀随机驱逐 KV token,无需评分网络。
- ✓效果:推理任务上对齐可学习驱逐器,vLLM serving 吞吐约 +32%–43%。
- ✓影响:长上下文编码/agent 部署可用几乎零训练开销的缓存压缩。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察