LightSeek Foundation 发布面向 Kimi K3 的草稿模型合集(EAGLE-3、DFlash2、DSpark),在 40 张 NVIDIA GB200 上用 TorchSpec 解耦训练,并公开数据配方。博客给出 10 项基准的接受长度与 SPEED-Bench 端到端吞吐;DFlash2 平均接受长度约 4.02,低并发吞吐优于 EAGLE-3。

核心要点速览 (Key Takeaways)

  • ✓三款草稿架构齐发:EAGLE-3、DFlash2、DSpark,面向 Kimi K3 投机解码加速。
  • ✓40×GB200 + TorchSpec 解耦训练;公开 kimi-mtp-dataset 配方与 Docker/CI。
  • ✓HumanEval 等编码基准上 DFlash2 接受长度约 5.08,显著高于 EAGLE-3 的 3.29。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算