HuggingPapers 转发:NVIDIA 在 Hugging Face 发布 Qwen3.8-Flash-Next 的 NVFP4 量化权重(125B MoE、混合注意力),称体积约减少 63% 且精度损失很小。官方仓库为 nvidia/Qwen3.8-Flash-Next-NVFP4,便于在 NVIDIA 硬件上做更高吞吐的本地/边缘推理,降低部署显存门槛。

核心要点速览 (Key Takeaways)

  • ✓权重:nvidia/Qwen3.8-Flash-Next-NVFP4 已在 Hugging Face 可下。
  • ✓压缩:NVFP4 约减 63% 体积,面向本地高吞吐推理。
  • ✓定位:125B MoE + 混合注意力,适合在 NVIDIA GPU 上部署编码/对话工作负载。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算