开发者 3 秒速决决策指标
HuggingPapers 转发:NVIDIA 在 Hugging Face 发布 Qwen3.8-Flash-Next 的 NVFP4 量化权重(125B MoE、混合注意力),称体积约减少 63% 且精度损失很小。官方仓库为 nvidia/Qwen3.8-Flash-Next-NVFP4,便于在 NVIDIA 硬件上做更高吞吐的本地/边缘推理,降低部署显存门槛。
核心要点速览 (Key Takeaways)
- ✓权重:nvidia/Qwen3.8-Flash-Next-NVFP4 已在 Hugging Face 可下。
- ✓压缩:NVFP4 约减 63% 体积,面向本地高吞吐推理。
- ✓定位:125B MoE + 混合注意力,适合在 NVIDIA GPU 上部署编码/对话工作负载。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察