阿里云通义千问发布多模态 MoE 模型 Qwen3.8-Flash 并开源权重,仅 6B 激活参数即在 DeepSWE 1.1 拿到 58.7、SWE-bench Pro 拿到 62.5,训练成本仅为 Qwen3.7-Plus 的 1/9,同时放出 Qwen3.8-Flash-Next 作为 Qwen4 架构先行预览。

核心要点速览 (Key Takeaways)

  • ✓DeepSWE 1.1 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9,编程与办公任务相对 Qwen3.7-Plus 全面领先
  • ✓GDN+QSA 混合注意力、Gated Residual、N-gram Embedding 与 Muon 优化器,1M 上下文 QSA 预填充最高提速 7.6 倍
  • ✓权重已上 Hugging Face / ModelScope,vLLM 与 SGLang 提供 Day-0 支持;QwenCloud 定价 $0.16/$0.47 每百万 Token
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算