⚡
TL;DR Verdict 开发者 3 秒速决决策指标
阿里通义千问团队开源发布了针对长程软件工程强化的 Qwen2.5-Coder-32B-Instruct 增量权重。通过引入高质量代码执行反馈与多轮合成排错轨迹,该模型在 SWE-bench Verified 上取得了 48.9% 的解决率,刷新了 32B 参数量级开源模型的全球最高纪录,并在单张 RTX 4090 / A10G 上支持长达 128k 上下文推理。
核心要点速览 (Key Takeaways)
- ✓32B 体量在 SWE-bench Verified 达到 48.9%,逼近早前闭源前沿旗舰水平。
- ✓针对真实仓库环境的测试执行反馈循环进行了针对性对齐强化。
- ✓全权重已上线 Hugging Face 与 ModelScope,支持 vLLM 和 Ollama 开箱即用。
🧭
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察