SWE-bench 评测团队联合顶尖研究机构推出了全新的 SWE-bench Pro 基准测试。新基准将测试用例从单纯的 Python 扩展到 Rust、Go、C++ 与 TypeScript 等 5 大工业级系统语言,包含 1,200 个来自顶级开源项目的真实 Issue 修复场景,更真实地衡量 AI 智能体在多语言混合微服务体系中的工程解决能力。

核心要点速览 (Key Takeaways)

  • ✓涵盖 Rust、Go、C++ 与 TypeScript 四大系统级语言的 1,200 个真实工程修复用例。
  • ✓引入编译期类型检查与集成测试通过率双重校验标准,杜绝虚假通过(False Positives)。
  • ✓首批排行榜已公布,Claude 3.7 Sonnet 与 DeepSeek-R1 领跑多语言综合解决率榜首。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算