官方 SWE-bench 团队发布了 SWE-agent Multimodal。新版本为智能体赋予了图像识别与完整无头网页浏览器控制能力,专门用于调试和修复复杂的前端 UI 渲染 Bug。该架构不仅可作为 SWE-bench Multimodal 评测标准,也可直接作为前端开发者的日常自动化调试工具。

核心要点速览 (Key Takeaways)

  • ✓将软件工程 Agent 的评测与实操从纯文本 Issue 扩展到带有交互界面的复杂前端任务。
  • ✓内置浏览器沙箱允许智能体自主查看页面渲染效果、模拟用户点击并审查控制台报错。
  • ✓完全开源于 GitHub,同一套运行时既可用于学术标准跑分,也可作为开发辅助插件。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算