学术界与产业界联合发布 Android Bench 2.0 评测基准。随着 Coding Agent 轻松突破简单单元测试与单函数修复,新版本全面引入需耗时数天才能完成的「长程任务(Long-Horizon Tasks, LHT)」,重点考察智能体从零搭建完整 App、多模块大版本依赖平滑升级以及跨端联调的架构鲁棒性。

核心要点速览 (Key Takeaways)

  • ✓告别单文件局部代码修复,全面考核跨多模块与多天的复杂项目交付能力
  • ✓包含从零搭建架构、第三方 SDK 兼容重构与真机自动化 UI 巡检等真实场景
  • ✓当前顶级前沿模型在此基准上的平均解决率仅为 31.4%,揭示长程规划巨大提升空间
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算