Hugging Face 论文页披露《An Empirical Study of Harness Design for Coding Agents》:在固定执行循环下拆开规划、动作空间与上下文管理,用 4 个模型在 SWE-Bench Verified 与 Terminal-Bench 2.1 上跑 176 组对照。核心结论包括:上下文变紧时上下文管理价值上升(主要靠防止溢出失败);规则省略再接 LLM 摘要效率最佳;规划对弱模型更像精度脚手架、对强模型收益变弱。

核心要点速览 (Key Takeaways)

  • ✓固定执行循环,单独消融规划、动作空间与上下文管理,共 176 组对照。
  • ✓评测覆盖 SWE-Bench Verified 与 Terminal-Bench 2.1,跨 4 个模型。
  • ✓上下文越紧管理越重要;规则省略+LLM 摘要效率最佳;规划对弱模型更有用。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算