通义千问团队提出 Terminal-Universe:把终端/代码 Agent 轨迹经确定性回放与补全 Agent 重建为可复用可执行工作区,再沿广度(跨仓库)与深度(多轮用户)合成新任务并配可执行校验。基于公开轨迹产出约 3.73 万任务充分环境与约 3.2 万条 SFT 演示;对 Qwen3.5-27B 做监督微调后,Terminal-Bench 2.1 提升 11.9 分,EvoCode-Bench v2 MT@4 提升 13.8 分,显著优于直接模仿原始轨迹。

核心要点速览 (Key Takeaways)

  • ✓重建:回放轨迹中的文件操作再补全缺失依赖,得到可复用可验证工作区。
  • ✓规模:约 3.73 万任务充分环境;Single-WS / Cross-WS / Multi-Round 约 3.2 万条 SFT。
  • ✓效果:Qwen3.5-27B 上 Terminal-Bench 2.1 +11.9、EvoCode-Bench v2 MT@4 +13.8。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算