Vals 今日发布 Vibe Code Bench 1-100(VCB 1-100):在已通过的完整 Web 应用上,要求模型按依赖顺序完成多轮产品改动,且不能破坏既有行为;首个未完成迭代即终止。官方榜单显示 Claude Opus 5 以 28.53% 领先,Claude Fable 5.1 28.00%、GPT-6 Astra 27.64% 紧随其后。相对只评「从零做出能跑版本」的基准,该套题更贴近真实持续演进的 vibe coding / 编程智能体工作负载。

核心要点速览 (Key Takeaways)

  • ✓VCB 1-100 从已通过的完整应用起步,按依赖顺序施加多轮产品请求,首个失败迭代即终止。
  • ✓榜单:Claude Opus 5 28.53%,Claude Fable 5.1 28.00%,GPT-6 Astra 27.64%。
  • ✓Vals 指出模型自我测试差异大:Opus 5 / Fable 5.1 约三分之一工具调用为浏览器;Grok 4.6 几乎不用浏览器。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算