Artificial Analysis(@ArtificialAnlys)发布 Intelligence Index v4.3:将 Terminal-Bench 从 2.1 升至 4.0(改用 mini-SWE-agent),并以与 Zapier 合作的 AutomationBench-AA(657 条私有业务工作流)替换 τ³-Banking;Claude Fable 5.1 与 GPT-6 Astra 并列领先得分 53,OpenAI 占据多数性价比前沿。

核心要点速览 (Key Takeaways)

  • ✓基准:Index v4.3 升级 Terminal-Bench 4.0,并新增 AutomationBench-AA(私有测试集)。
  • ✓权重:含私有任务/答案的评测权重由 40% 升至 45%;Agents/Coding/General/Science 类别权重不变。
  • ✓结果:Claude Fable 5.1 与 GPT-6 Astra 并列 53;开源权重侧 GLM-5.3 / Kimi K3 以 44 领先。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算