开发者 3 秒速决决策指标
Artificial Analysis(@ArtificialAnlys)发布 Intelligence Index v4.3:将 Terminal-Bench 从 2.1 升至 4.0(改用 mini-SWE-agent),并以与 Zapier 合作的 AutomationBench-AA(657 条私有业务工作流)替换 τ³-Banking;Claude Fable 5.1 与 GPT-6 Astra 并列领先得分 53,OpenAI 占据多数性价比前沿。
核心要点速览 (Key Takeaways)
- ✓基准:Index v4.3 升级 Terminal-Bench 4.0,并新增 AutomationBench-AA(私有测试集)。
- ✓权重:含私有任务/答案的评测权重由 40% 升至 45%;Agents/Coding/General/Science 类别权重不变。
- ✓结果:Claude Fable 5.1 与 GPT-6 Astra 并列 53;开源权重侧 GLM-5.3 / Kimi K3 以 44 领先。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察