开发者 3 秒速决决策指标
Vals AI 发布 MysteryMechanism 基准,测试智能体能否通过有限实验从零还原被封存的科学数学机制。GPT-6 Astra 以 53.2% 准确率领先,Claude Fable 5.1 为 47.8%、Claude Opus 5 为 37.4%;Astra 单测约 1.77 美元,约为亚军 Fable 5.1(5.63 美元)的三分之一。
核心要点速览 (Key Takeaways)
- ✓MysteryMechanism:从封存机制与有限实验中还原科学关系的新基准
- ✓GPT-6 Astra 53.2% 登顶,领先 Claude Fable 5.1(47.8%)与 Opus 5(37.4%)
- ✓Astra 单测约 1.77 美元,约为亚军 Fable 5.1(5.63 美元)的三分之一
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察