2026 年 6 月
AI Coder Bench
真实编程任务基准排行。50 项任务,覆盖 Bug 修复、功能开发、重构、系统设计和 Debug & 解释。
6数据源
49模型总数
777任务数
July 2026期间
2026-07-18最近更新
●我们从 6 大公开评测机构直接拉取原始榜单,不做二次加权、不做综合排名。想深入了解,点每张卡片右上角「查看官方榜单」。
📌 4 个视角 · 6 大官方榜单
每张卡片是一家评测机构的 Top-5 缩略图,点击卡片可展开完整榜单,也可以直接跳转到官方页面。
LMArena ★
数十万次真人盲评对话(Elo)
指标:
Arena Elo· 12 个模型- #1Claude Fable 51631
- #2Claude Opus 4.81581
- #3Grok 4.51558
- #4Claude Sonnet 4.61544
- #5Kimi K2.61519
Artificial Analysis
综合 20+ benchmark 的智能指数
指标:
AA Index· 46 个模型- #1Claude Fable 559.9
- #2GPT-5.6 Sol58.9
- #3Kimi K357.1
- #4Claude Opus 4.855.7
- #5GPT-5.6 Terra55
LiveBench
题库定期换新,防止训练污染
指标:
Avg score%· 23 个模型- #1GPT-5.6 Sol82.9%
- #2Claude Fable 581.4%
- #3GPT-5.580.5%
- #4GPT-5.6 Terra80.3%
- #5Claude Opus 4.879.8%
Aider Polyglot
133 道真实编程任务,6 种语言
指标:
Pass rate%· 19 个模型- #1GPT-5.6 Sol88.0%
- #2GPT-5.584.9%
- #3Gemini 2.5 Pro83.1%
- #4Grok 4.579.6%
- #5DeepSeek-V4-Pro74.2%
LiveCodeBench
持续更新的竞赛编程题库
指标:
Pass{'@'}1%· 11 个模型- #1DeepSeek-V4-Pro100.0%
- #2GPT-5.4100.0%
- #3GPT-5.4 mini100.0%
- #4GPT-5.5100.0%
- #5Claude Sonnet 4.6100.0%
EvalPlus
HumanEval+ 严格版测试套件
指标:
HumanEval+%· 17 个模型- #1GPT-5.489.0%
- #2GPT-5.4 mini89.0%
- #3Qwen3.6-Plus87.2%
- #4DeepSeek-V4-Pro86.6%
- #5DeepSeek-V4-Flash83.5%
LMArena对话
| # | 模型 | Arena Elo |
|---|---|---|
| #1 | Claude Fable 5Anthropic | 1631 |
| #2 | Claude Opus 4.8Anthropic | 1581 |
| #3 | Grok 4.5xAI | 1558 |
| #4 | Claude Sonnet 4.6Anthropic | 1544 |
| #5 | Kimi K2.6Moonshot AI | 1519 |
| #6 | GPT-5.5OpenAI | 1488 |
| #7 | Gemini 3 ProGoogle | 1486 |
| #8 | GPT-5.6 SolOpenAI | 1486 |
| #9 | GPT-5.4OpenAI | 1472 |
| #10 | Gemini 2.5 ProGoogle | 1393 |
| #11 | Gemini 3.5 FlashGoogle | 1286 |
| #12 | Gemini 3.1 ProGoogle | 1211 |
排名颜色:#1#2#3#4-5#6-10#11+
「其他榜单排名」列显示该模型在另外 5 个榜单里的排名徽章,一眼看清跨榜单表现(灰色 = 该榜单未测过此模型)。
数十万次真人盲评对话对比(Elo 评分),来自 LMArena/Chatbot Arena。是目前最权威的"用户体验"排行榜。
📊 6 大数据源方法论
Artificial Analysis 综合 20+ benchmark(MMLU-Pro、GPQA、HLE、SciCode、IFBench、Terminal-bench 等)合成一个 Intelligence Index,是"综合能力"最全面的商业评测机构。
AA Index46 个模型所有排名和数值都直接来自官方数据源,我们只做名称匹配和聚合展示,不做任何加权、加分或二次排名。榜单方式各不相同,请勿直接横向比较不同榜单的原始数值。