2026 年 6 月

AI Coder Bench

真实编程任务基准排行。50 项任务,覆盖 Bug 修复、功能开发、重构、系统设计和 Debug & 解释。

6数据源
49模型总数
777任务数
July 2026期间
2026-07-18最近更新
我们从 6 大公开评测机构直接拉取原始榜单,不做二次加权、不做综合排名。想深入了解,点每张卡片右上角「查看官方榜单」。

📌 4 个视角 · 6 大官方榜单

每张卡片是一家评测机构的 Top-5 缩略图,点击卡片可展开完整榜单,也可以直接跳转到官方页面。

LMArena
数十万次真人盲评对话(Elo)
对话
指标:Arena Elo· 12 个模型
  1. #1Claude Fable 51631
  2. #2Claude Opus 4.81581
  3. #3Grok 4.51558
  4. #4Claude Sonnet 4.61544
  5. #5Kimi K2.61519
官方 ↗
Artificial Analysis
综合 20+ benchmark 的智能指数
综合
指标:AA Index· 46 个模型
  1. #1Claude Fable 559.9
  2. #2GPT-5.6 Sol58.9
  3. #3Kimi K357.1
  4. #4Claude Opus 4.855.7
  5. #5GPT-5.6 Terra55
官方 ↗
LiveBench
题库定期换新,防止训练污染
推理
指标:Avg score%· 23 个模型
  1. #1GPT-5.6 Sol82.9%
  2. #2Claude Fable 581.4%
  3. #3GPT-5.580.5%
  4. #4GPT-5.6 Terra80.3%
  5. #5Claude Opus 4.879.8%
官方 ↗
Aider Polyglot
133 道真实编程任务,6 种语言
编码
指标:Pass rate%· 19 个模型
  1. #1GPT-5.6 Sol88.0%
  2. #2GPT-5.584.9%
  3. #3Gemini 2.5 Pro83.1%
  4. #4Grok 4.579.6%
  5. #5DeepSeek-V4-Pro74.2%
官方 ↗
LiveCodeBench
持续更新的竞赛编程题库
推理
指标:Pass{'@'}1%· 11 个模型
  1. #1DeepSeek-V4-Pro100.0%
  2. #2GPT-5.4100.0%
  3. #3GPT-5.4 mini100.0%
  4. #4GPT-5.5100.0%
  5. #5Claude Sonnet 4.6100.0%
官方 ↗
EvalPlus
HumanEval+ 严格版测试套件
编码
指标:HumanEval+%· 17 个模型
  1. #1GPT-5.489.0%
  2. #2GPT-5.4 mini89.0%
  3. #3Qwen3.6-Plus87.2%
  4. #4DeepSeek-V4-Pro86.6%
  5. #5DeepSeek-V4-Flash83.5%
官方 ↗

LMArena对话

指标: Arena Elo·12 个模型·拉取于 2026-07-18

查看官方榜单 ↗
#模型Arena Elo其他榜单排名
#1
Claude Fable 5Anthropic
1631
A #1
L #2
ALE
#2
Claude Opus 4.8Anthropic
1581
A #4
L #5
A #6
L #7
E #9
#3
Grok 4.5xAI
1558
A #7
L #9
A #4
L
E #7
#4
Claude Sonnet 4.6Anthropic
1544
A #8
L #10
A #7
L #5
E #6
#5
Kimi K2.6Moonshot AI
1519
A #17
L #16
A #10
LE
#6
GPT-5.5OpenAI
1488
A #6
L #3
A #2
L #4
E
#7
Gemini 3 ProGoogle
1486
A #24
LALE
#8
GPT-5.6 SolOpenAI
1486
A #2
L #1
A #1
L
E #17
#9
GPT-5.4OpenAI
1472
A #9
L #7
A #8
L #2
E #1
#10
Gemini 2.5 ProGoogle
1393
A #31
L
A #3
L #8
E #8
#11
Gemini 3.5 FlashGoogle
1286
A #12
L #11
ALE
#12
Gemini 3.1 ProGoogle
1211
A #13
L #8
ALE
排名颜色:#1#2#3#4-5#6-10#11+

「其他榜单排名」列显示该模型在另外 5 个榜单里的排名徽章,一眼看清跨榜单表现(灰色 = 该榜单未测过此模型)。

数十万次真人盲评对话对比(Elo 评分),来自 LMArena/Chatbot Arena。是目前最权威的"用户体验"排行榜。

📊 6 大数据源方法论

数十万次真人盲评对话对比(Elo 评分),来自 LMArena/Chatbot Arena。是目前最权威的"用户体验"排行榜。

Arena Elo12 个模型

Artificial Analysis 综合 20+ benchmark(MMLU-Pro、GPQA、HLE、SciCode、IFBench、Terminal-bench 等)合成一个 Intelligence Index,是"综合能力"最全面的商业评测机构。

AA Index46 个模型

LiveBench 每月更新题库,防止模型通过"背题"刷分。覆盖推理、数学、编码、语言、指令跟随、数据分析等 6 大能力。

Avg score%23 个模型

133 道真实编码任务(Bug 修复 / 功能开发),覆盖 6 种语言。指标为 pass_rate_2。

Pass rate%19 个模型

持续更新的竞赛编程题库,指标为 Pass@1。

Pass{'@'}1%11 个模型

HumanEval+ 严格版测试套件,164 道题。

HumanEval+%17 个模型

所有排名和数值都直接来自官方数据源,我们只做名称匹配和聚合展示,不做任何加权、加分或二次排名。榜单方式各不相同,请勿直接横向比较不同榜单的原始数值。