2026 实时验证

AI Coding 模型排行榜

聚合全球 7 大权威基准镜像与真实开发任务场景评测。官方公开数据透明对齐,中立客观,无付费排名。

7数据源
104模型总数
0评测用例
October 2026数据周期
2026-10-01最近更新
●我们从 6 大公开评测机构直接拉取原始榜单,不做二次加权、不做综合排名。想深入了解,点每张卡片右上角「查看官方榜单」。
🧩适配矩阵⚔️横向 PK
ADSponsored

📌 7 大官方榜单 · 直连镜像

每张卡片是一家评测机构的 Top-5 缩略图。点「展开完整」查看该机构完整榜单,或直接跳转官方页面。数据 100% 来自各机构,我们不做归纳计算。

LMArena Code ★
真人盲评实时代码生成与编程 Elo 天梯
编码
指标:Coding Elo· 52 个模型
  1. #1Claude Opus 5.51817.8
  2. #2GPT-6 Astra1789.1
  3. #3GPT-6 Sol1758.7
  4. #4Claude Fable 5.11750.7
  5. #5Claude Sonnet 5.51708.7
官方 ↗
LMArena Agent
真人盲评的真实 Agent 编码会话
Agent
指标:Agent Score· 34 个模型
  1. #1Claude Fable 5.114.55
  2. #2Claude Opus 5.513.78
  3. #3GPT-6 Astra12.18
  4. #4GPT-6 Sol10.65
  5. #5Claude Opus 58.76
官方 ↗
CursorBench
Cursor 官方 Agent 编码基准 (v4.0)
Agent
指标:Pass rate%· 12 个模型
  1. #1Claude Opus 5.557.8%
  2. #2Claude Fable 5.151.8%
  3. #3Claude Opus 546.6%
  4. #4Grok 4.746.3%
  5. #5GPT-5.6 Sol41.7%
官方 ↗
Artificial Analysis
专业权威第三方独立大模型智力指数
综合
指标:Intelligence Index· 98 个模型
  1. #1Claude Opus 5.557.6
  2. #2Claude Sonnet 5.556
  3. #3Claude Fable 5.153.4
  4. #4GPT-6 Astra52.7
  5. #5Gemini 4 Argon52.6
官方 ↗
Vals AI
真实世界高价值任务评测 (软件/金融/网络安全/自主智能)
综合
指标:Accuracy%· 30 个模型
  1. #1Gemini 4 Argon68.9%
  2. #2Claude Sonnet 5.567.0%
  3. #3Claude Opus 5.567.0%
  4. #4Claude Fable 5.165.8%
  5. #5Claude Opus 563.7%
官方 ↗
LiveBench
题库定期换新,月度防污染编程评测
编码
指标:Score%· 43 个模型
  1. #1Claude Fable 5.183.4%
  2. #2Claude Opus 5.583.2%
  3. #3Claude Fable 583.0%
  4. #4GPT-6 Astra82.2%
  5. #5Muse Spark 1.381.6%
官方 ↗
LMArena Text
全球主流大模型盲评文本对话与综合能力 Elo 积分
对话
指标:Arena Elo· 89 个模型
  1. #1Gemini 4 Argon1524.8
  2. #2Claude Opus 4.81505.5
  3. #3Claude Fable 51504.9
  4. #4Claude Opus 5.51504
  5. #5Claude Fable 5.11501.2
官方 ↗

LMArena Code编码

指标: Coding Elo·52 个模型·拉取于 2026-10-01

查看官方榜单 ↗
✨

不知道哪个模型最契合你的预算与技术栈?

体验「四大王牌套餐对决」与「$20包月 vs API 真实盈亏平衡测算仪」

前往比价与盈亏测算↗
#模型Coding Elo性价比 Value其他榜单排名选型行动
#11817.8
19.3
L #2
C #1
A #1
V #3
L #2
L #4
#21789.1
7.7
L #3
C—
A #4
V #6
L #4
L #19
#3
GPT-6 SolOpenAI
1758.7
37.5
L #4
C—
A #6
V #8
L #6
L #36
#41750.7
7.5
L #1
C #2
A #3
V #4
L #1
L #5
#51708.7
36.8
L—C—
A #2
V #2
L #17
L—
#6
Claude Opus 5Anthropic
1693.7
4.6
L #5
C #3
A #7
V #5
L #10
L #8
#71679
37.8
L #7
C—
A #5
V #1
L—
L #1
#81671.2
43.9
L #19
C—
A #12
V #24
L #13
L #16
#9
Kimi K3Moonshot AI
1657.8
22.1
L #15
C—
A #15
V #22
L #11
L #10
#101655.4
63
L #12
C #11
A #9
V #9
L #5
L #6
#111636.3
41.5
L #16
C #4
A #11
V #12
L #19
L #44
#12
Hunyuan-T1Tencent
1633.2
479.7
L #11
C—
A #43
V #23
L—
L #34
#131625.6
7.2
L #6
C—
A #8
V #7
L #3
L #3
#14
GLM-5.3Zhipu AI
1622
60.5
L #20
C—
A #13
V #14
L #23
L #17
#151620.1
40.1
L #23
C #6
A #14
V #16
L #15
L #22
#161620
391.2
L #14
C—
A #20
V #19
L #7
L #24
#171619.3
11.5
L #8
C #5
A #10
V #10
L #8
L #13
#18
GLM-5.2Zhipu AI
1604.6
60
L #17
C—
A #31
V—
L #31
L #20
#191592.2
81.7
L #29
C—
A #19
V #20
L #12
L #9
#201590.4
267.8
L #28
C—
A #30
V—
L #27
L #48
#211582.7
79.9
L #18
C #7
A #18
V #13
L #26
L #7
#221582.3
121.7
L #22
C—
A #27
V #25
L #18
L #30
#231581.9
601.5
L #21
C—
A #25
V #21
L #34
L #42
#241557.2
13.2
L #9
C—
A #17
V #11
L #22
L #2
#251552
39.8
L #24
C—
A #22
V #27
L #25
L #27
#261539.5
28.8
L #10
C #9
A #24
V #17
L #24
L #31
#271536.3
75.4
L #33
C—
A #29
V—
L #30
L #14
#281521.6
20.7
L—C—
A #33
V—
L #33
L #25
#291519.5
25.5
L #26
C #8
A #16
V #15
L #16
L #28
#301517.9
238.1
L #27
C #10
A #26
V #18
L #29
L #38
#311517
120.3
L—C—
A #55
V—L—
L #35
#321514.9
212.2
L #30
C—
A #35
V—
L #32
L #23
#33
GPT-5.5OpenAI
1512.1
17.5
L #13
C—
A #23
V—
L #9
L #15
#34
Kimi K2.6Moonshot AI
1508.7
74.1
L—C—
A #40
V—
L #35
L #32
#35
GLM-5.1Zhipu AI
1508.5
54.1
L—C—
A #41
V—L—
L #29
#361499.1
34.8
L—C—
A #32
V #26
L #28
L #18
#37
MiniMax-M3MiniMax
1482.4
185.3
L #31
C—
A #36
V #28
L #41
L #47
#381481.8
224.1
L—C—
A #37
V—
L #37
L #33
#39
Kimi K2.7 CodeMoonshot AI
1472.9
47.6
L—C—
A #42
V—
L #38
L—
#40
GPT-5.4OpenAI
1465.3
28.3
L #25
C—
A #21
V—
L #14
L #21
#411446.2
45.7
L #32
C—
A #34
V #29
L #20
L #11
#421439.7
126.5
L—C—
A #50
V—
L #42
L #37
#431438.9
43.5
L—C—
A #38
V—L—
L #12
#44
GLM-4-PlusZhipu AI
1434.5
73.8
L—C—
A #49
V—L—
L #45
#451397.1
187.1
L—C—
A #48
V—L—
L #54
#461396.9
376.2
L—C—
A #45
V #30
L #36
L #39
#47
DeepSeek-V3DeepSeek
1361.6
542.7
L—C—
A #52
V—L—
L #52
#481356.6
65.8
L—C—
A #44
V—
L #43
L #46
#491329.4
43.2
L—C—
A #56
V—L—
L #56
#501263.1
82.1
L #34
C—
A #62
V—L—
L #50
#51
Mistral Large 3Mistral AI
1229.8
23.5
L—C—
A #75
V—L—
L #55
#521226.8
23.4
L—C—
A #58
V—L—
L #40
排名颜色:#1#2#3#4-5#6-10#11+

「其他榜单排名」列显示该模型在其他榜单里的排名徽章,一眼看清跨榜单表现(灰色 = 该榜单未测过此模型)。各榜单口径不同,数值不可直接横向比较。

LMArena Code 榜:LMSYS 代码竞技场,基于开发者真实盲评代码生成与竞赛挑战计算 Elo 天梯分。数据取自 arena.ai/leaderboard/code 实时同步,我们 1:1 镜像展示,不做二次加权。

ADSponsored
📊 7 大权威数据源方法论

LMArena Code 榜:LMSYS 代码竞技场,基于开发者真实盲评代码生成与竞赛挑战计算 Elo 天梯分。数据取自 arena.ai/leaderboard/code 实时同步,我们 1:1 镜像展示,不做二次加权。

Coding Elo52 个模型

LMArena Agent 榜:基于真实的 Agent 编码与多轮工具会话,由真人盲评打分(signal-based agent score)。数据镜像自 arena.ai/leaderboard/agent。

Agent Score34 个模型

CursorBench 是 Cursor 官方的 Agent 编码基准(v4.0),任务来自真实 Cursor 会话中的多文件、模糊需求场景。指标为 pass rate (%)。数据镜像自 cursor.com/cursorbench 官方快照。

Pass rate%12 个模型

Artificial Analysis 综合指数 (Intelligence Index):专注评估前沿大模型的综合推理、智商与代码质量,覆盖 600+ 主流前沿模型,每日高频跟踪最新发布。

Intelligence Index98 个模型

Vals AI (Vals Index):专注评估全球前沿模型在真实世界高价值复杂任务(软件工程、金融量化、网络安全及自主智能体)中的执行准确率。指标为 Accuracy (%)。数据直接取自 vals.ai/home 官方基准并 1:1 镜像展示。

Accuracy%30 个模型

LiveBench 编程专项:每月定期换新防污染题库,提取代码补全 (code completion)、代码生成 (code generation)、JS、Python 与 TypeScript 等核心编程得分。

Score%43 个模型

LMArena Text 榜:全球最大规模真人盲测竞技场(Chatbot Arena),评估大语言模型跨领域文本生成与复杂指令遵从的综合 Elo 评分。数据实时镜像自 arena.ai/leaderboard/text。

Arena Elo89 个模型

所有排名和数值都直接来自官方数据源,我们只做名称匹配和聚合展示,不做任何加权、加分或二次排名。各榜单方式不同,请勿直接横向比较不同榜单的原始数值。