20260814 大模型横评

数据截至 2026 年 8 月 14 日。 综合测评优先采用 Artificial Analysis 当前统一口径;价格采用各厂商官方 API 价格。DeepSeek 直接使用 8 月 16 日起生效的新价格

1. 综合能力排名

Artificial Analysis Intelligence Index v4.1.1,统一取高能力档位。

模型AA Intelligence输出速度Context权重
Claude Opus 56352.7 tok/s1M闭源
Claude Fable 562≈64 tok/s1M闭源
GPT-5.6 Sol6161.7 tok/s1M闭源
Kimi K36039.1 tok/s1M开放
GPT-5.6 Terra57115.5 tok/s1M闭源
Claude Sonnet 55565.8 tok/s1M闭源
GLM-5.253107.4 tok/s1M开放
DeepSeek V4 Pro 08135378.4 tok/s1M开放
GPT-5.6 Luna52155.3 tok/s1M闭源
DeepSeek V4 Flash 073152119.9 tok/s1M开放

(Artificial Analysis)


2. Coding Agent 独立测评

Artificial Analysis Coding Agent Index v1.3。该榜单统一由 DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA 三项组成。

模型 / AgentCoding IndexDeepSWETerminal-Bench v2SWE-Atlas-QnA
Claude Opus 5 xhigh / Claude Code6760%85%55%
GPT-5.6 Sol max / Codex6769%88%43%
Claude Fable 5 max / Claude Code6666%83%49%
GPT-5.6 Terra max / Codex6267%84%36%
Kimi K3 / Kimi Code6164%84%37%
GPT-5.6 Luna max / Codex5963%80%33%
DeepSeek V4 Flash max / Codex5543%85%39%
GLM-5.2 / Claude Code4329%72%29%
DeepSeek V4 Pro high / Claude Code319%66%20%

(Artificial Analysis)


3. 三个最新国产模型:公开 Agent Benchmark

BenchmarkKimi K3GLM-5.3DeepSeek V4 Pro 0813
DeepSWE v1.167.366.962.7
Terminal-Bench 2.188.387.9
Terminal-Bench 3.028.3
Agents’ Last Exam28.525.7
CyberGym84.583.3
ExploitBench54.4
Toolathlon-Verified74.1
BrowseComp90.4
FrontierSWE81.2
GDPval-AA v2 Elo1769

(Kimi AI)


4. API 价格总表

单位全部为 美元 / 100 万 Token

DeepSeek 使用 2026 年 8 月 16 日 16:00 UTC 起的新价格

模型Cached InputInputOutputAA Intelligence
Claude Fable 5$1.00$10.00$50.0062
GPT-5.6 Sol$0.50$5.00$30.0061
Claude Opus 5$0.50$5.00$25.0063
Kimi K3$0.30$3.00$15.0060
GPT-5.6 Terra$0.20$2.00$12.0057
Claude Sonnet 5$0.20$2.00$10.0055
GLM-5.2$0.26$1.40$4.4053
DeepSeek V4 Pro · Peak$0.044$1.32$3.9653
DeepSeek V4 Pro · Off-Peak$0.022$0.66$1.9853
DeepSeek V4 Flash · Peak$0.014$0.44$1.3252
GPT-5.6 Luna$0.02$0.20$1.2052
DeepSeek V4 Flash · Off-Peak$0.007$0.22$0.6652

价格均来自厂商官方定价页面。Kimi K3 官方价为 ($0.30 / $3 / $15);GLM-5.2 为 ($0.26 / $1.40 / $4.40);Claude Fable / Opus / Sonnet 分别为 ($10 / $50)、($5 / $25)、($2 / $10);GPT-5.6 Sol / Terra / Luna 标准短上下文分别为 ($5 / $30)、($2 / $12)、($0.20 / $1.20)。(Kimi AI)

DeepSeek 新定价中,V4 Pro 为 Peak ($1.32 / $3.96)、Off-Peak ($0.66 / $1.98);V4 Flash 为 Peak ($0.44 / $1.32)、Off-Peak ($0.22 / $0.66)。(DeepSeek API Docs)


5. 把“性能”和“花多少钱”直接摆在一起

统一假设一次工作量:

1M 非缓存输入 + 200K 输出

不计算缓存。

成本排名模型AA Intelligence一次工作量成本
1DeepSeek V4 Flash · Off-Peak52$0.352
2GPT-5.6 Luna52$0.440
3DeepSeek V4 Flash · Peak52$0.704
4DeepSeek V4 Pro · Off-Peak53$1.056
5DeepSeek V4 Pro · Peak53$2.112
6GLM-5.253$2.280
7Claude Sonnet 555$4.000
8GPT-5.6 Terra57$4.400
9Kimi K360$6.000
10Claude Opus 563$10.000
11GPT-5.6 Sol61$11.000
12Claude Fable 562$20.000

价格基础数据:(DeepSeek API Docs)


6. 最简版数据结论

维度当前结果
AA 综合最高Claude Opus 5 — 63
国产 / 开放模型综合最高Kimi K3 — 60
Coding Agent Index 最高GPT-5.6 Sol / Claude Opus 5 — 67
国产 Coding Agent Index 最高Kimi K3 — 61
最快输出GPT-5.6 Luna — 155.3 tok/s
52 分档最低 API 成本DeepSeek V4 Flash Off-Peak
53 分档最低 API 成本DeepSeek V4 Pro Off-Peak
60+ 分档最低固定工作量成本Kimi K3 — $6.00
当前综合最高开放模型Kimi K3
最新但尚无 AA 统一分数GLM-5.3

数据说明

  • GLM-5.3 于 8 月 14 日发布,AA 尚未完成统一评测,因此不拿 GLM-5.2 的 53 分冒充 GLM-5.3。 GLM-5.3 的官方 API 目前仍标为 coming soon,因此价格表继续使用可正式按 Token 调用的 GLM-5.2。(Overview - Z.AI DEVELOPER DOCUMENT)
  • DeepSeek 全文已经直接采用新价格;Peak 为 UTC 01:00–04:00、06:00–10:00,其余时间为 Off-Peak。(DeepSeek API Docs)
  • OpenAI 表格采用 Standard、Short Context 价格;长上下文请求有独立费率。(OpenAI Developers)
  • Coding Agent 测试会受到 Agent Harness 影响,因此单独使用 AA Coding Agent Index,不和厂商自测结果混算。(Artificial Analysis)