DeepSeek V4 Pro 正式版:拿第三方实测去对流出的跑分表,对不上

DeepSeek V4 Pro 0813 正式版发布,Artificial Analysis 独立评测综合 53 分排第 23。流出的 Agent 评测表宣称 Terminal Bench 87.9 超过 Opus 4.8,但第三方实测只有 79%,差了近 9 分。本文逐项核对两套数据,还原真实位置。

zhuermu··10 分钟
DeepSeekDeepSeek V4 Pro模型评测Artificial AnalysisTerminal BenchAgent 编码
DeepSeek V4 Pro 正式版:拿第三方实测去对流出的跑分表,对不上

8 月 13 日,DeepSeek 把 API 里的 deepseek-v4-pro 悄悄换成了 DeepSeek-V4-Pro-0813。没有发布会,就是文档里改了个版本号——4 月那个挂了快四个月的 preview 版,到这天才算转正。

转正当天,社交媒体上开始传一张 Agent 评测对比表,最抓眼的一行是 Terminal Bench 2.1:DeepSeek 87.9,Claude Opus 4.8 是 85.0。国产模型在 agent 编码上反超顶级闭源模型——这个结论传得很快。

同一天,Artificial Analysis 也把 0813 的独立评测挂上去了。我把两边的数字放在一起对了一遍,发现关键那行对不上。

一、先分清这两套数据#

  • 社交媒体流出的 Agent 评测表:单项分数很细,但出处存疑,没有第三方复现。
  • Artificial Analysis 的独立评测:第三方自己跑的,模型标识明确写着 DeepSeek V4 Pro 0813,不是 4 月那版。

这两套里,只有后者是别人拿模型实际跑出来的。所以正确的用法不是”两套都列出来给读者看”,而是用能核对的那套,去查不能核对的那套

二、独立评测的位置:53 分,第 23 名#

AA 的 Intelligence Index 由 9 项评测合成,包括 Terminal-Bench 2.1、Humanity’s Last Exam、GPQA Diamond、SciCode、长上下文推理等。

Artificial Analysis Intelligence Index 完整榜单,DeepSeek V4 Pro 0813 以 53 分位列第 23

0813 拿到 53 分,在 605 个模型里排第 23。

前面站着的是:Claude Opus 5(63)、Claude Fable 5(62)、GPT-5.6 Sol(61)、Grok 4.6(61)、Kimi K3(60)、Qwen3.8 Max(58)。和 0813 同为 53 分的有 GLM-5.2、GPT-5.4、GPT-5.6 Terra。

三个可以直接读出来的事实:

比自己的旧版本进步明显。 4 月的 V4-Pro (max) 在同一个榜上是 44 分,0813 是 53 分,涨了 9 分。这是第三方测的,不是自己说的。

跟最强的差一档。 53 对 Opus 5 的 63,差 10 分。同一份榜单里,53 分大致相当于 Claude Opus 5 开”低思考强度”时的水平。“追平顶级闭源”从综合指标看不成立。

在国产模型里也不领先。 Kimi K3 拿 60,Qwen3.8 Max 拿 58,都在前面。0813 是和 GLM-5.2 并列。

三、关键那行:87.9 还是 79%#

Terminal-Bench v2.1 这一项,AA 是独立测过的,可以直接对。

AA 独立实测的 Terminal-Bench v2.1 排名,DeepSeek 0813 为 79%

AA 实测:DeepSeek V4 Pro 0813 = 79%。流出表格写的是 87.9。

差了将近 9 分。更要紧的是排名跟着翻了:

Terminal-Bench 2.1流出表格AA 实测
DeepSeek V4-Pro-081387.979%
Claude Opus 4.885.085%
谁赢DeepSeek 赢 2.9Opus 赢 6

流出表格里最能传播的那句”超过 Opus 4.8”,在独立实测里是反的。AA 那张图上,0813 的 79% 排在 28 个前沿模型里的倒数第 7,只比 Nemotron 3 Ultra 的 54% 高。

我本来以为这是测试环境不同导致的整体偏移——不同的 harness、不同的重试策略,分数确实会有几分出入。但把表里其他模型也拿去对了一遍之后,这个解释不太成立:

Terminal-Bench 2.1流出表格AA 实测差值
Claude Opus 4.885.085%0
Claude Fable 588.085%+3
GLM-5.281.078%+3
Kimi K388.385%+3.3
DeepSeek 081387.979%+8.9

竞品那几行的偏差都在 3 分以内,Opus 4.8 甚至是分毫不差。只有 DeepSeek 自己那行高出近 9 分,是其他模型偏差的三倍。这已经不是环境差异能解释的范围了。

再看 HLE(Humanity’s Last Exam)这项,AA 同样独立测了:

AA 独立实测的 HLE 排名

AA 实测 0813 = 39%,流出表格写 42.7。 这项差 3.7 分,方向一致——两边都显示 DeepSeek 落后。0813 的 39% 在图上是倒数第二。

规律就出来了:在 DeepSeek 本来就落后的项目上,自报数字和实测大体吻合;在它宣称领先的项目上,自报数字高得足以把输翻成赢。

四、流出表格里其余那些项#

那张表还有八九项 AA 没测,没法核对。

社交媒体流传的 Agent 评测对比表

这些数字我不打算当结论用,但有一点值得留意——它显示的提升幅度实在太大了:

评测Preview0813变化
DeepSWE12.862.7+49.9
DSBench-Hard31.167.2+36.1
Cybergym52.783.3+30.6
DSBench-FullStack41.871.1+29.3
NL2Repo38.561.5+23.0

DeepSWE 从 12.8 跳到 62.7,翻了快五倍。如果真的发生了,那确实是后训练针对工具调用和代码仓库任务做了很重的强化。

但对照上面那张 Terminal-Bench 的核对结果,这些数字我建议先当”待验证”看。毕竟能核对的两项里,一项夸大了 9 分。AA 的综合分只涨了 9 分(44 → 53),跟”某些单项翻五倍”的叙事对不上——如果多个 agent 单项真的都有这种量级的提升,综合分不太可能只动 9 分。

五、两个容易被漏掉的数字#

啰嗦程度。 AA 页面上 Verbosity 是 130M tokens,同类中位数 69M。为了拿到这 53 分,0813 生成了接近同类两倍的输出 token。响应更慢,而且按输出 token 计费的话,账单会比单价看起来的更高。

每任务成本。 AA 有张图专门算这个,把推理消耗折进去之后的真实成本:

AA 的 Cost per Task 对比

GPT-5.6 Luna $0.05、GLM-5.2 $0.32、Gemini 3.6 Flash $0.56、Kimi K3 $0.84、Claude Opus 5 $2.34、Claude Fable 5 $3.14。

但 0813 这项现在是空的——AA 还没录入它的价格,页面上 Input/Output Price 都显示 $0.00,Speed 也是 N/A。所以它每任务到底多少钱,这张图暂时答不了。看到 $0.00 不要当成免费,那是数据没进去。

还有一点:AA 把 0813 标成 Proprietary(闭源)。4 月那批 MIT 开源权重不等于 0813 这个 build,新权重目前没放出来。想自己部署 0813 的,暂时没这个选项。

六、最后#

把能核对的部分理一遍:

0813 相比 preview 是真的进步了,9 分的独立综合提升不是小数目。 这一点没有疑问。

但它没有追平顶级闭源模型,在国产模型里也不是第一。 Kimi K3 和 Qwen3.8 Max 都在前面。

那张流出的表不能直接引用。 它对竞品的数字挺准,对自己的数字在关键项上高了将近 9 分,刚好把一场 6 分的落后写成了 2.9 分的领先。

评测数据和真实工作场景的体感还是有一些差距,感觉可以真的用起来后再看用户的最终体感。


自己核一遍:本文用到的跑分和定价都可以在模型对比里横着查, 换算到你自己的用量就用 LLM 成本计算器。按实际 token 量算出来的数字, 比任何一张宣传表都更接近你月底的账单——这也是我不建议只看那张流出的表的原因。

参考资料

  1. Artificial Analysis — DeepSeek V4 Pro 0813 — Artificial Analysis
  2. DeepSeek V4 Pro API 文档 — DeepSeek 官方

常见问题

DeepSeek V4 Pro 0813 是什么?
2026 年 8 月 13 日,DeepSeek 将 API 中的 deepseek-v4-pro 从 4 月的 preview 版升级为正式版 DeepSeek-V4-Pro-0813,没有举办发布会,仅在文档中更新了版本号。
0813 在第三方评测中表现如何?
Artificial Analysis Intelligence Index 给出 53 分,排在 605 个模型中的第 23 名。相比 4 月 preview 版的 44 分,提升了 9 分,但仍落后于 Claude Opus 5(63)、Kimi K3(60)、Qwen3.8 Max(58)等。
流出的 Agent 评测表可信吗?
在可核对的 Terminal Bench 2.1 这一项上,流出表格写 87.9,第三方实测为 79%,高出近 9 分,且方向翻转(表中显示超过 Opus 4.8,实测是落后 6 分)。竞品偏差仅 0-3 分,只有 DeepSeek 自己那行异常偏高。
0813 是开源的吗?
Artificial Analysis 将 0813 标记为 Proprietary(闭源)。4 月开源的 MIT 权重是旧版本,0813 的新权重尚未公开发布。
分享这篇文章 微博 X LinkedIn
微信扫码

用微信扫一扫,把文章带到聊天或朋友圈。

继续阅读