DeepSeek V4 Pro 正式版:拿第三方实测去对流出的跑分表,对不上
DeepSeek V4 Pro 0813 正式版发布,Artificial Analysis 独立评测综合 53 分排第 23。流出的 Agent 评测表宣称 Terminal Bench 87.9 超过 Opus 4.8,但第三方实测只有 79%,差了近 9 分。本文逐项核对两套数据,还原真实位置。

8 月 13 日,DeepSeek 把 API 里的 deepseek-v4-pro 悄悄换成了 DeepSeek-V4-Pro-0813。没有发布会,就是文档里改了个版本号——4 月那个挂了快四个月的 preview 版,到这天才算转正。
转正当天,社交媒体上开始传一张 Agent 评测对比表,最抓眼的一行是 Terminal Bench 2.1:DeepSeek 87.9,Claude Opus 4.8 是 85.0。国产模型在 agent 编码上反超顶级闭源模型——这个结论传得很快。
同一天,Artificial Analysis 也把 0813 的独立评测挂上去了。我把两边的数字放在一起对了一遍,发现关键那行对不上。
一、先分清这两套数据#
- 社交媒体流出的 Agent 评测表:单项分数很细,但出处存疑,没有第三方复现。
- Artificial Analysis 的独立评测:第三方自己跑的,模型标识明确写着
DeepSeek V4 Pro 0813,不是 4 月那版。
这两套里,只有后者是别人拿模型实际跑出来的。所以正确的用法不是”两套都列出来给读者看”,而是用能核对的那套,去查不能核对的那套。
二、独立评测的位置:53 分,第 23 名#
AA 的 Intelligence Index 由 9 项评测合成,包括 Terminal-Bench 2.1、Humanity’s Last Exam、GPQA Diamond、SciCode、长上下文推理等。

0813 拿到 53 分,在 605 个模型里排第 23。
前面站着的是:Claude Opus 5(63)、Claude Fable 5(62)、GPT-5.6 Sol(61)、Grok 4.6(61)、Kimi K3(60)、Qwen3.8 Max(58)。和 0813 同为 53 分的有 GLM-5.2、GPT-5.4、GPT-5.6 Terra。
三个可以直接读出来的事实:
比自己的旧版本进步明显。 4 月的 V4-Pro (max) 在同一个榜上是 44 分,0813 是 53 分,涨了 9 分。这是第三方测的,不是自己说的。
跟最强的差一档。 53 对 Opus 5 的 63,差 10 分。同一份榜单里,53 分大致相当于 Claude Opus 5 开”低思考强度”时的水平。“追平顶级闭源”从综合指标看不成立。
在国产模型里也不领先。 Kimi K3 拿 60,Qwen3.8 Max 拿 58,都在前面。0813 是和 GLM-5.2 并列。
三、关键那行:87.9 还是 79%#
Terminal-Bench v2.1 这一项,AA 是独立测过的,可以直接对。

AA 实测:DeepSeek V4 Pro 0813 = 79%。流出表格写的是 87.9。
差了将近 9 分。更要紧的是排名跟着翻了:
| Terminal-Bench 2.1 | 流出表格 | AA 实测 |
|---|---|---|
| DeepSeek V4-Pro-0813 | 87.9 | 79% |
| Claude Opus 4.8 | 85.0 | 85% |
| 谁赢 | DeepSeek 赢 2.9 | Opus 赢 6 |
流出表格里最能传播的那句”超过 Opus 4.8”,在独立实测里是反的。AA 那张图上,0813 的 79% 排在 28 个前沿模型里的倒数第 7,只比 Nemotron 3 Ultra 的 54% 高。
我本来以为这是测试环境不同导致的整体偏移——不同的 harness、不同的重试策略,分数确实会有几分出入。但把表里其他模型也拿去对了一遍之后,这个解释不太成立:
| Terminal-Bench 2.1 | 流出表格 | AA 实测 | 差值 |
|---|---|---|---|
| Claude Opus 4.8 | 85.0 | 85% | 0 |
| Claude Fable 5 | 88.0 | 85% | +3 |
| GLM-5.2 | 81.0 | 78% | +3 |
| Kimi K3 | 88.3 | 85% | +3.3 |
| DeepSeek 0813 | 87.9 | 79% | +8.9 |
竞品那几行的偏差都在 3 分以内,Opus 4.8 甚至是分毫不差。只有 DeepSeek 自己那行高出近 9 分,是其他模型偏差的三倍。这已经不是环境差异能解释的范围了。
再看 HLE(Humanity’s Last Exam)这项,AA 同样独立测了:

AA 实测 0813 = 39%,流出表格写 42.7。 这项差 3.7 分,方向一致——两边都显示 DeepSeek 落后。0813 的 39% 在图上是倒数第二。
规律就出来了:在 DeepSeek 本来就落后的项目上,自报数字和实测大体吻合;在它宣称领先的项目上,自报数字高得足以把输翻成赢。
四、流出表格里其余那些项#
那张表还有八九项 AA 没测,没法核对。

这些数字我不打算当结论用,但有一点值得留意——它显示的提升幅度实在太大了:
| 评测 | Preview | 0813 | 变化 |
|---|---|---|---|
| DeepSWE | 12.8 | 62.7 | +49.9 |
| DSBench-Hard | 31.1 | 67.2 | +36.1 |
| Cybergym | 52.7 | 83.3 | +30.6 |
| DSBench-FullStack | 41.8 | 71.1 | +29.3 |
| NL2Repo | 38.5 | 61.5 | +23.0 |
DeepSWE 从 12.8 跳到 62.7,翻了快五倍。如果真的发生了,那确实是后训练针对工具调用和代码仓库任务做了很重的强化。
但对照上面那张 Terminal-Bench 的核对结果,这些数字我建议先当”待验证”看。毕竟能核对的两项里,一项夸大了 9 分。AA 的综合分只涨了 9 分(44 → 53),跟”某些单项翻五倍”的叙事对不上——如果多个 agent 单项真的都有这种量级的提升,综合分不太可能只动 9 分。
五、两个容易被漏掉的数字#
啰嗦程度。 AA 页面上 Verbosity 是 130M tokens,同类中位数 69M。为了拿到这 53 分,0813 生成了接近同类两倍的输出 token。响应更慢,而且按输出 token 计费的话,账单会比单价看起来的更高。
每任务成本。 AA 有张图专门算这个,把推理消耗折进去之后的真实成本:

GPT-5.6 Luna $0.05、GLM-5.2 $0.32、Gemini 3.6 Flash $0.56、Kimi K3 $0.84、Claude Opus 5 $2.34、Claude Fable 5 $3.14。
但 0813 这项现在是空的——AA 还没录入它的价格,页面上 Input/Output Price 都显示 $0.00,Speed 也是 N/A。所以它每任务到底多少钱,这张图暂时答不了。看到 $0.00 不要当成免费,那是数据没进去。
还有一点:AA 把 0813 标成 Proprietary(闭源)。4 月那批 MIT 开源权重不等于 0813 这个 build,新权重目前没放出来。想自己部署 0813 的,暂时没这个选项。
六、最后#
把能核对的部分理一遍:
0813 相比 preview 是真的进步了,9 分的独立综合提升不是小数目。 这一点没有疑问。
但它没有追平顶级闭源模型,在国产模型里也不是第一。 Kimi K3 和 Qwen3.8 Max 都在前面。
那张流出的表不能直接引用。 它对竞品的数字挺准,对自己的数字在关键项上高了将近 9 分,刚好把一场 6 分的落后写成了 2.9 分的领先。
评测数据和真实工作场景的体感还是有一些差距,感觉可以真的用起来后再看用户的最终体感。
自己核一遍:本文用到的跑分和定价都可以在模型对比里横着查, 换算到你自己的用量就用 LLM 成本计算器。按实际 token 量算出来的数字, 比任何一张宣传表都更接近你月底的账单——这也是我不建议只看那张流出的表的原因。
参考资料
- Artificial Analysis — DeepSeek V4 Pro 0813 — Artificial Analysis
- DeepSeek V4 Pro API 文档 — DeepSeek 官方
常见问题
DeepSeek V4 Pro 0813 是什么?
0813 在第三方评测中表现如何?
流出的 Agent 评测表可信吗?
0813 是开源的吗?
微信扫码
用微信扫一扫,把文章带到聊天或朋友圈。
继续阅读
- AI 与 Agent
Kimi K3 正式发布:2.8 万亿参数全开源,这次真的不一样
月之暗面发布 Kimi K3:2.8 万亿参数、全球首个开源 3T 级模型、100 万 token 上下文、原生多模态。本文深度解读 KDA 与 AttnRes 架构创新、Artificial Analysis 全球第四的评测成绩、对齐 Claude Sonnet 5 的定价信号,以及开源前沿模型对整个行业的四层长远影响。
- AI 与 Agent
提示缓存(一):到底缓存了什么
prompt caching 省下的不是网络往返,而是 prefill 阶段的算力。本文讲清 KV cache 从哪来、前缀哈希为什么要求逐 token 一致、TTL 为什么必须存在,以及缓存写入为什么会比不缓存更贵。
- AI 与 Agent
提示缓存(二):五家厂商三家云的账单差异
AWS 文档说 Claude Sonnet 4.5 在 Bedrock 上要 4096 token 才能缓存,我实测是 1024——和一方 API 一样。本文对照五家模型厂商与三家云的当期倍率、TTL 档位、跨区域行为,并区分哪些数字是实测的、哪些只是文档值。
- AI 与 Agent
提示缓存(三):开了却没命中,怎么查
提示缓存失效几乎不报错——推理成功、日志干净、只有账单变贵。本文按出现频率拆四类元凶:前缀混进易变内容、序列化顺序抖动、工具顺序不稳、中间层静默吞掉缓存标记,并给出一个跨厂商的命中率自检脚本。