# DeepSeek V4 Pro 正式版：拿第三方实测去对流出的跑分表，对不上

> DeepSeek V4 Pro 0813 正式版发布，Artificial Analysis 独立评测综合 53 分排第 23。流出的 Agent 评测表宣称 Terminal Bench 87.9 超过 Opus 4.8，但第三方实测只有 79%，差了近 9 分。本文逐项核对两套数据，还原真实位置。

- 作者: zhuermu
- 发布: 2026-08-13
- 网页版: https://zhuermu.com/blog/deepseek-v4-pro-0813/

---
8 月 13 日，DeepSeek 把 API 里的 `deepseek-v4-pro` 悄悄换成了 `DeepSeek-V4-Pro-0813`。没有发布会，就是文档里改了个版本号——4 月那个挂了快四个月的 preview 版，到这天才算转正。

转正当天，社交媒体上开始传一张 Agent 评测对比表，最抓眼的一行是 Terminal Bench 2.1：DeepSeek 87.9，Claude Opus 4.8 是 85.0。国产模型在 agent 编码上反超顶级闭源模型——这个结论传得很快。

同一天，Artificial Analysis 也把 0813 的独立评测挂上去了。我把两边的数字放在一起对了一遍，发现关键那行对不上。

## 一、先分清这两套数据

- **社交媒体流出的 Agent 评测表**：单项分数很细，但出处存疑，没有第三方复现。
- **Artificial Analysis 的独立评测**：第三方自己跑的，模型标识明确写着 `DeepSeek V4 Pro 0813`，不是 4 月那版。

这两套里，只有后者是别人拿模型实际跑出来的。所以正确的用法不是"两套都列出来给读者看"，而是**用能核对的那套，去查不能核对的那套**。

## 二、独立评测的位置：53 分，第 23 名

AA 的 Intelligence Index 由 9 项评测合成，包括 Terminal-Bench 2.1、Humanity's Last Exam、GPQA Diamond、SciCode、长上下文推理等。

![Artificial Analysis Intelligence Index 完整榜单，DeepSeek V4 Pro 0813 以 53 分位列第 23](/images/blog/deepseek-v4-pro-0813/aa-intelligence-index.png)

**0813 拿到 53 分，在 605 个模型里排第 23。**

前面站着的是：Claude Opus 5（63）、Claude Fable 5（62）、GPT-5.6 Sol（61）、Grok 4.6（61）、Kimi K3（60）、Qwen3.8 Max（58）。和 0813 同为 53 分的有 GLM-5.2、GPT-5.4、GPT-5.6 Terra。

三个可以直接读出来的事实：

**比自己的旧版本进步明显。** 4 月的 V4-Pro (max) 在同一个榜上是 44 分，0813 是 53 分，涨了 9 分。这是第三方测的，不是自己说的。

**跟最强的差一档。** 53 对 Opus 5 的 63，差 10 分。同一份榜单里，53 分大致相当于 Claude Opus 5 开"低思考强度"时的水平。"追平顶级闭源"从综合指标看不成立。

**在国产模型里也不领先。** Kimi K3 拿 60，Qwen3.8 Max 拿 58，都在前面。0813 是和 GLM-5.2 并列。

## 三、关键那行：87.9 还是 79%

Terminal-Bench v2.1 这一项，AA 是独立测过的，可以直接对。

![AA 独立实测的 Terminal-Bench v2.1 排名，DeepSeek 0813 为 79%](/images/blog/deepseek-v4-pro-0813/aa-terminal-bench.png)

**AA 实测：DeepSeek V4 Pro 0813 = 79%。流出表格写的是 87.9。**

差了将近 9 分。更要紧的是排名跟着翻了：

| Terminal-Bench 2.1 | 流出表格 | AA 实测 |
|---|---:|---:|
| DeepSeek V4-Pro-0813 | 87.9 | **79%** |
| Claude Opus 4.8 | 85.0 | **85%** |
| 谁赢 | DeepSeek 赢 2.9 | **Opus 赢 6** |

流出表格里最能传播的那句"超过 Opus 4.8"，在独立实测里是反的。AA 那张图上，0813 的 79% 排在 28 个前沿模型里的倒数第 7，只比 Nemotron 3 Ultra 的 54% 高。

我本来以为这是测试环境不同导致的整体偏移——不同的 harness、不同的重试策略，分数确实会有几分出入。但把表里其他模型也拿去对了一遍之后，这个解释不太成立：

| Terminal-Bench 2.1 | 流出表格 | AA 实测 | 差值 |
|---|---:|---:|---:|
| Claude Opus 4.8 | 85.0 | 85% | **0** |
| Claude Fable 5 | 88.0 | 85% | +3 |
| GLM-5.2 | 81.0 | 78% | +3 |
| Kimi K3 | 88.3 | 85% | +3.3 |
| **DeepSeek 0813** | **87.9** | **79%** | **+8.9** |

竞品那几行的偏差都在 3 分以内，Opus 4.8 甚至是分毫不差。只有 DeepSeek 自己那行高出近 9 分，是其他模型偏差的三倍。这已经不是环境差异能解释的范围了。

再看 HLE（Humanity's Last Exam）这项，AA 同样独立测了：

![AA 独立实测的 HLE 排名](/images/blog/deepseek-v4-pro-0813/aa-hle.png)

**AA 实测 0813 = 39%，流出表格写 42.7。** 这项差 3.7 分，方向一致——两边都显示 DeepSeek 落后。0813 的 39% 在图上是倒数第二。

规律就出来了：**在 DeepSeek 本来就落后的项目上，自报数字和实测大体吻合；在它宣称领先的项目上，自报数字高得足以把输翻成赢。**

## 四、流出表格里其余那些项

那张表还有八九项 AA 没测，没法核对。

![社交媒体流传的 Agent 评测对比表](/images/blog/deepseek-v4-pro-0813/leaked-agent-benchmarks.png)

这些数字我不打算当结论用，但有一点值得留意——它显示的提升幅度实在太大了：

| 评测 | Preview | 0813 | 变化 |
|---|---:|---:|---|
| DeepSWE | 12.8 | 62.7 | +49.9 |
| DSBench-Hard | 31.1 | 67.2 | +36.1 |
| Cybergym | 52.7 | 83.3 | +30.6 |
| DSBench-FullStack | 41.8 | 71.1 | +29.3 |
| NL2Repo | 38.5 | 61.5 | +23.0 |

DeepSWE 从 12.8 跳到 62.7，翻了快五倍。如果真的发生了，那确实是后训练针对工具调用和代码仓库任务做了很重的强化。

但对照上面那张 Terminal-Bench 的核对结果，这些数字我建议先当"待验证"看。毕竟能核对的两项里，一项夸大了 9 分。AA 的综合分只涨了 9 分（44 → 53），跟"某些单项翻五倍"的叙事对不上——如果多个 agent 单项真的都有这种量级的提升，综合分不太可能只动 9 分。

## 五、两个容易被漏掉的数字

**啰嗦程度。** AA 页面上 Verbosity 是 130M tokens，同类中位数 69M。为了拿到这 53 分，0813 生成了接近同类两倍的输出 token。响应更慢，而且按输出 token 计费的话，账单会比单价看起来的更高。

**每任务成本。** AA 有张图专门算这个，把推理消耗折进去之后的真实成本：

![AA 的 Cost per Task 对比](/images/blog/deepseek-v4-pro-0813/aa-cost-per-task.png)

GPT-5.6 Luna $0.05、GLM-5.2 $0.32、Gemini 3.6 Flash $0.56、Kimi K3 $0.84、Claude Opus 5 $2.34、Claude Fable 5 $3.14。

但 0813 这项现在是空的——AA 还没录入它的价格，页面上 Input/Output Price 都显示 $0.00，Speed 也是 N/A。所以它每任务到底多少钱，这张图暂时答不了。看到 $0.00 不要当成免费，那是数据没进去。

还有一点：AA 把 0813 标成 **Proprietary（闭源）**。4 月那批 MIT 开源权重不等于 0813 这个 build，新权重目前没放出来。想自己部署 0813 的，暂时没这个选项。

## 六、最后

把能核对的部分理一遍：

**0813 相比 preview 是真的进步了，9 分的独立综合提升不是小数目。** 这一点没有疑问。

**但它没有追平顶级闭源模型，在国产模型里也不是第一。** Kimi K3 和 Qwen3.8 Max 都在前面。

**那张流出的表不能直接引用。** 它对竞品的数字挺准，对自己的数字在关键项上高了将近 9 分，刚好把一场 6 分的落后写成了 2.9 分的领先。

评测数据和真实工作场景的体感还是有一些差距，感觉可以真的用起来后再看用户的最终体感。

---

**自己核一遍**：本文用到的跑分和定价都可以在[模型对比](/tools/model-comparison/)里横着查，
换算到你自己的用量就用 [LLM 成本计算器](/tools/llm-cost-calculator/)。按实际 token 量算出来的数字，
比任何一张宣传表都更接近你月底的账单——这也是我不建议只看那张流出的表的原因。

---

## 常见问题

### DeepSeek V4 Pro 0813 是什么？

2026 年 8 月 13 日，DeepSeek 将 API 中的 deepseek-v4-pro 从 4 月的 preview 版升级为正式版 DeepSeek-V4-Pro-0813，没有举办发布会，仅在文档中更新了版本号。

### 0813 在第三方评测中表现如何？

Artificial Analysis Intelligence Index 给出 53 分，排在 605 个模型中的第 23 名。相比 4 月 preview 版的 44 分，提升了 9 分，但仍落后于 Claude Opus 5（63）、Kimi K3（60）、Qwen3.8 Max（58）等。

### 流出的 Agent 评测表可信吗？

在可核对的 Terminal Bench 2.1 这一项上，流出表格写 87.9，第三方实测为 79%，高出近 9 分，且方向翻转（表中显示超过 Opus 4.8，实测是落后 6 分）。竞品偏差仅 0-3 分，只有 DeepSeek 自己那行异常偏高。

### 0813 是开源的吗？

Artificial Analysis 将 0813 标记为 Proprietary（闭源）。4 月开源的 MIT 权重是旧版本，0813 的新权重尚未公开发布。


---

## 参考资料

- [Artificial Analysis — DeepSeek V4 Pro 0813](https://artificialanalysis.ai/models/deepseek-v4-pro) — Artificial Analysis
- [DeepSeek V4 Pro API 文档](https://api-docs.deepseek.com/) — DeepSeek 官方
