# 我不再蹲模型发布了：换了半年最强模型，我的幻觉一点没少

> 半年里 Opus 主力型号发了四代、价格没动，我天天拿最新模型干活，热情却没了、幻觉也没少。这篇把六条困惑一条条摊开：榜单、幻觉、真实提效、harness、对 Agent 的过度依赖，以及自己被提速多少的错觉。

- 作者: zhuermu
- 发布: 2026-09-02
- 网页版: https://zhuermu.com/blog/model-plateau-agent-reliance/

---
Claude Fable 5.1 刚刚发布，官方说它已经在所有平台上线。[19] 放在半年前，我大概已经开始找评测、拉表格、准备趁热点拼一篇文章了。现在看到这条消息，我没有那么兴奋，第一反应是「哦，又更新了」，然后随手划走。

今年来模型的发布和更新很多很频繁，但是似乎模型的智能已经达到了某个临界值了。各家新模型总是各种刷榜、号称史上最强，实际干起活来和之前的模型感觉区别不大，有些评测似乎还有退化。

首先非常庆幸自己所在的公司可以免费几乎无限量的用当前最前沿的模型(OpenAI 和 Anthropic)，我以前总在蹲新的模型发布信息，然后趁热点用模型抓取各种评测信息来组合一篇文章。这半年我基本没停过手，天天拿最新的模型干活，热情反而慢慢没了，还攒了一肚子说不明白的问题。这篇就想把这问题一条条摊开，顺便让AI查了不少资料，看看是我的错觉，还是真的在快速进度。

---

## 1 半年里 Opus 发了四代，我却没有感觉干活更好

Opus 4.6 是 2026 年 2 月 5 日发的，Opus 5 是 7 月 24 日发的。[1][2] 中间还夹着 4.7 和 4.8——4.8 是 5 月 28 日，距 4.7 只隔了六周左右。[15][16]

也就是说，**半年里 Opus 主力型号发了四代，节奏差不多每六周一次，而且四代的定价一直没动，都是每百万 token 5 美元进、25 美元出。**[1][2][16]

![半年内 Opus 从 4.6 到 5 共发布四代，间隔约六周，定价始终不变](/images/blog/model-plateau-agent-reliance/01-opus-timeline.png)

*图 1：四代之间价格没变，我的体感差异也越来越小*

我刷小红书的评论很多人都偏爱 4.6 那一版的。不过可能我看到的样本很小，也没拿出大样本的偏好数据。也看到有人解释：最新模型不说人话，是不是一种过训练拟合，查下来也没有证据能支撑这种说法，硬套上去只是让判断显得像那么回事。

所以这条我也无法解释，只保留个人体感：发布越来越频繁，我的「哇」越来越少。

## 2 那我为何每次都用最新版本的来干活呢？

如果新模型真没用，我为什么还一直换？

想下来，我是把「模型更强」这一件事糊成了一团。它其实至少是四件事：能力上限、事实可靠性、说话风格、成本和速度。

- 能力上限确实在涨。这个我认。官方说 Opus 5 在好几个编码和知识工作评测上是当时最强。[2]
- 成本几乎没动——四代都是 5/25。[1][2] 速度有快有慢。
- 输出风格是众口难调，也是「偏爱 4.6」这种话的来源，纯主观。
- 而**事实可靠性**，就是它会不会一本正经地瞎说——这一块，我的体感是基本没怎么动。

![模型能力上限持续上涨，但可靠性基本横盘、个人实际产出几乎不动的三条曲线示意](/images/blog/model-plateau-agent-reliance/02-three-curves.png)

*图 2：能力上限的曲线一直往上，可靠性和我的实际产出却几乎贴着底*

连模型厂自己都在说榜单没那么值钱。Anthropic 的工程博客直接写：这些编码榜单顶部的名次，常常只差几个百分点，他们甚至专门去研究评测里的「基础设施噪声」。[10]

榜单还有更离谱的。有第三方梳理过，2026 年 6 月 SWE-bench Verified 榜首报了 95%，可一百条成绩里九十九条是厂商自报的，同一族模型换到标准化的评测环境里，分数低一大截。

能力上限那点涨幅，被榜单包装放大了。如果盯着榜单追新，追的其实是被放大的那部分。

## 3 我天天用最新模型，幻觉为什么半年没少？

新的模型发布，是不是就能让任务效率提升、让工作中的幻觉减少？我个人每天都在用最前沿的模型完成各种工作，但幻觉依然严重，半年前存在的问题现在依然存在。我一度以为是自己用得不对。

结果查到一篇 OpenAI 的论文，2025 年 9 月发的，它的核心主张是：模型会幻觉，是因为现在的训练和评测方式，奖励「自信地猜」，而不是奖励「承认不知道」。[11][12] 这篇论文还从理论上把幻觉建模成一个二元分类里的错误，也就是判断「这句话对不对」时的出错，用这个视角解释为什么幻觉没那么神秘。OpenAI 官网那篇和 arXiv 上那篇是同一项工作的两个版本，不能作为相互论证的依据。那有没有别人做的、独立的证据？我又找了两篇。一篇是 Miao 和 Kearns 的实证研究，他们在小模型上人为控制「只出现过一次的稀有事实」的比例，发现这个比例越高，幻觉就越多——这支持「幻觉和稀有、单例事实有关」这条机制，但它没有直接证明是评测激励在作怪。[17] 另一篇是 Jiayun Wu 等人的预印本，说得更直接：现在主流的二元奖励强化学习，等于把模型训练成「一个好的应试者」，只要答对的概率大于零就鼓励它去蒙；而让模型学会在没把握时弃答、承认不确定，校准就明显变好。[18] 这两篇一个偏机制、一个偏训练方式，方向和 OpenAI 那篇是对得上的。

如果考试规则是「蒙对了得分、说不会得零分」，那学生当然全都硬着头皮蒙。换个更强的模型，只是换了个更会考试的学生，可考试规则没变。幻觉不会因为模型变强就自己消失。

所以不是我用错了。是我一直指望「换新模型」去解决一个「换新模型解决不了」的问题。

## 4 这些东西到底让我的效率提升了多少

我一直觉得自己有 AI 之后快多了。这次我特意去找了正经的实验，不是厂商软文那种。

 BCG 和哈佛的实验： 758 个咨询顾问，18 个「AI 能力范围内」的任务。用 GPT-4 的人多完成 12.2% 的任务、快 25.1%、质量高 40%。[5] 听着很爽。这篇论文还有下半句：**碰到「能力范围外」的任务，用 AI 的人答对的概率反而低了 19 个百分点。**[5] 他们管这叫「锯齿状前沿」——AI 好用，但它的能力边界是锯齿形的，你看不清哪儿是齿尖哪儿是齿谷，一脚踩空就被它自信地带沟里。这篇今年 3 月正式发在 Organization Science 上了。

 还有METR 的那实验。它是个非营利机构，找了 16 个资深开源开发者，在他们自己维护多年、动辄百万行的仓库上，用自己报的真实任务做随机对照。结论反直觉：**允许用 AI 的时候，他们反而慢了 19%。**[3][4]

但开发者的感知却不一样。这些开发者事前预期 AI 能让他们快 24%，干完之后，即便实际慢了，他们还是觉得自己快了 20%。[3] 这不就是我吗——我一直觉得自己在提速，可能只是「觉得」而已。

不过 METR 自己在 2026 年 2 月出了个更新：这个「变慢」是 2025 早期的工具、资深开发者、在自己最熟的大仓库里跑出来的，不能代表所有人。他们 2025 晚期的新一轮数据显示，虽然因为「开发者不愿意不用 AI 干活」产生了很大的选择偏差、信号很弱，但原始结果已经开始显示提速的迹象了。[8] 官方原话是，2025 早期的结论「已经不能代表当前的影响」。

所以我不能拿这条去判断「AI 让所有人变慢」。但却告诉我：自己被提速多少的判断，可能一直是虚高的。

## 5 为什么大家现在更多聊 harness 了

今年 harness 相关的讨论似乎比模型发布更热。圈里的热闹从「哪个模型强」挪到了「怎么把模型套起来用」——上下文怎么喂、给什么工具、怎么让它长时间续着跑，也就是所谓的 harness、scaffold、context engineering。

我原本以为这只是我个人体感，但查下来发现这事有实打实的依据。

Anthropic 官方说过一句很关键的话：在 SWE-bench 上，同一个底层模型，光是 scaffold（脚手架）不一样，成绩就能差出一大截。[9] 还有论文专门做了这个实验：模型和任务都锁死，只换 harness 的两套配置，三个编码基准上的结果就变了。[13]

![模型经过 harness、验证，最后才到产出的链路图，标注验证是 AI 最弱、人最该在的环节](/images/blog/model-plateau-agent-reliance/03-model-harness-verify.png)

*图 3：真正决定我能不能交出活的，是模型外面那一圈——喂什么、怎么跑、谁来验。*

这么看，注意力从模型转向 harness 就不奇怪了。模型这几代趋同了，能拉开差距的反而是模型外面那一圈，连模型厂商都承认 harness 足以左右榜单名次的事。

## 6 我最怕困惑的问题：用久了，我好像变笨了

前面都还是技术账。这一条是我更在意的：现在最可怕的是我的工作过于依赖 Agent，导致我自己的学习和思考能力退化太快了。

有几件不体面的事，我先招了：

我经常看不懂 AI 帮我写出来的东西。不是完全看不懂，是那种「读一遍觉得对，你要我讲讲为什么这么写，我讲不出来」的看不懂。它是对的，但那个「对」不是我的思考出来的，AI 帮我去思考、去执行后，形成的一些实验结果和技术手册我很难把这些东西给别人讲清楚为什么这么干。

我现在也很难直接去看官方文档的长篇大论了。以前一篇长文档我能啃完，现在看两屏就烦，第一反应是「丢给 AI 问一下得了」。遇到不懂的就直接发问，追问完继续追问，官方那份写得明明白白的长文，我反而没耐心看。等 AI 绕来绕去几轮还没绕对，我才回头老老实实去读文档，常常发现答案原本就写在那里。省下的那点读文档的时间，最后都加倍还了回去。这跟前面 METR 那个「以为在提速、其实在拖后腿」是同一回事，只不过这次的对象是我自己。

最糟的是做技术文档经常写得很难懂：我会写很多场外信息（玩过狼人杀的应该知道），把自己的思考过程、把给 AI 的指令，不合时宜地塞进文档里。大部分时候我都是就不懂的地方直接发问，发问完了以后，我要呈现的文章又把我发问的东西冗杂到内容中，上下文管理越来越混乱。回头再看自己的稿子，常常发现同一篇里前后两处说法其实是打架的——那是我追问过程里两个不同阶段的结论，我都原样留了下来，当时没察觉它们互相矛盾。

这也不是我一个人问题。微软和卡内基梅隆有个针对 319 个知识工作者的调查，结论挺冷静：**对 AI 越信任的人，批判性思考用得越少；而对自己越有信心的人，批判性思考反而用得越多。**[7] 它还说，AI 把批判性思考的重心，从「自己解决问题」挪到了「核对、整合、盯着 AI 的产出」。[7]

这是相关性、是自报的调查，不是什么脑成像证明「AI 让你变笨」，我不想吓唬人。但那句「从解决问题的人，变成校验 AI 输出的人」——说的就是这半年的我。以前给客户整理资料从官方获取资料，通读一遍把最新的内容矫正上去非常自信的给过去了，现在让 AI 写完，要验证每一句话的真实性，然后去验证的过程可能参考的资料也是 AI 生成的幻觉，导致对所有文档都产生不信任。

当我连读长文档的耐心都没了、连自己写的东西都讲不清了，我拿什么去「校验」？校验恰恰是最需要判断力的活。我把最费脑子的活留给了自己，却把练脑子的机会全喂给了 AI。 特别是我还担心我看到的长文档也是 AI 写的夹带幻觉的东西。

## 7 我以后怎么用 AI 

我没打算戒掉 AI，那不现实，它确实帮我把查资料、跑验证的效率提上来了。我会尝试改了几个习惯：

- **不追发布了。** 一个模型好不好用，我用自己的活试，不看它榜单第几。
- **成稿和过程彻底分开。** 提示词、追问、AI 的思考、场外信息，全部留在草稿区，绝不进正文。正文只放我自己想清楚、能讲明白的结论。这篇文章我就是这么写的——所有引用的外部事实，我都单独记了一份来源台账，一句一核。
- **不懂的先自己读一遍原文，再问 AI。** 顺序反过来，哪怕慢点。读官方长文这件事，我当成练耐心。
- **验证这一步，AI 写脚本来验证。** 不依赖 AI 模型本身的知识，有数据、有公式有接口的可以让 AI 写脚本来验证，要留执行脚本。

## 最后

这半年我最大的收获，不是学会了用哪个新模型，而是承认了一件事：模型更强，不等于我更强。

模型的上限一直在涨，价格没怎么变，榜单越来越好看。可我的幻觉没少、我的产出没见涨、我读长文的耐心还在失去。真正稀缺的东西，从来不在模型那一侧——是判断力，是知道上下文的边界在哪，是愿意花时间去验证的那点耐心。

这些东西，AI 替不了我，只会因为我偷懒而慢慢锈掉。

所以我不蹲发布了。我想先把自己这台「harness」修一修。

## 精选来源

- **[1][2][16]** Anthropic 官方发布页：Claude Opus 4.6（2026-02-05）、Opus 4.8（2026-05-28）、Opus 5（2026-07-24），型号、日期、定价均以官方为准。
- **[3][4][8]** METR：早-2025 资深开源开发者随机对照实验（慢 19%、感知与现实的裂缝），以及 2026-02 的实验设计更新（晚-2025 已现提速迹象）。
- **[5]** Dell'Acqua 等《Navigating the Jagged Technological Frontier》（BCG × 哈佛，2026 年发于 Organization Science）：前沿内提效、前沿外反而更容易错。
- **[6]** Peng 等《The Impact of AI on Developer Productivity》（GitHub Copilot 随机对照实验，2023）。
- **[7]** Lee 等《The Impact of Generative AI on Critical Thinking》（微软 × 卡内基梅隆，CHI 2025）。
- **[9][10][13]** Anthropic 工程博客与《Same Model, Different Harness》论文：同一模型换 harness，成绩显著变化。
- **[11][12]** OpenAI《Why Language Models Hallucinate》（2025-09，官网博客与 arXiv 2509.04664 是同一项工作的两个版本）：评测激励奖励「自信瞎猜」，并从理论上把幻觉建模成二元分类里的错误。
- **[17]** Miao & Kearns《Hallucination, Monofacts, and Miscalibration: An Empirical Investigation》（arXiv 2502.08666，2026-03 修订）：实证控制单例事实比例，支持稀有事实与幻觉的正相关（不直接证明评测激励）。
- **[18]** Jiayun Wu 等《Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning》（arXiv 2512.19920，预印本，2026-01 修订）：二元 RLVR 奖励鼓励猜测，学会弃答后校准改善。
- **[19]** Anthropic 官方发布页：Claude Fable 5.1 与 Mythos 5.1（2026 年 9 月），型号名称、「已在所有平台上线」均以官方为准。

## 相关内容

- [AI 炒作与现实核对：2026](/blog/ai-hype-reality-check-2026/)
- [Claude Fable 5 与 Mythos 发布](/blog/claude-fable-5-mythos-launch/)
- [模型能力横向对比](/tools/model-comparison/)

---

## 常见问题

### 半年里最强模型换了一代又一代，你的实际产出提升了吗？

能力上限确实在涨，但我的体感是事实可靠性基本没动、幻觉没少、实际产出也没见明显增长。榜单的进步没有等比转化成日常干活的体验，前沿越来越锯齿状。

### 为什么大家现在更多聊 harness，而不是模型本身？

Anthropic 官方说过，同一个底层模型，光是 scaffold 不一样，SWE-bench 成绩就能差出一大截，也有论文锁死模型和任务、只换 harness 就让三个编码基准结果改变。模型这几代趋同了，能拉开差距的反而是模型外面那一圈。

### AI 到底让开发者变快还是变慢？

取决于任务，而且人很容易高估自己的提效。METR 对资深开源开发者的随机对照实验里，用 AI 反而慢了 19%，但他们事后仍觉得自己快了 20%；METR 2026 年 2 月又说这个早期结论已不能代表当前影响。

### 过度依赖 Agent 会让人变笨吗？

现有的是相关性、自报调查，不是脑成像证明。微软和 CMU 对 319 个知识工作者的调查发现，越信任 AI 的人批判性思考用得越少。风险存在，但不能说大脑已经损坏。


---

## 参考资料

- [Introducing Claude Opus 4.6](https://www.anthropic.com/news/claude-opus-4-6) — Anthropic（2026-02-05）
- [Introducing Claude Opus 5](https://www.anthropic.com/news/claude-opus-5) — Anthropic（2026-07-24）
- [Impact of Early-2025 AI on Experienced OSS Developer Productivity](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study) — METR（2025-07）
- [Becker et al. METR RCT paper](https://arxiv.org/abs/2507.09089) — arXiv 2507.09089
- [Navigating the Jagged Technological Frontier](https://www.hbs.edu/faculty/Pages/item.aspx?num=68729) — Dell'Acqua et al.（HBS × BCG）
- [The Impact of AI on Developer Productivity（GitHub Copilot RCT）](https://arxiv.org/html/2302.06590v1) — Peng et al.（2023）
- [The Impact of Generative AI on Critical Thinking](https://www.microsoft.com/en-us/research/publication/the-impact-of-generative-ai-on-critical-thinking-self-reported-reductions-in-cognitive-effort-and-confidence-effects-from-a-survey-of-knowledge-workers) — Lee et al.（Microsoft × CMU, CHI 2025）
- [We are Changing our Developer Productivity Experiment Design](https://metr.org/blog/2026-02-24-uplift-update) — METR（2026-02）
- [Claude SWE-bench Performance（scaffolding）](https://www.anthropic.com/engineering/swe-bench-sonnet) — Anthropic Engineering
- [Quantifying infrastructure noise in agentic coding evals](https://www.anthropic.com/engineering/infrastructure-noise) — Anthropic Engineering
- [Why Language Models Hallucinate（官网博客）](https://openai.com/index/why-language-models-hallucinate) — OpenAI（2025-09）
- [Why Language Models Hallucinate（arXiv 版）](https://arxiv.org/abs/2509.04664) — Kalai et al., arXiv 2509.04664
- [Same Model, Different Harness](https://arxiv.org/abs/2608.26218) — arXiv 2608.26218
- [Effective context engineering for AI agents](https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents) — Anthropic Engineering
- [Introducing Claude Opus 4.7](https://www.anthropic.com/news/claude-opus-4-7) — Anthropic
- [Introducing Claude Opus 4.8](https://www.anthropic.com/news/claude-opus-4-8) — Anthropic（2026-05-28）
- [Hallucination, Monofacts, and Miscalibration: An Empirical Investigation](https://arxiv.org/abs/2502.08666) — Miao & Kearns, arXiv 2502.08666（rev. 2026-03）
- [Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning](https://arxiv.org/abs/2512.19920) — Jiayun Wu et al., arXiv 2512.19920（preprint, rev. 2026-01）
- [Introducing Claude Fable 5.1 and Claude Mythos 5.1](https://www.anthropic.com/claude-fable-and-mythos-5-1) — Anthropic（2026-09）
