跑分对不上

数据核对

把官方跑分、定价和宣称能力,拿第三方数据逐项核对

官方跑分与 Artificial Analysis 等独立评测交叉验证,标价与实际完成任务成本分开算,宣称上下文与有效上下文分开测。结论对不上时,写清对不上的是哪一项。

5 篇文章

AI 与 Agent

提示缓存(二):五家厂商三家云的账单差异

AWS 文档说 Claude Sonnet 4.5 在 Bedrock 上要 4096 token 才能缓存,我实测是 1024——和一方 API 一样。本文对照五家模型厂商与三家云的当期倍率、TTL 档位、跨区域行为,并区分哪些数字是实测的、哪些只是文档值。

DeepSeek V4 Pro 正式版:拿第三方实测去对流出的跑分表,对不上
AI 与 Agent

DeepSeek V4 Pro 正式版:拿第三方实测去对流出的跑分表,对不上

DeepSeek V4 Pro 0813 正式版发布,Artificial Analysis 独立评测综合 53 分排第 23。流出的 Agent 评测表宣称 Terminal Bench 87.9 超过 Opus 4.8,但第三方实测只有 79%,差了近 9 分。本文逐项核对两套数据,还原真实位置。

Kimi K3 正式发布:2.8 万亿参数全开源,这次真的不一样
AI 与 Agent

Kimi K3 正式发布:2.8 万亿参数全开源,这次真的不一样

月之暗面发布 Kimi K3:2.8 万亿参数、全球首个开源 3T 级模型、100 万 token 上下文、原生多模态。本文深度解读 KDA 与 AttnRes 架构创新、Artificial Analysis 全球第四的评测成绩、对齐 Claude Sonnet 5 的定价信号,以及开源前沿模型对整个行业的四层长远影响。

技术深潜

Claude Code vs OpenClaw:51 万行 vs 53 万行源码对决

Claude Code 源码泄露暴露了 51.2 万行 TypeScript,我们终于能与 OpenClaw 做一次真正对等的逐行比较——架构、Agent 定义、安全模型与设计哲学。

技术深潜

OpenClaw vs Claude Code:架构与战略全面对比

两款 AI Agent 产品,两种截然不同的理念。深度对比它们的架构、普及路径以及未来走向。