模型评测
2 篇文章
AI
DeepSeek V4 Pro 正式版:拿第三方实测去对流出的跑分表,对不上
DeepSeek V4 Pro 0813 正式版发布,Artificial Analysis 独立评测综合 53 分排第 23。流出的 Agent 评测表宣称 Terminal Bench 87.9 超过 Opus 4.8,但第三方实测只有 79%,差了近 9 分。本文逐项核对两套数据,还原真实位置。
10 分钟
AI
Kimi K3 正式发布:2.8 万亿参数全开源,这次真的不一样
月之暗面发布 Kimi K3:2.8 万亿参数、全球首个开源 3T 级模型、100 万 token 上下文、原生多模态。本文深度解读 KDA 与 AttnRes 架构创新、Artificial Analysis 全球第四的评测成绩、对齐 Claude Sonnet 5 的定价信号,以及开源前沿模型对整个行业的四层长远影响。
14 分钟