LLM API 成本计算器
按请求量、输入输出 token 与缓存命中率,一次算出各家模型的月度账单。价格预填的是列表价(核对于 2026-08-15), 每一格都能改成你实际拿到的价格。
各模型月度成本
| 模型 | 输入 $/M | 缓存 $/M | 输出 $/M | 月度成本 | 每千次请求 | 相对最便宜 |
|---|---|---|---|---|---|---|
| Claude Opus 5 Anthropic | — | — | — | |||
| Claude Sonnet 5 Anthropic | — | — | — | |||
| Claude Haiku 4.5 Anthropic | — | — | — | |||
| DeepSeek V4 Pro DeepSeek | — | — | — | |||
| DeepSeek V4 Flash DeepSeek | — | — | — | |||
| Gemini 3.7 Flash Google | — | — | — | |||
| Gemini 3.5 Flash Lite Google | — | — | — | |||
| GPT-5.6 Sol OpenAI | — | — | — | |||
| GPT-5.6 Terra OpenAI | — | — | — | |||
| GPT-5.3 Codex OpenAI | — | — | — | |||
| GPT-5.6 Luna OpenAI | — | — | — |
价格为各厂商列表价,核对日期 2026-08-15。每个数字都可以直接改成你谈下来的价格。
全部计算在你的浏览器里完成,不会上传任何数据。
这个数是怎么算出来的
月度成本 = 未命中缓存的输入 token × 输入单价 + 命中缓存的输入 token × 缓存单价 + 输出 token × 输出单价, 请求数按 30 天折算。单价的单位都是「每百万 token」,这是目前各家统一的计价口径。
真正容易被低估的是两件事。第一是输出 token 的权重 —— 多数厂商的输出单价是输入的 5 到 6 倍,一个把 800 token 答案改成 300 token 的 prompt 改动, 省下的钱往往比换一档便宜模型更多。第二是缓存命中率 —— RAG 和 agent 场景里,system prompt 与检索上下文在多轮之间高度重复,命中率从 0 提到 80% 时, 输入侧成本直接掉到两成。这也是为什么上面把它做成了一个滑块,而不是一个隐含的假设。
没有计入的部分要说清楚:批处理(batch)与低优先级档位通常再打五折; 长上下文(超过厂商阈值)会走另一套更贵的单价;工具调用、web search、向量存储都是独立计费项; 按量计费之外的预留容量、私有部署与数据驻留附加费都不在这里。 这个计算器要回答的是「按 token 计费下,这套用量大概花多少」,而不是替代账单。
缓存单价一列,凡是厂商没有公布缓存读价格的模型,默认填的就是输入价 —— 也就是不假设有折扣, 宁可估贵不估便宜。