10CENTby Recall_li
IT · AI API · COST ANALYSIS

DeepSeek API 8月17日调价:真正要重算的,不只是峰谷

DeepSeek API 8月17日起采用峰谷定价;新的空闲价本身也上调。本文用官方价格和一笔可复算账单,拆解真正的成本变化与应对顺序。

高峰与空闲时段的AI API流量调度示意图

这次变化表面上是“高峰价是空闲价的两倍”,真正影响预算的却有三层:空闲价本身上调、输出 token 涨得比输入更快,以及实时请求与可延迟任务从此有了不同成本。

先把事实钉牢

DeepSeek 官方更新日志显示,DeepSeek‑V4‑Pro 正式版已于 8 月 13 日同步上线 APP、网页端和 API,API 模型名仍是 deepseek-v4-pro。官方价格页同时列出当前版本:V4‑Flash‑0731 与 V4‑Pro‑0813,二者都支持 100 万 token 上下文、最大 38.4 万 token 输出、Responses API 与 Anthropic API。

官方还给出了一组 Agent 评测:V4‑Pro 的 Terminal Bench 2.1 为 87.9,DeepSWE 为 62.7,Toolathlon‑Verified 为 74.1;V4‑Flash 对应为 82.7、54.4、70.3。这些数字来自厂商自己的更新日志,其中还混有内部测试集,能说明产品定位变化,但不能替代独立评测。

调价将在北京时间 2026 年 8 月 17 日 00:00 生效。高峰时段为每天 9:00—12:00、14:00—18:00,共 7 小时;其余 17 小时为空闲时段。这里没有“仅工作日”的限定。

先看价格全表

先看价格全表
DeepSeek API 价格(元/百万 tokens)
模型计费项当前新空闲新高峰
Flash缓存命中输入0.020.050.10
Flash缓存未命中输入11.53
Flash输出24.59
Pro缓存命中输入0.0250.150.30
Pro缓存未命中输入34.59
Pro输出613.527

当前价格与待生效价格都以“元/百万 tokens”为单位。

Flash 当前为:缓存命中输入 0.02 元、缓存未命中输入 1 元、输出 2 元。8 月 17 日后,空闲价分别变为 0.05、1.5、4.5 元,高峰价分别为 0.10、3、9 元。

Pro 当前为:缓存命中输入 0.025 元、缓存未命中输入 3 元、输出 6 元。8 月 17 日后,空闲价分别变为 0.15、4.5、13.5 元,高峰价分别为 0.30、9、27 元。

别被“峰谷定价”四个字带偏

别被“峰谷定价”四个字带偏

如果只看到“高峰是空闲的两倍”,很容易误以为避开高峰就能维持原成本。事实并不是这样:新的空闲价也普遍高于当前价。

Flash 的新空闲价相对当前价,缓存命中输入变为 2.5 倍,未命中输入变为 1.5 倍,输出变为 2.25 倍;到了高峰,则分别是当前价的 5 倍、3 倍和 4.5 倍。

Pro 更明显:新空闲时段的缓存命中输入是当前价的 6 倍,未命中输入 1.5 倍,输出 2.25 倍;高峰分别达到 12 倍、3 倍和 4.5 倍。

还有一个常被忽略的平均数。假设请求在 24 小时内均匀分布,新价格的日均单价等于空闲价的 31/24,约 1.292 倍。把所有可延迟任务从均匀分布搬到空闲时段,理论上可比“什么都不调度”节省约 22.6%;但这只是相对于新价格下的均匀流量,不代表能回到旧账单。

把一笔真实账单算出来

把一笔真实账单算出来

假设某应用每天使用 1 亿输入 token、1000 万输出 token,输入缓存命中率为 80%。这不是所有业务的典型值,只是为了让价格变化可计算。

使用 Flash,旧价账单为 41.6 元;全部放在新空闲时段为 79 元,增加约 89.9%;全部处于高峰为 158 元,增加约 279.8%;如果流量全天均匀,约为 102.04 元,增加约 145.3%。

使用 Pro,同一工作量旧价为 122 元;新空闲时段为 237 元,增加约 94.3%;高峰为 474 元,增加约 288.5%;全天均匀约 306.13 元,增加约 150.9%。

这组账单揭示了一个比“错峰”更重要的事实:输出往往是大头。以新空闲价计算,Flash 每减少 100 万输出 token 可省 4.5 元,而把 100 万输入从未命中变成命中可省 1.45 元;Pro 对应是 13.5 元和 4.35 元。前者大约都是后者的 3.1 倍。当然,缓存通常能一次覆盖很长的稳定前缀,所以工程上仍值得优先做好。

真正该优化的顺序

真正该优化的顺序
  • 先把账拆开:按模型、缓存命中与否、输入/输出、峰谷时段记录 token,不要只看总金额。
  • 再分任务:在线问答、用户交互保留实时;报表、索引、评测、批处理和可重试 Agent 任务尽量移到空闲时段。
  • 先控输出,再谈花活:给简单任务设合理输出上限,避免重复总结、冗长推理和无效重试。
  • 稳定缓存前缀:系统提示词、工具定义、长期上下文尽量保持顺序与内容稳定,把变化部分放到后面。
  • 分层路由:默认用 Flash,只有复杂推理、长链路 Agent 或高价值任务再升级到 Pro;不要把 Pro 当作全局默认。
  • 给调度器加预算护栏:按日设置成本告警、失败重试上限和高峰禁跑清单,防止一个死循环把峰值价格放大。

这次调价真正释放了什么信号

DeepSeek 一边把 V4‑Pro 正式版定位到更强的生产级 Agent,一边用峰谷价格把一部分需求从白天移开。我的判断是,这不只是一次简单涨价,而是 API 从“低价统一供给”走向“能力分层 + 时间分层”的信号。

对个人开发者,最实用的动作不是立刻迁移,而是先跑一周 token 日志,算清自己的命中率、输出占比和高峰占比。对团队,模型选择也不该只看单价:要把成功率、重试次数、人工返工和时延一起算进去。便宜但要跑三次的请求,未必比一次成功的 Pro 更省。

最后留一个简单结论:能延迟的任务要错峰,能复用的上下文要缓存,能短答的任务不要长答,真正困难的任务才上 Pro。8 月 17 日之后,API 成本优化将不再只是“选哪个模型”,而是“什么时候跑、跑多长、跑几次”。