DeepSeek V4.1 Flash 调价:缓存命中和没命中差 50 倍,坑在这里

2026-09-19 DeepSeek定价缓存成本优化

这条不是发布会新闻,是账单新闻。DeepSeek 的官方定价页跟着 V4.1 Flash 一起更新了,几个数字值得抄进你的成本表(单位:美元 / 百万 token):

计费项闲时高峰
deepseek-flash 输入(缓存命中)$0.003$0.006
deepseek-flash 输入(缓存未命中)$0.15$0.3
deepseek-flash 输出$0.6$1.2
deepseek-v4-pro 输出$1.98$3.96

高峰时段是周一到周五 UTC 01:00–04:00 与 06:00–10:00(换算北京时间 9:00–13:00、14:00–18:00),中国法定节假日全天算闲时,周末也全天算闲时。

真正的重点藏在第一行和第一列的对比里:缓存命中 $0.003,未命中 $0.15,差 50 倍。 这意味着你同样的业务量、同样的模型,账单可能因为输入怎么拼而相差一个数量级。

为什么会有这种差额:DeepSeek 的缓存按前缀匹配。它会把你输入里前面一段稳定不变的内容缓存下来,下次请求只要前缀一致,这部分就按命中价算。一旦前缀变了(哪怕只变一个字符),从变化点开始全部按未命中重新计费。

所以对独立开发者来说,“优化成本”的第一步不是换更便宜的模型,是把 prompt 重新排一遍:

  • 把不变的部分放最前面:系统提示、工具定义、少样本示例、知识片段。顺序固定不要动态调整。
  • 把每次都变的部分放最后:用户输入、当前时间戳、一次性 ID、随机数。
  • 别把变量塞进前缀:很多人习惯在系统提示里写”今天是 {{date}}“,这一句会让每天第一次请求必然未命中,之后当天缓存才会生效——更好的做法是把日期放到用户输入那段。
  • 按用户或租户分桶:多用户共享同一个前缀命中率反而高,但如果在前缀里塞了用户画像,等于给每个用户各开一份缓存。

泼点冷水:别指望命中率做到 100%。多轮对话、RAG 检索内容每次不同、上下文窗口被截断都会把缓存打散。合理的验收线是先看一个月的实际情况再定目标,别拿理论值做预算。另外这张表是美元标价,人民币通道计费以平台实际汇率与余额结算为准,月底对账时对一两次。

顺带一条:V4 Pro 原本计划随 Flash 上线下线,后来因为不少开发者反馈还在依赖旧版、反对下线,官方改口在 9 月 14 日之后继续提供 deepseek-v4-pro-0813 的调用。这是一次提醒——再便宜的模型也别只绑一家,模型层做一层抽象,留一条能在一小时内切走的备用通道。

原文:https://api-docs.deepseek.com/quick_start/pricing

原文出处 · 事实以此为准
DeepSeek API Docs · Models & Pricing
阅读原文 ↗