没想到浓眉大眼的deepseek涨价这么狠!
价格屠夫涨价了我对 DeepSeek 是有感情的。写代码让它补函数做 RAG 让它啃文档跑 Agent 就把系统提示词、工具说明和历史会话一股脑塞进去。偶尔看账单还会生出一种朴素幸福这 API居然允许我放心大胆地堆上下文。直到今天我打开deepseek看见新价格表。https://api-docs.deepseek.com/zh-cn/quick_start/pricing/我的第一反应是等等那个缓存命中价格是不是小数点挪过了第二反应是没有它不但没挪错还非常坚定地站在那里提醒我从今往后要少吃一点“长上下文自助餐”。根据 DeepSeek 官方价格页API 将从 **2026 年 8 月 17 日 00:00北京时间**起采用峰谷定价9:00—12:00、14:00—18:00 为高峰其他时段为空闲且空闲价格减半。1 模型也有早晚高峰只不过堵住的不是车是我们的 token。先把口径摆在桌上下面的“原价”取自本文配图中展示的现价新分时价格与 DeepSeek 官方定价页一致。1 正式上线、充值或报预算时请以控制台与官方页面为准。本文的情绪可以奔放数字不能。价格一摆CPU 都替我捏了把汗模型计费项配图原价新空闲价新高峰价高峰/原价V4-Flash缓存命中输入0.02 元0.05 元0.10 元5×V4-Flash缓存未命中输入1.00 元1.50 元3.00 元3×V4-Flash输出2.00 元4.50 元9.00 元4.5×V4-Pro缓存命中输入0.025 元0.15 元0.30 元12×V4-Pro缓存未命中输入3.00 元4.50 元9.00 元3×V4-Pro输出6.00 元13.50 元27.00 元4.5×单位都是人民币元/百万 tokens。DeepSeek 的计费本来就区分缓存命中输入、未命中输入和输出。1 真正让我坐直的是 V4-Pro 那一格高峰期缓存命中输入从 0.025 元到 0.30 元12 倍。这不等于“缓存没用了”——缓存命中仍远比未命中便宜。问题在于写 Agent 的我们早就把它当成无限额度会员卡系统提示词、工具定义、项目规范每次都带上盼模型理解整个工程宇宙。以前像便宜加面现在老板说面能续但要另算。输出也不甘示弱。高峰期 Flash 输出 9 元/百万 tokensPro 输出 27 元/百万 tokens都是配图原价的 4.5 倍。于是“请尽可能详细地解释”“先分析十种方案再给结论”“再自我审查三轮”这些曾经显得很有追求的提示词突然有了一丝财务部的阴影。我算了一笔账然后把 Agent 的“深度思考”关小了一格拿一个典型的代码审查 Agent 举例单次调用携带 10 万缓存命中 token 的仓库规范和历史上下文、2 万未命中输入 token并生成 1 万输出 token。按配图中的 V4-Pro 原价算单次约0.1225 元按新价算空闲时段约0.24 元高峰时段约0.48 元。也就是说逻辑没变、功能没变、接口甚至还是那个 200高峰期的一次任务成本却接近原来的3.92 倍。最妙的是这种变化没有报错弹窗不会在 CI 里红一片不会在日志里抛异常只会在月底账单到来时用一种非常平静的方式教育你什么叫“单位经济模型”。客服机器人、代码 Copilot、文档分析 SaaS 和多智能体流水线就没这么轻松了调用频繁、上下文长、输出多而且都爱在白天扎堆。恭喜最活跃的业务时间和 token 最贵时段完成了精准对齐匹配度比许多向量检索还高。这波会影响谁先别忙着宣布“模型寒冬”长上下文默认开启的应用首当其冲仓库全量、知识库大段、每轮历史完整回放模型更有记忆账单也更有记性。高峰期跑批同样要改文档总结、评测、重建索引、代码扫描若非秒级需要就晚点跑这不叫摸鱼叫 FinOps。还有默认给用户长答案的产品用户问一句代码问题你写出《从编译原理到人生哲学》他看两行剩下的 token 则庄严地完成从显卡到账单的价值传递。这不是“赶紧删依赖”的号角。模型会改价、并发会变、版本会换真正耐用的能力是知道每次调用花在哪儿、为什么花、能不能少花一点。作为一个被价格表温柔教育过的人我准备这么干先把 token 账记明白。每个请求记录模型、时段、场景、输出 token、缓存命中与未命中 token。DeepSeek 在usage中提供了prompt_cache_hit_tokens与prompt_cache_miss_tokens。[2] 没有明细表只会看到一团“怎么又贵了”的云有了它才能定位哪条 Agent 链路在偷偷点单。再把缓存当工程不当玄学。缓存依赖输入前缀的完整匹配不是“意思差不多”就能命中也不保证百分之百命中。[2] 固定提示词和工具定义尽量放前部并保持稳定时间戳、随机 ID、动态变量别塞进前缀。你不是写散文是给缓存铺高速。给输出加“刹车”。分类、路由和结构化提取只返回 JSON代码修复优先返回 diff检索问答默认“结论引用”只有用户要求时再展开。给工具调用设轮次上限给长任务设停止条件。让模型少写废话并不叫抠门这叫尊重用户的注意力也尊重自己的余额。最后学会看表办事。离线评测、批量摘要、标签生成、代码库索引尽量放空闲时段交互请求做分层低风险走 Flash真需要时再上 Pro。高峰期缩短回答、关闭非必要自检或把耗时任务异步化。以前我们给数据库削峰填谷现在轮到 token 了。场景从前的“豪爽写法”现在更稳的做法RAG 问答每轮重塞大段文档稳定前缀、分块复用、监控命中率代码 Agent默认多轮反思到底按风险分级限制工具轮次和输出批量任务白天来一个跑一个入队并尽量调度到空闲时段客服一个模型回答所有问题Flash/Pro 路由短答优先别只转发“涨了 12 倍”要把成本函数拿出来真正应该和团队讨论的不是“DeepSeek 还香不香”而是成本函数单次成本 缓存命中输入 × 命中单价 未命中输入 × 未命中单价 输出 × 输出单价。价格是外部变量缓存命中率、输入结构、输出长度、模型路由和调用时机才是我们能动手改的变量。1 如果高峰成本变高不代表你必须把调用量粗暴砍掉。你完全可以先搬走可延迟任务再稳定公共前缀然后给简单任务换轻量模型最后清理那些写到天荒地老、其实没人读的输出。结语模型没变贵是我们终于得学会算账了DeepSeek 这次调整像一位总请你吃平价自助的朋友突然说“晚高峰的甜虾另算。” 你可以感叹“浓眉大眼的你也变了”但更现实的是拿好盘子、看好时段、别把不爱吃的东西堆成山。便宜 API 容易掩盖粗放架构价格一抬我们会更认真地做缓存、路由、限流、调度和成本观测。成熟的 AI 系统不只要调用成功还得回答为什么现在调用、调用了什么、值不值这个价。至于我还会继续用 DeepSeek只是更珍惜每一个 token——尤其下午两点最容易让人和账单一起上头的 token。参考资料延伸阅读与资源Redis 8 实战精讲从 CRUD 到源码构建高可用缓存系统Redis 实战修炼与原理进阶Python 3实战精进从脚本到高并发订单引擎python入门Rquests从菜鸟脚本到企业级SDK的网络实战圣经Milvus向量数据库实战修炼从 0 到 1精通向量检索与生产落地MongoDB 实战进阶与内核修炼后端工程师的 AI 转型第一课Ollama 与私有化大模型实战10倍开发者的 Dify 魔法书从零构建全栈 AI 应用后端工程师转型AI第一课-Ollama 与私有化大模型实战大型语言模型(LLM) vLLM 高性能推理落地实战Agent开发之LlamaIndex 实战修炼与源码进阶大语言模型Transformers 实战修炼与源码剖析

相关新闻