不换模型,先拧这三个开关
错峰、缓存、降档。三个开关都写在 2026 年 8 月的官方文档里,一个都不用改模型,但有两个坑会反向加钱

文章目录
共 4 节同一条批量改写任务,跑在北京时间上午十点和跑在晚上八点,按 DeepSeek 2026 年 8 月 17 日起生效的官方价格表,单价差一倍。你什么都没改,只改了排程里的一个时间。
内容产线上省钱,多数人的第一反应是换个便宜模型。这个动作有代价:换模型要重跑提示词、重看输出质量、重新定失败处理,而且换完还得跑一段时间才敢下结论。产能会掉一到两周。
先固定结构,再谈产量。这一篇讲的三个开关,全都不动模型:错峰、缓存、降档。三个都写在 2026 年 8 月的官方文档里,采集日是 2026 年 8 月 18 日。第四节讲两个会反向加钱的坑——这两个坑不写清楚,前面三个开关可能白拧。
一、开关一:错峰。挪一个时间字段,单价对半
先看有没有峰谷价这回事。
据 DeepSeek 官方 2026 年 8 月 13 日的公告与 8 月 18 日实拉的定价页,该平台自 2026 年 8 月 16 日 16:00 UTC 起改按峰谷计价,官方原文写的是非高峰费率比高峰低 50%。峰时段英文页写的是 UTC 01:00–04:00 与 06:00–10:00,中文页写的是北京时间 09:00–12:00 与 14:00–18:00,两套写法指同一段时间,其余时段是谷时。折算下来,每天 7 小时是峰时,17 小时是谷时,而且中午 12:00 到 14:00 那两小时是谷时。
这个开关怎么拧,很直接:把所有不需要人盯着的任务,排到谷时。
内容产线上能挪的任务比你以为的多。批量改写、批量翻译、批量打标、素材去重、成片脚本的第一稿、每天早上要看的选题清单——这些的共同点是「结果第二天早上到位就行」。真正挪不动的只有一类:用户在线时发起的调用。
还有第二种错峰,是异步批处理。据 Anthropic 官方定价页 2026 年 8 月 18 日实拉,其 Batch API 对输入与输出 token 各打五折,代价是异步——你提交一批,过一会儿来取结果。这和时段错峰是两个独立的开关,可以叠加:把批量任务改成异步提交,再排到谷时。
对内容产线来说,异步这件事的门槛比想象中低。产线本来就是分批走的:第一天定选题,第二天出初稿,第三天过审。中间的等待时间以小时计,异步接口的返回时间落在这个窗口里,流程一点都不用改。
拧完要验一次,别跳。排程平台跑的时区不一定是你以为的那个——服务器本地时区、UTC、账号设置里的时区,三者可以各不相同。验法是改完之后隔一个账期,把账单按时段拉一遍,看谷时那一栏的量有没有起来。量没起来,就是时区没对上,不是价格表骗人。
还有一个产线上的细节:任务全压在同一分钟发起,会撞并发上限,失败重试的那部分是要重新付费的。把二十条任务摊到一小时里,比全塞在零点整那一分钟稳。
要注意的是,不是每家都有峰谷价。这个开关的适用范围是「你正在用的这家有没有」——打开它的定价页看一眼,有就拧,没有就跳过,不要为了这个开关去换供应商。换供应商的成本,第一段已经说过了。
二、开关二:缓存。前缀稳定才有命中,前缀一动全部作废
第二个开关的收益比第一个大,但它对结构有要求。
据 Anthropic 官方定价页 2026 年 8 月 18 日实拉,其提示词缓存的价格倍率是:缓存读取(命中)为基础输入价的 0.1 倍,5 分钟缓存写入为 1.25 倍,1 小时缓存写入为 2 倍。官方在同一页给了回本条件的原文口径:5 分钟档一次命中就回本,1 小时档两次命中回本。换成具体数字,Claude Sonnet 5 的基础输入价是每百万 token $2,缓存命中价是 $0.20。
DeepSeek 那一侧的量级也放一起看。据其 8 月 18 日实拉的定价页,V4-Pro 谷时的缓存命中输入是每百万 token $0.022,未命中是 $0.66,差 30 倍。
倍率讲完了,讲结构。缓存命中的前提是提示词的前缀完全一致。前缀里只要有一个字符变了,缓存就作废,那一次请求按未命中计费,还要付一次写入的钱。
内容产线上最常见的三种「把缓存搞坏」的写法:
- 1把日期塞进系统提示词的开头。「日期:某年某月某日」这一行放在最前面,等于每天换一次前缀,缓存一天命中一次都拿不到。改法是把它挪到最后面,动态内容一律往后放。
- 2每条素材都拼一份新的角色设定。同一批任务用同一份角色设定,就应该是同一个字符串,不要按素材去改措辞。真要改,改在动态段。
- 3把示例样本按素材随机抽。示例样本是最值得进缓存的部分,它长、它稳定。按素材随机抽等于把最该复用的那一段变成了每次都新的。
改法归纳成一句:静态在前,动态在后,中间不要插变量。
工具侧也有动静,方向是一样的。据 Claude Code 官方 CHANGELOG,2026 年 8 月 12 日的 2.1.229 版把 workflow 扇出改成同前缀错峰启动,后续的 agent 读缓存前缀而不是重复付费;2026 年 8 月 3 日的 2.1.221 版把 auto 模式的权限检查改成复用缓存前缀以降低缓存成本。这两条说明的是同一件事——同样的活儿,让后面的调用去读前面已经缓存过的那一段,账单会低。
这个开关的自查动作是四步,做完大概二十分钟:
- 1拉出上个账期里花钱最多的那一条链路。 只拉一条。不要一次看全部,看全部的结果通常是一条都没改。
- 2找到这条链路发出去的完整请求内容,从头读到尾。 重点看前 30% 是不是每次都一样。
- 3把每次都变的那些片段圈出来,逐个判断它们能不能挪到末尾。 能挪的挪;挪不动的记下来,那是这条链路的缓存上限。
- 4改完之后连跑三天,去账单里看缓存命中的 token 占比有没有涨。 不看单次调用,看三天的占比。占比没涨,说明前缀还是没稳住,回到第 2 步。
三、开关三:降档。官方自己在教你怎么少花钱
第三个开关是把同一个任务换到更低的算力档,不换模型家族。
据 OpenAI 官方 2026 年 8 月 13 日发布的《The builder's guide to GPT-5.6》,该文给出了选型方法与「降低 reasoning effort 省钱」的做法,并举了一个官方自己的例子:GPT-5.6 Sol 在 low reasoning 档下,于 Agents' Last Exam 这个基准上的成绩超过了上一代 GPT-5.5 的 high reasoning 档。厂商官方文档在教用户怎么少花钱,这件事本身就说明高档位不是默认答案。
档位这个开关在 8 月被好几家同时铺开:
- →据 DeepSeek 官方 2026 年 8 月 13 日的公告,V4-Pro 与 V4-Flash 同时新增 `reasoning_effort` 的 low / high / max 三档。
- →据 Google 官方 2026 年 8 月 13 日 GA 的 Gemini 3.7 Flash 文档,该模型的 thinking 支持 low / medium / high 三档,不支持 minimal,传了会报错。
- →据 NVIDIA 官方 2026 年 8 月 11 日的发布,其开源了一个叫 NeMo Switchyard 的模型路由库,按质量、延迟、成本自动把智能体工作流的每一步路由到最合适的模型,算法可自定义。
最后这条值得单独说一句:分档路由这件事以前是各家自己写的私货,2026 年 8 月第一次有大厂给出了开源实现。
内容产线上怎么分档,我的做法是按环节分,不按模型分:
要判断力的环节用高档。选题定夺、事实核对、终稿定版——这三个环节出错的代价是整条内容作废,省不出钱。
要产量的环节用低档。扩写、改写、翻译、切分、打标、生成变体——这些环节的输出会被后面的环节再过一遍,单次质量波动可以被吸收。
中间那一层用中档,并且要有回归集。回归集就是一组固定的输入和你认可的输出,二十条就够。降档之前跑一遍,降档之后再跑一遍,逐条对。没有回归集就不要降档——降完你分不清质量有没有掉,只能凭感觉,而感觉在产线上不算数。
要提醒一句:档位的名字各家不一样,`reasoning_effort`、thinking 档、speed 档,甚至同一家不同型号支持的档位也不同(Gemini 3.7 Flash 就明确不支持 minimal)。别把一家的档位名照搬到另一家的调用里,那不是省钱,那是报错。
四、两个反向加钱的坑,和什么时候三个开关都不该拧
前面三个开关拧完,还有两个坑,踩上去账单会不降反升。
坑一:分词器换代会吃掉价差。据 Anthropic 官方定价页 2026 年 8 月 18 日实拉的说明,Claude 4.7 及之后的模型与 Claude Mythos Preview 使用了新的分词器,同样的文本约多产生 30% 的 token,具体增幅取决于内容与工作负载形态;Claude Sonnet 4.6 及更早的模型用的是旧分词器。这意味着一件很实际的事:Sonnet 5 的输入价是每百万 token $2、Sonnet 4.6 是 $3,单看价格是便宜三分之一;但同一段文本在新分词器下会切出更多 token,实际省下的幅度得按你自己的文本重算。看单价不够,要看「同一篇稿子跑完一共花了多少钱」。
坑二:阶梯计费是整单按档,不是超出部分按档。据阿里云百炼官方文档,单价取决于单次请求的输入 token 总量,该请求的全部 token 按对应阶梯的单价结算;据 xAI 官方定价页,其同样写明 prompt 达到阈值后整个请求的全部 token 按高档计费。具体的量级:百炼 qwen3.7-flash 的输入价,32k 以内是每百万 token ¥0.2,32k 到 256k 是 ¥0.6,一次请求多塞一点,整单单价变成三倍;xAI 的 grok-4.6 在 200k 以上走长档,输入从 $2.00 变成 $4.00、输出从 $6.00 变成 $12.00。
坑二在内容产线上最容易出事的地方是「把一整批素材塞进一个请求」。看起来是省了调用次数,实际是把整单推过了阶梯线。改法是拆批,按阶梯线之下的长度切。
最后说什么时候这三个开关都不该拧。
第一,你的账单还没到值得优化的量。如果一个月的模型开销只有几百块,这三个开关加起来能省的钱,抵不过你花在上面的工时。这种时候正确的动作是把工时投到产量上,不是投到单价上。
第二,这条链路的输出还没稳定。提示词还在天天改、输出质量还在来回调的阶段,前缀不可能稳定,缓存拧了也没命中;降档更会把「是提示词问题还是档位问题」搅成一团。先把结构固定,再谈省钱。顺序反了,你会花两倍时间排查。
第三,你只有一个人,而这三件事都要维护。错峰要维护排程、缓存要维护前缀纪律、降档要维护回归集。三样都上,等于给自己加了三个每周都要看一眼的事。我的建议是一次只上一个,跑满两周,确认账单和质量都对得上,再上下一个。
第四,别为了省钱去动那个已经在赚钱的链路。产线上跑得最顺的那一条,不要拿它做优化实验。拿一条量中等、出错代价可控的链路先试,试通了再往主线上搬。
关于一张真实的月度 AI 账单由哪几块构成,站内另有一篇专门写过,本篇只讲不改架构就能拧的这三个开关。
本文事实来源
可自行复核- 1
DeepSeek 官方:V4-Pro 正式版发布公告,含 API 价格改按峰谷计价、非高峰比高峰低 50%、自 2026 年 8 月 16 日 16:00 UTC 生效,以及 V4-Pro 与 V4-Flash 新增 `reasoning_effort` 的 low / high / max 三档。
- 2
DeepSeek 官方:Models & Pricing 英文页,峰时为 UTC 01:00–04:00 与 06:00–10:00;V4-Pro 谷时缓存命中输入每百万 token $0.022、未命中 $0.66。
- 3
DeepSeek 官方:模型与价格中文页,北京时间峰谷时段(峰时 09:00–12:00、14:00–18:00)。
- 4
Anthropic 官方:Pricing 页,Batch API 对输入与输出 token 各打五折;提示词缓存倍率为读取 0.1 倍、5 分钟写入 1.25 倍、1 小时写入 2 倍,官方口径为 5 分钟档一次命中回本、1 小时档两次命中回本;Claude Sonnet 5 输入 $2 / 输出 $10 / 缓存命中 $0.20 每百万 token,Claude Sonnet 4.6 输入 $3 / 输出 $15;并载明 Claude 4.7 及之后的模型与 Claude Mythos Preview 使用新分词器、同样文本约多产生 30% token,Sonnet 4.6 及更早用旧分词器。
- 5
Anthropic 官方:Claude Code CHANGELOG,2.1.229(2026 年 8 月 12 日)把 workflow 扇出改为同前缀错峰启动、后续 agent 读缓存前缀而不是重复付费;2.1.221(2026 年 8 月 3 日)auto 模式权限检查复用缓存前缀以降低缓存成本。
- 6
OpenAI 官方:《The builder's guide to GPT-5.6》,给出选型方法与降低 reasoning effort 省钱的做法,并举例 GPT-5.6 Sol 在 low reasoning 档下于 Agents' Last Exam 上超过 GPT-5.5 的 high reasoning 档。
- 7
Google 官方:Gemini 3.7 Flash 于 2026 年 8 月 13 日 GA,thinking 支持 low / medium / high,不支持 minimal,传入会报错。
- 8
NVIDIA 官方:开源模型路由库 NeMo Switchyard,按质量、延迟、成本自动把智能体工作流的每一步路由到最合适的模型,算法可自定义。
- 9
阿里云百炼官方:qwen3.8-max 模型页,载明单价取决于单次请求的输入 token 总量、该请求全部 token 按对应阶梯单价结算。
- 10
阿里云百炼官方:qwen3.7-flash 模型页,输入价 32k 以内每百万 token ¥0.2、32k 至 256k ¥0.6、256k 至 1M ¥1.2。
- 11
xAI 官方:API pricing 页,载明 prompt 达阈值后整个请求全部 token 按高档计费;grok-4.6 标准档输入 $2.00 / 缓存输入 $0.50 / 输出 $6.00,200k 以上长档为 $4.00 / $1.00 / $12.00。
