莱客AI商学院/文章/你去年算不过来的账,今年能算过来了
深度文章免费

你去年算不过来的账,今年能算过来了

推理价格的中位年降幅是 50 倍,而高端卡租金在涨;被「太贵」否掉的需求,该按新单价重算一遍

莱客编辑部2026-05-21预计 7 分钟
你去年算不过来的账,今年能算过来了 封面

文章目录

共 4 节
01一、变便宜的是买 token,变贵的是囤高端卡02二、50 倍和 280 倍意味着什么:重算一遍只要几分钟03三、缓存命中:差三十到九十倍,而且最容易被漏掉04四、重算清单:四步,一个下午

50 倍。这是每年的降幅,不是三年的。

据 Epoch AI 的 LLM 推理价格趋势数据(2025 年 3 月 12 日),LLM 推理价格的年降幅在 9 倍到 900 倍之间,中位数约为每年 50 倍(原文 "prices declining between 9x per year and 900x per year, with a median of 50x per year")。同一页还写了一句限定,一起读才完整:"The fastest price drops in that range have occurred in the past year, so it's less clear that those will persist." ——那个区间里最快的降幅发生在该页发布前的一年,会不会持续并不确定。

另一组从不同角度得出的数:据 Stanford HAI《AI Index Report 2025》(2025 年 4 月 7 日发布),达到 GPT-3.5 级能力的推理成本,在 2022 年 11 月至 2024 年 10 月之间下降超过 280 倍。

这两个数字合起来说明一件对生意人很实际的事:你在一年前、两年前因为「太贵」否掉的那些需求,当时那笔账是真的算不过来,现在那笔账可能已经变了。否决意见有保质期,而大多数公司从来不给否决意见设复审日。

但同一段时间里,还有一个数字在往相反方向走,这一条必须一起说,否则整篇文章就是误导。

一、变便宜的是买 token,变贵的是囤高端卡

据 SemiAnalysis 于 2026 年 4 月 2 日发布的价格指数,H100 的一年期租赁合约价,从 2025 年 10 月的 1.70 美元/卡时,涨到了 2026 年 3 月的 2.35 美元/卡时。

$2.35 除以 $1.70 约等于 1.38——五个月内涨了约 38%。

把这条和开头那两条放在一起,会看到一个经常被混为一谈、但方向完全相反的结构:

  • 买 token(调 API):中位年降幅约 50 倍;GPT-3.5 级能力的成本在 2022 年 11 月至 2024 年 10 月之间下降超过 280 倍。
  • 囤高端卡(租/买算力):H100 一年期合约价五个月涨约 38%。

一个在跌,一个在涨。它们不是同一件事,也不该被同一句「AI 越来越便宜」或者「AI 越来越贵」概括。

为什么会这样,不是这篇文章要回答的问题——那属于算力供需,我们没有核到能支撑因果解释的材料,不做推断。但结果对采购是清楚的:

你在 API 那一侧买东西,时间站在你这边;你在算力那一侧买东西,时间不站在你这边。

这直接推出一条判断。对一家十几人到几十人的公司来说,如果有人在讨论「要不要自己买卡/包机器把模型跑起来」,那么至少要面对一个事实:你锁定的那个价格所对应的资源,在 2025 年 10 月到 2026 年 3 月这五个月里是涨的;而你如果不锁,去调 API,那一侧的中位年降幅是 50 倍。

我们把这条租金换算成一个更直观的数:按 $2.35/卡时,单张卡租满一年是 2.35 × 24 × 365 = $20,586。这是一张卡的年租金,不含电、不含机房、不含人。

这个数在第二节还会再出现一次——同样一笔钱在 API 那一侧能买到什么量级的调用,是一个会让很多人重新排优先级的对比。

时间对你是敌是友,取决于你站在这笔交易的哪一侧。买 token,越等越便宜;囤卡,越等越贵。

需要说明的是,这条判断不覆盖那些「数据根本不允许出厂」的场景。数据不能出去的时候,自建不是选项之一,是唯一选项,涨价也得买。这一类不在本文的讨论范围里。

二、50 倍和 280 倍意味着什么:重算一遍只要几分钟

先说清楚这两个数该怎么用,尤其是不该怎么用。

不该这么用:把 50 倍直接套到你那个具体项目上,得出「去年报价 10 万,现在就是 2000 块」。

不行。理由有两个,都写在原始数据里。

第一,据 Epoch AI 的这条数据,年降幅的区间是 9 倍到 900 倍——这个区间宽得惊人。50 倍是中位数,不是你的项目会拿到的数。你的项目落在 9 倍那一侧还是 900 倍那一侧,取决于它用的是什么能力档位、什么模型族。

第二,Stanford HAI 那个 280 倍有两个非常明确的限定条件:达到 GPT-3.5 级能力的推理成本,以及 2022 年 11 月到 2024 年 10 月这一段固定区间。它测的是「维持同一个能力水平,成本降了多少」,不是「所有模型都降了 280 倍」。如果你的项目需要的是当前最强档的能力,这个 280 倍对你不适用。

该这么用:把它当成一个触发复审的信号,而不是一个换算系数。

这两个数唯一能告诉你的,是「否决意见的保质期比你以为的短得多」。至于你那个项目现在到底要多少钱,只有一个办法能知道——打开当前的官方定价页,按你的真实用量重算一遍。

而重算这件事,比大多数人以为的快。

用一个可替换的假设口径:一个工单送进去 2,000 个 token,回来 500 个。这是假设,不是数据,你应该换成自己业务的真实值。

1 万个工单就是输入 20 个百万、输出 5 个百万。据 DeepSeek 官方定价页(单价采集于 2026 年 8 月 18 日),V4 Flash 的高峰定价是 $0.44 / $1.32,低谷价是它的一半。

账单 = 20 × 0.44 + 5 × 1.32 = 8.8 + 6.6 = $15.4

如果这是每月的量,一年 12 万单 = $184.8

(这一节的 DeepSeek 单价采集于 2026 年 8 月 18 日。这家在 2026 年 8 月 16 日刚改过一次计价结构、并把价目全线上调——做任何超过一个季度的预算之前,重新打开一次定价页。这一条正是本文自己在讲的那件事。)

整个计算过程是两次乘法一次加法。你手上任何一个被否掉的需求,把它的月处理量和平均长度代进去,五分钟能算完。

现在把它和第一节那个数放在一起:一张 H100 租一年是 $20,586,而按上面这个口径,月一万单的模型账单一年是 $184.8。

这两个数不能直接比——它们买的不是同一样东西,一个是算力一个是调用额度,用途和承载量完全不同。我们不做等价换算。但它足以说明一件事:在决定自己搭之前,先算一遍调 API 要多少钱,这个动作的成本是五分钟,可能省掉的是五位数。

回到那些被否掉的需求。当年那句「太贵,不做」的背后,一定有一个具体的数——一个报价、一个估算、一个人力折算。找到那个数,用上面这套算法重算一遍。大多数会依然算不过来,少数会翻案。翻案的那少数,就是这篇文章的全部价值。

三、缓存命中:差三十到九十倍,而且最容易被漏掉

有一个省钱点几乎不出现在任何选型讨论里,因为它不在价格表最显眼的那一行上。

据 DeepSeek 官方定价页,V4 Flash 的高峰标准价是输入 $0.44 / 输出 $1.32,而高峰缓存命中价是 $0.014;低谷价是这三个数各自的一半。

把它们相除:

  • $0.44 ÷ $0.014 ≈ 31 倍
  • $1.32 ÷ $0.014 ≈ 94 倍

也就是说,标准价和缓存命中价之间差的量级,和 Epoch AI 那条「中位每年 50 倍」的年降幅是同一个数量级。

这里有一个便于记忆的说法,但必须先声明它只是类比、不是等价关系:把缓存用起来,在账单上的效果,和多等一年的价格下降处在同一个量级。这句话不能拿去做预算,但可以拿去排优先级——很多公司在等降价,却没有先把手边这个已经存在的数量级用掉。

回到那 1 万个工单。V4 Flash 原本 $15.4,其中输入端是 20 × $0.44 = $8.8。如果这 20 个百万 token 全部命中缓存,输入端变成 20 × $0.014 = $0.28,总账单降到 0.28 + 6.6 = 约 $6.88

$15.4 变成 $6.88。什么模型都没换,只是命中了缓存。

条件是什么?前缀重复。同一份长系统提示词、同一份产品手册、同一套规则文档、同一版报价规则被反复送进去。命中的是重复的那一段,不是整个请求。

什么形状的业务命中率高?判断标准很朴素:你送进去的内容里,有多大比例是每次都一样的。

  • 客服问答:每次都带同一份产品手册和话术规则 → 重复比例高
  • 单据抽取:每次都带同一套字段定义和校验规则 → 重复比例高
  • 内容审核:每次都带同一份审核标准 → 重复比例高
  • 一次性的资料翻译、每次内容完全不同的长文档总结 → 重复比例低,这个价格你用不上

为什么它最容易被漏掉?因为它在价格表上是一行小字,而供应商报价的时候通常只报标准价。一份不区分「标准输入价」和「缓存命中价」的报价单,在前缀重复度高的业务上,可能把成本高估好几倍。

我们的看法是:在重算任何一个被否掉的项目时,第三件事必须是单独把「每次都一样的那部分内容」拎出来算。不拎出来,你算出的是一个偏高的数,而这个偏高的数可能刚好让一个本该翻案的项目继续躺着。

一个项目值不值得做,取决于你把账算到第几位。算到标准价那一位,很多项目还是不该做;算到缓存那一位,有一些会翻过来。

四、重算清单:四步,一个下午

这一节是可以直接执行的部分。不需要技术背景,需要的只是能翻到过去的会议记录或者立项申请。

第 1 步。翻出过去 12 到 18 个月里,因为「太贵」被否掉的需求。

只翻这一个理由。因为「没人做」被否的、因为「不合规」被否的、因为「老板不喜欢」被否的,都不在这次范围里——价格下降解决不了那些问题。

为什么是 12 到 18 个月?因为按 Epoch AI 那条中位数,这个跨度对应的价格变化足够大到值得重算;再往前的项目,业务前提本身多半也变了,等于是个新项目,不属于「翻案」。

把它们列成一张表,每行记三件事:当年估算的成本、当年估算依据的用量、被否时的判断线(比如「一个月不能超过 5000 块」)。

第 2 步。按当前的官方单价重算一遍。

打开你候选的那几家的官方定价页,取当前的数,用第二节那个算法:账单 = 输入百万数 × 输入单价 + 输出百万数 × 输出单价。

用量沿用第 1 步记下的那个当年估算值,先不要调整——这一步只换单价,不换用量,才能看清楚是不是价格这一个变量把结论翻过来了。

第 3 步。把重复度高的部分单独标出来,按缓存价再算一遍。

对每一行,问一句:送进去的内容里,每次都一样的那部分大概占多少。是同一份手册、同一套规则、同一份字段定义反复送,就属于这一类。

把这部分的 token 数按缓存命中价单独算,其余按标准价算,两个数相加,得到第二个账单。

第 2 步和第 3 步会给出两个数字。这两个数字之间的距离,就是你在报价环节最容易被高估的那一段。

第 4 步。只挑单位成本降幅超过一个数量级的,重新立项。

这是最关键、也最反直觉的一步:降了三成、降了一半的,不要重新立项。

理由是,一个当年被否的项目,除了成本还有别的阻力——要占人、要改流程、要有人验收。这些阻力没有随价格下降而变小。只有当成本降到原来的十分之一以下,节省才大到足以压过那些没变的阻力,翻案才立得住。

降幅在一倍两倍之间的,标注一下,明年再看。它们不是不能做,是现在做还不划算。

四步走完,你手上会有一张表,上面大部分行的结论仍然是「不做」,少数几行会变成「重新提一次」。这个产出是符合预期的——如果重算之后一多半都翻案了,那更可能是第 1 步没筛干净,把当初因为别的原因被否的需求也捞进来了。

代价:单价降了,不等于你的总账会降

这一节必须写,因为前面三节全是在讲「变便宜」。

第一,单价降,用量会涨。

一件事从「太贵不能做」变成「便宜到可以做」的时候,人的行为会跟着变:原来只处理重要工单,现在全部都处理;原来一天跑一次,现在实时跑;原来只给一个部门用,现在全公司开放。单价降 50 倍、用量涨 100 倍,总账单是往上走的。

所以第 2 步里那句「先不要调整用量」,只对判断「是不是价格把结论翻过来了」有效。真到立项那一步,你必须重新估一个放开使用之后的用量,用那个数再算一次。这两个数经常差一个数量级。

第二,模型账单从来不是这件事的全部成本。

对接要人、验收要人、出错了要人兜、流程要改、员工要重新学。这些成本没有跟着 token 价格一起降。一个模型账单从 5000 块降到 100 块的项目,如果要占一个人两个月,那两个月的人力成本可能仍然远大于省下的那 4900 块。

这也是第 4 步为什么要卡「一个数量级」——那道线的作用,就是把「省下的钱大到能覆盖没变的成本」这件事筛出来。

第三,也是最该写在最后的一条:重算之后,大部分项目仍然不该做。

价格下降能翻案的,只有那些当年唯一的阻力就是单位成本的项目。如果一个需求当年被否,真实原因是没人负责、没人验收、或者压根没想清楚做完之后谁用,那么价格降到零它也不该做。

我们的建议是:把这次重算的产出控制在两到三行。挑出降幅最大、当年阻力最单纯的那两三个,认真提一次。一次翻案十个,等于没有翻案——最后一个都推不动。

同系列里还有一篇讲怎么给候选模型建一套自己的验收样本集的,重新立项之前值得先看一遍。

本文事实来源

可自行复核
  1. 1

    Epoch AI:LLM 推理价格的年降幅在 9 倍到 900 倍之间,中位数约每年 50 倍。原文 "prices declining between 9x per year and 900x per year, with a median of 50x per year";该页自带限定 "The fastest price drops in that range have occurred in the past year, so it's less clear that those will persist."页面两处标注 Mar 12 2025

    Epoch AI

    更正记录:本文初稿写的是「我们没有在该数据页面上核到具体的发布日期」。这是一个假声明——该页两处都标着 Mar 12 2025,那句英文原句也确实写在页面上,只是它位于页面的次级区块,渲染成 markdown 时会被吃掉,所以多位写手"核不到"。判定「核不到」之前必须用原始 HTML 复核一次,这一条已写进 §B 附录的纪律。正文与本节两处均已改标日期并补上原句与限定句。

  2. 2

    Stanford HAI《AI Index Report 2025》:达到 GPT-3.5 级能力的推理成本,在 2022 年 11 月至 2024 年 10 月之间下降超过 280 倍(原文 "dropped over 280-fold between November 2022 and October 2024")。

    斯坦福 HAI2025 年 4 月 7 日发布

  3. 3

    DeepSeek 官方定价页:2026 年 8 月 16 日 16:00(UTC)起改为高峰 / 低谷两档计价并全线上调。按 2026 年 8 月 18 日的挂牌价,V4 Flash 高峰输入 $0.44 / 输出 $1.32、高峰缓存命中 $0.014,低谷价为其一半。

    DeepSeek 官方

  4. 4

    H100 一年期租赁合约价由 2025 年 10 月的 1.70 美元/卡时涨至 2026 年 3 月的 2.35 美元/卡时。 (SemiAnalysis,2026 年 4 月 2 日发布;1.70 与 2.35 分别为 2025 年 10 月与 2026 年 3 月的观测点)

    SemiAnalysis