莱客AI商学院/文章/为什么 token 越来越便宜,卡却越来越贵
深度文章免费

为什么 token 越来越便宜,卡却越来越贵

同一张价目表上,最贵的卡和最便宜的卡差 12.6 倍;而 H100 的一年期合约价在五个月里涨了近四成。「算力越来越便宜」只说对了一半,说错的那一半正好是你要签合同的那一半

莱客编辑部2026-07-22预计 7 分钟
为什么 token 越来越便宜,卡却越来越贵 封面

文章目录

共 4 节
01一、三条曲线,不是两条02二、为什么方向相反:你买 token 的时候,买的是别人已经沉没的产能03三、三类支出,三种合约期04四、什么情况下这笔钱不该花

两个价格,同一段时间。

据 SemiAnalysis 于 2026 年 4 月 2 日发布的 H100 一年期租赁价格指数,H100 的一年期租赁合约价从 2025 年 10 月的低点 1.70 美元每卡每小时,涨到 2026 年 3 月的 2.35 美元,涨幅接近 40%。

同一段时间里,据国内一家 GPU 租赁平台在 2026 年 2 月 27 日发布的行业文章,A100 在国内的租赁价格已经从 2024 年高点的 15~30 元每卡时,落到 2~5 元每小时区间。

一个涨了近四成,一个跌掉八成以上。它们不是矛盾的两条消息,它们是同一个市场里的两件不同商品。

「算力越来越便宜」这句话只说对了一半。说对的那一半是买 token 和租中端卡,说错的那一半正好是你打算签长约的那一半。 下面把三条曲线并排放一次,然后回答那个更值钱的问题:为什么它们方向相反,以及这件事该怎么改变你的花钱顺序。

一、三条曲线,不是两条

大部分讨论只摆两条:卡和 token。实际上是三条,中间那条最容易被漏掉,而中小企业的钱几乎全花在中间那条上。

曲线具体价格时间方向
高端卡(一年期合约)H100 从 1.70 美元/卡时涨到 2.35 美元/卡时2025-10 → 2026-03
中端卡(按小时租)A100 从 15~30 元/卡时落到 2~5 元/小时;RTX 4090 各平台 1.5~2.5 元/卡/小时2024 高点 → 2026-02 / 2026-05
token 单价达到同一能力所需的推理价格,年降幅在 9 倍到 900 倍之间Epoch AI,2025-03-12

第三行那个「9 倍到 900 倍」需要说清口径,我们去追了一遍原文:Epoch AI 的测法是把能力固定住看价格——盯住六个基准上的某个固定成绩,看达到这个成绩所需的最低推理价格逐年怎么变。原文给的例子是,达到 GPT-4 在一组博士级科学问题上的表现,所需价格每年下降 40 倍。所以这条曲线说的不是「模型变便宜了」,是「同样一件事变便宜了」。这两句话差别很大:前者可以靠降配实现,后者不行。

三条数字放在一起还不够直观,把它们折成同一个单位——年化变化率——差别才出得来。下面三步换算是本文自己算的,口径的不严谨之处随后逐条写明:

  • 高端卡:2.35 ÷ 1.70 = 1.382,这是五个月的涨幅;按同样速率外推成一年,1.382 的 12/5 次方约等于 2.18,即年化约 +118%
  • 中端卡:取 2024 年高点区间的中位 22.5 元和 2026 年 2 月区间的中位 3.5 元,跨度两年,3.5 ÷ 22.5 = 0.156,开平方约 0.394,即年化约 −61%
  • token:9 倍到 900 倍,换成跌幅是年化 −89% 到 −99.9%

三个数并排:+118%、−61%、−89% 以上。 三个方向,三个量级。

这三步换算的不严谨之处必须自己先拆:第一,五个月的涨幅外推成一年,是一个数学动作不是一个预测,真实的年化不会正好是这个数;第二,中端卡那两个区间取的是中位数,而两端的区间本身跨度就很大,取值方式一变结果就变;第三,三条曲线的商品不同、市场不同、合约形式不同,年化率只能用来比方向和量级,不能用来比大小。我们把它算出来,是因为不算出来的话,「一个在涨、一个在跌」这句话听起来像在说两件小事。

还有一个不需要任何换算、也不涉及任何跨市场比较的数,比上面三个都干净。

我们去看了一家国内算力平台自己挂出来的公开价目表(该页面未标注更新日期)。同一张表、同一批卡、按卡按小时计价:RTX 4090 24G 是 1.98 元,RTX 5090 32G 是 3.25 元,L20 48G 是 4.00 元,L40 48G 是 4.50 元,L40S 48G 是 4.98 元,A800 80G 是 7.80 元,H20 96G 是 12.00 元,H800 80G 是 25.00 元。

25.00 ÷ 1.98 ≈ 12.6 倍

同一天、同一家平台、同一张价目表,最贵的那一档是最便宜那一档的十二倍多。这一格的差价,比任何一条时间曲线都更直接地决定你的账。

二、为什么方向相反:你买 token 的时候,买的是别人已经沉没的产能

这一节是本文的全部价值。三条曲线之所以方向不同,不是因为市场混乱,是因为它们的价格由三套完全不同的东西决定。

第一,高端卡的价格由「还没建成的产能」决定。

SemiAnalysis 那份 2026 年 4 月 2 日的材料里,除了价格本身,还写了三条原因,每一条都指向同一个方向。

其一是需求侧出现了具体的、可指名的大买家。原文写着 Anthropic 的 Claude 4.6 Opus 与 Claude Code 需求激增,该公司的年度经常性收入在一个季度里从 90 亿美元增至 300 亿美元以上。这是一家美国的大模型提供方,营收在一个季度里翻了三倍多——这就是把 H100 合约价顶上去的那只手。

其二是供给侧当时的状态:原文写的是「按需 GPU 租赁产能在所有 GPU 型号上都已售罄」(on-demand GPU rental capacity is sold out across all GPU types)。售罄不是贵不贵的问题,是有没有的问题。

其三是这一轮涨价不只在 GPU 上。同一份材料写道,进入 2026 年初,DRAM 与 NAND 的价格从「持续多个季度的快速上涨」变成「完全抛物线式」,迫使服务器厂商以超过零部件涨幅的幅度重新定价。卡贵只是账面上最显眼的一项,整台机器都在变贵。

三条合起来是一句话:高端卡这条曲线上,你面对的是一群预算量级和你差着好几个数量级的买家,而供给要等新的产能建成。你出的价高不高,不由你决定。

第二,中端卡的价格由「已经建成、但没人排队」的产能决定。

这一侧的逻辑正好反过来。卡已经在机房里了,电费和折旧每天都在发生,闲着一小时就是净损失。所以只要没人排队,价格就会一路往下找需求。这就是 A100 从十几二十几元跌到个位数的机制——不是它变差了,是它不再是那群大买家抢的东西了。

这里必须给一个提醒:上面那两条中端卡的价格,出自一家 GPU 租赁平台自己发布的行业文章。它是卖方内容,利益相关,读的时候要打上这个标签。 我们去找过第二份中立的、可核验的国内中端卡价格序列,没有找到。所以这两个数在本文里的用法是「量级参照」,不是「市场基准」。

第三,token 的价格由「已经沉没的产能」决定,而且中间还隔着一层。

这是三条里最关键的一条。你按 token 付钱的时候,你付的不是卡的成本。你付的是一个已经把卡买了、把机房建了、把模型训完了的公司,愿意用什么价格把这套东西的边际产出卖给你。

对那家公司来说,训练那笔钱已经花掉了,收不回来。所以它的定价目标不是覆盖成本,是抢占用量。这就是为什么卡在涨的同时 token 在跌——两条曲线中间没有传导管道。

一个可以直接看到的例证:据新华网 2026 年 6 月 23 日的报道,豆包 2.1 Pro 的公开定价是每百万 token 输入 6 元、输出 30 元、缓存命中 1.2 元;同一篇报道写着,面向高频场景的豆包 2.1 Turbo「价格进一步降至 2.1 Pro 的一半」。

把这个数和上一节那张价目表放在一起,可以看出两侧省钱的杠杆完全不是一个长度:

  • 在 token 这一侧换档位,Pro 换成 Turbo,省一半;
  • 在卡这一侧换卡型,H800 换成 4090,省 12.6 倍。

再换一个老板听得懂的单位。按 1.98 元/卡时算,一张 RTX 4090 租满一个月(按 720 小时不停机)是 1425.6 元;同样这笔钱按豆包 2.1 Pro 的输入价买 token,1425.6 ÷ 6 ≈ 237.6 百万,约 2.38 亿输入 token

这一步除法的口径要写清四点:只算了输入价,没算输出;没算存储、公网和数据整理的工时;720 小时是满月不停机的理想值,实际达不到;以及最重要的一条——这两个数不能直接比谁划算,因为一张空卡不会自己产出 token。 它能说明的只有一件事:你租一张卡的时候,你买的是「自己运营一套推理服务」这件事的原料,而不是结果。愿不愿意接这个活,是一道组织题,不是一道价格题。

卡在涨,是因为有人在抢还没建成的产能;token 在跌,是因为有人在卖已经沉没的产能。两条曲线中间没有管道,所以它们可以长期反向——而你的钱该走哪一条,取决于你要买的是原料还是结果。

三、三类支出,三种合约期

前两节是判断,这一节是动作。把 AI 相关的算力支出分成三类,每一类的价格方向不同,因此合约期也必须不同。这四步有先后。

第 1 步。先把你的支出分到三个格子里,一分钱都不许悬空。

三个格子是:买 token(按调用量付给模型提供方)、租中端卡时(按小时或按月租 4090/A100/L20 这一档)、锁高端卡产能(签一年期以上的合约,或者直接买机器)。

分完之后先看一个比例:第三格占你 AI 总预算的百分之多少。如果这个数大于零,下一步就必须做。

第 2 步。第三格里的每一笔,都要能说出「为什么不能是前两格」。

理由只有三类站得住:数据有白纸黑字不许出域的条款;你的活是训练不是推理;你的调用量已经大到按 token 付更贵。三类都不占,这笔钱就该退回前两格。 十家里有八家的真实需求全在推理,却按训练的规格做预算,这是这个方向上最贵的一种错误。

第 3 步。合约期按曲线方向定,不按销售的折扣定。

  • 买 token:不签长约。 这一侧的价格在跌,签长约等于放弃后面所有的降价。按月付,随时能换。
  • 租中端卡:先签三个月,别签年。 这一侧同样在跌,同样的理由。三个月的另一个作用是攒出一条真实的使用曲线,那条曲线比折扣值钱。
  • 锁高端卡:如果必须锁,锁的时候要把「卡型」写进合同。 这一侧在涨且售罄,你能拿到的确定性只有一样,就是合同上写死的那个型号。只写「算力」不写型号,服务商有权在合同期内把你换到另一款卡上。

第 4 步。每季度重跑一次前三步,因为三条曲线的斜率不一样。

这一步最容易被跳过。三条曲线跌涨速度差着一个数量级,意味着上季度做对的分配,这个季度可能已经不是最优。重跑一次的成本是一个下午,收益是不让一笔按去年价格签的合同一直挂在账上。

至于「去年被否掉的项目,按今年的单价该怎么重算一遍」,本站另有一篇专门讲,那一篇给了完整的四步重算清单。

四、什么情况下这笔钱不该花

第一,你还没有一个能说出「谁在等这个结果」的场景。 三条曲线跟你没关系。价格是买东西的人才需要关心的,而你还没确定要买什么。这种情况下,最便宜的下一步是找一个具体场景,不是询价。

第二,你的月度使用率是个位数百分比。 那么第三格里的任何一笔支出都不该花。一台七成时间在空转的机器,它的单位成本不是标价那个数,而是标价除以你真正用掉的那部分——这道除法会让任何看起来划算的报价当场翻倍。

第三,你打算按「趁便宜多囤一点」的思路做决定。 中端卡这条曲线还在往下走,把它变成固定资产,等于用长期的钱锁一个还在降的价。而高端卡那条曲线上,你囤不到——那一侧的问题不是贵,是排不上。两边都不该囤,理由不一样,结论一样。

第四,如果你的数据不出厂是一条习惯而不是一份条款。 那么第三格的支出多半买的是心安。判断方法只有一句:去找那份写着「这类数据不得出域」的东西——客户准入条款、行业监管要求、合同附件,三者有其一才算。三者都没有,就先按 token 付一年,一年之后你手上会有一条真实的调用曲线,那时候再做这个决定,质量比空着手做高一个量级。

最后回到开头那两个价格。

它们之所以能长期反向,是因为它们卖的根本不是同一样东西:一个卖的是「你自己去建一套推理服务的原料」,一个卖的是「别人已经建好的推理服务的结果」。中小企业的钱几乎全部应该花在后者上,而这条建议之所以成立,靠的不是「哪个便宜」,是「哪一侧的价格风险不由你承担」。

三条曲线里,只有一条是你能踩上去的顺风。踩错的代价不是多花钱,是把一笔本该按月付的钱,签成了三年。

本文事实来源

可自行复核
  1. 1

    H100 一年期租赁合约价从 2025 年 10 月低点 1.70 美元/卡时涨至 2026 年 3 月 2.35 美元/卡时,涨幅接近 40%;「按需 GPU 租赁产能在所有 GPU 型号上都已售罄」;Anthropic 的 Claude 4.6 Opus 与 Claude Code 需求激增,其年度经常性收入一个季度内从 90 亿美元增至 300 亿美元以上;2026 年初 DRAM 与 NAND 价格由持续快速上涨转为「完全抛物线式」,服务器厂商以超过零部件涨幅的幅度重新定价

    SemiAnalysis2026-04-02

  2. 2

    A100 国内租赁价格从 2024 年高点 15~30 元/卡时落到 2~5 元/小时区间;该页为 GPU 租赁平台自身发布的行业文章,属卖方内容,利益相关

    晨鸟AI2026-02-27

  3. 3

    RTX 4090 各平台按小时计费价格区间约 1.5~2.5 元/卡/小时;同上,卖方内容,利益相关

    晨鸟AI2026-05-18

  4. 4

    某国内算力平台公开价目表(按卡按小时):RTX 4090 24G 1.98 元、RTX 5090 32G 3.25 元、L20 48G 4.00 元、L40 48G 4.50 元、L40S 48G 4.98 元、A800 80G 7.80 元、H20 96G 12.00 元、H800 80G 25.00 元。该页面未标注更新日期

    算力互联页面未标注日期

  5. 5

    LLM 推理价格年降幅在 9 倍到 900 倍之间;测法为固定六个基准(MMLU、GPQA Diamond、MATH-500、MATH 5、HumanEval、LMSys Chatbot Arena ELO)上的成绩看所需最低价格;例:达到 GPT-4 在一组博士级科学问题上的表现所需价格每年下降 40 倍

    Epoch AI2025-03-12

  6. 6

    豆包 2.1 Pro 公开定价:每百万 token 输入 6 元、输出 30 元、缓存命中 1.2 元;豆包 2.1 Turbo「价格进一步降至 2.1 Pro 的一半」

    新华网2026-06-23