莱客AI商学院/文章/2026 年一张表看懂全球模型价格带
深度文章免费

2026 年一张表看懂全球模型价格带

同一件事,用不同模型的成本可以差到几十倍;差到这个程度,选型就不再是技术问题

莱客编辑部2026-08-02预计 5 分钟
2026 年一张表看懂全球模型价格带 封面

文章目录

共 4 节
01一、先把表摆出来,再换算成账单02二、价格差几十倍,分数只差几分03三、按任务分档,而不是按模型排队04四、被漏掉的两项成本,和一个保质期

$0.20 和 $10。我们把各家官方定价页上的输入价统一成"每百万 token"之后,最低点和最高点之间隔着 50 倍。

输出端的差距更大:$1.20 到 $50,约 42 倍。

本文所有价格取自 2026 年 8 月 18 日各家官方定价页,单位统一为「每百万 token 输入 / 输出」;其中 DeepSeek 那两行于 2026 年 8 月 16 日改成高峰 / 低谷两档并全线上调,本文已按 8 月 18 日的挂牌价重新采集。价格随时会变,下文会说明为什么这句话必须写在正文里。

一、先把表摆出来,再换算成账单

我们逐家打开官方定价页,统一口径后得到这张表:

厂商型号输入 / 输出(每百万 token)
AnthropicClaude Opus 5(1M 上下文)$5 / $25
AnthropicClaude Fable 5$10 / $50
AnthropicClaude Sonnet 5引导价 $2 / $10
OpenAIGPT-5.6 Sol$5 / $30
OpenAIGPT-5.6 Terra$2 / $12
OpenAIGPT-5.6 Luna$0.20 / $1.20
DeepSeekV4 Flash高峰 $0.44 / $1.32;低谷 $0.22 / $0.66
DeepSeekV4 Pro高峰 $1.32 / $3.96;低谷 $0.66 / $1.98(缓存命中低至 $0.022)
月之暗面Kimi K3¥20 / ¥100
智谱GLM-5.2$1.4 / $4.4
字节豆包 2.1 Pro¥6 / ¥30(缓存 ¥1.2)

Kimi K3 与豆包 2.1 Pro 的官方定价页以人民币计价,我们没有做汇率换算,也没有找到把两种货币放进同一张表的官方依据;这两行请单独看,不要和美元行直接相减。

DeepSeek 那两行是区间价而不是单价:2026 年 8 月 16 日 16:00(UTC)起它改成高峰 / 低谷两档计价,低谷价是高峰价的一半,高峰时段为世界协调时 01:00–04:00 与 06:00–10:00。所以「DeepSeek 多少钱」这个问题在这一家没有唯一答案,取决于你的活跑在几点。本文的账单演算取的是高峰价,夜里能跑的批量任务单价直接减半。

剩下的问题是,"每百万 token"这个单位老板看不懂。要看懂,得换成账单。

我们用一个可替换的口径:假设一个客服工单送进去 2,000 个 token,回来 500 个。这是假设不是数据,你可以换成自己业务的真实值再算一遍。

1 万个工单,就是:

  • 输入 10,000 × 2,000 = 20,000,000 token = 20 个百万
  • 输出 10,000 × 500 = 5,000,000 token = 5 个百万

于是账单 = 20 × 输入单价 + 5 × 输出单价。

代进去:

型号1 万个工单的模型成本算式
Claude Fable 5$45020×10 + 5×50
GPT-5.6 Sol$25020×5 + 5×30
Claude Opus 5$22520×5 + 5×25
GPT-5.6 Terra$10020×2 + 5×12
Claude Sonnet 5$9020×2 + 5×10
GLM-5.2$5020×1.4 + 5×4.4
DeepSeek V4 Pro$46.220×1.32 + 5×3.96
DeepSeek V4 Flash$15.420×0.44 + 5×1.32
GPT-5.6 Luna$1020×0.2 + 5×1.2
Kimi K3¥90020×20 + 5×100
豆包 2.1 Pro¥27020×6 + 5×30

同一批工单,最贵 $450,最便宜 $10。450 ÷ 10 = 45 倍。

同一件事,一头收你 450 美元,另一头收你 4.2 美元。这个量级的差,已经不是技术选型能决定的事,是采购该决定的事。

再放大到真实的量。如果这是每月的工单量,一年就是 12 万单:Fable 5 一年 $5,400,V4 Flash 一年 $184.8(挪到低谷时段是 $92.4)。前者是要走预算流程的数,后者是一笔零头。

所以"随便选一个好用的"在小规模测试阶段成立,上量之后立刻不成立。

二、价格差几十倍,分数只差几分

价格拉开几十倍,能力拉开多少?

据 Artificial Analysis 的模型能力榜,Claude Opus 5 以 61 分居首;Kimi K3 是 57 分,位列全球第 3,同时是榜上最强的开源模型;GLM-5.2 是 51 分。

这三个分数只覆盖上表中的三款。其余型号我们没有在同一榜单上找到对应分数,不做推断,也不替它们填分。

就这三款看:最高 61,最低 51,差 10 分。而 Opus 5($225)和 GLM-5.2($50)在那张账单表上差了 4.5 倍。

再看另一个口径。据 Epoch AI 于 2026 年 5 月 29 日发布的数据,最强开源权重模型平均落后前沿闭源模型 4 个月、8 个 ECI 点。

把这两组数放在一起,能得出的判断是:

分数是压缩过的刻度,价格不是。

榜单分数把成千上万个任务压成一个数。61 和 57 之间的 4 分,不代表每个任务都好 6.6%。更可能的分布是:绝大多数任务上两者看不出差别,少数任务上差得很明显。

而价格是每次调用都收的。踩不到那"少数任务"的时候,多付的钱全是白付。

所以选型的问题不该是"哪个最强",而是:我的任务里,那"少数"占多大比例,以及它们值不值那个差价。

这也是开源侧性价比在 2026 年变得难以忽视的原因。智谱 GLM-5.2 是 744B 参数、MIT 协议开源,据其官方资料全程在昇腾 910B 上训练完成,定价 $1.4 / $4.4;月之暗面 Kimi K3 是 2.8 万亿参数,官方定价 ¥20 / ¥100。

4 个月的能力时间差,对绝大多数业务不构成阻塞,对少数业务构成。分清楚哪些是少数,是下一节的事。

三、按任务分档,而不是按模型排队

顺序是:先把任务分档,再把模型对上去。反过来做,最后都会变成"全公司统一用一个模型",然后为最贵的那一档付所有账。

第 1 步:先按"错了以后谁发现"给任务分类,不要按"难不难"。

难不难是技术判断,谁发现是成本判断。很难但错了会被下一道工序拦住的任务,可以用便宜模型;很简单但错了直接发到客户手里的任务,不可以。

第 2 步:划出第一档——大批量、结果可自动校验。

判断依据只有一条:你能不能写出一条不靠人就能判对错的规则。

能写出来的属于这一档:输出必须是给定选项之一、必须是合法日期格式、必须能和数据库里某条记录对上。校验规则兜住错误,模型只要够快够便宜。

这一档直接用价格表最下面那几行。按上面的算法,1 万单 $10 到 $15.4 的量级。

第 3 步:划出第二档——需要判断,但有人复核。

判断依据:错了会被下一道工序拦住,并且这道人工复核的成本,低于换用贵模型要多花的钱。

这一档是大多数公司真正的主战场。中间价位那几行,1 万单 $50 到 $100。

第 4 步:划出第三档——一次错就有代价。

判断依据:输出之后没有第二双眼睛看,或错误不可撤回。对外合同条款、财务口径、直接推送给客户的内容,都在这一档。

这一档用旗舰,且不要为省钱换模型。45 倍听起来很多,但一份发错的对外文件,赔的钱通常远超一年的模型账单。

第 5 步:每一档只留两家,一主一备。

留两家是为了下一节说的停服风险;只留两家是不让工程侧被无止境的适配拖住。

分档做完常会出现一个意外:第一档调用量占绝大部分,成本占比却很低;第三档调用量很小,却吃掉大半预算。这个结构本身是健康的——真正要查的是第二档有没有被无意识地塞进第三档。

四、被漏掉的两项成本,和一个保质期

价格表上写着的数,不是你最终付的数。

缓存命中

据 DeepSeek 官方定价页,V4 Pro 的高峰标准输入价是 $1.32,而高峰缓存命中价是 $0.044。两者相除,$1.32 ÷ $0.044 = 30 倍。低谷价是这两个数各自的一半,倍数不变。

据字节官方定价,豆包 2.1 Pro 输入 ¥6,缓存 ¥1.2,是标准价的五分之一。

回到那 1 万个工单。V4 Pro 原本 $46.2,其中输入端是 20 × $1.32 = $26.4。如果这 20 个百万 token 全部命中缓存,输入端变成 20 × $0.044 = $0.88,总账单降到约 $20.68。

$46.2 变成 $20.68。什么都没换,只是命中了缓存。

什么场景成立?前缀重复的场景:同一份长系统提示词、同一份产品手册、同一套规则文档被反复送进去,客服、审核、批量抽取都是这个形状。什么场景不成立?每次输入都完全不同——那缓存价是一个你永远用不上的价格。

我们的看法是:一份不区分"标准输入价"和"缓存命中价"的选型报价单不能算数,它可能高估三倍,也可能低估三倍。

停服风险

据月之暗面官方文档,Kimi K2 已于 2026 年 5 月 25 日下线。

这不是假设的风险,是已经发生过的先例。现在接进业务流程的模型,都会有下线的一天。

这件事推出三个判断:

第一,别让业务逻辑和某个具体型号绑死。

提示词、评测集、校验规则,这些是你的资产。型号不是。

第二,每一档留一个备选,且备选要真跑通过,不是写在文档里。

第三,权重开源的模型在这个维度上多一个口子。GLM-5.2 是 MIT 协议开源的 744B 模型——即使某家停掉 API,你仍有一条不依赖对方的路。这条路有自己的成本(算力、运维、人),但它存在。

价格本身也会变

据 OpenAI 官方公告,GPT-5.6 Luna 在 2026 年 7 月 30 日降价 80%,降到 $0.20 / $1.20。

一次降价 80%,这就是"价格表有保质期"最直接的证据。本文价格取自 2026 年 8 月 18 日的官方页面;DeepSeek 在 2026 年 8 月 16 日刚改过一次计价结构并把价目全线上调——做任何超过一个季度的预算之前,重新打开一次各家定价页。

代价:什么时候不该做这件事

便宜模型省下来的钱,可能全赔在人工复核上。判断线可以自己算:贵模型和便宜模型的账单差,除以你团队的人工小时成本,等于你能承受的额外复核小时数。

举例:1 万个工单,GPT-5.6 Sol 是 $250,Luna 是 $10,差 $240。把 $240 除以你团队的时薪,得到一个小时数;如果换便宜模型后这 1 万单多出的复核时间超过它,你不是在省钱,是把预算从模型账单挪到了工资单,而且挪多了。

这条线每家公司不一样,因为人工成本不一样。别抄别人的选型结论,抄算法。

还有一种情况是整件事都不该做:如果一个月的模型账单还低于做这次选型的人力成本,就先别分档。按上面的算法,月一万单全用中档也就几十到一百美元;为省七十美元占用两个人一周,这笔账是亏的。

先把量做起来。账单变成一个需要看的数字之后,这张表才有用。

同系列里还有一篇讲怎么给模型任务建评测集,分档之后可以接着看。

本文事实来源

可自行复核
  1. 1

    Anthropic 官方定价页(Claude Opus 5 / Fable 5 / Sonnet 5),取自 2026 年 8 月初。

    Anthropic 官方

  2. 2

    OpenAI 官方定价页(GPT-5.6 Sol / Terra),取自 2026 年 8 月初。

    OpenAI 官方

  3. 3

    OpenAI 官方公告:GPT-5.6 Luna 于 2026 年 7 月 30 日降价 80% 至 $0.20 / $1.20。

    OpenAI 官方

  4. 4

    DeepSeek 官方定价页(V4 Flash / V4 Pro,含缓存命中价):2026 年 8 月 16 日 16:00(UTC)起改为高峰 / 低谷两档计价并全线上调;按 2026 年 8 月 18 日的挂牌价,V4 Flash 高峰 $0.44 / $1.32、低谷 $0.22 / $0.66,V4 Pro 高峰 $1.32 / $3.96、低谷 $0.66 / $1.98,缓存命中价高峰 $0.044 / 低谷 $0.022。

    DeepSeek 官方

  5. 5

    月之暗面 Kimi 官方定价页(Kimi K3,2.8 万亿参数,¥20 / ¥100),取自 2026 年 8 月初。

    Kimi 官方

  6. 6

    月之暗面 Kimi 官方模型文档:Kimi K2 已于 2026 年 5 月 25 日下线。

    Kimi 官方

  7. 7

    智谱 Z.ai 官方定价与产品文档(GLM-5.2,744B,MIT 开源,全程在昇腾 910B 上训练完成,$1.4 / $4.4)。

    智谱 Z.ai 官方

  8. 8

    新华网:豆包 2.1 Pro 定价 ¥6 / ¥30,缓存 ¥1.2,2026 年 6 月 23 日。

    新华网

  9. 9

    Artificial Analysis 模型能力榜:Claude Opus 5 = 61 分居首,Kimi K3 = 57 分、全球第 3 且为最强开源模型,GLM-5.2 = 51 分。

    Artificial Analysis

  10. 10

    Epoch AI:最强开源权重模型平均落后前沿闭源模型 4 个月、8 个 ECI 点,2026 年 5 月 29 日。

    Epoch AI