2026 年一张表看懂全球模型价格带
同一件事,用不同模型的成本可以差到几十倍;差到这个程度,选型就不再是技术问题

文章目录
共 4 节$0.20 和 $10。我们把各家官方定价页上的输入价统一成"每百万 token"之后,最低点和最高点之间隔着 50 倍。
输出端的差距更大:$1.20 到 $50,约 42 倍。
本文所有价格取自 2026 年 8 月 18 日各家官方定价页,单位统一为「每百万 token 输入 / 输出」;其中 DeepSeek 那两行于 2026 年 8 月 16 日改成高峰 / 低谷两档并全线上调,本文已按 8 月 18 日的挂牌价重新采集。价格随时会变,下文会说明为什么这句话必须写在正文里。
一、先把表摆出来,再换算成账单
我们逐家打开官方定价页,统一口径后得到这张表:
| 厂商 | 型号 | 输入 / 输出(每百万 token) |
|---|---|---|
| Anthropic | Claude Opus 5(1M 上下文) | $5 / $25 |
| Anthropic | Claude Fable 5 | $10 / $50 |
| Anthropic | Claude Sonnet 5 | 引导价 $2 / $10 |
| OpenAI | GPT-5.6 Sol | $5 / $30 |
| OpenAI | GPT-5.6 Terra | $2 / $12 |
| OpenAI | GPT-5.6 Luna | $0.20 / $1.20 |
| DeepSeek | V4 Flash | 高峰 $0.44 / $1.32;低谷 $0.22 / $0.66 |
| DeepSeek | V4 Pro | 高峰 $1.32 / $3.96;低谷 $0.66 / $1.98(缓存命中低至 $0.022) |
| 月之暗面 | Kimi K3 | ¥20 / ¥100 |
| 智谱 | GLM-5.2 | $1.4 / $4.4 |
| 字节 | 豆包 2.1 Pro | ¥6 / ¥30(缓存 ¥1.2) |
Kimi K3 与豆包 2.1 Pro 的官方定价页以人民币计价,我们没有做汇率换算,也没有找到把两种货币放进同一张表的官方依据;这两行请单独看,不要和美元行直接相减。
DeepSeek 那两行是区间价而不是单价:2026 年 8 月 16 日 16:00(UTC)起它改成高峰 / 低谷两档计价,低谷价是高峰价的一半,高峰时段为世界协调时 01:00–04:00 与 06:00–10:00。所以「DeepSeek 多少钱」这个问题在这一家没有唯一答案,取决于你的活跑在几点。本文的账单演算取的是高峰价,夜里能跑的批量任务单价直接减半。
剩下的问题是,"每百万 token"这个单位老板看不懂。要看懂,得换成账单。
我们用一个可替换的口径:假设一个客服工单送进去 2,000 个 token,回来 500 个。这是假设不是数据,你可以换成自己业务的真实值再算一遍。
1 万个工单,就是:
- →输入 10,000 × 2,000 = 20,000,000 token = 20 个百万
- →输出 10,000 × 500 = 5,000,000 token = 5 个百万
于是账单 = 20 × 输入单价 + 5 × 输出单价。
代进去:
| 型号 | 1 万个工单的模型成本 | 算式 |
|---|---|---|
| Claude Fable 5 | $450 | 20×10 + 5×50 |
| GPT-5.6 Sol | $250 | 20×5 + 5×30 |
| Claude Opus 5 | $225 | 20×5 + 5×25 |
| GPT-5.6 Terra | $100 | 20×2 + 5×12 |
| Claude Sonnet 5 | $90 | 20×2 + 5×10 |
| GLM-5.2 | $50 | 20×1.4 + 5×4.4 |
| DeepSeek V4 Pro | $46.2 | 20×1.32 + 5×3.96 |
| DeepSeek V4 Flash | $15.4 | 20×0.44 + 5×1.32 |
| GPT-5.6 Luna | $10 | 20×0.2 + 5×1.2 |
| Kimi K3 | ¥900 | 20×20 + 5×100 |
| 豆包 2.1 Pro | ¥270 | 20×6 + 5×30 |
同一批工单,最贵 $450,最便宜 $10。450 ÷ 10 = 45 倍。
再放大到真实的量。如果这是每月的工单量,一年就是 12 万单:Fable 5 一年 $5,400,V4 Flash 一年 $184.8(挪到低谷时段是 $92.4)。前者是要走预算流程的数,后者是一笔零头。
所以"随便选一个好用的"在小规模测试阶段成立,上量之后立刻不成立。
二、价格差几十倍,分数只差几分
价格拉开几十倍,能力拉开多少?
据 Artificial Analysis 的模型能力榜,Claude Opus 5 以 61 分居首;Kimi K3 是 57 分,位列全球第 3,同时是榜上最强的开源模型;GLM-5.2 是 51 分。
这三个分数只覆盖上表中的三款。其余型号我们没有在同一榜单上找到对应分数,不做推断,也不替它们填分。
就这三款看:最高 61,最低 51,差 10 分。而 Opus 5($225)和 GLM-5.2($50)在那张账单表上差了 4.5 倍。
再看另一个口径。据 Epoch AI 于 2026 年 5 月 29 日发布的数据,最强开源权重模型平均落后前沿闭源模型 4 个月、8 个 ECI 点。
把这两组数放在一起,能得出的判断是:
分数是压缩过的刻度,价格不是。
榜单分数把成千上万个任务压成一个数。61 和 57 之间的 4 分,不代表每个任务都好 6.6%。更可能的分布是:绝大多数任务上两者看不出差别,少数任务上差得很明显。
而价格是每次调用都收的。踩不到那"少数任务"的时候,多付的钱全是白付。
所以选型的问题不该是"哪个最强",而是:我的任务里,那"少数"占多大比例,以及它们值不值那个差价。
这也是开源侧性价比在 2026 年变得难以忽视的原因。智谱 GLM-5.2 是 744B 参数、MIT 协议开源,据其官方资料全程在昇腾 910B 上训练完成,定价 $1.4 / $4.4;月之暗面 Kimi K3 是 2.8 万亿参数,官方定价 ¥20 / ¥100。
4 个月的能力时间差,对绝大多数业务不构成阻塞,对少数业务构成。分清楚哪些是少数,是下一节的事。
三、按任务分档,而不是按模型排队
顺序是:先把任务分档,再把模型对上去。反过来做,最后都会变成"全公司统一用一个模型",然后为最贵的那一档付所有账。
第 1 步:先按"错了以后谁发现"给任务分类,不要按"难不难"。
难不难是技术判断,谁发现是成本判断。很难但错了会被下一道工序拦住的任务,可以用便宜模型;很简单但错了直接发到客户手里的任务,不可以。
第 2 步:划出第一档——大批量、结果可自动校验。
判断依据只有一条:你能不能写出一条不靠人就能判对错的规则。
能写出来的属于这一档:输出必须是给定选项之一、必须是合法日期格式、必须能和数据库里某条记录对上。校验规则兜住错误,模型只要够快够便宜。
这一档直接用价格表最下面那几行。按上面的算法,1 万单 $10 到 $15.4 的量级。
第 3 步:划出第二档——需要判断,但有人复核。
判断依据:错了会被下一道工序拦住,并且这道人工复核的成本,低于换用贵模型要多花的钱。
这一档是大多数公司真正的主战场。中间价位那几行,1 万单 $50 到 $100。
第 4 步:划出第三档——一次错就有代价。
判断依据:输出之后没有第二双眼睛看,或错误不可撤回。对外合同条款、财务口径、直接推送给客户的内容,都在这一档。
这一档用旗舰,且不要为省钱换模型。45 倍听起来很多,但一份发错的对外文件,赔的钱通常远超一年的模型账单。
第 5 步:每一档只留两家,一主一备。
留两家是为了下一节说的停服风险;只留两家是不让工程侧被无止境的适配拖住。
分档做完常会出现一个意外:第一档调用量占绝大部分,成本占比却很低;第三档调用量很小,却吃掉大半预算。这个结构本身是健康的——真正要查的是第二档有没有被无意识地塞进第三档。
四、被漏掉的两项成本,和一个保质期
价格表上写着的数,不是你最终付的数。
缓存命中
据 DeepSeek 官方定价页,V4 Pro 的高峰标准输入价是 $1.32,而高峰缓存命中价是 $0.044。两者相除,$1.32 ÷ $0.044 = 30 倍。低谷价是这两个数各自的一半,倍数不变。
据字节官方定价,豆包 2.1 Pro 输入 ¥6,缓存 ¥1.2,是标准价的五分之一。
回到那 1 万个工单。V4 Pro 原本 $46.2,其中输入端是 20 × $1.32 = $26.4。如果这 20 个百万 token 全部命中缓存,输入端变成 20 × $0.044 = $0.88,总账单降到约 $20.68。
$46.2 变成 $20.68。什么都没换,只是命中了缓存。
什么场景成立?前缀重复的场景:同一份长系统提示词、同一份产品手册、同一套规则文档被反复送进去,客服、审核、批量抽取都是这个形状。什么场景不成立?每次输入都完全不同——那缓存价是一个你永远用不上的价格。
我们的看法是:一份不区分"标准输入价"和"缓存命中价"的选型报价单不能算数,它可能高估三倍,也可能低估三倍。
停服风险
据月之暗面官方文档,Kimi K2 已于 2026 年 5 月 25 日下线。
这不是假设的风险,是已经发生过的先例。现在接进业务流程的模型,都会有下线的一天。
这件事推出三个判断:
第一,别让业务逻辑和某个具体型号绑死。
第二,每一档留一个备选,且备选要真跑通过,不是写在文档里。
第三,权重开源的模型在这个维度上多一个口子。GLM-5.2 是 MIT 协议开源的 744B 模型——即使某家停掉 API,你仍有一条不依赖对方的路。这条路有自己的成本(算力、运维、人),但它存在。
价格本身也会变
据 OpenAI 官方公告,GPT-5.6 Luna 在 2026 年 7 月 30 日降价 80%,降到 $0.20 / $1.20。
一次降价 80%,这就是"价格表有保质期"最直接的证据。本文价格取自 2026 年 8 月 18 日的官方页面;DeepSeek 在 2026 年 8 月 16 日刚改过一次计价结构并把价目全线上调——做任何超过一个季度的预算之前,重新打开一次各家定价页。
代价:什么时候不该做这件事
便宜模型省下来的钱,可能全赔在人工复核上。判断线可以自己算:贵模型和便宜模型的账单差,除以你团队的人工小时成本,等于你能承受的额外复核小时数。
举例:1 万个工单,GPT-5.6 Sol 是 $250,Luna 是 $10,差 $240。把 $240 除以你团队的时薪,得到一个小时数;如果换便宜模型后这 1 万单多出的复核时间超过它,你不是在省钱,是把预算从模型账单挪到了工资单,而且挪多了。
这条线每家公司不一样,因为人工成本不一样。别抄别人的选型结论,抄算法。
还有一种情况是整件事都不该做:如果一个月的模型账单还低于做这次选型的人力成本,就先别分档。按上面的算法,月一万单全用中档也就几十到一百美元;为省七十美元占用两个人一周,这笔账是亏的。
先把量做起来。账单变成一个需要看的数字之后,这张表才有用。
同系列里还有一篇讲怎么给模型任务建评测集,分档之后可以接着看。
本文事实来源
可自行复核- 1
Anthropic 官方定价页(Claude Opus 5 / Fable 5 / Sonnet 5),取自 2026 年 8 月初。
- 2
OpenAI 官方定价页(GPT-5.6 Sol / Terra),取自 2026 年 8 月初。
- 3
OpenAI 官方公告:GPT-5.6 Luna 于 2026 年 7 月 30 日降价 80% 至 $0.20 / $1.20。
- 4
DeepSeek 官方定价页(V4 Flash / V4 Pro,含缓存命中价):2026 年 8 月 16 日 16:00(UTC)起改为高峰 / 低谷两档计价并全线上调;按 2026 年 8 月 18 日的挂牌价,V4 Flash 高峰 $0.44 / $1.32、低谷 $0.22 / $0.66,V4 Pro 高峰 $1.32 / $3.96、低谷 $0.66 / $1.98,缓存命中价高峰 $0.044 / 低谷 $0.022。
- 5
月之暗面 Kimi 官方定价页(Kimi K3,2.8 万亿参数,¥20 / ¥100),取自 2026 年 8 月初。
- 6
月之暗面 Kimi 官方模型文档:Kimi K2 已于 2026 年 5 月 25 日下线。
- 7
智谱 Z.ai 官方定价与产品文档(GLM-5.2,744B,MIT 开源,全程在昇腾 910B 上训练完成,$1.4 / $4.4)。
- 8
新华网:豆包 2.1 Pro 定价 ¥6 / ¥30,缓存 ¥1.2,2026 年 6 月 23 日。
- 9
Artificial Analysis 模型能力榜:Claude Opus 5 = 61 分居首,Kimi K3 = 57 分、全球第 3 且为最强开源模型,GLM-5.2 = 51 分。
- 10
Epoch AI:最强开源权重模型平均落后前沿闭源模型 4 个月、8 个 ECI 点,2026 年 5 月 29 日。
