卖铲子的生意好不好做:拆一个 AI 网关的真实毛利
把三张公开价目页并排放,同一个型号的挂牌价一模一样;最大的那家聚合平台在自己的文档里写着「不加价」,它挣的是买额度时那 5.5%

文章目录
共 4 节$5 / $25。这是 Anthropic 官方定价页上 Claude Opus 5 的挂牌价,每百万 token 输入 / 输出。
同一个型号,在一家做模型 API 中转的平台的公开价目页上,写的也是 $5 / $25。
不是接近,是一模一样。
这篇文章要拆的是「转售模型能力」这门生意——市面上叫它 AI 网关、API 中转、模型聚合。它常被当成 AI 创业里最稳的那条路:不用做产品,不用教育市场,进货卖货,赚差价。我们把各家公开挂牌的进价和售价逐张打开核对了一遍,得到的第一个结论就是上面这三行。
必须先写在前面的一句话:本文用的全部是公开挂牌价,不是任何一家的实际结算价。 大客户折扣、预付返点、渠道协议,这些东西从来不公开,本文一个字都不推测。所以下面算出来的是挂牌价这一层的价差结构,不是谁的真实账本。
还有一个口径要交代:本文引用的官方定价页与平台价目页,页面本身都不标注更新日期。我们按页面上的现行挂牌价引用,不替它们补一个日期。价格随时会变,你自己决定之前请重新打开一次。
一、把三张公开价目页并排放:同一个型号,价格一样
先摆进价,全部来自各家自己的官方定价页。
| 厂商 | 型号 | 输入 / 输出(每百万 token) |
|---|---|---|
| Anthropic | Claude Opus 5 | $5 / $25 |
| Anthropic | Claude Sonnet 5 | $2 / $10 |
| OpenAI | GPT-5.6 Sol | $5 / $30 |
| OpenAI | GPT-5.6 Terra | $2 / $12 |
| DeepSeek | V4 Flash | $0.14 / $0.28 |
| DeepSeek | V4 Pro | $0.435 / $0.87 |
再摆售价。我们打开了 302.AI 的公开价目页——这是一家把多家模型聚合到一个接口下的中转平台,价目对所有人可见,不需要登录。它页面上列的是:claude-opus-5 是 $5 / $25,claude-sonnet-5 是 $2 / $10,gpt-5.6-sol 是 $5 / $30,gpt-5.6-terra 是 $2 / $12,deepseek-v4-flash 是 $0.14 / $0.28 起。
逐行对一遍:六行里有五行完全相同,第六行标着「起」。
这一步不需要任何演算。转售这门生意,在「挂牌价」这一层的价差是零。
顺便记一个我们没有做的比较,因为它做不成。同一张价目页上还有一行 qwen3.8-max,$1.8 / $5.3。而阿里云百炼官方模型价格页上列出的旗舰型号叫 qwen3.7-max,国际站是 $2.5 / $7.5、中国大陆地域是 $1.65 / $4.951,页面同时标着有限时折扣。型号名不是同一个,折扣状态也不同,这两组数不能相减。 谁把它们相减了给你看一个「加价率」,那个数是造出来的。
到这里,一个念头会很自然地冒出来:那这些平台靠什么活着?
二、最大的那家把抽成写进了文档:0% 加价,5.5% 充值手续费
这个问题有一个公开答案,而且是当事人自己写的。
OpenRouter 是公开可查的模型聚合平台里体量最大的一家。它的文档里有这么一句原话:「We pass through the pricing of the underlying providers without any markup」——按底层供应商的定价原样透传,不加价。
那它收什么?同一份文档写得很清楚,三笔:
第一,买额度的时候收手续费。用银行卡走 Stripe 是 5.5%(最低 $0.80),用加密货币是 5%。
第二,BYOK(你自己带供应商的密钥来)每月前 100 万次请求免费,超过之后,收「同一个模型、同一个供应商在 OpenRouter 上正常价格的 5%」。
第三,模型调用本身——不收。
把这三条读完,这门生意的形状就清楚了:它挣的不是模型差价,是支付通道费和调度费。
这是这个赛道公开可查的抽成水平,一个个位数的百分比。而且注意它收在哪儿——收在你充值的那一刻,不是收在你调用的那一刻。这两者的区别很大:前者是一次性的、可预测的;后者才是「毛利」这个词通常指的东西。
下面这笔账你可以自己算,我们把口径写全:
假设你做的是同样的事,按 5.5% 收充值手续费。一个客户一个月充 10 万元,你这个月从他身上拿到 5,500 元(10 万 × 5.5%,这一步是我们自己算的,口径就是照搬上面那个百分比)。
这 5,500 元要覆盖什么?服务器、带宽、把多家接口统一成一套的开发、供应商故障时的切换、客户调用失败时的排查、退款和对账、以及一个能在半夜被叫醒的人。
5,500 元不是利润,是这一个月全部运营成本加利润的总和。 如果你的客户不是一个月充 10 万而是一个月充 3,000 元,这个数变成 165 元。
所以「进货卖货赚差价」这个心理模型,从第一步就套错了。
三、那毛利到底从哪来:三个位置,全在进价那一侧
挂牌价不能动,抽成是个位数,这门生意还有毛利吗?有,但它藏在另一头——不是把售价抬上去,是把进价压下去。
公开定价页上一共只有三个可以压的位置。
第一个位置:缓存命中。
Anthropic 官方定价页写明,缓存读取(cache hit)的价格是基础输入价的 0.1 倍。落到 Claude Opus 5 上:基础输入 $5,缓存命中 $0.50。
DeepSeek 官方定价页把这两个价直接列成两行:V4 Flash 的输入价,缓存未命中是 $0.14,缓存命中是 $0.0028;V4 Pro 是 $0.435 对 $0.003625。
除一下。$0.14 ÷ $0.0028 = 50 倍;$0.435 ÷ $0.003625 = 120 倍。这两个除法是我们自己做的,分子分母就是上面那两组官方数字,口径是「同一个型号、同一个输入端、命中与不命中」。
同一次请求,命中和不命中,成本差 50 到 120 倍。 这是这门生意里唯一一个数量级级别的杠杆。
它成立的条件很具体:请求的前缀必须重复。同一份系统提示词、同一份产品手册、同一套规则文档被反复送进去——客服、审核、批量抽取都是这个形状。每次输入都完全不同的场景,这个价格你永远用不上。
这件事值得单独说一句,因为它是模型计费独有的。租带宽没有这个东西,卖服务器也没有:同样一次请求、内容一模一样,只因为前面那一段刚刚送过,价格就差两个数量级。转售模型能力的毛利,本质上就是这个机制的搬运费。 一个不管缓存的网关,和一个把缓存做透了的网关,进价可以差出好几倍,而它们的挂牌价是一样的。
第二个位置:批量处理。
Anthropic 官方定价页给出的 Batch API 是输入输出各打五折:Opus 5 从 $5 / $25 变成 $2.50 / $12.50。代价是异步——它不适合有人在屏幕那头等着的场景。
第三个位置:分档路由。
上面那张表里,最贵的输入价是 $5,最便宜的是 $0.14。$5 ÷ $0.14 ≈ 35.7 倍(自算)。把不需要旗舰的请求路由到便宜档,进价立刻掉一大截。
三个位置说完,一个不太舒服的事实也就出来了:这三样,你的客户自己也能做。
缓存是官方文档里写着的功能,批处理是官方提供的接口,分档路由是一张 if-else。你的护城河不是他做不到,是他嫌麻烦。 嫌麻烦这件事能撑多久,取决于他的量有多大——量越大,他自己做的动力越强,而他恰恰是你最不想失去的那个客户。
四、代价:进价不由你定,而且它会消失
先说三笔代价,再说什么时候不该做。
第一笔代价:你的进价方随时会调价,而且他会先告诉全世界。
DeepSeek 官方定价页上写着这么一句:「We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.」——计划整体提价,且预期幅度不小。(该页面未标注日期,本文按页面现行内容引用。)
这句话对一个转售者意味着什么:你的进价方在自己的官网上预告要涨价,而你的售价是公开挂牌的、被所有同行盯着的。进价往上走的那一天,你只有两个选择——跟着涨(客户会问为什么),或者自己吃掉(毛利本来就是个位数)。
第二笔代价:你依赖的型号会整个消失。
据月之暗面官方模型文档,Kimi K2 本体已于 2026 年 5 月 25 日下线。
这不是假设的风险,是已经发生过的先例。对自用的人来说,下线意味着换一个型号;对转售的人来说,下线意味着你价目页上的一行、以及绑在这一行上的所有客户,需要在没有提前量的情况下被搬走。
第三笔代价:稳定性的成本是不对称的。
客户用你而不用官方,买的是「一个接口打通所有家」这个便利。这个便利一旦在他上线之后失效一次,他失去的是他自己的生意,你失去的是他。而你收的是个位数百分比。赔付能力和抽成水平之间的这个缺口,是这门生意最难看的一处。
接下来是可以自己走一遍的五步,用来判断这件事你做不做得起。
第 1 步。先算你的客户一个月会充多少钱。 不是「潜在市场规模」,是你手上已经能报出名字的那几个人,他们一个月各充多少。加起来。
第 2 步。把这个总额乘以你打算收的百分比。 参照上面那个公开的量级,个位数。得到的这个数,是你每个月全部的收入。
第 3 步。把你的服务器、带宽、开发和值班摊进去,看看还剩多少。 值班这一项不许省——第三笔代价说的就是它。
第 4 步。假设你最大的那个客户明天自己去官方开了账号,重算一遍第 2 步。 因为第三节说了,他能做,他只是嫌麻烦。
第 5 步。如果第 4 步之后的数是负的,这件事就不该当第一桶金来做。 它可以是你已有生意的一个附加能力,不该是你的主营。
什么时候不该做这个项目。
第一种:你手上没有一批已经在花钱调模型的客户。转售是一门存量生意,它不创造需求,它只是把已经存在的调用换一条路走。没有存量的时候,你要先花全部力气去做获客,而获客的成本远高于个位数的抽成能覆盖的范围。
第二种:你没有人能在半夜起来处理故障。这不是态度问题,是这门生意的最低配置——你卖的就是可用性。一个人做转售、又只能白天在线,那你卖的东西在夜里是不存在的。
第三种,也是最该拦住的一种:你打算靠「比官方便宜」来打开局面。挂牌价这一层没有空间,比官方便宜只能来自两个地方——要么你在补贴,要么货不是官方那一路。前者烧完就停,后者是另一回事,不在本文讨论范围里。
同系列里还有一篇讲怎么按任务给模型分档、把账单压下去的,那篇是从买方角度写的,和这一篇正好是同一件事的两头。
本文事实来源
可自行复核- 1
Claude Opus 5 挂牌价 $5 / $25、Sonnet 5 $2 / $10;缓存读取为基础输入价的 0.1 倍;Batch API 输入输出各五折(Opus 5 为 $2.50 / $12.50)
- 2
GPT-5.6 Sol $5 / $30、Terra $2 / $12
- 3
DeepSeek V4 Flash $0.14 / $0.28(缓存命中 $0.0028)、V4 Pro $0.435 / $0.87(缓存命中 $0.003625);页面原文「We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.」
- 4
302.AI 公开价目页:claude-opus-5 $5 / $25、claude-sonnet-5 $2 / $10、gpt-5.6-sol $5 / $30、gpt-5.6-terra $2 / $12、deepseek-v4-flash $0.14 / $0.28 起、qwen3.8-max $1.8 / $5.3
- 5
阿里云百炼官方模型价格页:旗舰型号 qwen3.7-max,国际站 $2.5 / $7.5、中国大陆地域 $1.65 / $4.951,页面标注有限时折扣
- 6
OpenRouter 官方文档:「We pass through the pricing of the underlying providers without any markup」;买额度手续费 Stripe 5.5%(最低 $0.80)、加密货币 5%;BYOK 每月前 100 万次请求免费,超出部分收「同模型同供应商在 OpenRouter 上正常价格的 5%」
- 7
Kimi K2 本体已于 2026 年 5 月 25 日下线
