一个 AI 服务订单的真实成本构成:算完你会重新定价
同一个订单,调用费按三家官方价算出来是 72 元、240 元和 13.68 美元——而它在整张成本表里排最后一位

文章目录
共 5 节先算一笔能算到分的账。
假设一个订单:给客户做一个接待场景,一个月处理 3000 条对话,每条平均消耗输入 2000 个 token、输出 400 个 token。
这个订单的调用费是多少?我们按三家在 2026 年 7 月 18 日之前公开发布过、且带发布日期的官方定价,各算一遍。算完你会看到三个差得很远的数——然后你会发现,这三个数放进整张成本表里,都排在最后一位。
这篇文章要做的就是把另外三块摆出来。大多数报价单亏,不是亏在算错了调用费,是亏在只算了调用费。
一、能算到分的那一块:三家官方价,一次可复算的演算
先把口径说死:本节只引用带公开发布日期、且能对应到官方页面的定价。 有几家的官方定价页面本身不标注发布日期,那些数字这篇文章一个都不用——一份倒推成本的文章,如果引用了一个说不清"什么时候是这个价"的数字,整张表就没有意义。我们去逐个看过,符合这个条件的有三家。
第一家。 据智谱官方定价文档,GLM-5.2(744B,MIT 开源)的定价是每百万 token 输入 1.4 美元、输出 4.4 美元(2026 年 6 月 13 日)。
第二家。 据新华网 2026 年 6 月 23 日的报道,豆包 2.1 Pro 的定价是每百万 token 输入 6 元、输出 30 元,缓存命中 1.2 元。
第三家。 据月之暗面官方定价页,Kimi K3(2.8 万亿参数)于 2026 年 7 月 16 日发布,定价为每百万 token 输入 20 元、输出 100 元。
把上面那个订单代进去。总输入 = 3000 × 2000 = 600 万 token = 6 百万;总输出 = 3000 × 400 = 120 万 token = 1.2 百万。
- →豆包 2.1 Pro:6 × 6 + 1.2 × 30 = 36 + 36 = 72 元
- →Kimi K3:6 × 20 + 1.2 × 100 = 120 + 120 = 240 元
- →GLM-5.2:6 × 1.4 + 1.2 × 4.4 = 8.4 + 5.28 = 13.68 美元
三步除法与乘法都写在上面,你可以自己复算。两个必须说明的口径:第一,前两个数是人民币、第三个是美元,本文不做汇率换算——没有一个能标注日期的汇率来源,换算出来的数就是一个不能核验的数,所以三个数只并排摆,不排名次。第二,两家人民币计价的之间是 240 ÷ 72 ≈ 3.3 倍,这一步除法是本文自己做的,分子分母就是上面两个数。
还有一项多数人漏掉的减法。豆包那条定价里的缓存命中价是 1.2 元,比输入价低了 4 倍。假设这个接待场景里有六成的输入内容是重复的(同一份说明、同一套规则,每次都要带上),那么:命中部分 3.6 百万 × 1.2 = 4.32 元,未命中部分 2.4 百万 × 6 = 14.4 元,输入合计 18.72 元,加上输出 36 元,总共 54.72 元。
对比不走缓存的 72 元,省下 17.28 元,降幅 24%。这一步演算同样是本文自己做的,"六成命中"是本文设定的假设值,不是任何一方公布的数据——你自己那个场景的命中率只有跑起来才知道。
72 元、240 元、54.72 元、13.68 美元。四个数摆在这里,然后是本文真正想说的那句话。
二、算到分之后,这个订单反而更难定价了
因为这一块小到不影响决策。
一个能对外接待、跑满一个月、处理 3000 条对话的场景,调用费是几十元到几百元。而据澎湃 2026 年 5 月 19 日发布的报道,长江商学院对全国 2016 家规模以上工业企业的实测显示,500 人以下企业的 AI 支出,42.6% 落在 2 万到 10 万元这个区间。
把 72 元放进 2 万元里:占 0.36%。
这个比例意味着什么?意味着围绕调用费做的一切优化,对这个订单的盈亏几乎没有影响。换一家更便宜的、把提示压短一点、把缓存调好——三件事加起来省下的钱,可能还不够你为此多开一次会。
而这一块还在继续变小。据 Epoch AI 的推理价格趋势数据(页面标注 2025 年 3 月 12 日),同等能力的大模型推理价格年降幅度从 9 倍到 900 倍不等,中位数约为每年 50 倍(原文 "prices declining between 9x per year and 900x per year, with a median of 50x per year");该页同时写着一句限定——"The fastest price drops in that range have occurred in the past year, so it's less clear that those will persist.",最快的那几档降幅集中在其发布前一年,未必持续;另据斯坦福 HAI 于 2025 年 4 月 7 日发布的《AI Index Report 2025》,达到 GPT-3.5 级能力的推理成本在 2022 年 11 月至 2024 年 10 月之间下降了超过 280 倍。
一项正在以这个速度变小的成本,不该是你定价的锚。
有意思的是,机构调研里对这一块的关注反而在上升。据埃森哲 2026 年 7 月 17 日发布的中国数字化转型指数,试点覆盖率已升至 88%、价值兑现率仅 14%,进行过系统性运营重构的仅 18%;而它列出的新增障碍里,原文写着一句"调用词元产生持续性成本支出"。
这句话本身是真的——它确实是一笔持续支出,性质和一次性的软件采购完全不同。但把它放在 88% 对 14% 这个落差旁边看,就能读出另一层:卡住价值兑现的不是那笔持续支出,是那 82% 没有做系统性运营重构的部分。 成本表上最刺眼的那一行,往往不是最贵的那一行。
三、剩下三块:哪些是公开口径,哪些是本文的建议值
从这一节开始,数字的性质变了,所以先把界限划清楚:
- →公开口径:有来源、有时间、可点开核验的,正文逐条标注;
- →本文建议值:没有第三方统计的,一律明写"这是本文的建议值,不是实测数据"。公开可查的范围内不存在"AI 服务订单成本构成"的第三方统计,我们没有找到第二份,也不替任何人编一个。
第二块:人力工时(本文建议值,公开锚点在客户侧)
这一块的结构是固定的,数字要你自己填。以上面那个接待场景为例,工时至少分五段:
- 1需求澄清——把"做一个接待"变成"接待什么、不接待什么",建议值 3~5 小时;
- 2样本收集与标注——向客户要真实历史输入,请客户自己圈出不能出错的那些,你这一侧建议值 2 小时,客户那一侧至少一个下午;
- 3搭建与调试——这一段差异最大,建议值 6~10 小时;
- 4联合验收——上线后两周,你的投入建议值 6~10 小时;
- 5交付文档与交接——建议值 2~4 小时。
五段相加,建议值区间是 19~31 小时。
把它换成钱要用你自己的时薪。这里用 100 元/小时作为示例值——这个数你必须换成自己的:25 小时 × 100 元 = 2500 元。2500 ÷ 72 ≈ 34.7 倍。这一步除法是本文做的,分子是示例值不是实测,所以 34.7 这个数本身没有意义,有意义的是数量级:人力工时比调用费高一到两个数量级。
这一块还有一个不受你控制的放大因子,它有公开出处。据新京报贝壳财经 2025 年 7 月 29 日的报道,一份中国企业家 AI 应用调研显示,中小企业转型的第一障碍是人不是钱——47.66% 缺复合型人才、43.75% 缺 AI 专业知识,而认为成本过高的只有 29.69%。这份调研样本仅 128 份,量级很小,引用它必须带着这个前提。 但它指出的方向对报价很实在:客户那边很可能没有一个能配合你的人,第 2 段里"客户那一侧一个下午"如果落不了地,这一段的工时会全部转移到你身上。
第三块:返工与验收(公开锚点 + 本文建议值)
多数报价单把返工率默认成零。有一个公开锚点可以校正这个预期。
据 MIT NANDA 发布的《The GenAI Divide》报告原文,其给出的漏斗是 60% 的组织在评估、20% 进入试点、5% 进入生产——也就是进入试点的项目里,大约四分之一走到了生产(这一步除法由本文做出,分子分母是原文的 5% 与 20%)。该报告封面自标"Preliminary Findings",样本为 52 场访谈加 153 份行业会议现场问卷,报告自陈"六个月观察期可能不足,可能低估了成功率"——这三条限制必须和那个 25% 一起读,它不能当成你的返工率。
它能说明的是:从"跑通了"到"客户真的在用",中间有一段不小的损耗,而这段损耗默认落在乙方身上。 本文的建议值是:报价时按第二块工时的 30% 计提返工准备,第一次做某类场景时按 50%。这两个百分比是建议值,不是数据。
第四块:售后与兜底(公开锚点在责任与退款两侧)
这一块最容易被算成零,因为它发生在钱已经收到之后。
责任这一侧有明码标价。 据市场监管总局令第 117 号《直播电商监督管理办法》(2026 年 1 月 7 日发布,2026 年 2 月 1 日施行)第三十七条,使用人工智能人物图像开展直播须标识并持续提示,违法情形的责任由直播间运营者承担,罚则 1 万至 10 万元。另据中央电视台 2026 年 1 月 14 日的报道,杭州互联网法院审结全国首例涉 AI"幻觉"侵权案,判决生效,确立过错责任加三层注意义务。这两条合起来说明:兜底做没做、留没留痕,是有价目的。
退款这一侧有分布。 据新浪财经 2026 年 3 月 17 日的报道,黑猫投诉平台上 AI 课程相关投诉已高达 4000 多条,较去年同期增长 1000 余条;同一篇报道另引网经社"电诉宝"的一个数——2025 年第四季度,数字教育这个大领域的退款问题占比高达 71.26%。同日另一则报道中,四川省消委 2025 年全年受理"AI+"培训相关投诉 3739 件。这三个数分属三个来源、三个口径,不能合成一句——71.26% 是数字教育大领域的季度占比,不是黑猫平台上 AI 课投诉的退款占比。三个数都是知识付费口径,不能直接搬到服务交付上,但七成以上集中在退款这个形状说明的事是跨品类的:纠纷发生在交付之后。 本文的建议值:把合同金额的 10% 当作售后准备金,在验收通过 30 天之后才计入利润。
第五块(容易被整块漏掉):供应商变更导致的重做
据月之暗面官方模型文档,Kimi K2 本体已于 2026 年 5 月 25 日下线。一个被写进交付物、客户每天在用的名字,可以在某一天不再存在。
这一块的特点是:它不随你的水平变化,也无法通过做得更好来避免。 本文的建议是不把它计入单个订单成本,而是写进合同的一个条款——"模型或平台停止提供服务时,重做按新单计"。写了这一条,这块成本归零;不写,它就是一个金额不确定的负债。
四、四行表,和重新定价的三步
把五块收成一张四行表(第五块归为条款,不进表):
| 行 | 这一块的数从哪来 | 在总成本里的量级 |
|---|---|---|
| 调用费 | 三家官方定价页,可算到分 | 几十到几百元 |
| 人力工时 | 你自己的时薪 × 19~31 小时(本文建议值区间) | 前一行的一到两个数量级以上 |
| 返工准备 | 人力工时 × 30%(首次做该类场景 50%,本文建议值) | 与人力工时同量级 |
| 售后准备 | 合同金额 × 10%(本文建议值) | 随合同金额走 |
重新定价三步:
第 1 步。把第二行填出来,用你上一单的真实记录,不用估的。 上一单没记时间,那这一步做不了——去记下一单,两周后再回来。这是全篇唯一一个必须先有自己数据的步骤,也是唯一一个别人替不了的。
第 2 步。把第一行放到最后填。 顺序反过来的人最多:先算调用费,算完觉得"成本才几十块",于是报了一个覆盖不了工时的价。把它放到最后填,是为了不让它污染你对这单值多少钱的判断。
第 3 步。四行加总之后,和 2 万到 10 万这个区间对一次。 42.6% 的 500 人以下企业的 AI 支出落在这里。加总的结果如果远高于这个区间,问题不在你贵,在你接的这单对这个规模的客户来说太大了——正确的动作是把交付范围切小,而不是降价。
五、什么时候不该这么做
第一种:单子小于一万元。 这套四行表要占掉你半天时间去填,而半天时间本身可能就是这单利润的一大截。小单的正确做法是用一个固定的最低价把整类活兜住,把精细核算留给能覆盖它的订单。
第二种:你还没有一单的真实工时记录。 第 1 步就卡住了。这时候不该做的是"先按行业惯例估一个"——公开可查的范围内没有这个惯例,估出来的数会被你自己当成事实用一整年。先记两单,再来填这张表。
第三种:客户按结果付费,而不是按项目付费。 那么这张表的用途从"定价"变成"止损线"——它告诉你的是这单做到什么程度就该停,不是该收多少钱。两种用法不能混。
最后是一条必须写下来的代价:这张表会让你的报价变高,而变高的那部分很难向客户解释。 因为客户能看见的只有第一行——他也会算,他算出来就是几十块钱。这时候唯一有效的解释不是把成本表摊给他看,而是把验收标准摊给他看:他圈出来的那些不能出错的样本、两周的联合验收、售后的响应约定。他买的不是运行成本,是这些东西。 说不清这一点的时候,降价是唯一的出路,而降到最后就是那 0.36% 的生意。
关于成本结构整体该怎么重算,《老板必修:AI时代商业模式》第 3 课讲的是同一件事的公司版本。
本文事实来源
可自行复核- 1
GLM-5.2(744B,MIT 开源)定价每百万 token 输入 $1.4 / 输出 $4.4
- 2
豆包 2.1 Pro:输入 ¥6 / 输出 ¥30 / 缓存命中 ¥1.2 每百万 token
- 3
Kimi K3(2.8 万亿参数)官方定价 ¥20 输入 / ¥100 输出 每百万 token
- 4
长江商学院对全国 2016 家规模以上工业企业实测:500 人以下企业 AI 支出 42.6% 落在 2 万~10 万元区间
- 5
Epoch AI:大模型推理价格年降 9 倍~900 倍,中位数约 50 倍/年(原文 "prices declining between 9x per year and 900x per year, with a median of 50x per year")。
该页自带限定 "The fastest price drops in that range have occurred in the past year, so it's less clear that those will persist.";页面两处标注日期 Mar 12 2025(该句位于页面次级区块,渲染成 markdown 时会被吃掉,须看原始 HTML)
- 6
斯坦福 HAI《AI Index Report 2025》:GPT-3.5 级能力推理成本在 2022 年 11 月至 2024 年 10 月之间下降超过 280 倍(原文 "dropped over 280-fold between November 2022 and October 2024")
- 7
埃森哲中国数字化转型指数:试点覆盖率 88%、价值兑现率 14%、进行系统性运营重构的仅 18%;新增障碍原文「调用词元产生持续性成本支出」
- 8
中国企业家 AI 应用调研:47.66% 缺复合型人才、43.75% 缺 AI 专业知识、29.69% 认为成本过高。样本仅 128 份
- 9
MIT NANDA《The GenAI Divide》原文漏斗:60% 评估 → 20% 试点 → 5% 生产;封面自标 Preliminary Findings;样本 52 场访谈 + 153 份现场问卷;报告自陈「六个月观察期可能不足,可能低估了成功率」
- 10
《直播电商监督管理办法》(市场监管总局令第 117 号)第三十七条:责任由直播间运营者承担,罚则 1 万~10 万元
- 11
杭州互联网法院审结全国首例涉 AI「幻觉」侵权案,判决生效,确立过错责任 + 三层注意义务
- 12
黑猫投诉平台:原文「AI课程相关的投诉已高达4000多条,较去年同期增长1000余条」(新浪财经转述)
- 13
网经社「电诉宝」《2025年Q4数字教育消费投诉数据与典型案例报告》:2025 年第四季度数字教育领域的退款问题占比高达 71.26%。
数字教育大领域的季度口径,不是黑猫平台上 AI 课投诉的退款占比,与来源 12 分属两个平台、两个时段、两个统计范围
- 14
四川省消委 2025 年全年受理「AI+」培训相关投诉 3739 件。
该篇通篇未出现黑猫、4000 条与 71.26%
- 15
Kimi K2 本体已于 2026 年 5 月 25 日下线(官方模型文档)
