老板不需要懂大模型,但必须搞清这三件事
价格带、能力代际、停服风险——三件事各有一个你自己就能打开核对的依据,剩下的名词一个都不用记

文章目录
共 4 节一张报价单摆在会议桌上,服务名称那一栏写着「大模型接入」,金额是五位数。老板问了一句:你选的这个,比别人贵在哪。技术负责人讲了二十分钟,全是型号名和参数缩写。
那二十分钟里,跟这张报价单真正有关的信息只有三条:这件事每个月要花多少钱、你选的这个型号还能用多久、它哪天没了你怎么办。
本文不解释模型是怎么工作的——那件事和这张报价单没有关系。本文只做一件事:把这三条各配一个你自己能打开、能核对、不需要问任何供应商的依据。三条依据的原始页面,我们各追了一遍,链接在文末。
一、价格带:不看型号,看三个字段
打开任何一家的官方定价页,上面的信息量都不小。跟你有关的只有三个字段:
输入价、输出价、缓存命中价。 单位统一换算成「每百万 token 多少钱」——各家页面上的计价单位不一样,有的按千,有的按百万,有的按次,不统一到同一个单位,你比出来的差距是假的。
第三个字段最容易被漏。缓存命中价指的是同样一段内容被重复送进去时的价格,它通常明显低于输入价。一件重复度高的业务(同一份产品手册、同一套报价规则被反复带进去),这一项决定了你的账单是原价还是折价。看报价单的时候,问一句「我这个用法命中缓存吗」,比问「你用的是哪个型号」有用得多。
为什么本文不给你一张具体的价格表。
我们本来准备给,最后没给,理由是价格表有保质期,而这个保质期已经被两份公开材料量化过。
据斯坦福大学 HAI《AI Index Report 2025》(2025 年 4 月 7 日发布):达到 GPT-3.5 同等水平的推理成本,在 2022 年 11 月到 2024 年 10 月之间下降超过 280 倍。同一份报告还写着,硬件层面的成本以每年约 30% 的速度下降,能效每年提升约 40%。
据 Epoch AI 于 2025 年 3 月 12 日发布的推理价格趋势分析,不同性能档位上的价格年降幅差别极大,原文写的是「ranging from 9x to 900x per year」——9 倍到 900 倍。
把 30% 这个数往后推两年算一次:0.7 × 0.7 ≈ 0.49。也就是说,按这个速度,硬件那一块的成本两年后大约是一半。能效那一头 1.4 × 1.4 ≈ 1.96,接近两倍。这两个乘法是我们自己做的,分子分母就是报告给的那两个年化比例,它假设的是「按同样的速度线性延续」——而报告本身并没有承诺这个速度会延续。 它能说明的只有一件事:你签的那份三年合同,第三年的单价一定不会是签约那天的单价,所以合同里要有重新议价的条款。
所以正确的动作不是记住一个数,是学会自己抓一次。
四步,把价目页换算成你听得懂的单位。
第 1 步。数出这件事一个月发生多少次。 工单数、报价单数、客服会话数、要写的文章数——数得出来的才做,数不出来的先别上。
第 2 步。别估算长度,直接跑 20 次真实的请求。 用你自己业务里的真实内容,不要用示例。跑完记下这 20 次一共花了多少钱。任何一家的控制台都有用量记录,这个数不用问供应商。
第 3 步。总花费除以 20,得到单次成本,再乘以第 1 步那个次数。 这就是这件事一个月的模型开销。
第 4 步。把这个数,和「这件事一个月占掉的人力分钟数 × 你的人力单价」写在同一行。 两个数并排,这张报价单该不该批就有答案了。
四步做完,你手上有一个可以拿去对账的数,而且它的口径是你自己的业务,不是任何一张行业均价表。
最后一条纪律:抓下来的那一页要截图,并且在截图上写上抓取日期。 多数定价页不标注更新时间,你不写,三个月后没有人能说清那是什么时候的价——包括当初做决定的你自己。
二、能力代际:不看发布会,看厂商自己的弃用页
每一家供应商都有两类页面。一类是发布会和新品说明,告诉你新的有多强;另一类通常藏在文档里,叫「模型弃用」「legacy」或者「已下线模型」,告诉你哪些型号被它自己标成了旧代、哪一天停止提供。
发布会那一页跟你的钱没关系,弃用那一页才有。
理由很直接:你不会因为出了更强的型号而多赚钱,但你会因为在用的那个型号被停掉而返一次工。所以「能力代际」这件事,老板要看的不是「谁家最强」,是三个问题:
- 1你在用的那个型号,被列进弃用列表了吗?
- 2如果在,官方给的过渡期是多久? 有的给一年,有的给三个月。
- 3官方指定的等价替代型号是哪个?有没有说明差别?
这三问的答案全部在供应商自己的文档里,不需要任何技术背景就能读。让人打开那一页,截图,写上日期,贴进你的采购档案。
换代对你的真实影响不是「变强了」,是「要重跑一次验收」。 一个已经在跑的流程,换了型号之后,原来定好的那套话术、那套判断标准、那批测试用例,都要再过一遍。这一遍要花的是人天,不是 token 钱。所以采购的时候就该问清楚:过渡期内要重测的东西有多少,谁来测。
顺着这条线还有一个更该被老板知道的判断:追最强,对你的回报影响排在很后面。
据 Gartner 于 2025 年 6 月 25 日发布的预测:超过 40% 的 agentic AI 项目会在 2027 年底之前被取消,被点名的原因集中在成本失控、价值不清和风险控制不足,不是模型不够强。
这条预测本身是一个机构的判断,不是已发生的统计,引用它的时候要知道这个区别。但它指的方向和一件常识对得上:一个流程如果没人负责、没定验收标准,换成再强的型号也一样跑不出结果。你的瓶颈通常不在代际上,在代际这件事上花掉的注意力,多数是浪费的。
三、停服风险:已经有现成的先例
这一条是三件事里最少被写进合同、也最贵的一件。
先看一个已经发生过的事实:月之暗面的平台文档里写着,Kimi K2 本体已于 2026 年 5 月 25 日 下线。这不是预测,是一条可以打开页面核对的记录。你依赖的那个型号会消失,这件事有先例。
供应侧还有一层你完全控制不了的变化。据美国商务部工业与安全局(BIS)2026 年 1 月 13 日发布的许可审查政策修订,对华半导体出口的审查口径被再次调整。这类变动不由你的供应商决定,也不由你决定,但它最终会落到你的账单和可用性上。
一张五行的自查表,把它填了。 每一行都只要一句话的答案:
- 1这条业务依赖几家供应商? 答案是「一家」的,风险等级直接标最高。
- 2在用的型号,在弃用列表里吗?停服公告会发到哪个邮箱? 收不到公告等于没有预警。
- 3换掉它需要多久? 给一个天数。给不出天数,说明没人试过。
- 4换掉它之后,哪些东西要重做? 提示词、判断规则、测试用例、对接口,逐项列出来。
- 5历史数据能导出来吗?导出的是什么格式? 会话记录、标注结果、日志——导不出来的,等于押在了对方手上。
合同里必须写进去的三条,一条都不要省:提前告知期(停服或调价提前多少天通知)、等价替代(供应商是否承诺提供替代能力,以及替代期间的价格)、数据可导出(导出的范围、格式和期限)。这三条谈的时候不贵,出事的时候值很多钱。
四、这三件事管不了什么
必须把边界说清楚,否则这篇文章会被用错。
第一,这三件事一件都不解决「我该从哪一步动手」。 如果你还没有一个正在跑的场景,价目页查得再熟也没有用——你算出来的是一个不存在的业务的成本。顺序是先有场景,再有这三件事。没有场景就去比价格,是把第二步当第一步做。
第二,它们只决定边际成本,不决定回报。 模型开销通常只是这件事总成本里较小的一块,人力、整理资料、返工、还有那个负责盯着它的人,加起来常常更大。价格带压到最低,也救不回一个没人负责的流程。
第三,抄别人的结论会过期。 上面那两组年降幅数据说的正是这件事:任何一张表、任何一个「某某型号最划算」的结论,都带着一个没写出来的抓取日期。别人替你查过的,不算你查过。
什么时候不该花时间在这三件事上。
一种是你的用量还很小的时候。一个月的模型开销还不到一次外卖团建的钱,为它开三次会、比五家价格,是把最贵的资源(老板和骨干的时间)花在最便宜的一项上。用量小的阶段,正确的做法是先跑起来,等账单能被看见了再回来做这三件事。
另一种是这件事还没有人负责的时候。三件事都要有人去打开页面、截图、写日期、填表。这个动作交不出去,表就永远是空的,而一张空表比没有表更危险——它会让你以为自己已经管过了。
先把场景选出来,再回来做这三件事,顺序反了,前面的功夫都要重来。这套「先算人力分钟数、再决定要不要上」的判断顺序,在《DeepSeek企业实战》第 1 课。
本文事实来源
可自行复核- 1
达到 GPT-3.5 同等水平的推理成本在 2022 年 11 月至 2024 年 10 月之间下降超过 280 倍;硬件层面成本每年下降约 30%,能效每年提升约 40%
- 2
LLM 推理价格年降幅「ranging from 9x to 900x per year」
- 3
Kimi K2 本体已于 2026 年 5 月 25 日下线(模型停服的公开先例)
- 4
Gartner 预测:超过 40% 的 agentic AI 项目将在 2027 年底之前被取消
- 5
美国商务部工业与安全局(BIS)修订对华半导体出口许可审查政策
