为什么「最强模型」对你的生意通常没用
一项随机对照试验里,16 名资深开发者用上当时最好用的那一档工具,实测慢了 19%,而他们自己以为快了 20%

文章目录
共 4 节19% 和 20%。
前一个是实测出来的:一群资深开发者被允许使用 AI 工具之后,完成同一批真实任务多花了 19% 的时间。
后一个是他们自己填的:做完之后,他们平均认为 AI 让自己快了 20%。
这两个数出自同一项随机对照试验。它们之间差着 39 个百分点,而这 39 个百分点里,装着大多数公司的 AI 效果报告。
一、那项试验到底测了什么,以及没测什么
据研究机构 METR 于 2025 年 7 月 10 日发布的研究,这项随机对照试验的规模是:16 名有经验的开源开发者、246 个真实任务。任务被随机分成两组,一组允许使用 AI 工具,一组不允许,然后量完成时间。
结果是那句原话:允许使用 AI 工具的时候,他们完成同一批问题多花了 19% 的时间。
他们用的工具,研究页面上写得很清楚:Cursor Pro,配 Claude 3.5 与 3.7 Sonnet。在那个时间点上,这是被普遍认为最好用的一档编程工具组合——"最好用"是我们的措辞,研究本身没有做这个判断,它只列了工具清单。
真正值钱的是另外两个数。开工之前,这些开发者预计 AI 会让他们快 24%。做完之后,在已经慢了 19% 的情况下,他们仍然认为 AI 让自己快了 20%。
把这三个数放在一起算一次:预期 24% 快,实测 19% 慢,差 43 个百分点;事后自评 20% 快,实测 19% 慢,差 39 个百分点。这两步减法是我们自己做的,研究页面没有直接给这两个差值。 口径是把"快"记为正、"慢"记为负后相减,只用于说明感知与实测的落差有多大,不是研究结论。
限制也必须一起写出来,否则这篇文章就成了另一种断章取义。研究作者在同一页上明确写了:他们并没有提供证据说明 AI 对"多数软件开发者"无效,样本可能不代表大多数开发工作;他们还承认存在学习曲线可能超出观察期、招募环节可能有选择偏差、以及结论未必能推广到"高质量的大型开源仓库"以外的场景。
我们去把这份研究读完的原因,不是想证明 AI 没用。是因为它测到了一件几乎测不到的事:当一个人相信自己变快了的时候,他有可能实际上变慢了,而且慢得不少。
对一个 5 到 50 人的公司,这一条的含义非常具体:如果你的 AI 效果结论来自"大家反馈都说好用",那它的证据强度,比这项试验里那个 20% 还要低。 至少人家还有一组对照。
二、那真正决定回报的是什么
再看三组来源独立、口径各不相同的数字。
据 Gartner 于 2025 年 6 月 25 日发布的新闻稿预测,到 2027 年底,超过 40% 的 agentic AI 项目会被取消。注意口径:这是预测,且只针对 agentic 这一类项目。
据埃森哲中国数字化转型指数 2025 年版(2025 年 7 月),46% 的企业在规模化使用生成式 AI,只有 9% 拿到了显著价值。
还有一组来自麦肯锡对约 500 家组织的调研。这一组我们只拿到了转载版本,未能核到原始报告与它的发布时间,请按"据转载"看待:88% 的组织在使用 AI,仅 39% 报告有实际收益,约 6% 达到了 5% 以上的 EBIT 影响。同一份调研里还有一句,是这三组数字里行动价值最高的一句——收益影响最大的单一因素是"重新设计工作流",而只有 21% 的公司真的做了。
四组数字(含上一节那一组),口径完全不同,没有一组能直接和另一组相比。但它们指向同一个方向:拉开差距的那件事,不在模型这一侧。
这就是"最强模型对你的生意通常没用"这句话的真实含义。它不是说旗舰模型不强,也不是说别用。它说的是:在你的流程没有被重画之前,模型强弱这个变量的影响,小到你测不出来。
道理并不复杂。一个报价流程如果是"业务员问车间、车间查库存、库存回消息、业务员再算料工费、最后套模板",那么这条流程的耗时大头是三段等待,不是打字。你把打字那一段从三分钟压到三十秒,甚至压到零,整条流程的时间基本不变。这时候你换一个更强的模型,改变的是那三十秒里的一部分——你在优化一个不是瓶颈的环节,还为此付了旗舰的单价。
把这件事算成数会更清楚。下面这组数是本文设的示例口径,不是任何调研数据,你要用自己那张基线表上的真实值替换掉它:假设一条报价从接到询价到发出去,全程 120 分钟,其中"等别人回消息"占 95 分钟、"人做判断"占 13 分钟、"打字和排版"占 12 分钟。
现实里最常见的那种上法,是把 AI 接在打字那一段。就算把 12 分钟整段压到 0,总时长从 120 分钟降到 108 分钟,降幅 10%。而如果你把三段等待里的第一段改掉——比如让库存状态变成一个随时能查到的数,而不是一条要等人回的消息——省下的分钟数比前者大一个量级。
这一步除法很简单,但它决定了钱该往哪花:12 ÷ 120 = 10%,这就是"把打字这一段做到完美"的收益上限。 上限是 10% 的那一段,不值得为它去买最贵的那一档;而那 95 分钟,换任何模型都动不了它,只有改流程能动。
顺带说一句为什么大家都先动打字那一段:因为它是唯一一段不需要跟别人商量就能改的。改等待那一段要动别人的部门、别人的习惯、别人的考核。AI 项目最常见的走位不是选错了工具,是选了那段最容易动的、也最不值钱的环节。
而第一节那 39 个百分点解释了为什么这件事能持续很久没被发现:改完之后,所有人都会觉得快了。 没有基线,没有对照,感觉就是唯一的证据。
三、不换模型,先做一次对照:五步,一周做得完
下面这套五步,是给"要不要换一个更强的模型"这个具体决定用的。它不需要买任何东西,也不需要技术背景,一个人一周之内能做完。
第 1 步。选一类你真的在做的任务,攒 30 条。
不是 30 个测试题,是过去真实发生过的 30 条——真实的客户咨询、真实的报价单、真实的验收单据。数量给 30 条,是因为再少了偶然性太大,再多了你一周做不完。每一条要连着它当初的正确答案一起存下来,那份正确答案是这套对照的标尺。
第 2 步。先量没有 AI 的那一版,量三天。
用秒表也行,用手写的格子表也行。只量两个数:每条花了多少分钟、其中有几条返工了。 三天,条件不变。这三天量出来的东西叫基线,没有它,后面四步全部作废。
第 3 步。同一批任务,同一份提示词,只换模型。
这一步的纪律只有一条:一次只改一个变量。 很多人在换模型的同时把提示词也改了、把流程也顺手调了,然后拿到一个更好的结果,于是把功劳记在模型头上。这样的对照什么也证明不了。要换模型,就只换模型,提示词一个字不动。
第 4 步。记的还是那两个数,加上一个第三个数。
每条花了多少分钟、有几条返工、以及贵的那一档比便宜的那一档多花了多少钱。 第三个数从你的账单里直接抄,不要估。
第 5 步。把两张表并排放,只回答一个问题。
问题是:多花的那笔钱,换回来的返工减少值不值。 算法是把多花的钱除以你团队的人工小时成本,得到一个小时数;如果换成贵档之后,这 30 条省下的返工时间少于这个小时数,那就不该换。
这一步的答案经常是"不该换"。而更常见的一种结果是:两档的返工条数一样,差别在人眼看不出来的地方。那说明你这类任务的瓶颈不在模型上,第 2 步那张基线表会告诉你它在哪一段。
做完这五步,你手上会有一张别人给不了你的东西:一个属于你自己业务的、可复算的换档结论。 它比任何一份榜单截图都管用,因为榜单测的是公开题目上的表现,你买的是它在你那 30 条上的表现。
四、什么时候「最强模型」确实值那笔钱
这一节是给上面三节泼冷水的。只讲好处不讲例外,就成了另一种偷懒。
第一种情况:输出之后没有第二双眼睛。 对外发出去的条款、直接给客户的报价、写进合同的口径——这一类错一次的代价,通常远超一整年的模型账单差价。这一类不要为省钱换档,第三节那套算法在这里不适用,因为它的分母里没有"赔一次"这一项。
第二种情况:这件事本来就跑不通。 如果便宜那一档在你的 30 条上返工率高到没法用,那不是"值不值"的问题,是"能不能"的问题。能不能优先于值不值。
第三种情况:你的业务量太小,整件事都不值得算。 如果一个月的模型账单还低于你做这次对照要占用的人力成本,那就先别对照,随便挑一个够用的,把量做起来再说。这一条对一人公司尤其适用。
再说三个代价,都是第三节那套五步的真实成本。
代价一,那 30 条要人去攒,而且攒的过程会让人难受。 因为你会在攒的时候发现,过去有些任务根本没有一份说得清的"正确答案"。这不是坏消息,这是这套方法最值钱的副产品——它逼你把"什么样的输出算对"写下来。
代价二,三天基线期里,团队会觉得你在做无用功。 这三天不产出任何改善,只产出一张表。忍住,不要跳过。跳过基线的评估,最后都会退化成"大家反馈都说好用",也就是第一节那个 20%。
代价三,结论可能是"两档没差别",而这个结论不好汇报。 一份写着"我们试了,结论是不用换"的报告,看起来不如"我们上线了新模型"漂亮。但它省下的是真金白银,而且它让下一次的决定有据可依。我们的看法是,一个公司能不能把 AI 用出回报,很大程度上取决于它敢不敢接受这一类不好看的结论。
最后回到开头那两个数。19% 和 20%,一个来自秒表,一个来自感觉。你要做的第一件事,不是挑模型,是给自己的业务装一块秒表——三天,两个指标,一张纸。装完之后你会发现,值得换的东西通常不是模型。
至于"先重画哪一段流程",那是另一个问题,值得单独看一篇。
本文事实来源
可自行复核- 1
METR 随机对照试验:16 名有经验的开源开发者、246 个任务;允许使用 AI 工具时完成任务多花 19% 时间;试验前开发者预计提速 24%,试验后仍自评提速 20%;所用工具为 Cursor Pro 配 Claude 3.5 / 3.7 Sonnet。作者自述的限制:未提供证据说明 AI 对多数开发者无效、样本可能不具代表性、可能存在超出观察期的学习效应与招募端的选择偏差、结论未必能推广到高质量大型开源仓库以外
- 2
Gartner 新闻稿:预测到 2027 年底超过 40% 的 agentic AI 项目将被取消
- 3
埃森哲中国数字化转型指数 2025 年版:46% 的企业在规模化使用生成式 AI,仅 9% 拿到显著价值
- 4
麦肯锡对约 500 家组织的调研:88% 在使用 AI、39% 报告实际收益、约 6% 达到 5% 以上 EBIT 影响;收益影响最大的单一因素是"重新设计工作流",仅 21% 真的做了。⚠️ 我们只拿到转载版本,未能核到原始报告与其发布时间,正文已两处标注"据转载"
只拿到转载版本,麦肯锡官网原文未能取到,因此这一条没有可点开的一手地址
