最容易高估的是模型能力,最容易低估的是交付稳定性
88% 跨过了试点,14% 拿到了结果——客户不缺见识过惊艳的经历,缺的是一次不出错的交付;四个指标,每个都写清怎么量、量多久、及格线怎么定

文章目录
共 4 节88% 和 14%。
据埃森哲《2026 中国企业数字化转型指数》(2026 年 7 月 17 日发布,样本为八个行业的 160 家中国企业),跨过先进 AI 应用试点阶段的受访中国企业占比「从去年的 46% 跃升至 88%」,而「实现生产效率、收入和利润提升等显著成果的企业仅从去年的 9% 升至 14%」。
这两个数不要相减。 原文没有说后者是前者的子集,相减得出的那个「74 个百分点」是假的。两个数各自成立就够用了:用起来的很多,拿到结果的很少。
要买你交付的那个人,就是从这个池子里出来的。他不缺见识过惊艳演示的经历——他缺的是一次不出错的交付。
一、分数和演示衡量的是上界,客户按下界付钱
先说交付方自己最容易犯的那个错。
你给客户看的那次演示,通常是你跑了几遍里最好的一次。这不是不诚实,这是人的默认动作——谁都会把最好的那次拿出来。问题在于,你自己也会把那一次当成它的水平。
模型分数是同一类东西的放大版。
据 UC Berkeley RDI 于 2026 年 4 月发布的研究,研究者做了一个自动扫描代理,去审计八个最主流的 AI Agent 基准。原文写着:这个代理在这些基准上拿到了「near-perfect scores」——具体区间是 73% 到 100%——而它「without solving a single task」,一道任务都没有真正解决。
这里要划一条自己的边界:坊间流传的「头部分数虚高 5 到 15 分」这个说法,本文写作时在该页原文上没有核到,所以本文不使用那个数字。 上面这两句引文是页面上写着的,就用这两句。
这项研究常被拿去讨论「选型该不该信榜单」,那是采购侧的话题(同系列另有一篇专门讲)。对交付方来说,它说明的是另一件事:一个漂亮的分数,和「每一次都能把事做成」之间,可以完全没有关系。
分数测的是能力的上界——它最好能到哪里。你的演示也是上界。
所以下面四个指标,量的全是下界:最差的那些次有多差、隔多久出现一次、出现的时候有没有人接住。
在给指标之前,先给一条统一的定线原则,它比四个指标本身更重要:
四条及格线都不要去抄行业基准。先量出你自己的第一条基线,及格线就等于这条基线。
稳定性的目标是「别掉下去」,不是「比别人高」。一条从外面抄来的及格线,要么你一开始就达不到(于是很快放弃),要么你一开始就远远超过(于是它永远不会报警)。两种都没用。
二、四个可量化的交付稳定性指标
指标一:一次通过率。
- →怎么量。 分母 = 这一期所有交付批次;分子 = 客户没有提出任何需要改动的批次。按批次计,不按条计——一个批次里错三条和错一条,对客户来说是同一件事:这批不能直接用。
- →量多久。 连续 4 周,并且至少 30 个批次。不足 30 个,就把窗口往后拉到攒够为止,不要用 12 个批次得出的数去做决定。
- →及格线怎么定。 先量两周,得到一个数 X。及格线就是 X,往后 4 周不低于 X。
- →一个陷阱。 客户懒得提意见,不等于通过。要在验收环节写一句「没问题请回复确认」,没有收到确认的批次不计入分子。不加这一条,这个指标会一路虚高,直到某天客户不声不响换了人。
指标二:同题复跑一致率。
- →怎么量。 固定 20 条真实样本输入,每周同一天连跑 3 遍。一致的定义是:三遍在你的合格 / 不合格判定上结论相同,并且关键字段相同(金额、日期、数量、对方名称这类)。语气不同不算不一致,金额差一位算。
- →量多久。 每周 1 次,先连续 8 周,之后长期保留。为什么是 8 周:供应商侧的变化不会通知你——版本、路由、限流策略都可能在你不知情的时候改,8 周大致能覆盖到一次这样的变化。
- →及格线怎么定。 20 条里允许不一致的上限是 1 条。出现 2 条,把不一致的那一类输入从自动通路里摘出来转人工,不要先去调提示词碰运气——调提示词的问题是你无法证明它改好了,除非再跑满 8 周。
- →一个陷阱。 样本要从真实历史里抽,并且要按真实比例留下难缠的那些。全抽典型样本,三遍一定一致,这个指标就永远是满分。
这个指标是四个里唯一只在 AI 交付上成立的,所以要多说两句。
传统交付里,同一份输入跑两遍必然一样:脚本一样、模板一样、人照着同一份操作说明做。所以没人量一致率,也不需要量。
模型不是这样。同一份输入、同一份提示词、同一天,可以给出两个都「看起来对」的结果,而其中一个把金额抄错了一位。更麻烦的是它的不一致不是缓慢漂移——不是像人那样越来越累、质量慢慢滑下去——而是同一分钟内的两个答案。你没法靠「感觉它变差了」来发现,因为它从来没有变差,它一直是这样。
这就是为什么指标一不够用:一次通过率量的是「这一次对不对」,同题复跑一致率量的是「它下一次还对不对」。客户买的是后者。
指标三:漏兜率。
- →定义。 本该转人工却没转的条数 ÷ 这一期的总条数。它的镜像是兜底触发率(该转的真的转了)。触发率高不是坏事,漏兜率不为零才是。
- →怎么量。 上线后前 4 周人工 100% 抽检,第 5 周起每周抽 10%。抽到的每一条都问一句:这一条它本来是不是就不该自己答。
- →量多久。 长期,不停。
- →及格线怎么定。 红线是 0 条/周。 出现 1 条,当周就改规则,不要攒够三条再一起改。理由很直接:漏兜的每一条都已经发出去了,改规则救不回已经发出去的那条,只能决定还会不会有下一条。
- →一个陷阱。 漏兜率是四个指标里唯一不会自己报警的。一次通过率会被客户的意见暴露,一致率会被复跑暴露,时延会被时钟暴露;漏兜只有人去看才看得见。 所以抽检比例可以往下降,但不能降到 0。
指标四:交付时延的 P90,不看平均值。
- →怎么量。 从「客户提交」到「交付物送达」的时长,取第 90 百分位。算法:把这一期 N 次的时长从小到大排,取第 ceil(0.9 × N) 个。举例:30 单,ceil(0.9 × 30) = 27,排在第 27 位的那一单的时长就是 P90。这个算式是本文自行给出的口径,读者可以按同样的方法复算。
- →量多久。 滚动 30 天。
- →及格线怎么定。 P90 ≤ 你对外承诺的时长。
- →一个陷阱,也是四个里最贵的一条。 按平均值定承诺,等于承诺相当一部分单子会超时。 平均值天生就有一批单落在它上方,而落在上方的那些,恰恰是最容易吵架的那些。承诺要按 P90 定,不按平均定。另外,P90 和平均值不是同一个东西,不能互相换算,也不能拿别人的平均值跟你的 P90 比大小。
四个放在一起:
| 指标 | 怎么量 | 量多久 | 及格线 |
|---|---|---|---|
| 一次通过率 | 无需改动的批次 ÷ 总批次,按批次计 | 连续 4 周且不少于 30 个批次 | 先量两周得到基线 X,此后不低于 X |
| 同题复跑一致率 | 20 条固定样本每周连跑 3 遍,判定与关键字段是否相同 | 每周 1 次,先连续 8 周 | 20 条里不一致不超过 1 条 |
| 漏兜率 | 本该转人工却没转的条数 ÷ 总条数 | 前 4 周 100% 抽检,之后每周抽 10%,长期 | 0 条/周 |
| 交付时延 P90 | 时长排序取第 ceil(0.9 × N) 位 | 滚动 30 天 | 不超过对外承诺时长 |
表里除了两条引文之外的所有数字(30 个批次、20 条样本、8 周、1 条、10%、0 条、90 百分位),都是本文给出的建议值,不是任何调研结论。
三、兜底设计:四条,各配一个指标
指标只负责告诉你出了问题。兜底负责让出问题的那次不至于变成事故。四条,一一对应。
第 1 条(配一次通过率):内部截止 = 对外承诺 − 20%,省下的那段时间就是返工预算。
没有这段预算,一次通过率的每一次下降都会直接变成一次逾期——因为你根本没有留出重做一遍的时间。20% 是建议值,关键是这段时间要事先扣掉,而不是「万一有问题再说」。
第 2 条(配同题复跑一致率):那 20 条验收集每周自动跑一次,不一致超阈值时你先知道,客户后知道。
这一条的全部价值就在「谁先知道」这五个字上。同样一个问题,你先发现是一次主动说明,客户先发现是一次事故。
第 3 条(配漏兜率):每一条自动通路都要配一条「慢但一定对」的人工通路,并且事先测过它一天能顶多少单。
没测过产能上限的降级路径等于没有。 真出事那天你会发现人工通路一天只能处理 8 单,而积压的是 40 单——这时候「有兜底」这件事在账上是零。
第 4 条(配 P90):在跑的任务数超过人工通路的日产能时,停止接新单,或者明确告知新交期。
这一条最难执行,因为它要求你在生意好的时候主动关一次门。但四个指标里最先崩的永远是 P90,而 P90 一崩,另外三个会在两周内跟着崩——赶工的时候,人会先放弃抽检。
还有一条统管四个的:四个指标每周固定同一天量一次,条件不变才有可比性。 换了模型、换了提示词版本、换了客户结构的那一周,要单独标出来,不要混进趋势线里。混进去之后,你会花两周去解释一个其实是自己造成的波动。
四、代价,和什么时候不该做这套
时间成本。 建第一条基线 4~6 小时,主要花在攒那 20 条样本和把「什么算通过」定义清楚上;之后每周 40~60 分钟。这是本文的估算值。
不适用的第一种情况:单量太少。
每周交付批次不足 5 个的时候,这四个指标在统计上量不出东西——一次通过率会在 0 和 1 之间来回跳,看着像剧烈波动,其实只是样本太少。这个阶段正确的做法是逐单复盘:每一单出的问题记一条,攒够 30 单再开始做指标。
不适用的第二种情况:单笔毛利低于人工处理一单的成本。
这时候正确的动作不是「先做自动化,再加兜底」,而是根本不做这个自动化——它的兜底成本比它省下来的还高。这句话得说在前面:不是所有能自动化的事情都值得自动化。
第三条代价,也是必须先接受的:这套东西会让你的对外承诺变保守很多。
按 P90 定承诺、内部截止再扣 20%,两条加起来,你报出去的交期会比原来长。这是真实的竞争力损失——你会在一些比价的单子上,输给报得更短的那家。
要接受它的理由只有一条:报得更短的那家,赢下来之后得在交付里还回去,而你不用还。这个差别在第一单上看不出来,在第三单上才开始显形。
第四条,说得再直白一点:这四个指标不会让模型变好。
它们只做一件事——让你比客户更早知道它什么时候不好。这是整套东西的全部作用,也是它值得做的全部理由。
最后回到开头那份指数里的第三个数:据埃森哲同一份《2026 中国企业数字化转型指数》,「只有 18% 的企业着手进行运营和业务的系统性重构」。
对交付方来说,这个 18% 不是坏消息,是一个交付条件:你交出去的东西,大概率要在客户一段没改过的流程里跑。 而在一段没改过的流程里,最先暴露出来的从来不是能力不够,是同一件事这次这样、下次那样。
这就是为什么客户不为「有时很惊艳」买单,只为「每次都不出错」买单。
同系列里另有一篇讲怎么用你自己的 50 条真实样本代替榜单做选型的,那篇管选型,这篇管选完之后。
本文事实来源
可自行复核- 1
埃森哲《2026 中国企业数字化转型指数》(2026 年 7 月 17 日发布,样本为八个行业的 160 家中国企业):「跨过先进 AI 应用试点阶段的受访中国企业占比从去年的 46% 跃升至 88%」;「实现生产效率、收入和利润提升等显著成果的企业仅从去年的 9% 升至 14%」;「只有 18% 的企业着手进行运营和业务的系统性重构」。
样本量 160 家,非全行业普查;正文未对 88% 与 14% 做减法,原文没有说后者是前者的子集。
- 2
UC Berkeley RDI(2026 年 4 月):研究者构建了一个自动扫描代理审计八个最主流的 AI Agent 基准,原文「We built an automated scanning agent that systematically audited eight among the most prominent AI agent benchmarks … and discovered that every single one can be exploited to achieve near-perfect scores without solving a single task.」,近满分的具体区间为 73% 到 100%。
本文写作时逐句核对该页,未核到坊间流传的「头部分数虚高 5 到 15 分」,故正文未使用该数字,并在正文中明确写出这一点。
