接了单不敢交付:AI 服务的质量兜底怎么设计
兜底不是多检查几遍,是提前把「什么情况必须停下来喊人」写成一条谁都能判定的线——连行业通行的那套分数都已经被证明可以刷

文章目录
共 5 节一个单子做完了,定金也收了,可就是不敢发那条"已完成"。
理由通常说不清楚。你自己试了几十遍,都对;你拿给朋友试,也对。但你心里知道一件事:你验的是"它这几十遍都对",客户要的是"它以后每一遍都对",这两件事之间没有桥。
绝大多数人在这个位置的反应是再多检查几遍。多检查几遍不解决问题,因为它增加的是你的样本数,而客户面对的是无限多的真实输入。兜底不是把错误率压低,是提前定义好"什么情况必须停下来喊人",并且把这条线写进交付文件里,让客户在签字之前就同意它。
一、不敢交,是因为你和客户验收的不是同一件事
先把这个落差说清楚,因为后面所有的动作都从这里长出来。
你的验收标准是通过率:一百条里对了九十七条。客户的验收标准是事故:那三条里有没有一条是当着他客户的面说错的。这两个标准在数学上不冲突,在生意上是两回事——九十七条对的不会有人提,那三条会全部变成微信消息发到你手机上。
所以第一件要放弃的幻想是:用一个更高的分数去换客户的安心。 这条路已经被堵死了,而且有出处。
据加州大学伯克利分校 RDI 实验室 2026 年 4 月公布的研究,研究者用一套自动扫描的方法,把当时八大主流 Agent 基准全部攻破——不是靠把任务做对,而是靠 reward hacking,也就是找到评分机制本身的漏洞。原文写的是「every single one can be exploited to achieve near-perfect scores without solving a single task」,一道任务都不解也能拿到近满分,具体落在 73% 到 100% 这个区间(Terminal-Bench 100%、SWE-bench Verified 100%、WebArena 约 100%、FieldWorkArena 100%、GAIA 约 98%、OSWorld 73%)。
这条结论对接单的人意味着什么,很具体:行业通行的那套分数,不能拿来当你对客户的质量承诺。 你说"它在某某评测上排第几",客户信了;出事之后这句话不能保护你,因为它本来就证明不了它在客户的活上表现如何。
那用什么?用客户自己的样本。这是本文第三节那张表的全部来由。
还有一层落差要一并说掉:你交付的东西是会自己变的。 据月之暗面官方模型文档,Kimi K2 本体已于 2026 年 5 月 25 日下线。一个被写进交付物、被客户每天用着的名字,可以在某一天不再存在。传统外包交付的软件不会有这个性质——它跑得好好的,不会因为供应商那边的一次公告而停。这是 AI 服务交付独有的一种失效,也是所有兜底条款里最容易被漏掉的一条。
二、兜底的三个部件
兜底不是一个动作,是三个部件。三个缺一个,另外两个都会失效。
部件一:一条接管阈值。 它必须满足一个苛刻的条件——不需要专业判断就能判定。"回答质量不佳时转人工"不是阈值,因为质量不佳由谁认定说不清。"涉及金额时转人工"是阈值,因为一句话里有没有金额,是个是非题。阈值的写法在第三节。
部件二:一句提前说好的告知。 这一件很多人当成礼貌问题,它其实是硬要求,而且已经有罚则。
据市场监管总局令第 117 号《直播电商监督管理办法》(2026 年 1 月 7 日发布,2026 年 2 月 1 日施行)第三十七条,使用人工智能人物图像开展直播的,应当予以标识并持续提示;违法情形的责任由直播间运营者承担,罚则为 1 万元至 10 万元。这一条对做交付的人有两个含义:其一,告知不是可选项;其二,承担责任的是那个用它的商家,不是做出来的你——但你如果没告诉客户这件事,客户被罚之后第一个找的还是你。
另有一条要提前判一次。据国家互联网信息办公室 2026 年 4 月 10 日发布的《人工智能拟人化互动服务管理暂行办法》,该办法将于 2026 年 7 月 15 日施行,适用对象是提供"持续性情感互动"的服务;原文同时明确写了不适用的情形——智能客服、知识问答、工作助手、学习教育、科学研究等不涉及持续性情感互动的服务不适用。你交付的东西落在哪一边,要在接单的时候判,不是在施行日之后判。判完把结论写进交付文件的第一页。
部件三:一条写进合同的赔付边界。 这一条是三个里最难谈、也最保命的。它要写清三件事:什么算事故、单次事故的赔付上限、以及超过多少次事故客户可以终止。
为什么必须写:据中央电视台 2026 年 1 月 14 日的报道,杭州互联网法院审结了全国首例涉 AI"幻觉"侵权案,判决生效,确立的是过错责任加三层注意义务。这起案子的裁判规则另有一篇专门拆过,本篇只取一个结论:责任的分配看的是各方尽没尽到注意义务,而"尽到了什么"这件事,事后靠回忆是说不清的,只能靠交付时留下的文件。你那份写着阈值和告知的交付文件,就是你的注意义务留痕。
三个部件的关系是这样的:阈值决定它什么时候停,告知决定停下来之后终端用户知道发生了什么,赔付边界决定万一没停住时钱怎么算。只做第一件的人最多,而只做第一件等于没做——因为它停了,没人知道该谁接手。
三、四类必须停下来的情况,和一张 14 天联合验收表
先给四类阈值。它们是本文给出的最小集,四条都是是非题,不需要专业判断:
第 1 类,涉及金额。 报价、折扣、退款、赔付,任何一句话里出现了钱的数额,停下来转人工。这一类的代价最直观,一个数字错了就是真金白银。
第 2 类,涉及承诺。 交期、效果、"一定""保证""包"这类词一旦出现,停。承诺造成的损失不是当场发生的,是几周之后发生的,所以更贵。
第 3 类,涉及个人信息或凭证。 对方开始报手机号、身份证号、订单号、地址,停。这一类停的不是错误,是风险。
第 4 类,它自己说不确定。 输出里出现"可能""建议您联系""我不太确定"这类表述,直接转人工。这一类是四类里最容易实现、也最被忽略的——它不需要你判断内容对不对,只需要判断它有没有露怯。
四类之外的一切,都不该由你来兜底,而应该在合同里明确划到"正常波动"里去。兜底范围写得越宽,这单越亏。
接下来是验收。下面这张表用来替代"我再多测几遍"这个动作,一共五步,14 天。
第 1 步(第 0 天)。向客户要 50 条真实历史输入。 不是他编的,是他业务里真实发生过的——过去的咨询记录、过去的工单、过去的邮件。这一步做不到就别往下走:拿不到真实样本,说明客户方没有人真的在管这件事,后面四步都会空转。
第 2 步(第 0 天)。这 50 条里,让客户自己标出他认为"绝对不能出错"的那 10 条。 标注这个动作必须由客户做,不能由你替他做。这 10 条就是这单的验收线,其余 40 条是参考。
第 3 步(第 1 到 7 天)。全量人工过一遍。 这七天里每一条输出你都看,不抽样。看的时候只记两样:命中了四类阈值中的哪一类、以及有没有该停没停。
第 4 步(第 8 到 14 天)。降到三成抽检,并且开始记转人工率。 转人工率是这单毛利的直接因子——它是你后面所有报价的依据。
第 5 步(第 14 天)。和客户一起过那 10 条。 全对,交付;有一条不对,不要改提示词就重来,先问一句:这一条属于四类阈值里的哪一类? 如果不属于任何一类,说明阈值集少了一条,补上再跑七天。如果属于,说明是阈值没生效,那是实现问题不是设计问题。
这五步之所以能替代"多测几遍",是因为它把"对不对"这个说不清的问题,换成了两个说得清的问题:该停的有没有停、客户圈的那 10 条有没有过。
关于上线之前该写哪两张清单(它必须会的、它不许答的),另有一篇专门写过,那一篇是本篇的上游动作;本篇讲的是清单写完之后,怎么把它变成对客户的承诺。
四、把转人工率算进报价,否则兜底就是白做
兜底会吃毛利,这件事必须在报价的时候就算进去,不能等交付完了再心疼。
算法只有一句话:转人工率乘以你每次接管要花的分钟数,就是这单的隐藏工时。 第三节第 4 步记下来的那个转人工率,就是分子。
这里有一个公开锚点可以帮你把预期放正。据 MIT NANDA 发布的《The GenAI Divide》报告原文,其给出的漏斗是 60% 的组织在评估、20% 进入试点、5% 进入生产——进入试点的项目里大约四分之一走到了生产。该报告封面自标"Preliminary Findings",样本为 52 场访谈加 153 份行业会议现场问卷,报告自陈"六个月观察期可能不足,可能低估了成功率",这些限制要一起看。它不能当你的返工率用,但它说明的那件事对报价很实在:从跑通到真的在用,中间的损耗不小,而这段损耗默认落在乙方身上。
另一个方向的锚点在需求侧。据澎湃 2026 年 5 月 19 日发布的报道,长江商学院对全国 2016 家规模以上工业企业的实测显示,尚未采用 AI 的企业里,79.2% 的核心阻碍是"场景不适用"。这个数字翻译成接单的语言是:你的客户很可能自己也说不清这件事该做到什么程度。说不清的时候,验收标准就会在交付之后被临时发明出来——而第三节那 10 条,就是用来在交付之前把它钉死的。
所以报价的顺序是:先跑第三节的五步,拿到转人工率,再报第二期的价;第一期的价永远是试的价,不是这门生意的真实价。 我的建议是第一单直接告诉客户这是试的价,比事后涨价体面得多,也容易得多。
五、什么时候不该这么做
第一种:客户方没有一个能接管的人。 四类阈值全都指向同一个动作——转人工。转给谁?客户那边没有这个人的时候,阈值触发之后消息就悬在半空,而终端用户会认为是你没做好。这种单子要么加钱把接管也承包下来,要么不接。 承包接管意味着你的一个人要长期在线,这笔成本是月度的,不是一次性的。
第二种:客户要的是"全自动",并且不接受任何转人工。 这个要求本身和上面三个部件是矛盾的。遇到这种需求,正确的动作是把第一节那条落差摊开讲一遍,讲完他还坚持,就不该接——因为出事的时候,那三条错的会全部算在你头上,而你手上没有任何免责的留痕。
第三种:单子太小。 五步验收要占掉你 14 天里的一部分注意力,向客户要 50 条真实样本还要占掉客户那边的人一个下午。一个几千元的单子撑不起这套流程,硬上的结果是你把利润全花在了验收上。小单的正确做法是把交付范围缩到"不涉及金额、不涉及承诺、不涉及个人信息"的那一部分——四类阈值里的前三类都不触发,兜底成本自然就低了。
最后一条代价:这套设计会让你的交付看起来"没那么智能"。 客户会问,怎么老是转人工。这个问题要正面答:转人工的次数是可见的,不转人工造成的事故是不可见的,而后者才是要赔钱的那一种。能被看见的成本,永远比看不见的损失便宜。
这套完整的兜底规则模板与话术,在《数字员工搭建实战》第 5 课。
本文事实来源
可自行复核- 1
加州大学伯克利分校 RDI:自动扫描代理用 reward hacking 攻破全部八大 Agent 基准,原文「every single one can be exploited to achieve near-perfect scores without solving a single task」,具体分数 73%~100%(Terminal-Bench 100% / SWE-bench Verified 100% / WebArena 约 100% / FieldWorkArena 100% / GAIA 约 98% / OSWorld 73%)。
坊间流传的「头部分数虚高 5~15 分」经该页原始 HTML 逐字复核零命中,无一手出处,本文不使用
- 2
Kimi K2 本体已于 2026 年 5 月 25 日下线(官方模型文档)
- 3
《直播电商监督管理办法》(市场监管总局令第 117 号)第三十七条:AI 人物图像直播须标识并持续提示;违法情形由直播间运营者承担责任;罚则 1 万~10 万元
- 4
《人工智能拟人化互动服务管理暂行办法》:适用于「持续性情感互动」服务;智能客服、知识问答、工作助手、学习教育、科学研究不涉及持续性情感互动的不适用
- 5
杭州互联网法院审结全国首例涉 AI「幻觉」侵权案,判决生效,确立过错责任 + 三层注意义务
- 6
MIT NANDA《The GenAI Divide》原文漏斗:60% 评估 → 20% 试点 → 5% 生产;封面自标 Preliminary Findings;样本 52 场访谈 + 153 份现场问卷;报告自陈「六个月观察期可能不足,可能低估了成功率」
- 7
长江商学院对全国 2016 家规模以上工业企业实测:未采用企业 79.2% 的核心阻碍是「场景不适用」
