莱客AI商学院/文章/让 AI 上岗的第一周:全量人工抽检,第二周才降到三成
深度文章免费

让 AI 上岗的第一周:全量人工抽检,第二周才降到三成

一天 120 条对话,第一周每天看 80 分钟,第二周 24 分钟——两周加起来不许超过一个人两个工作日,超了就该缩范围而不是加人

AI 效率专家 · 商业研究院2026-07-17预计 8 分钟
让 AI 上岗的第一周:全量人工抽检,第二周才降到三成 封面

文章目录

共 4 节
01一、第一周为什么必须是全量:分母太小的时候,比例是骗人的02二、第二周降到三成,但降档的条件不是日历03三、两周排班表,和一张六列的抽检记录04四、代价,以及什么时候不该这么做

上线第一天,办公室里有六个人围着那块屏幕看它答了什么。第三天剩两个人。第八天,没有人再打开那个后台。

这不是懈怠。它是一个可以预料的曲线:新鲜感的半衰期大约就是三天,而这套东西真正开始出错、并且错得有规律的时间,通常在第二周。两条曲线交叉的那个位置,就是绝大多数上线项目被放弃的位置——不是因为它不能用,是因为再没有人说得清它做对了多少。

所以处方要在新鲜感耗尽之前就写死,写成排班,不写成态度。

先把话说清楚:下面这套「第一周全量、第二周三成」是本文给出的执行强度建议,不是任何统计结论,也没有哪份研究说过三成是最优值。 它的作用是给你一条可以照着排班的线,你可以按自己的对话量调,但我不建议第一周低于全量。理由在第一节。

一、第一周为什么必须是全量:分母太小的时候,比例是骗人的

先看一道除法,你可以自己复算。

假设你的对话量是一天 120 条,你按 10% 抽检,也就是每天抽 12 条。再假设它真实的出错率是 5%——也就是每 20 条会错一次。那么这 12 条里一条都没抽到错的概率是多少?

0.95 的 12 次方,约等于 0.54

这道乘方是我自己算的,口径必须说清楚:它假设每条对话出错是彼此独立的、且错误在一天里均匀分布。真实情况两条都不满足——出错往往扎堆在某一类问题上,也扎堆在某个时段。所以这个 0.54 不是一个精确的概率,它只用来说明一个量级:在 10% 的抽检强度下,一个每二十条犯一次的问题,有一半以上的可能在第一天完全不出现。

不出现的后果不是漏掉一条错误,是漏掉一个类别。你第二天会带着"昨天没问题"这个结论去做第二天的判断,而这个结论本身是假的。

这就是第一周必须全量的第一个理由:第一周你要采集的不是错误率,是错误的种类。种类这个东西,抽样抽不出来。

第二个理由是错法会变。第一周的错法集中在"它不知道自己不该答"——超出范围的问题它也接了,语气还挺笃定。第二周的错法开始变成"它答得对,但对的是上一个版本的规则"。这两类错误需要的处理动作完全不同,前者改的是范围,后者改的是资料。如果你在第一周就只看三成,你会把这两类混在一起,然后得出一个"总体还行"的结论。

第三个理由更实际一点:这套东西上线之后,你迟早要向别人证明你注意过它。据中央广播电视总台 2026 年 1 月 14 日的报道,杭州互联网法院审结了全国首例 AI「幻觉」侵权案,驳回了索赔请求,判决已经生效,裁判确立的是过错责任原则,并提出了分层的注意义务。

关于这起案子,本文只用这一条原则,不再往下拆——那几层注意义务的具体表述,可核对到的公开报道里没有展开,本文不推测,同系列另有一篇专门讲它对客服岗意味着什么。这里只取它对排班的那一点含义:过错责任的意思是,你事前做过的动作有机会算数。而"做过"这件事在事后只由一样东西证明——有没有留下一张带日期的记录。

一张每天记满的抽检表,就是这张记录。它的第一用途是让你看清它在错什么,第二用途才是给别人看。两个用途都要求它在第一周是满的。

二、第二周降到三成,但降档的条件不是日历

多数人会把这句话读成"第八天开始只看三成"。这是读错的,而且是最贵的一种读错。

降档的触发条件不是时间,是三个数同时达标。 第七天晚上你手里应该有一张七天的表,看三件事:

第一,这七天里新出现的错误类别,最后两天是不是零。 注意是"新类别",不是"新错误"。同一类错误第五次出现不影响降档,一个从没见过的错法在第七天冒出来,就说明种类还没采全,第二周继续全量。

第二,转人工的比例是不是稳住了。 稳住的意思不是低,是不再大幅波动。一天 8%、第二天 22%、第三天 6%,这不叫稳,这叫它的判断边界还在飘。飘的时候降档,等于在你最看不清的时候把灯关小。

第三,被人工改过的回答,有多少是同一个原因。 如果七天里改过的二十条里有十六条是同一个原因,那这个原因还没修掉,修掉之前不许降档;如果二十条分散在十几个原因上,说明剩下的是长尾,可以降。

三条都过,第八天降到三成。有一条不过,把第一周原样再跑一周——这是本文唯一允许的一次"重来",重来的成本远低于你在看不清的状态下往前走两个月。

接下来给上限,因为不给上限的排班表最后都会变成"有空就看看"。

还是那个例子:一天 120 条对话。按每条对话人工看完并做一次判定平均 40 秒算——这个 40 秒是本文设的口径,你可以按自己的对话长度换成 20 秒或者 90 秒——第一周每天要看 120 条,是 4800 秒,80 分钟;第二周每天看 36 条,是 1440 秒,24 分钟。两周各按五个工作日算,合计 520 分钟,约等于 8 小时 40 分,一个人一个工作日多一点。

于是上限就有了:两周抽检的总投入不许超过一个人两个工作日。

超了怎么办?不是加人,是缩范围。超过这个数只说明一件事——你第一版开放的业务范围太宽了。范围一宽,全量抽检就变成一件必须靠加班完成的事,而靠加班完成的事撑不过第一周。把开放范围砍掉一半,抽检强度维持不变,永远好过范围不动、把抽检降到你看得完为止。

三、两周排班表,和一张六列的抽检记录

下面是可以直接抄走的部分。先排班,五条。

第 1 步。定两个人,一个业务侧、一个交叉侧,且都不许是搭这套东西的人。 业务侧那个人负责判"这么答对不对",交叉侧那个人只负责判"这个问题该不该由它来答"。这两件事分开判,是因为它们经常给出相反的结论——答得很好,但本来就不该它答,这种情况在第一周占的比例比多数人预想的高。至于为什么不许让搭系统的人自己抽检:他会不自觉地把自己已经知道的上下文补进去,看到的是他理解的那句话,不是客户读到的那句话。

第 2 步。每天两个固定时段,不许攒。 我的建议是午后和下班前各一次,每次不超过 45 分钟。攒到周末一次看完,是这套排班最常见的死法——攒起来看的时候,你只会打勾,不会记录,因为你已经看到第三十条了。

第 3 步。第一周全量,第二周三成,三成怎么抽要写死。 不许"随手挑几条"。写死的抽法给两种,选一种:按时间等距抽(每第三条抽一条),或者按类别配额抽(每一类问题至少两条)。第一周的表已经告诉你有哪些类别了,所以第二周我更建议后者——等距抽会漏掉低频但危险的那一类。

第 4 步。两周里三件事不许做:不许扩业务范围、不许改那份「它不许答的」清单、不许关日志。 想改的全部记在表的最后一列,攒到第 15 天一起改。中途改一次,前面的记录就不能和后面的放在一起看了。

第 5 步。第 15 天开一次会,只做两件事:一是把两周里出现过的错误类别排个序,二是决定要不要扩范围。 不做第三件事。特别是不要在这场会上讨论"要不要换一个更好的"——两周的数据说不清这件事,谈了也是拍脑袋。

再给记录模板。六列,一张纸,或者一个表格文件,不要为它上系统。

写什么约束
1 日期与时段绝对日期,上午/下午不许空
2 对话编号能回溯到原文的那个号只写编号,不摘抄内容
3 判定对 / 可接受但不该由它答 / 错只有这三档,不设"基本正确"
4 错误类别超范围 / 事实错 / 承诺错 / 语气不当四选一,选不出来就新增一类并记下来
5 处理动作已改资料 / 已加禁答项 / 已转人工 / 暂不处理「暂不处理」也要写,它是长尾的证据
6 是否需要回头通知客户是 / 否填「是」的必须当天做完

第 3 列为什么不设"基本正确"这一档:因为九成的记录会落在那一档,落进去之后这张表就作废了。判定档位一多,记录的人就有了逃避判断的地方;只有三档的时候,他必须做决定。 这是这张表唯一的设计要点。

第 5 列的「暂不处理」是我特别要求写进去的。第一周一定会有一批错误,你当时判断它不值得改。到第 15 天那场会上,把所有「暂不处理」拉出来看一眼——如果同一个原因在这一列里出现了五次以上,那它就不是长尾,是你判断错了。

第 6 列每天填「是」的条数,是这两周最值得盯的一个数。它比准确率有用得多:准确率说的是它做得怎么样,回头通知的条数说的是这件事已经落到客户那里去了多少。 后者是唯一一个会真正花掉你信任额度的数。

四、代价,以及什么时候不该这么做

先说三笔代价,都得在开工之前认下来。

第一笔:上线的头两周,这件事不但不省人,还多用人。 一个人两个工作日的抽检,加上两个人每天各 45 分钟的时段占用,都发生在你还没拿到任何节省的时候。当初说服老板上线的那个"能省几个人"的数字,在这两周里是负的。这一点必须提前跟老板说,而不是等他第十天来问。 说在前面,它叫计划;说在后面,它叫解释。

第二笔:抽检的人必须是懂业务的那个,而懂业务的那个通常是最忙的。 这套排班占的不是闲人的时间,占的是最贵的那份时间。所以上限那一条不是省事,是保命——超过两个工作日,这个人就会开始糊弄,而他一糊弄,这张表就从证据变成了摆设。

第三笔:全量抽检会看到很多让你不舒服的东西。 它会答出一些你从没想过它会答的话。第一周的表通常很难看,难看到有人会提议"先关掉再说"。我的建议是不要关——第一周的难看是采集来的,不是发生的;你只是第一次看见了本来就一直在发生的事。

再说三种不适用。

第一种:你的对话量小到一天不足二十条。 那就全部看完,不需要这套排班,也不需要那张表。为二十条对话设计两个岗位和一张六列表,管理成本比事情本身还大。这套东西的起点大约在每天上百条这个量级。

第二种:它不直接面对客户。 内部用的那些——整理资料、出初稿、跑一段内部流程——抽检的重点不在"说错话",在"用错了资料"和"越权做了本该有人确认的事"。三部门于 2026 年 5 月 8 日印发的《智能体规范应用与创新发展实施意见》要求制定「开发、部署、应用、维护全周期安全管理」规范,并点名要防范「隐私泄露、越权操作、行为失控」三类风险。内部用途的抽检,看的就是中间那一类,排班可以宽松,但那条"没命中任何规则时它做了什么"必须专门测。

第三种:这套东西已经跑了三个月。 那这篇给不了你什么。上线两周用的是"采集种类"的打法,三个月之后要换成另一套:固定一批回归用例,每次改动之后重跑一遍,加上按月随机复检。两者的目的不同——前者在找你还不知道的东西,后者在守你已经知道的东西。

最后放两条外部的旁证,它们不改变上面任何一步,但能解释这套排班为什么值得。

据 Gartner 2025 年 6 月 25 日的预测,超过 40% 的 agentic AI 项目会在 2027 年底之前被取消。这条只是预测,不是已发生的统计;我把它放在这里,是因为它和第一段那条新鲜感曲线指向同一件事——项目被取消的时候,多数人给不出"它到底做对了多少"的答案,而给不出答案的东西,在预算会上永远是第一个被砍的。

另一条更硬。据 UC Berkeley RDI 于 2026 年 4 月发布的研究,一套自动扫描代理用 reward hacking 的方式攻破了全部八大 Agent 基准——原文写的是「every single one can be exploited to achieve near-perfect scores without solving a single task」,一道任务都不解也能拿到 73% 到 100% 的近满分。这条的用处只有一句话:供应商给你的那个准确率,不能当作你的基线。 你的基线只能来自你自己那张两周的表——上面那些对话是你的客户问的,那才是你要交付的题目。

顺带一个可以核对的背景:据国家互联网信息办公室 2026 年 7 月 10 日的公告,截至 2026 年 6 月 30 日,全国累计已有 988 款生成式 AI 服务完成备案。备案是入场资格,不是质量证明——它证明的是这个服务可以被提供,不是它在你的业务里答得对。这两件事经常被供应商放在同一页 PPT 上讲。

这套抽检排班与那张六列记录表的完整版本,在《数字员工搭建实战》第 5 课。

本文事实来源

可自行复核
  1. 1

    杭州互联网法院审结全国首例 AI「幻觉」侵权案,驳回索赔请求,判决已生效;裁判确立过错责任原则并提出分层的注意义务。该分层注意义务的具体表述在可核对的公开报道中未展开,本文不引用、不推测其内容

    央视新闻2026-01-14

  2. 2

    三部门印发《智能体规范应用与创新发展实施意见》:要求制定「开发、部署、应用、维护全周期安全管理」规范,防范「隐私泄露、越权操作、行为失控」等风险。该文件无公开文号,全文无量化目标

    国家网信办2026-05-08

  3. 3

    Gartner 预测:超过 40% 的 agentic AI 项目将在 2027 年底前被取消。属预测,非已发生的统计

    Gartner2025-06-25

  4. 4

    UC Berkeley RDI:自动扫描代理以 reward hacking 攻破全部八大 Agent 基准,原文「every single one can be exploited to achieve near-perfect scores without solving a single task」,具体分数 73%~100%(Terminal-Bench 100% / SWE-bench Verified 100% / WebArena 约 100% / FieldWorkArena 100% / GAIA 约 98% / OSWorld 73%)。

    伯克利 RDI2026-04

    坊间流传的「头部分数虚高 5~15 分」经该页原始 HTML 逐字复核零命中,无一手出处,本文不使用

  5. 5

    截至 2026 年 6 月 30 日,全国累计 988 款生成式 AI 服务完成备案

    国家网信办2026-07-10