数字员工上线前必须写的两张清单
一张「它必须会的」,一张「它不许答的」——后者更重要;三部门 2026 年 5 月 8 日印发的实施意见,把「全周期」四个环节写进了要求

文章目录
共 4 节数字员工上线那天,多数公司手里只有一张纸,写的是"它能干什么"。
这张纸通常是供应商给的,或者是照着功能演示抄下来的。它列的是能力:能查订单、能答保修、能记录留言。看起来很像一张清单,但它不是。真正要写的是两张,而且第二张比第一张重要。
先把外部依据摆出来,免得后面被当成一句经验之谈。据国家网信办、国家发展改革委、工业和信息化部三部门于 2026 年 5 月 8 日联合印发的《智能体规范应用与创新发展实施意见》,其中「将智能体安全、可靠、可信作为发展的底线」,并要求制定「开发、部署、应用、维护全周期安全管理」规范,构建「分类分级治理框架」,敏感领域实行备案、检测等管理,防范「隐私泄露、越权操作、行为失控」等风险。
请注意「全周期」后面那四个词:开发、部署、应用、维护。这四个环节里,多数公司只在第二个环节动过手——把它接上、开出来。而两张清单要覆盖的,是这四个环节的每一个。
再补两句边界,放在这里而不是文末,因为它是使用说明:这份文件没有公开文号,本文只写"三部门联合印发";它全文没有任何量化目标,所以本文接下来给出的所有条数、比例、周期,全部是本文给出的执行建议值,不是这份文件的规定,也不是任何研究的结论。
至于"说错话要不要赔"这个问题,据中央广播电视总台 2026 年 1 月 14 日的报道,杭州互联网法院已审结全国首例 AI「幻觉」侵权案,判决生效,确立的是过错责任原则——这一句在本文只作背景,展开的分析在同系列另一篇里。这一篇只讲一件事:两张清单具体怎么写。
一、只有一张纸的公司,写错的往往是那一张
先说为什么那张"它能干什么"的纸不够用,以及它通常错在哪。
第一个错法:写成了功能列表,不是场景列表。
"能查订单"是功能。"客户报出手机号后四位、要求确认发货没有"才是场景。功能是供应商的语言,场景是你客户的语言。用功能写出来的清单,验收的时候只能验"这个按钮点得动",验不出"客户那句话它接不接得住"。
第二个错法:把"能"当成了"应该"。
它能答价格,不等于它应该答价格。功能列表天然是往多了写的——供应商没有理由把自家能力写少。而你要的是一个上界,不是一个下界。
第三个错法,也是最要命的:没有配套的另一张。
只有"它必须会的",缺"它不许答的",等于只写了一半。而这两张纸的关系不是补充,是校验:「必须会的」定义了它的服务范围,「不许答的」定义了它的责任边界,两张对不上,中间那块空白就是事故发生的地方。
第二张纸难写,是有原因的。写"它能干什么"只需要看产品;写"它不许答什么"需要有人把公司的责任边界说清楚——哪些话说出去要认账、哪些承诺一旦给出就收不回来、哪一类问题答错了不是丢单而是赔钱。这件事只有业务方能回答,而业务方通常不在上线会议上。
我的建议是,把第二张清单的评审会开在采购之前,不是上线之前。 采购之前写,你会发现有些功能根本不该买;上线之前写,那些功能已经在合同里了,你只能挑着关掉——关不干净的部分,就成了将来的风险敞口。
二、每一条清单项,必须写满三个字段
两张清单的格式是同一套。每一条,都要写满三个字段,缺一个就不算写完。
字段一:触发条件。
不是"关于价格的问题",而是"当对话中出现具体金额、折扣、优惠、返现这类要求时"。触发条件写得越接近原话越好,因为要靠它去测试。写成"关于价格的问题",测试的人不知道该输入什么;写成一串具体的说法,测试就有了脚本。
字段二:期望动作。
这一栏只有两种合法写法:要么写它该说什么,要么写它该停下来做什么。 不许写"谨慎处理",不许写"合理回复"——这类词在验收那天什么也验不出来。
在「必须会的」那张纸上,期望动作是一个具体的回答范围;在「不许答的」那张纸上,期望动作是一个明确的停止和交接。两者格式一致,方向相反。
字段三:失败时转给谁。
这一栏最容易被留空,而它是三个字段里唯一能在事故当天起作用的。要求有两条:写到岗位,不写部门;同一个岗位在两张清单里出现的条数要有上限——我的建议是不超过 10 条。超过这个数,意味着你把所有出口都接到了同一个人身上,他休一天假,这套东西就有十条通路是断的。
三个字段写完,你会得到一个副产品:这条清单项自动就是一条测试用例。 触发条件是输入,期望动作是断言,失败时转给谁是兜底路径。写清单和写测试在这里是同一件事,这也是我不建议把清单写成一段散文的原因——散文没法拿去跑。
三部门那份实施意见里提到的三类风险,正好可以当作检查这三个字段的角度:隐私泄露对应"它会不会把不该说的信息说出去",越权操作对应"它会不会替客户做了本该由人确认的决定",行为失控对应"它在没有匹配到任何一条清单项的时候会做什么"。第三个角度最容易漏。
我的建议是给这个默认行为单独写一条,放在两张清单的最下面:没命中任何一条时,一律转人工,不许自由发挥。 这一条写不写,决定了这套东西是"有边界的"还是"边界之外全靠运气"。
三、「不许答的」这张怎么写:先定上限,再往里填
这张纸的写法和第一张相反。第一张是从零往上加,这张是先定上限,再往里填。
先给三条上限,都是本文的建议值,你可以按自己的情况调,但我不建议一条都不设。
上限一:「必须会的」第一版最多 5 个场景。 5 个之外的,第一版一律不开。场景少,归因才清楚——出了问题你能一眼看出是哪一个场景的哪一条没写对。
上限二:每个场景最多 3 条分支。 一个场景写出七八条分支,说明这个场景本身还没拆干净,该拆成两个场景,而不是加分支。
上限三:「不许答的」条数,不超过「必须会的」条数的 2 倍。 这条上限的作用不是限制你写,是逼你面对一个事实——如果禁止项写到了三倍四倍还打不住,说明你要开放的这个业务范围本身太宽,正确的动作是缩范围,不是继续加禁止项。清单越长,维护越难,最后没人看的清单和没有清单是同一件事。
上限定完,往里填。填的顺序我建议这样:
第 1 步。先填两条法定的,这两条不由你的业务决定。
第一条:不许否认或隐瞒自己是 AI。依据是《人工智能生成合成内容标识办法》第十条:「用户使用网络信息内容传播服务发布生成合成内容的,应当主动声明并使用服务提供者提供的标识功能进行标识。」这条义务的方向是"主动声明",所以清单上要写的不只是"不许说自己是人",还要写"在什么触发条件下必须主动说明"。
第二条:不许编造或假冒。依据是《直播电商监督管理办法》(市场监管总局、网信办令第 117 号,2025 年 12 月 18 日公布、2026 年 2 月 1 日施行)第三十四条:不得利用人工智能等技术手段「编造、传播虚假或者引人误解的商业信息,假冒他人进行商业宣传」。落到清单上,"引人误解"这四个字比"虚假"更该被重视——一句话每个字都是真的,拼在一起让人误解,同样在这条里面。
这两条要放在清单最前面,且不许因为任何业务理由被删掉。
第 2 步。再填"答错了要赔钱"的那一类。 判断标准只有一个:这句话说出去之后,客户能不能拿着它向你主张什么。能,就进这张清单。
第 3 步。最后填"答错了很难圆回来"的那一类。 这一类不一定涉及赔付,但一旦说岔就没法自然收场——比如涉及具体某个人的说法、涉及和同行的比较、涉及公司还没对外说过的安排。
第 4 步。填完之后倒过来对一遍。 拿着「必须会的」那 5 个场景,逐条问:这个场景里有没有一条分支会滑进禁止项?有的话,两张纸必须改一张——要么把场景切细,要么把禁止项写具体。这一步是两张清单唯一的交叉校验,跳过它,两张纸各写各的,中间的空白照样存在。
四、上线前的检查顺序,以及什么时候不该写这两张纸
三部门那份文件要求的是「开发、部署、应用、维护」全周期。下面这五步就是按这四个环节排的,顺序不能换。
第 1 步(对应开发)。两张清单写完并签字,再谈接入。 签字的人必须是业务侧的,不是技术侧的——技术侧只能证明它按清单跑通了,证明不了这份清单对不对。
第 2 步(对应部署)。把每条清单项当成测试用例跑一遍,逐条留记录,记录带日期。 清单是意图,记录才是证据。只有清单没有记录,事后你手上仍然是空的。
第 3 步(对应应用)。上线后做一段时间的人工抽检,抽检比例逐周下调。 具体比例和周期由你定,我的建议是第一周的抽检强度要高到你自己觉得麻烦为止——第一周省下的力气,会在第三个月以三倍的形式还回来。
第 4 步(对应应用)。给那条"没命中就转人工"的默认规则单独做一次测试。 故意输入几句两张清单都没覆盖的话,看它做什么。这一步几乎没人做,而它测的正是"行为失控"这一类风险。
第 5 步(对应维护)。每月对一次清单,且这次评审只做减法。 只有第一次评审可以加条目,之后每月那一次只准删和改,不准加——想加的攒到季度评审。不设这条规矩,清单会在半年内长到没人愿意读。
接下来是代价,三条,都得先接受再开工。
第一,写「不许答的」那张纸要占业务方的时间,而且一定写不全。 它不是写一次就完的东西,第一版必然有遗漏,遗漏会在真实对话里暴露出来。接受"第一版不全"是开工的前提——追求一次写全的团队,通常的结局是这张纸永远停在草稿状态,而系统已经上线三个月了。
第二,清单越长维护越难,所以上限必须真的执行。 那三条上限最容易在第二个月被突破:出一次事就加两条,加着加着就没人看了。我的建议是把"删条目"也变成一个要签字的动作——只有加没有删的清单,寿命通常不超过一年。
第三,两张清单都写了,也不等于把责任转移出去了。 清单是让你有能力证明自己尽了该尽的注意,不是一份免责书。本文不是法律意见,具体情形请咨询律师。
最后是不适用的场景,两种。
第一种:你的数字员工不直接面对客户。 如果它只在内部用——整理内部资料、给同事出初稿、跑一段内部流程,那这两张清单可以简化成一张,重点放在"隐私泄露"和"越权操作"这两类,不用把对外话术那一套全搬过来。这一整套只在它会直接和客户说话的时候才必须做。
第二种:你还没定下它到底负责哪一段业务。 业务范围没定,两张清单都无从写起——「必须会的」不知道该写哪 5 个场景,「不许答的」不知道边界画在哪。这种情况下先做的是把业务范围定死,不是写清单。范围没定就开始写清单,写出来的一定是一张越写越长、越长越没人执行的许愿单。
同系列里另有一篇讲"说错话之后怎么才不赔钱"的,从判决确立的过错责任讲起,和这一篇的上线前动作刚好接得上。
本文事实来源
可自行复核- 1
《智能体规范应用与创新发展实施意见》,国家网信办、国家发展改革委、工业和信息化部三部门联合印发,2026 年 5 月 8 日:「将智能体安全、可靠、可信作为发展的底线」;要求制定「开发、部署、应用、维护全周期安全管理」规范;构建「分类分级治理框架」,敏感领域实行备案、检测等管理;防范「隐私泄露、越权操作、行为失控」等风险。
该文件无公开文号,本文只写「三部门联合印发」;全文无任何量化目标,本文未从中引用任何比例或数量。
- 2
《人工智能生成合成内容标识办法》(网信办、工信部、公安部、广电总局,2025 年 3 月 7 日发布,2025 年 9 月 1 日施行)第十条:「用户使用网络信息内容传播服务发布生成合成内容的,应当主动声明并使用服务提供者提供的标识功能进行标识。」
- 3
《直播电商监督管理办法》(市场监管总局、国家网信办令第 117 号,2025 年 12 月 18 日公布,2026 年 2 月 1 日施行)第三十四条:不得利用人工智能等技术手段「编造、传播虚假或者引人误解的商业信息,假冒他人进行商业宣传」。规章 PDF: ;发布页
- 4
杭州互联网法院审结全国首例 AI「幻觉」侵权案,判决生效,确立过错责任原则。中央广播电视总台,2026 年 1 月 14 日。本文仅作一句话背景引用,不展开其注意义务的具体层次。
