莱客AI商学院/文章/没有基线的效果评估,都是自说自话
深度文章免费

没有基线的效果评估,都是自说自话

三天、两个指标、一张表——这是上线前能补的最小方案;超过两个指标的基线,我建议一个都别采

AI 效率专家 · 商业研究院2026-05-26预计 7 分钟
没有基线的效果评估,都是自说自话 封面

文章目录

共 4 节
01一、三个最常见的错法,你多半犯了其中两个02二、先定"一次"是什么,再谈量什么03三、三天怎么定,以及三条让这份基线作废的情况04四、上线之后怎么用这张表,以及什么时候不该采基线

一个用了三个月的 AI 客服,老板问它到底省了多少时间。能拿出来的只有供应商后台的一张图:会话量、平均响应时长、满意度,三条线都在往好的方向走。

这张图回答不了那个问题。因为上线之前,没有人量过。

于是接下来发生的事很固定:负责这件事的人开始找感觉——"以前一单大概要半小时吧","快多了"。这句"以前大概"就是全部的基线,它不来自任何一次计时,来自记忆。拿记忆当分母算出来的提升,是自说自话。

一、三个最常见的错法,你多半犯了其中两个

错法一:把上线后的数当成效果。

会话量、响应时长、满意度这三个数都是真的,问题在于它们没有对照。没有对照期,也没有对照组,那么它们只能说明"这套东西在运转",不能说明"它比原来好"。

这一条听起来是常识,但它在实际里长成另一副样子:汇报材料上会写"平均响应时长 2.4 分钟",而没有人问上线前是多少。因为上线前那个数根本不存在,于是它就从汇报里消失了,只剩下一个孤零零的 2.4。

错法二:拿供应商后台的指标当自己的指标。

供应商给你的指标是它能测的,不是你要的。它能测"从客户发出消息到系统给出第一句回复",测不了"这件事一共占了你的人多少分钟"——因为后半段发生在它的系统外面:转给人、人去查、人回来答、客户又追问一句。

这两件事经常反向变化。第一句回复更快了,而整件事占用的人工分钟数没变,甚至因为多了一道"看看它答得对不对"而变长。只看前者,你会得到一份漂亮且错误的结论。

错法三:一上来量五个指标。

五个指标的采集成本不是两个的 2.5 倍。多出来的那三个通常包括满意度和准确率,这两样都要额外去问人、去抽检,采集动作从"记一个数"变成"发起一次沟通"。两周之后你会拿到一张缺格子的表,然后整张表作废。

再放一组外部的数,用来说明"没量过"这件事有多普遍。据埃森哲中国数字化转型指数 2025 年版(2025 年 7 月),46% 的企业在规模化使用生成式 AI,而只有 9% 拿到显著价值。据 InfoQ 研究中心与中欧国际工商学院《中国大模型落地应用研究报告 2025》(N=1166,2025 年发布,核心数据标注来源为 2024 年 7 月调研),进入大范围推广的只有 14%,序言里那三句话是「试点易、复制难;用得上、用不好;投入快、见效慢」。

请注意这些数字共同的前提:"拿到显著价值""见效慢"这类判断,本身就建立在有人量过的基础上。 而在你自己公司里,那个前提通常不成立——你既不知道自己算不算那 9%,也不知道自己离它有多远。

基线不值钱。它唯一的价值是:上线那天,你手上有一个可以被引用的数,而不是一句"以前大概"。

二、先定"一次"是什么,再谈量什么

处方从这里开始。三步,顺序不能换,答不上任何一步就停在那一步。

第 1 步。定计数单位:什么算"一次"。

不是"客服工作量",而是"一次咨询从进来到关闭"。不是"报价效率",而是"一次询价从收到到发出报价"。不是"对账",而是"一个供应商一个月的一次对账从开始到确认无误"。

这一步最容易被跳过,跳过之后所有的数都不能相加。给三个反面例子:把"一次咨询"和"一轮追问"混着算,条数会虚高;把"一次报价"里的改价重发算成新的一次,耗时会虚低;把"对账"按单据条数算而不按供应商算,两个月之间没法比。

判据只有一句:这个"一次"必须有一个明确的开始动作和一个明确的结束动作,两个动作都能被同一个人观察到。 说不清结束动作在哪,就说明还没拆干净,回去拆。

第 2 步。定两个指标:一个耗时,一个返工。上限是两个,我建议一个都别多。

耗时指标:这一次从开始到结束,占用了人多少分钟。注意是占用人的分钟数,不是自然时间——中间等别人回复的那 40 分钟,如果这个人去干别的了,就不算在里面。这一条要在开始之前跟记录的人说清楚,否则两个人会记出两套口径。

返工指标:这一次有没有被退回来重做。只记有和没有,打个勾,不记程度。

为什么第三个指标不能加:第三个通常是满意度或准确率。这两样的采集成本是前两样的十倍,而且三天之内采不出有意义的量。它们该在上线三个月之后单独立项去做,不该混在基线里。

第 3 步。定一张表:四列,一张纸。

日期 / 这一次的编号 / 占用分钟数 / 返工(打勾)。就这四列,不许加第五列。

三条约束,一条都不能松:

  • 记的人必须是干活的那个人本人,不是主管,不是被指派搞 AI 的你。主管记的是印象,本人记的是分钟。
  • 记的时间点是做完那一刻,不是下班前统一补。补的那份基线一律作废——人对自己刚花掉的时间的估计,误差方向是稳定偏低的。
  • 表头上必须写清这次采集的用途,一句话:本次记录用于测量流程耗时,不与任何人的绩效挂钩。这一句要真的做到。

关于最后一条,我的建议是把用途如实说出来,而不是含糊成"统计各岗位工时"。在一家几十人的公司里,隐瞒用途几乎必然穿帮,而穿帮之后你损失的不是这一次的数据,是下一次采集的配合度——而下一次采集,就是上线之后的那一次,那一次比这一次重要。

三、三天怎么定,以及三条让这份基线作废的情况

为什么是三天。 三天是"能盖住一个业务小节律的最小值"和"人还愿意认真记的最大值"之间的一个折中。这个天数是本文给出的建议值,不是任何研究的结论,你的业务如果是周节律(比如周一集中来单),那就采一个完整的周而不是三天。

但三天有个前提:这三天必须是普通的三天。 撞上下面任何一条,往后推,不要在这几天采:

  • 月初或月末的对账高峰;
  • 大促、展会前后一周;
  • 有人休假由别人顶班的那几天;
  • 系统刚换过版本的第一周。

算法:取中位数,不取平均数。

把三天里所有条的分钟数从小到大排一遍,取中间那一条。如果一共 27 条,就取第 14 条。

理由是耗时的分布是长尾的:一次卡了三个小时的异常单,会把平均数拉走十几分钟,而它一个月只发生一次。中位数不受它影响。这一步是本文给的口径,不是行业标准——如果你的汇报对象一定要平均数,那就两个都给,并且把最长的那三条单独列出来说明。

三条作废条件:

第一,三天里有一天的条数不足另外两天的一半。 说明那天不正常,作废重采,不要用另外两天凑。

第二,记录人中途换过。 分开算,别合并。两个人对"占用分钟数"的理解差异,通常大于你要测的那个提升。

第三,采集期内有人明确要求"你们记得快一点"。 这一句一出口,这份基线就废了——你测到的不再是常态,是被观察之后的状态。所以第 2 步末尾那句"不与绩效挂钩"必须由主管本人说,不是由你转述。

四、上线之后怎么用这张表,以及什么时候不该采基线

上线之后,同一张表、同一个人、同一套排除规则,再采三天。 然后拿两个中位数相减。

给一个演算示范,下面这两个数是为了说明口径而设的假设值,不是任何一次实测:假设上线前中位数 42 分钟、上线后 26 分钟,差 16 分钟;这个月这件事跑了 180 条,16 × 180 = 2880 分钟,约 48 小时。

这个 48 小时有一句必须跟着的口径说明,它是最常见的一次夸大:这 48 小时不等于省下 48 小时的工资。 它是分散在 180 次里的碎片,每次 16 分钟。除非你把这些碎片攒起来去做另一件具体的事——多接一档单、把某项一直没人做的整理做掉、把加班压回去——否则它不落到任何一张成本表上。汇报里写"节省 48 小时"没问题,写"节省 X 万元人工成本"就越界了,除非你能说出那 48 小时被换成了什么。

返工那一列的用法更简单,也更容易被跳过:如果耗时降了而返工升了,那不是省了,是把工作从前面挪到了后面。 这种情况在上线第一个月很常见,它不代表失败,代表校对环节的强度还没降下来——但你必须看得见它,才不会在第二个月盲目扩大范围。

接下来是这套方法的代价,三条。

第一,采集这三天,干活的人每次要多花十几秒记一笔,还要在心里区分"占用分钟"和"自然时间"。这是真实的打扰,别假装没有。

第二,这份基线不准。它一定偏低(人对刚花掉的时间估计偏低)、一定漏记(忙的时候会忘)。它的价值不在准,在于上线后用同一套有偏的方法再采一次,两次的偏差方向一致,差值才有意义。 所以上线后那次绝不能换人、换记法、换排除规则——换了,前面全白采。

第三,两个指标意味着你主动放弃了很多信息。准确率、满意度、客户流失,这些在基线里都不会有。接受这一点,否则你会在第 4 天开始加列,加到第 10 天这张表就没人记了。

什么时候不该采基线,三种情况。

第一种:这件事一个月只跑三五次。 三天采不到样本。这类流程不要装成基线,就老老实实做一次完整的实测:上线前完整记一次(每一步几分钟、卡在哪),上线后完整记一次,两次并排放。样本 1 对 1,但它诚实,比一份用三天硬凑出来的假基线有用。

第二种:你还没定下这件事的"一次"是什么。 回第 1 步,别往下走。定不出开始和结束动作,说明这段流程本身还没被写下来,那么该做的是把流程写下来,不是采数。

第三种:你已经上线了。 那就承认基线没了。唯一不该做的事是用"上线前印象中的样子"倒推一个数写进汇报——那是自说自话的第二种形态,而且比第一种更危险,因为它带着一个具体的数字。

这种情况下能补的只有一件事:去找上线前留下的、带时间戳的原始记录——工单系统的创建与关闭时间、聊天记录的首条与末条时间、邮件的收发时间。只取有时间戳的那部分,条数少也没关系,然后在汇报里写明"样本 N 条,来自某系统的时间戳,非全量"。条数少而口径清楚,比条数多而来路不明强得多。

最后说一句为什么这件事在 AI 这类项目上格外要紧。换一套新的业务系统,前后对比可以事后补——旧系统有日志,新系统也有日志,两边都能导出来。而 AI 顶掉的那一段恰恰不在任何系统里:它顶掉的是一个人打开对话框、想一下、写一段话的那几分钟。这几分钟在上线前没有任何日志,上线后落进了供应商的后台,两边口径还不一样。所以这是少数几类"基线必须靠人手工采、且过期不补"的项目——它不像别的系统那样,事后还能从数据库里翻出来。

这套评估往下延伸到迭代闭环怎么排,完整的做法在《DeepSeek企业实战》第 5 课。

本文事实来源

可自行复核
  1. 1

    埃森哲中国数字化转型指数 2025 年版:46% 在规模化使用生成式 AI,仅 9% 拿到显著价值

    埃森哲2025-07

  2. 2

    InfoQ 研究中心 × 中欧国际工商学院《中国大模型落地应用研究报告 2025》,N=1166:大范围推广仅 14%;序言原话「试点易、复制难;用得上、用不好;投入快、见效慢」。

    中欧商学院2025 年发布

    核心数据标注来源为 2024 年 7 月调研,正文已注明

  3. 3

    长江商学院对全国 2016 家规模以上工业企业的调研:AI 渗透率整体 10.0%、小企业 5.4%;79.2% 未采用企业的核心阻碍是"场景不适用"

    澎湃新闻发布2026-05-19