别拿榜单截图做采购决策
八大 Agent 基准被一个自动化工具全部攻破,一道任务不解也能拿到近满分;替代它的验收方法只要 50 条样本

文章目录
共 4 节八个。这是 2026 年 4 月被攻破的 Agent 基准的数量——全部八个,一个没剩。
据 UC Berkeley RDI(2026 年 4 月)发布的研究,一个自动化扫描代理通过 reward hacking——也就是钻评测规则本身的空子——攻破了全部八大 Agent 基准。原文写的是「every single one can be exploited to achieve near-perfect scores without solving a single task」:每一个基准都能被利用来拿到近满分,而它一道任务都没有真正解决。具体分数是 Terminal-Bench 100%、SWE-bench Verified 100%、WebArena 约 100%、FieldWorkArena 100%、GAIA 约 98%、OSWorld 73%。
这句话值得逐字读两遍。它说的不是某一家厂商在跑分上作弊,而是评测机制本身可以被自动化地利用。一个工具,八个基准,全中。
这对生意人意味着一件很具体的事。当供应商把一张榜单截图推到你面前,那张截图上排名靠前的位置,可能有相当一部分是靠钻规则空子拿到的。
一、能被自动化攻破的,不是作弊,是设计缺陷
先把「攻破」这个词的含义说清楚,因为它决定了你该怎么应对。
如果只是某一家厂商偷偷用测试题训练,那是道德问题,解法是抓出来、点名、换一家。这种事有明确的责任方。
但据 UC Berkeley RDI(2026 年 4 月)的这项研究,攻破八大 Agent 基准的是一个自动化扫描工具。自动化的意思是:它不需要人去针对每个基准想招,它自己扫,自己找规则的缝,然后钻进去。
八个基准,形式各异、题目各异、由不同的团队设计,被同一个工具全部扫穿。这说明缝不在某一个基准里,在「用固定题目给通用能力打分」这件事本身里。
这个区别对采购是决定性的。如果是作弊,你可以换一家供应商;如果是机制缺陷,你换谁都一样——因为所有厂商面对的是同一批基准,谁不在这些基准上把分数做上去,谁就在销售环节吃亏。这不是一个道德滑坡的故事,这是一个「所有人被同一个计分板牵着走」的故事。
顺着这个逻辑再往下一步,会得到一个更不舒服的结论:分数越是被用来做营销,它被优化的动力就越强,它作为参考的价值就越低。一个没人拿去推销的冷门评测,反而更可能是干净的。这不是阴谋论,这是激励结构。
所以我们不建议的做法是「找一张更好的榜单」。找不到。真正的解法在第三节和第四节,是把评测的题目换成你自己的题目。
在此之前,还有一层更根本的问题要说。
二、你买的是它在你的数据上的表现,榜单测的是它在公开题目上的表现
即使一张榜单完全干净、一分虚高都没有,它对你的采购决策仍然帮助有限。原因和作弊无关。
榜单测的是公开题目上的平均表现。你要买的是你自己那批数据上的表现。这两件事在三个地方对不上。
第一,题目的分布不一样。
公开基准的题目是设计出来覆盖广度的——它要在很多领域上都测一点,才叫「通用能力」。而你的业务只发生在一个很窄的地方:一种行业的术语、一种客户的问法、一种单据的排版、一种你们内部才用的简称。
一个在广度上得高分的模型,在你那个窄口上的表现是未知的。它可能特别好,也可能特别差。榜单不告诉你,因为榜单没测过你那个口。
第二,错误的代价不一样。
榜单给每道题的权重通常是一样的:答对得分,答错不得分。你的业务不是这样。有的错误发出去就是一次道歉,有的错误会在下一道工序被拦住,成本相差几个量级。
一个「总分更高但在你最贵的那类错误上更容易犯错」的模型,在榜单上赢,在你的账上输。分数是把成千上万道题压成的一个数,压的过程中,恰恰把「哪种错误更贵」这件事压没了。
第三,你要的不只是答对,还有「不知道就说不知道」。
绝大多数评测奖励答案,不奖励拒答。而在真实业务里,一个模型在信息不足时硬答,往往比它答不出来危险得多——因为答不出来你会去人工处理,硬答你会直接发出去。
这一条几乎不会出现在任何榜单上,但它是你上线之后最先撞到的墙。
把这两节合起来:榜单的分数既可能虚高,又即使不虚高也测不到你要的东西。这就是我们不建议拿榜单截图做采购决策的全部理由。
那用什么代替它?在给方法之前,还有一组从完全不同角度得出的数字,它从另一侧说明了同一件事。
三、另一侧的印证:决定收益的不是分数,是流程
这组数字来自一份和评测完全无关的调研。
据媒体转载的麦肯锡一项覆盖约 500 家组织的调研(我们只拿到转载版本,未能核到原始报告,请按「据转载」看待),88% 的组织在使用 AI,仅 39% 报告有实际收益,约 6% 达到了 5% 以上的 EBIT 影响。
88% 在用,39% 有收益。这中间差着近五成的组织——它们用了,但没拿到回报。
这五成里,大概率有相当一部分是按榜单选的模型。因为按榜单选是最省事的路径:分数高的那个总不会错吧。而结果是,用了不等于有收益。
这份调研里还有一个数字,我们认为是整篇文章里最该抄下来的一句:收益影响最大的单一因素是「重新设计工作流」,而只有 21% 的公司真的做了。
请把这个 21% 和上面的 39% 放在一起看。
排在收益影响第一位的因素,不是模型选得对不对,不是参数量,不是榜单排名,是你有没有把那段工作流重新画一遍。而只有约五分之一的公司真的动了流程。
这意味着,一家公司在选型上纠结两个星期、反复对比几张榜单,最后可能连收益影响的第一顺位因素都没碰到。它把精力花在了「买哪个」上,而决定成败的是「买回来放进哪段流程、那段流程要不要重画」。
这一层和第一、二节说的是同一件事的两面:榜单分数既不可靠,也不重要。不可靠是因为机制可被利用,不重要是因为它排在收益影响因素的后面。
我们的看法是:选型这件事应该被压缩到一到两天,把省下来的时间放到流程上。而要把选型压缩到一到两天,你需要的正是一套快、糙、但直接测在你自己数据上的验收方法。
四、三种能替代榜单的验收方法
三种方法可以叠加使用,也可以只用第一种。全部不需要写代码,业务方自己就能做。
第 1 步。用你自己业务里的 50 条真实历史样本做盲测。
从过去的真实记录里抽 50 条——真实工单、真实询价、真实合同片段、真实客诉,什么业务就抽什么。要求是:这 50 条必须是已经有正确答案的,也就是当时人已经处理过、结果已经确定。
把这 50 条分别送给两到三个候选模型,把输出收集起来,去掉所有能看出是哪家模型的标记,打乱顺序,交给业务方打分。
盲测这一步不能省。不盲,人会不自觉地给自己听说过的那个牌子加分,这个偏差通常比模型之间的真实差距还大。
抽样的时候有一条纪律:不要只抽典型样本。照着实际比例抽,该有多少难缠的就留多少难缠的。只抽典型样本,三个模型会全部拿满分,你什么也测不出来。
第 2 步。把评分标准写成可打勾的条目,交给业务方而不是技术方。
不要用「哪个回答更好」这种问法,那样得到的只是一堆主观排序,换个人评就换个结论。
正确的做法是把「好」拆成三到六条可以打勾的条目,每条只回答是或否。比如:金额抽对了没有、交期抽对了没有、有没有编造单据里不存在的信息、语气能不能直接发给客户、需要人改的话要改几处。
拆完之后,评分就变成了数勾,不再是品味问题。两个不同的人评同一份输出,结论应该一致;不一致,说明条目还没拆干净,回去继续拆。
这些条目必须由业务方定,因为只有业务方知道哪一条错了会赔钱。技术方定出来的条目,往往测的是「像不像一个好答案」,而不是「能不能直接用」。
第 3 步。留一组故意刁难的边缘样本,专门看它会不会硬答。
从 50 条里单独划出 5 到 10 条,或者另外造一组,共同特征是:信息不足以得出确定答案。
比如一张缺了关键字段的单据、一个自相矛盾的客户需求、一个问的是你们根本不提供的服务的咨询、一份日期明显写错的合同。
这一组不看它答得对不对,只看一件事:它有没有说「这里信息不够」。
会说的,可以进下一轮;不会说、每次都给出一个看起来很完整的答案的,无论前 50 条考得多好,都要谨慎。因为前 50 条的错误你能发现,这一组的错误你发现不了——它长得和正确答案一模一样。
这三步走完,你得到的不是一个分数,是一张勾选表和一组你亲眼看过的输出。它比任何榜单截图都更适合拿去做采购决定,因为它测的就是你要买的那件事。
代价:这套方法要花的人天,和它不适用的地方
必须把成本写清楚。
人天。抽 50 条样本、清洗掉客户敏感信息、跑三个模型、拆评分条目、两个人各评一遍再对一次——按我们的估算方式,这是两个人两到三天的量,其中拆评分条目那一步最耗时,也最不能省。如果你打算把这套方法做成每次选型都跑一遍的常规动作,那么条目和样本集可以复用,第二次会快很多。
为什么 50 条是下限,不能再少。再少就没有区分度了。三个模型在 20 条样本上很可能打成平手,或者被一两条极端样本带偏结论——你换个 20 条重跑,排名就变了。50 条不是一个精确的统计学门槛,它是一个经验下限:低于这个数,你测出来的差异分不清是模型的差异还是抽样的运气。想更稳,就往上加,加到 100 条、200 条只会更好,代价是人天线性上涨。
它完全不适用的场景。如果这是一个全新业务,你手上根本没有历史样本——没有处理过的工单,没有确定的正确答案——那么这套方法一步都走不了。第一步就卡死。
这种情况下我们的建议是:先用最便宜的模型做一个月,把这一个月的真实交互和人工修正结果攒下来,那就是你的第一批样本。用一个月的实际使用换一个样本集,比对着榜单猜三个星期划算。
还有一种情况是整件事都不该做:如果这次选型影响的月账单只有几十美元,那么花两个人两三天去做盲测,成本远超过选错的代价。这时候正确的做法是随便选一个便宜的先跑起来,等量上来了再回头做这套验收。
同系列里还有一篇把各家官方价格拉成一张表、按任务分档对应模型的,样本集攒好之后可以接着看。
本文事实来源
可自行复核- 1
UC Berkeley RDI:一个自动化扫描代理通过 reward hacking 攻破全部八大 Agent 基准,原文「We built an automated scanning agent that systematically audited eight among the most prominent AI agent benchmarks … and discovered that every single one can be exploited to achieve near-perfect scores without solving a single task.」;具体分数为 Terminal-Bench 100%、SWE-bench Verified 100%、WebArena 约 100%、FieldWorkArena 100%、GAIA 约 98%、OSWorld 73%。 (2026 年 4 月)
更正记录:本条此前引用过「头部分数虚高 5 到 15 分」。逐字复核该页原始 HTML 与该团队论文 BenchJack(arXiv 2605.12673)全文,均零命中,该数字没有任何一手出处,已整条弃用,正文不再出现该数字,也不做任何量级化的保留。
- 2
麦肯锡对约 500 家组织的调研:88% 在用 AI、39% 报告实际收益、约 6% 达到 5% 以上 EBIT 影响;收益影响最大的单一因素是「重新设计工作流」,只有 21% 的公司真的做了。我们只拿到转载版本,未能核到原始报告与其发布时间,正文中已标注「据转载」。
