莱客AI商学院/文章/两周、三个客户、不写一行代码:一个人怎么验证 AI 创业想法
深度文章免费

两周、三个客户、不写一行代码:一个人怎么验证 AI 创业想法

101 份创业死亡复盘里排第一的死因是「没有市场需求」,占 42%——两周里你要拿到的不是一个能用的东西,是三笔别人主动付的钱

AI 获客专家 · 增长实验室2026-01-22预计 8 分钟
两周、三个客户、不写一行代码:一个人怎么验证 AI 创业想法 封面

文章目录

共 5 节
01一、大家不是不信你,是不知道该为什么掏钱02二、什么叫「验证通过」:三个人,三笔钱,一句话03三、Day 1 到 Day 14:每天做什么,做出什么,什么时候停04四、AI 在这两周里具体做什么,具体卡在哪05五、代价,和什么时候不该这么做

42%。

这是 101 份创业公司自己写的死亡复盘里,「没有市场需求」被提到的比例,排第一。排第二的是「钱烧完了」,29%。

两个数之间差 13 个百分点(这个减法是我自己做的)。意思是:比「做不下去」更常见的,是「做出来了,但根本没人要」。

一、大家不是不信你,是不知道该为什么掏钱

先把那份表摆开。据 CB Insights《The Top 20 Reasons Startups Fail》,基于 101 份创业公司公开的失败复盘,被提及最多的几项依次是:No Market Need 42%、Ran Out of Cash 29%、Not the Right Team 23%、Get Outcompeted 19%、Pricing/Cost Issues 18%、Poor Product 17%、Ignore Customers 14%。

这些百分比不能相加。 报告原文写着,很多公司同时给了不止一个原因,「图表里这前 20 项加起来不等于 100%(远远超过)」。42 + 29 + 23 + 19 已经是 113 了(这个加法是我自己做的,做出来就是为了说明它没有意义)。它不是分布,是提及率排序,能读的只有相对位置:「没人要」被提到的次数,比「钱不够」多。

报告里还有两段当事人的原话,更值得看。

一段来自 NewsTilt。他们做评论系统,理想客户是报社。原话是:「While there, we figured they were never going to buy, and we figured out a product that people were dying to use if it existed.」——他们那时已经知道对方永远不会买,转头又去设想了一个「如果它存在,人们会抢着用」的产品。

另一段来自 Meetro:「having hundreds of active users in Chicago didn't mean that you would have even two active users in Milwaukee, less than a hundred miles away」——芝加哥有几百个活跃用户,不代表一百英里外能有两个。

这两句话说的是同一件事:有人喜欢,和有人掏钱,是两条完全不搭界的线。 最常见的自我欺骗,就是把「他觉得这个想法挺好」当成验证通过。大家不是不信你,是他压根没给这件事排过队。你问他好不好,他答好,成本是零。

碰到下面三种信号,一律记零分:

  • 夸想法。 「这个方向挺对的」「这个确实是个真需求」。
  • 承诺未来。 「等这阵忙完一定找你」「下个季度就安排」。
  • 愿意免费试。 免费试用的意愿和付费意愿之间没有换算关系。

算数的证据只有三种,任意一种都比上面三句重得多:

  • 他付了钱。 哪怕是两百块的定金。
  • 他把别人拉了进来。 主动叫上同事、合伙人或老板一起听。
  • 他把内部的东西给了你。 报价表、台账、订单截图——愿意交出来的人,已经把你放进流程里了。

三种的共同点:都有成本。 验证要收集的只是有成本的信号。

那为什么这道题的重心变了?

因为「做不做得出」这一侧的时间被压塌了。一个人能在一个下午里,把一件过去要外包三周的事凑合着交出来。做得出不再稀缺,稀缺的那一侧全部挪到了「有没有人愿意为这个结果付钱」上。两周之所以够用靠的是这一点,之所以危险也是因为这一点——交付侧被压缩了,需求侧一分钟都没被压缩。

二、什么叫「验证通过」:三个人,三笔钱,一句话

给一个能当场判定的定义。

两周结束的时候,手上要有三笔已经到账的钱,来自三个互相不认识的人,并且这三个人各自描述「他买的是什么」时,说的是同一句话。

三个条件,缺一条都不算通过。

为什么是三个人,不是一个。 一个人付钱最可能的解释是人情,第二个人可能是第一个介绍的。只有三个人互不认识,「人情」这个解释才被排除。这是这套验证唯一的对照组设计。

为什么必须是到账,不是意向。 意向是零成本的。企业采购那一侧有一组可参照的公开数字:据 MIT NANDA 团队 2025 年 7 月发布的《The GenAI Divide》,漏斗是 60% 进入评估、20% 进入试点、5% 进入生产。三个除法:20 ÷ 60 ≈ 33%,5 ÷ 20 = 25%,5 ÷ 60 ≈ 8.3%(都是我自己算的,报告只给了那三个百分比)。

口径必须说清楚:它是企业采购 AI 的漏斗,不是你个人验证的漏斗,分母完全不是一回事,不能拿这三个数当自己的目标线。 这份报告的样本只有 52 场访谈加 153 份行业会议现场问卷,封面标着 Preliminary Findings。我引它只用它的形状:越往后走掉得越狠,每往后一步对方要付出的成本都上一个台阶。 意向在最上面那一层,离钱最远。

为什么三个人要说同一句话。 这一条最容易被忽略。三个人都付了钱,但一个说买的是「省时间」,一个说是「省一个人」,一个说是「不出错」——那你有的不是一门生意,是三个临时活,没法用同一套话去找第四个人。

三笔钱证明有需求,三句话一致才证明有生意。少了后面这半句,你验证到的是自己能接活,不是这件事能被重复。

三、Day 1 到 Day 14:每天做什么,做出什么,什么时候停

下面这套按每天不超过 2 小时设计,十四天合计约 28 小时(这个乘法是我自己算的),是为「还没辞职、只有晚上和周末」的人写的。

每天给三样:动作、当天的可交付产出、没达成就停的判据。 判据是最重要的部分——它的作用不是逼你坚持,是允许你及时停。

第一周:全花在需求侧

Day 1|写一句话。

动作:写出「我替谁、解决什么、结果长什么样」,一句话,不超过 30 字。

产出:一张纸上的一句话。

停的判据:出现「等等」「各种」「一系列」「全方位」中任何一个词,就是没写出来。连续两天写不出来,说明你要做的不是一件事而是一个领域,停。

Day 2|列 20 个人。

动作:列出 20 个知道你在做什么的人,每行注明他属于哪一类。

产出:一份 20 行的名单。

停的判据:凑不满 20 个,说明这个方向离你的关系太远——不是不能做,是不能用两周验。停。

Day 3|问一句话。

动作:把 Day 1 那句话发给名单里的 8 个人,只问一句:你身边有没有人正卡在这件事上。别问「你觉得怎么样」。

产出:8 条回复。

停的判据:8 条里少于 3 条给出具体的人或具体场景,回 Day 1 改那句话。

Day 4|约三场。

动作:约 3 场 15 分钟的访谈,语音就行。

产出:3 个写在日历上的确定时间。

停的判据:把剩下 12 个人也发完仍约不到 3 场,停。约不到人聊 15 分钟,就更约不到人付钱。

Day 5|做完两场。

动作:做完前两场访谈。每场只问三件事:这件事你平时怎么做、一个月发生几次、上一次为它花了多少钱。

产出:两份记录,每份都写得出这三个答案。

停的判据:两个人都答不上来「花了多少钱」。答不上来意味着这件事没有现成预算,你要新开一个预算科目,两周做不到。停。

Day 6|横着对一遍。

动作:做完第三场访谈,把三份记录横过来对,找共同的卡点。

产出:一张三列对照表。

停的判据:三个人的卡点没有一处重合,说明你面对的不是一类人。回 Day 2 换名单。

Day 7|写一页纸。

动作:写一页交付说明。写的是结果不是做法:交出去的东西长什么样、什么时候交、多少钱。

产出:一页 A4,不超过 400 字。

停的判据:出现任何一个只有你懂的词,重写。对方要反问「这是什么意思」的词,就等于没写。

第二周:把钱收进来

Day 8|报价。

动作:把这一页发给三位被访谈的人,问一句:这个价钱你会买吗,为什么。

产出:3 条回复。

停的判据:三个人都答「会考虑」。那是礼貌性回答。把价格改成两档再问一遍——多数人在两个选项之间才会露出真实态度。

Day 9|手工交付第一个。

动作:给愿意往下走的第一个人,手工做完一次完整交付。允许笨。

产出:一份真实的交付物。

停的判据:手工做一遍超过 6 小时,就把范围收窄一半重做——两周内验不了一件单次要一整天的事。

Day 10|收第一笔。

动作:交付完当场收钱,记下从开工到交付的净时长。

产出:一笔到账,加一个分钟数。

停的判据:对方不肯付。必须问清一句:是结果不对,还是价格不对。前者回 Day 6 重看卡点,后者只需改 Day 7 那一页。分不清这两个的人,会把定价问题当成需求问题,然后放弃一个本来成立的方向。

Day 11|把过程写成顺序。

动作:把 Day 9 做的那一遍,复述成一份不超过 10 步的固定顺序。

产出:一份 10 步以内的清单。

停的判据:压不到 10 步以内,说明这件事还不能被重复,它只是一次接活。

Day 12|按顺序交付第二个。

动作:照那份清单交付第二个人,同样计时。

产出:第二份交付物,第二个分钟数。

停的判据:第二次耗时没有比第一次少至少两成,说明那份顺序写的是流水账,回 Day 11 重写。

Day 13|第三个人,第三笔钱。

动作:交付第三个人并收钱。

产出:三笔到账。

停的判据:三笔里有两笔来自熟人且明显是照顾你,不算通过;把两周往后延,去找互不相识的第三方。

Day 14|算三个数,做判定。

动作:只算三个数——单次交付净时长(分钟)、单笔实收金额(元)、三个人对「你卖的是什么」的描述是否一致(是/否)。

产出:一页结论。

判定:前两个数相除得到每小时实收。这个数低于你手上其他活的时薪、且第三项是「否」——不要往下做。三项都过,才把 Day 11 那份清单变成可以重复卖的东西。

四、AI 在这两周里具体做什么,具体卡在哪

两周这个数字完全建立在它上面,所以这一节必须写具体。

它干得动三件事,都是把口语和过程压成结构。

第一件在 Day 6:三场访谈是三段散乱的口语,压成一张三列对照表,人手做要一晚上,交给 AI 十几分钟,人只需改回它对错的那几行。

第二件在 Day 8:把 Day 7 那一页改写成两个价格档的两版,并保证两版在描述同一件事。手写两版最容易前后不一致,对方一比对就露馅。

第三件在 Day 11:把「我昨天是怎么做的」复述成 10 步顺序。人写自己做过的事,会漏掉所有已成本能的步骤——那些恰恰是第二次交付会卡住的地方。让 AI 照着口述往回追问「这一步之前你还做了什么」,比自己回忆管用。

它干不动的是 Day 10 的那一下。 对方点开付款那个动作,没有任何东西能替代,也没有任何东西能预测。这就是为什么前 8 天全花在需求侧,只有 Day 9 到 Day 13 在交付侧。

还有一件必须防的事:你自己也能很轻松地做出一整套看起来很成立的验证材料。 好评截图、对比图、客户反馈,一个晚上就能齐。这不是假设:据北京市市场监督管理局公布的一起处罚案例(页面显示日期 2025 年 9 月 15 日;该页在市监局站点上的路径日期为 2025 年 10 月 29 日),一场「免费 AI 训练营」被罚款 50 万元,认定事实里包括用于证明效果的案例截图「有的是当事人 PS 的,有的是从网上搜来的」,直播则是提前录制的情景剧。

对外这么干会被罚;同一套手法用来骗自己没人罚你,代价是你照着一份漂亮的假证据把接下来一年投进去。所以这两周里唯一算数的产出,是银行流水和收款记录,不是任何一张可以被做出来的图。

五、代价,和什么时候不该这么做

第一笔代价:你会免费或半价做掉至少一次交付,且大概率超时。 Day 9 那次手工交付是这两周里最实的成本,它换来的不是那一单的钱,是 Day 11 那份清单——没真做过一遍,那份清单写不出来。

第二笔代价:这套方法会系统性淘汰掉一类方向。 凡是价值需要三个月以上才显现的(长期陪跑、能力建设这类),两周内一定验不出来,会被判据判死。这是真损失,不用找理由——要么承认它不适用,要么换一套周期更长、代价更大的办法。

第三笔代价:三个客户不能证明第十个客户。 三个人的一致描述只说明这件事有一个可重复的形状,不说明形状后面站着一百个人。两周验的是「值不值得往下投三个月」,不是「这门生意能做多大」。

什么时候不该这么做:

  • 客单价高到要走年度预算或招标的,不适用。 这类生意两周内不会出现付款动作,验证物要换成盖章的意向或进入下一轮评审——那已经不是两周的题。
  • 受资质管制的领域不适用。 医疗、法律、金融里需要持牌的那部分,「先手工交付一次试试」本身就有风险。
  • 本职合同里有兼职或竞业限制的,先看合同再动。 这两周里有真实收款,和「业余研究一下」性质不同。
  • 你自己完全不消费、也没有熟人在其中的行业,不适用。 Day 2 那 20 个人凑不出来,整套跑不起来——这不是方法的问题,是入场位置的问题。

最后说一句「不写一行代码」。它不是态度,是纪律:在拿到第三笔钱之前,任何把东西做得更自动、更好看、更省事的念头,全部往后推。 那些事不会因为晚做两周而变难,而需求验证一旦被推迟,通常就再也不做了。

同一个方向上,讲四个岗位怎么分的那一篇是《把自己拆成四个岗位:一人公司的第一份组织架构图》,验证通过之后再看,顺序刚好。

本文事实来源

可自行复核
  1. 1

    CB Insights《The Top 20 Reasons Startups Fail》(PDF 副标题原文:「From lack of product-market fit to disharmony on the team, we break down the top 20 reasons for startup failure by analyzing 101 startup failure post-mortems.」)。本文引用其第 3 页图表数值:No Market Need 42%、Ran Out of Cash 29%、Not the Right Team 23%、Get Outcompeted 19%、Pricing/Cost Issues 18%、Poor Product 17%、Need/Lack Business Model 17%、Poor Marketing 14%、Ignore Customers 14%;以及第 2 页原文「you'll see that chart highlighting the top 20 reasons doesn't add upto 100% (it far exceeds it)」。同一 PDF 第 6 页 NewsTilt 复盘原文「While there, we figured they were never going to buy, and we figured out a product that people were dying to use if it existed.」;第 5 页 Meetro 复盘原文「having hundreds of active users in Chicago didn't mean that you would have even two active users in Milwaukee, less than a hundred miles away」。

    AWS S3

    两处局限,如实写明:(一)该 PDF 的页面上没有印发布日期,我从文件属性里读到的创建时间是 2016 年 7 月 28 日,因此本文只说它「基于 101 份复盘」,不声称它是哪一年的最新结论;(二)样本全部是美国创业公司的公开复盘,且是自述而非抽样统计,本文只用它的相对排序,不用它的绝对水平,也不与任何国内数据做换算。

  2. 2

    MIT NANDA《The GenAI Divide: State of AI in Business 2025》(2025 年 7 月):漏斗为 60% 进入评估 → 20% 进入试点 → 5% 进入生产;样本为 52 场访谈 + 153 份行业会议现场问卷;封面标注 Preliminary Findings,报告自述观察期可能不足。

    MLQ.ai

    局限:这是企业采购 AI 的漏斗,与个人验证一个想法的漏斗分母完全不同,本文只借其形状(越往后成本台阶越高),未做任何数值套用。

  3. 3

    北京市市场监督管理局公布的「免费 AI 训练营」处罚案例(页面来源标注为北京日报客户端,页面显示日期 2025 年 9 月 15 日;该页在市监局站点上的路径日期为 2025 年 10 月 29 日):罚款 50 万元;认定事实包括用于证明效果的案例截图「有的是当事人 PS 的,有的是从网上搜来的」,直播为提前录制的情景剧。

    北京市政府