← 上一章☰ 目录下一章 →
第十八章
数据堆在那儿没人用
卷二 · 除了我还有谁在用|挂载真题 5 道(新H6、H10、H8、G8、J3)|织法 B · 战而后知

十一月最后一周,我第一次认认真真看了看我的数据库。

之前一直没时间。每天不是在修 bug 就是在改 Prompt。数据库长什么样,我只在部署的时候瞥了一眼。

这一看把我吓了一跳。

从七月到十一月,四个月的时间,数据库中躺着几千条开场白生成记录、几百次发送记录、几十次修改记录、以及数不清的点击流事件。每一个字段都有值——时间戳、用户 ID、岗位 ID、生成内容、修改内容、发送状态、回复状态。

数据很多。但我问了自己一个问题:这几千条记录,有没有任何一条在「让我产品的下次生成变得更好」?

答案是:没有。

每一次生成都是独立的。模型不知道它昨天写过什么开场白——它每次都是从零开始。用户修改了内容——但这个修改记录没有被用来训练或调整模型。哪些开场白拿到了回复、哪些没有——这个信息也没有被反馈到生成逻辑里。

数据堆在那儿,漂亮、完整、精确到毫秒——但它是死的。

一、我这叫「只采不用」

我翻了翻以前做设计时的习惯。每一个项目做完,我会把施工图、效果图、现场照片、甲方反馈归档到一个项目文件夹里。下一个项目做类似的场地时,我会先翻这个文件夹——路网怎么做、标高怎么定、种了什么树——直接复用。

产品做了四个月,几千条记录堆在数据库里,我没有复用任何一条。

我仔细看了那几千条记录的分布。开场白生成记录占了大部分——每一条都带着生成时的完整上下文:岗位描述、用户原始输入、AI 输出全文。其中大概有两百多条是用户「修改后发送」的——用户手动改了什么、改了多少、改完之后发送的结果是什么。还有几十条是同一个用户针对同一个岗位连续生成了多次的记录——第一版不满意,改了一些条件又生了一版,第二版满意了就发出去了。

最让我难受的是:我能从这些记录里清楚地看到,用户修改的每一个词都是对模型输出的「纠正」。他们改语气词、改动词、改公司名称的大小写——每一处修改都在告诉我:这里 AI 写得不对。而我从来没有把这份「纠正清单」用过一次。

数据的反馈回路就在我眼前——我却从来没接过。

这不是技术问题——技术上我能写一个脚本,把回复率高的开场白抽出来当一个种子库,下次写类似岗位的时候先参考。我没做这件事,不是因为我做不到——是因为我根本没往这个方向想。

我一直在想「怎么让模型写得更好」——加 Prompt、调参数、试不同的模型。但我从没想过「我手上已有的好内容,可以直接喂给模型当参考」。

数据飞轮——越用越好,越好越用。但它的前提是数据不能只进不出——必须有一个回路把数据「吃回去」。

二、我建了第一个回路

我做了两件事。

第一件:建了一个「好例子库」。从历史记录里筛出所有回复率 >30% 的岗位类型对应的开场白。不是只存一条——是以「岗位类型 + 语气风格」为维度,存了五到十条。技术岗的语气风格存一份、运营岗的存一份。下一次生成同样类型的开场白时——先把对应的好例子丢给模型当 few-shot,再说要求。

第二件:建了一个「坏例子库」。所有回复率 <10%、或者用户修改了超过 30% 内容的开场白——存起来。标记上「这个风格的不要」。下一次生成的时候——在 Prompt 里说「不要写成以下风格」,附上坏例子。

这两件事加起来大概写了两百行代码,花了一个晚上。效果立竿见影——用好例子做 few-shot 之后,技术岗和运营岗的回复率都涨了。涨得不多——大概 5 到 8 个百分点——但这是第一个从数据里长出来的改进,不是靠我猜的。

三、飞轮没转起来之前,先转起来再说

我跟小周说了这个事。他说:「你知道这叫什么吗?——人工飞轮。别人是用户生成数据 → 模型自己学 → 模型变好——你这边是用户生成数据 → 你手动挑 → 写成 few-shot → 模型变好。人力密集型的。」

我说:那至少我先把轮子推到能自己转起来的程度。如果我不做第一步,它永远飞不起来。

他说:「也是。比不转强。」

小周是对的——这还称不上真正的飞轮。真正的飞轮是自动的——数据进、模型参数更新、输出变好。我做的还是手动的——数据进、我挑、我写 few-shot。但先把回路建起来,哪怕目前是人工的,也比数据躺着强一百倍。

而且我做这件事的时候发现了一个规律:好例子的风格分布极其不均匀。技术岗有好几个好例子,运营岗也有——但市场岗和设计岗几乎没有。不是因为这些岗位的开场白写得差——是因为我数据里本身就缺这两个类型。问题不是「怎么让它变好」——是「我手上根本没有足够的数据让这个岗位类型转起来」。

我把数据按岗位类型分了桶。技术岗的数据最多——几百条,足够做好例子库。运营岗次之——几十条,能挑出一些。市场岗和设计岗——加起来不到二十条。不是这些岗位的回复率低——是这些岗位本身在数据里的占比就低。我产品早期主要做技术岗和运营岗——用户的分布决定了数据的分布。数据分布决定了飞轮能不能转起来。

所以我得先做判断:这两个冷启动的岗位方向,到底要不要推?如果推——我手上没有数据,只能靠人工写第一批好例子。如果不推——那它就一直冷着。这不是技术问题,是产品方向问题。

冷启动——设计岗和数据岗就是飞轮的冷启动区域。数据量不够,飞轮推不动。飞轮的第一个选择不是「怎么自动化」——是「要不要在这个方向用力推」。

四、阿 May 说她电脑上有二十个「最终版」

「你们数据库里几千条记录没人用——我电脑上有二十个『最终版』,每一个都比上一个『最终版』多改了一句话。」阿 May 说。

「我不是来跟你比惨的——我是说,东西堆着没用是常态。你们的数据库、我的电脑桌面,都一样。区别是你后来去用了,我还在堆。」

她这句话让我挺意外的。阿 May 从来不做一个说教者——她只是用一个景观设计师的直觉,把天底下所有行业的通病一句话说穿:东西堆着不用,就等于没有。

· · ·

五、坑在哪

坑一:只采不用。数据采了不用就是库存。仓库堆满了也不会自动变成飞轮。飞轮的第一步永远是「用起来」——哪怕用的方式很笨、是手动的。

坑二:等数据量够了再动手。数据量永远不够。有多少量做多少事——几十条数据能做 few-shot,几百条能做风格分类,几千条能做微调。在对应的量级做对应的事,而不是等到足够再做。

坑三:把飞轮当成一个技术问题。飞轮的第一步往往不是技术——是意识。意识到数据应该被吃回去,而不是只躺在数据库里。

· · ·

六、面试实战 · 当面试官问你怎么用数据改进产品

十二月二号,第六场面试,一家 AI 招聘平台。面试官姓张,上来就抛了一道很实务的题:

真题 · 新H6(迭代优化 · ★★★)
「你的产品上线之后,你是怎么做迭代的?举个具体的例子。」

(破题)这道题看起来跟你聊工作流程——但面试官其实在听你有没有「闭环意识」。迭代不是修 bug——迭代是把用户的每一次使用,变成产品下一次更好的原因。能说出一个完整回路的人——从发现问题到修复到验证——和只说『我每周根据反馈改一批东西』的人,是两种段位。

(翻存货)第一样是建好例子库的案例。用它。因为它有完整的回路——发现问题(数据躺着没用)→ 方案(建例子库做 few-shot)→ 验证(回复率涨了 5-8 个百分点)。
第二样是冷启动问题。用它展示你对飞轮局限性的认识。

(定结构)回路 + 结果 + 局限。维度:发现问题 → 动手修 → 看结果 → 知道还有哪里没修好。

口播稿 · 约 110 秒 「我拿数据飞轮这件事来说。

十一月末我翻了一次数据库——几千条开场白生成记录,很完整。但我发现一个问题:没有任何一条被用来让下一次生成变得更好。每一条都是独立生成的。

我先建了一个好例子库:从历史记录里筛出回复率大于 30% 的岗位类型的开场白——按岗位和语气做分类。下一次生成同样类型的开场白时,把对应的好例子先丢给模型当 few-shot。又建了一个坏例子库——回复率低于 10% 或用户修改超过 30% 的就存起来,在 Prompt 里说『不要写成这样』。

结果:技术岗和运营岗的回复率涨了大概 5 到 8 个百分点。不多——但这是第一次从数据里长出来的改进,不是靠我猜的。

但我也发现了另一个问题:设计岗和市场岗的好例子几乎为零——不是因为它们写得差,是因为我本来的数据量就不够。冷启动——数据量不够的时候飞轮推不动。我的办法是先人工喂,等到数据量上去了再自动化。」

(追问一)「那你现在这个好例子库是怎么维护的?」
——我答:目前还是手动的。每两周跑一次数据,把新的高回复率开场白加进去。频率不高,因为冷启动的岗位还没转起来。我的计划是先把每个岗位类型都推到有足够好例子的状态——然后再考虑自动化维护。目前量不大,手动维护完全够用。

(追问二)「你觉得数据飞轮最难的一步是什么?」
——我答:最难的是第一步——你得承认数据目前是死的。数据堆在那儿不丢,但它也不帮你变好。一旦你意识到「数据要吃掉」,后面的事都是执行问题。方向确定了,技术方案总能找到。但那个意识——很多人推了半年产品都没转过这个弯。

答复提案 · 「你是怎么迭代产品的」 v1 → v2 v1(废弃):「我每周根据用户反馈和数据分析做一次迭代。」——正确的废话。

v2(定稿)
· 开口白:「我拿数据飞轮这件事举例。」——用具体案例回答。
· 结构:发现数据躺着没用 → 建好例子库(few-shot)→ 建坏例子库(负样本)→ 结果(+5-8%)→ 局限(冷启动)。
· 30 秒版:「十一月我翻数据库——几千条记录没有一条被用来让下次生成变好。我建了好例子库——回复率 30% 以上的开场白,分类存好,下次生成当 few-shot。又建了坏例子库——回复率低于 10% 的,存起来当反面教材。结果:技术岗和运营岗回复率涨了 5 到 8 个百分点。但我发现设计岗和市场岗的好例子几乎为零——数据量不够飞轮推不动。所以现在先人工喂,等量上去了再自动化。」
· 锚点:三个数字——几千条记录/涨了 5-8%/两个岗位类型冷启动。一个案例名——好例子库。一句洞察——数据堆着不用等于没有。
· 取舍说明:放弃了讲多个迭代案例。代价是不够全面;收益是一个完整的回路故事比三个半截的案例更有说服力。
· 边界:这一版适合「你怎么迭代」。如果面试官问的是「你怎么做数据驱动决策」——需要回到具体的数据指标和决策逻辑。

· · ·

七、速查卡

新H8(数据思维)「你遇到过数据陷阱吗?」

他还会这么问:侧问——「数据一定是对的吗?」——哲学版,更好答,因为你可以直接说不对。
他在考什么:面试官面过太多被数据绑架的产品经理了——什么数据都看、什么指标都不敢放。他想要的不是你不看数据——是你知道数据什么时候靠得住、什么时候靠不住。
结论句:数据不骗人——但你解读它的方式会骗你自己。
三点口播稿:「说一个我踩过的数据陷阱。
第一,数据是真的,结论是错的。我上线了点赞按钮。数据上显示『好评率 85%』——大拇指朝上 /(朝上+朝下)= 85%。看起来用户满意度很高。但实际上总共只有 15 个人点了——三个踩十二个赞。这就是好评率 85%。分母太小的时候,再好看的百分比也没有意义。我差点拿这个数据去跟别人说『用户很喜欢我们产品』。
第二,分母陷阱不仅存在于反馈率——还存在于任何总量很小的分桶里。我发现『北京地区运营岗回复率 40%』,比全国平均高出一倍。当时很兴奋——以为自己找到了一个高潜力区域。后来一看:分母是 5 条。5 条里回了两条。这是 40%。不写分母的数据都是故事。
第三,我现在养成的习惯。后台的每一个指标,鼠标悬停上去都能看到分母。任何百分比旁边如果没带分母,我就不信。而且我学会了看数据之前先问一句:这个数背后是几条记录?
收口:所以数据陷阱不是数据在骗你——是你太想得到一个结论的时候,自然会挑那个好看的数来看。解决的办法不是不信数据——是看数据之前先问一句分母是多少。」
数据锚点:两个数字——85% 好评率跟 15 个人、40% 回复率跟 5 条数据。万能开头:「说一个我踩过的数据陷阱。」
一轮追问 + 应答:追问——「那你现在看数据还会被骗吗?」诚实追问。应答:「还会。但我现在骗自己的速度变慢了——以前看到一个好数字能开心半天,现在先查分母再开心。」
雷区:别说「我从不信单一数据」——这是标准答案,面试官听了一百次。说一个具体的事故。
30 秒版:「好评率 85%——听起来不错。实际上总共只有 15 个人反馈了,12 个赞 3 个踩。分母是 15。同样的事还发生过:『北京运营岗回复率 40%』——分母是 5 条,回了 2 条。所以我现在每个百分比先查分母,分母太小的时候任何百分比都是故事。」

新G8(产品思维)「什么是产品 sense?你有吗?」

他还会这么问:追问——「你觉得自己做产品最大的优势是什么?」——变体,答法一样。
他在考什么:这种题的陷阱是——你去背产品 sense 的定义。面试官不想听定义——他想听你用一个故事来证明你有。
结论句:产品 sense 是——你看到用户的一个行为,能猜出他背后那个没说出口的需求。并且有时候猜对了。
三点口播稿:「我说一个我觉得算是产品 sense 的时刻。
第一,我看到一个数字——用户不改直接发的比例在上升。这个数据一直都在后台,但我以前没当回事。直到有一天我意识到:不改直接发,不是用户懒——是他对内容满意到不需要改。这是一个没开口的需求:用户要的不是一个完美的开场白——是一个足够好、可以直接用的开场白。
第二,基于这个观察我做了一个决定。我不弹窗、不提示——把直接发送的路径做得比任何时候都顺。用户不需要为了确认而多花一秒。
第三,这个决定对了。发送量没有暴涨——因为本来就是在用的。但修改率下降了——用户对生成内容的挑刺意愿变低了。这个变化很小,但我知道方向是对的。
收口:所以我觉得产品 sense 不是什么玄学——是你看到一条没人注意的数据,然后问了一句『这个数据想告诉我什么』。有时候问对了,有时候问错了。问对的时候多过问错的时候——那就叫有产品 sense。」
数据锚点:一个行为——不改直接发比例上升。一个决定——简化发送路径。万能开头:「我说一个我觉得算是产品 sense 的时刻。」
一轮追问 + 应答:追问——「那你怎么知道自己问对了还是问错了?」关键的平衡追问。应答:「看用户行为有没有往你期望的方向变。改了直接发路径——修改率没涨反降,说明方向对了。如果路径改完之后用户反而不敢发了——那我就是问错了。答案不在我脑子里——在用户的行为数据里。」
雷区:别背定义。说一个具体的事——对面记住的是你的故事,不是你对产品 sense 的定义。
30 秒版:「我说一个我觉得算是产品 sense 的时刻。我看到用户不改直接发的比例在上升——不是懒,是对内容满意到不需要改。我做了一个决定:把直接发送的路径做得最顺,不给弹窗不提示。结果修改率反而下降了。我觉得产品 sense 不是玄学——是看到一条没人注意的数据,然后问『这想告诉我什么』。有时候问对了有时候问错了——问对的时候多过问错的时候,就叫有。」

新J3(指标体系)「你的产品用什么指标衡量成功?」

他还会这么问:侧问——「你怎么定义『产品做好了』?」——比正问尖锐,因为躲不开主观判断。
他在考什么:这道题最怕的是你报一串指标——DAU、留存、转化率、NPS——每个听起来都很对,但面试官听不出你真正在意什么。能说清楚你放弃了什么指标的人,比说清楚你用了什么指标的人更懂指标体系。
结论句:我只用一个北极星指标——回复率。其他都是辅助。
三点口播稿:「我的产品目前的北极星指标就一个——回复率。但我不是一开始就找到它的,我是放弃了很多指标之后留下的。
第一,我放弃过『生成数量』。用户每天生成多少条开场白——这个数字曾经是我最在意的。生成多说明活跃。后来发现,生成再多,没人用出去也白搭。用户可能一连生成了五条,每一条都不满意——最后关闭页面走了。生成数量告诉你『他们在用』——但不告诉你『用得好不好』。
第二,我放弃过『修改率』。用户修改AI生成的文本——修改率高说明用户对AI的输出不信任。但我后来发现修改率高也可能是用户很挑剔——他不是不信你,他是对自己有要求。所以单看修改率没有意义。我后来只看修改的内容类型——他改的是语气词还是事实——这个才告诉我是『不信任』还是『个性化需求』。
第三,我最后的北极星只有一个——回复率。HR回了就是好开场白,没回就是不好。其他所有指标——生成数量、修改率、页面停留时长——都只是这个北极星的相关变量。它们之间有相关性,但只有一个因果关系:回复率高就是有用。
收口:所以产品成功与否对我只有一个标准——用户拿去用了之后,有没有产生他想要的结果。其他的数都是中间变量,好看或者不好看,都不如那一个数重要。」
数据锚点:三个放弃的指标(生成数量、修改率、页面停留时长)。一个北极星(回复率)。万能开头:「我的北极星指标就一个——回复率。但我不是一开始就找到的。」
一轮追问 + 应答:追问——「回复率如果有噪音呢?比如 HR 回了但只是自动回复。」合理的质疑。应答:「所以我现在把回复分了两层——「有回复」和「有效回复」。有效回复的标准是:HR 问了问题、约了面试、或者表达了进一步沟通的意向。自动回复(『已收到』『谢谢』)算有回复但不计为有效。但说实话——数据量上来之前,有回复和有效回复的区分意义不大。先攒够量,再精细化。」
雷区:别报一串指标。面试官想听的是你做取舍的理由,不是你的指标字典。
30 秒版:「我的北极星指标只有一个——回复率。HR 回了就是好,没回就是不好。我放弃过很多指标:生成数量——生成再多没人用也白搭。修改率——改得多不一定是坏事,要看改的是什么内容。其他所有指标都只是回复率的相关变量。只有一个因果关系——回复率高就是有用。」

· · ·

八、这一章我真正学会的那一招

知识上我学会了数据飞轮和冷启动。但让我晚上睡不着的是另一个问题。

回看前四个月,我一直在「做新功能」——加 Prompt、加分支、加按钮。但我从来没停下来问过:我手上已经有了什么?这些东西能不能变成下一件事的起点?

几千条数据躺在那里——我视而不见。不是因为我不知道数据库有数据——是因为我默认「数据是存来以后有大用的」。这个想法跟阿 May 那二十个「最终版」是同一个心理——我们都在攒,以为攒够了自然会变好。

不会的。数据堆着不会自动变成飞轮。只有当你开始用它的时候,它才开始转动。

「数据堆在那儿不用,就等于没有。最便宜的改进方式往往不是加新功能——是把已经有的东西用起来。」

而且这句话倒过来说也成立:最贵的改进方式不是失败了——是成功了但你不知道为什么成功,所以下次还得猜一次。以前我改 Prompt 靠感觉——改完效果好了,但我不知道是改对了、还是那天模型状态好。现在有了好例子库,每次改完跑一遍回归集,再看看好例子库里的案例有没有被新版本覆盖——至少我知道效果是不是真的变好了。

十二月一号晚上,我在本子后半页写下第十四条:

「最便宜的改进不是加法——是把已经有的东西用起来。几千条数据不会自动变成飞轮,你先手动推一下,它才开始转。」

本子后半页十四条了。前半页停在第十八页。中间那沓还剩不到十页。

【掉落】数据堆着不用,等于没有。飞轮不是等数据量够了才开始转——是先手动推起来,再慢慢自动化。好例子做 few-shot,坏例子做负样本——两百行代码就能建一个最简单的飞轮回路。

AI 产品 PMF 验证与移动靶

AI 的 PMF:双重验证 × 移动靶 ① 需求验证 市场要不要:留存/付费 传统产品也要验 NPS/复购/转介绍 回答「用户要不要」 ② 模型能力验证 AI 特有:模型撑不撑得起 任务成功率/边界测试 Demo 惊艳 vs 量产拉胯 回答「产品承诺兑现吗」 ③ 移动靶应对 模型能力一年一变 版本升级重新验证 失败功能可能复活 靶子在动,瞄线要跟着动 收口:AI 的 PMF = 需求双验证 + 能力动态跟踪——需求是锚,能力是变量 ① 大白话定义:这一题拆成两半:第一半,AI 产品的 PMF 怎么验证——PMF(Product-Market Fit,产品市场匹配)指「产品被市场真正需要,用户离不开、愿意付费」——传统产品验证 PMF 只验一半:需求(用户要不要);AI 产品要验两半:需求验证(要不要)加模型能力验证(模型做不做得到产品承诺的效果——Demo 里惊艳的功能,量产时模型撑不撑得起)。第二半,为什么说 AI 时代的 PMF 是「移动靶」——需求没怎么变(人要写文案、画图、做客服),但模型能力在快速变(一年一个大版本,能力翻倍)——上季度模型做不好、PMF 验证失败的功能,这季度模型升级可能就成立了;反过来,验证通过的功能可能被更强的通用模型免费覆盖——靶子(模型能力)一直在动,你的产品定位瞄线就得跟着动——「需求是锚,能力是变量——AI 的 PMF 不是验一次就完,是跟着模型版本反复验」。

打个比方:PMF 验证像「开新餐馆验证有没有客人」——传统产品验证像「试菜」:菜端上来,客人吃不吃、回不回头(需求验证)——AI 产品验证像「试菜加试后厨」:菜单上写的「分子料理」,后厨能不能真做出来(模型能力验证)——菜单漂亮(Demo 惊艳)但后厨做不出(模型量产拉胯),客人吃了第一次就不来第二次——「AI 产品的 PMF:前厅验客人,后厨验手艺——两半都过了,才算真匹配」。移动靶像「射箭打移动靶」——靶子(模型能力)不是死的,一直在动——你瞄的是上季度模型的位置,箭射出去(产品上线)时靶子已经移到别处了——「靶子在动,瞄线要跟着动——AI 产品的定位是动态的,验证也是动态的」。

30 秒电梯版:「AI 的 PMF 验证是双重验证:一是需求验证(传统产品也有的——用户要不要、留不留、付不付费),二是模型能力验证(AI 特有的——模型做不做得到产品承诺的效果,任务成功率、边界测试,防止 Demo 惊艳量产拉胯)。为什么是移动靶:需求变化不大,但模型能力一年一个大版本——能力升级,上季度失败的功能可能复活,验证过的功能可能被通用模型覆盖——所以 AI 的 PMF 不是验一次,是跟着模型能力反复验证、动态重定位——需求是锚,能力是变量。」

② 为什么学:第一,它是「AI 产品成败的第一道关」——PMF 没过,投入再多也是白费——「先验证再投入,是 AI 产品经理的第一课——PMF 没过的产品,团队再努力也是给错误方向打工」;第二,它考「双重验证思维」——普通产品经理只想到需求,AI 产品经理还要想到模型能力——「能说出双重验证的人,做过 AI 产品的坑——只验需求不验能力的,被量产拉胯打过脸」;第三,它是「动态思维」的标杆——模型能力是变量,产品定位要跟着变——「传统 PMF 是静态题,AI 的 PMF 是动态题——会打移动靶的人,才是 AI 时代的产品经理」;第四,它是面试高频题——「AI 产品怎么验证 PMF」「Demo 很惊艳为什么实际不行」——「答得出双重验证加移动靶的人,面试官知道你有 AI 实战手感」;第五,它练「科学验证方法」——留存、付费、任务成功率——「验证方法越科学,决策越靠谱——拍脑袋的 PMF 是赌博」;第六,它连接「模型评估」——模型能力验证要用评估集——「PMF 验证是产品端的事,模型评估是技术端的事——两头都要会,才是完整的 AI 产品人」;第七,它是「防自嗨」的刹车——Demo 惊艳不代表 PMF——「团队最容易死在『Demo 很好看』的幻觉里——双重验证是那盆清醒的冷水」。

③ 原理拆解:这一题拆成「三块」:

第一块,需求验证——验「市场要不要」,方法和传统产品一样:留存(第二周还有多少用户回来——留存是最诚实的 PMF 指标,用一次就跑是好奇不是需求)、付费(多少人愿意掏钱——愿意付费的需求才是真需求,免费用户的热情不值钱)、口碑(NPS 净推荐值加转介绍率——用户会不会主动推荐给别人,推荐才是需求的放大器)。打个比方:这像「餐馆试菜」——菜好不好吃,看客人回不回头(留存)、愿不愿意付钱(付费)、会不会带朋友来(口碑)——「一次来的客人是好奇,回头的客人才是生意——留存、付费、口碑三把尺子,量出真需求」。翻车案例:有 AI 绘画工具上线前砸钱投流,首周新增 50 万用户,团队庆祝——第二周一看,次日留存 5%,三个月付费转化 0.1%——用户是被广告吸引来「试一下 AI 画画」的,不是真有需求——「拉新一时爽,留存火葬场——没有留存的需求是假需求,假 PMF 比没有 PMF 更烧钱」。

第二块,模型能力验证——验「模型撑不撑得起产品承诺的效果」,这是 AI 产品特有的:任务成功率(模型在真实场景跑 N 个任务,成功多少——Demo 挑的都是好样本,量产跑的是真实样本——真实任务成功率才是真能力);边界测试(输入的变化范围——用户方言、错别字、图片模糊、长文本——模型在边界上怎么表现);成本与延迟(每单推理成本多少、响应多快——能力达标但成本是收入的五倍,产品也立不住——「模型能力验证三连问:做得到吗?边界稳吗?成本撑得住吗?」)。打个比方:这像「后厨试菜」——菜单上写「分子料理」,厨师(模型)能不能真做出来——试了十道招牌菜都惊艳(Demo),但客人点普通菜(真实场景)也做砸——「菜单靠招牌菜撑门面,生意靠家常菜撑长期——模型能力验证要跑真实样本,别让 Demo 样本骗了你」。翻车案例:有公司做 AI 客服,Demo 视频里模型应答如流,投资人眼前一亮——上线后真实对话进来:方言听不懂、用户骂人接不住、多轮追问转圈圈——人工接管率 60%,客服团队比原来还累——「Demo 里是精选样本,量产里是真实世界——模型能力验证跑的是真实任务成功率,不是 Demo 精选率」。

第三块,移动靶应对——模型能力在变,产品怎么跟:能力监控(模型版本升级时重新跑评估集——能力涨了没、边界稳了没——「版本升级不是技术部门的事,是产品定位的事——每次升级重新验证一次 PMF」);机会雷达(能力升级会打开新功能空间——上季度做不了的「AI 视频剪辑」,这季度模型行了——「能力到了,之前失败的功能可能复活——失败记录要留好,别当垃圾删了」);防御设计(能力同质化的应对——模型大家都能用,你的差异化在数据、场景、体验——「模型能力是公共的,产品能力是自己的——移动靶时代,护城河在数据和工作流里」)。打个比方:这像「猎人在移动靶场上打猎」——靶子在动,你不能瞄准上次的位置开枪(能力监控);靶子移到新位置,正好是你练习过的区域(机会雷达);枪法是大家的(模型人人可用),但你对这片猎场的熟悉程度是自己的(数据加场景)——「靶子在动,三件事:盯着它、等它来、靠熟悉度赢——移动靶时代的生存法则」。翻车案例:有创业团队押注「老模型做不好」的功能做产品——「老模型写不了长文案,所以我们做长文案工具」——结果 GPT-4 发布,大厂免费功能直接覆盖,用户全跑了——「赌模型能力『做不到』,是移动靶时代最危险的赌注——你赌的能力瓶颈,可能下季度就被模型升级击穿——要赌就赌数据、场景、体验这些模型给不了的东西」。

④ 对比表格:

维度传统产品 PMFAI 产品 PMF移动靶应对
验证对象需求一项需求+模型能力双重动态跟踪能力变化
主要指标留存/付费/口碑+任务成功率/边界/成本+能力升级复测
验证频次验一次基本定型随模型版本反复验每次版本升级重跑
失败原因需求不存在需求假 或 模型撑不起押注旧能力/被新能力覆盖
类比试菜试菜+试后厨射移动靶


一句话总结:AI 的 PMF = 前厅验客人(需求)+ 后厨验手艺(能力)+ 随时盯靶子(动态)——双重验证加动态跟踪,才是完整的 AI 版 PMF。

⑤ 3+ 个例子:

例一,面试回答「AI 产品怎么验证 PMF」——回答:「双重验证:第一重需求验证——第二周留存(用一次就跑是好奇不是需求)、付费率(愿不愿意掏钱)、NPS(会不会推荐给别人);第二重模型能力验证——真实任务成功率(Demo 是精选样本,量产是真实样本)、边界测试(方言、错别字、模糊输入)、成本延迟(每单成本撑不撑得住收入);再加动态跟踪——模型版本升级重新跑评估集,失败过的功能可能复活,验证过的可能被覆盖——需求是锚,能力是变量」。为什么典型:它演示「完整的 AI 版 PMF 框架」——传统产品经理答到留存付费就停,你多答一层模型能力加动态跟踪——「多答的一层,就是 AI 产品经理和普通产品经理的分界线」。

例二,AI 客服的 PMF 验证——需求验证:上线前先找 50 家企业试用,两周后看多少家继续用(留存)、多少家愿付月费(付费)——模型能力验证:拿过去三个月真实工单当评估集,跑任务成功率——发现「退款咨询」成功率 92%,「投诉安抚」只有 31%——结论:需求是真的,但模型撑不起投诉场景——先只做退款咨询场景上线,投诉场景人工兜底。为什么典型:它演示「双重验证怎么改变产品范围」——能力不足不是砍产品,是先收缩场景再逐步扩——「PMF 验证的产出不是『通过/不通过』,是『哪些场景过、哪些不过』——验证的目的是划清能做的边界」。

例三,AI 绘画工具的「移动靶」时刻——2023 年初团队做「AI 写真」工具:模型把真人照片转动漫风格,质量一般但有付费意愿——2023 年中模型大升级,动漫风格质量暴涨——但大厂同日上线免费功能,用户一夜全跑——团队复盘:死在「只押模型能力」上,没有数据(用户风格偏好库)没有场景(垂直人群专属玩法)护城河——转型做「证件照+职业照」垂直场景加简历工作流,活了下来。为什么典型:它演示「移动靶被击中的完整剧本」——能力升级既是机会也是威胁——「被覆盖不是末日,转型垂直场景才是出路——移动靶时代,通用能力靠不住,垂直深耕才靠得住」。

例四,生活场景——小区门口新开了一家「AI 心理咨询聊天机器人」体验店——需求验证:来体验的人多不多、第二次还来不来(留存)、愿不愿意办卡(付费)——能力验证:真实聊 100 个来访者,看多少能接住(真实任务成功率)——发现轻度焦虑聊得很好,重度抑郁的来访者聊完状态更差——结论:能力边界在「轻症疏导」,重度人群不但不该做还要出免责提醒——「生活里的 AI 产品处处要双重验证——验出能力边界,才知道能服务谁、不能服务谁」。为什么典型:它演示「能力验证的伦理价值」——模型能力边界直接关系用户安全——「能力验证不只是商业问题,还是责任问题——知道模型不能做什么,比知道能做什么更重要」。

例五,传统产品 vs AI 产品的 PMF 对比——传统外卖 App:验证「附近的人要不要点外卖」——需求验证过了就基本成了(功能做出来就能兑现);AI 点餐助手:验证「要不要」(留存付费)加「模型能不能听懂点餐」(方言、生僻菜名、加辣减辣多轮修改)——传统产品验证一次,AI 产品每次模型升级都要复验。为什么典型:它演示「同一场景、两套验证」——让面试官一眼看到差别——「对比是回答『与传统 PMF 有何不同』的最佳结构——同一个场景摆出来,不同在哪一目了然」。

⑥ 常见误区:误区一,只看需求不看能力——「用户要 AI 写周报,需求验证过了就冲」——「模型写出来像小学生的周报,需求再真也留不住人——双重验证,缺一不可」;误区二,用 Demo 当验证——「Demo 惊艳就是 PMF」——「Demo 是精选样本,量产是真实世界——Demo 验证的是『能做一个』,量产验证的是『能做一万个还不崩』」;误区三,PMF 验一次就完——「上线验证过就高枕无忧」——「模型一年一个大版本,能力在变、竞争在变——AI 的 PMF 是体检,要定期做」;误区四,赌模型做不到——「老模型做不好,所以我们做——「赌能力瓶颈是移动靶时代最危险的赌注——下季度模型升级就把你击穿」;误区五,能力不足就砍产品——「投诉场景模型不行,整个客服产品砍掉」——「能力不足是收缩场景加人工兜底,不是砍产品——边界内先跑起来,能力到了再扩」;误区六,验证指标堆数量——「拉新 50 万就是 PMF」——「拉新是虚荣指标,留存付费才是诚实指标——虚荣指标骗团队,诚实指标骗不了人」。

⑦ 第一人称面试回答:「AI 产品的 PMF 验证,我分三块答:第一,需求验证——留存(第二周还有多少回来)、付费(多少人愿意掏钱)、口碑(会不会推荐给别人)——需求是真的,才有后面的一切;第二,模型能力验证——真实任务成功率(跑真实样本,不是 Demo 精选样本)、边界测试(方言、错别字、长文本)、成本延迟(每单推理成本撑不撑得住收入)——AI 产品特有的,Demo 惊艳量产拉胯的坑都埋在这;第三,移动靶——模型能力一年一个大版本,能力监控(升级就重新跑评估集)、机会雷达(能力到了失败过的功能可能复活)、防御设计(差异化押在数据、场景、体验上,不押在模型能力上——模型能力是公共的,产品能力是自己的)。我做景观设计时也遇到过类似的『双重验证』:方案效果图做出来美轮美奂(Demo),但施工队能不能按图纸做出来是另一回事(能力验证)——石材、坡度、排水有一项落地不了,效果图就是 PPT 公园——后来我们做方案都先跑『样板段』(最小可行验证):先做十米样板段,材料、工艺、效果全验过,再全园铺开——这和 AI 产品的双重验证一模一样:样板段验过的,才敢全量上线。」

⑧ 小结口诀:AI 版 PMF 口诀——「一需求,留存付费看真相;二能力,真实样本成功率;三移动靶,版本升级重新验——需求是锚,能力是变量,双重验证打靶不慌。」

⑨ 三轮追问:

追问一:模型能力验证的「真实任务成功率」怎么定义?

答:四步定标准——任务拆解(把产品功能拆成原子任务——AI 客服拆成「识别意图」「检索知识库」「生成回复」——每个原子任务单独测);评估集构建(从真实生产环境抽 100 个代表性样本加边界样本——「评估集要来自真实世界,不是团队拍脑袋写的」);判定标准(每个任务的『成功』标准写清楚——「生成回复」的成功 = 答案正确加语气合适——标准不写清,评估就是各说各话);双人标注(两个标注员独立打分,不一致的讨论定案——「成功率要有公信力,标注就得双人背靠背」)。

面试官想听什么:考察「评估工程化思维」——知道成功率不是拍脑袋算的——「能说出评估集构建细节的人,做过真实模型评估」;也考察「严谨性」——评估标准不糊弄。

追问二:移动靶时代,怎么判断该押注哪个方向?

答:三条筛线——数据护城河(这个方向有没有独有数据——用户行为数据、行业数据——数据是模型给不了的,押它);场景黏性(用户换到别家的成本高不高——深度集成在工作流里的功能用户离不开——「通用工具易替代,嵌在工作流里的功能才是家」);体验纵深(能不能把单一能力做成完整体验闭环——不只「生成」还有「修改-审校-发布」全流程——「单点能力大厂三天覆盖,体验闭环大厂三个月不一定追上」)。

面试官想听什么:考察「护城河思维」——移动靶时代的押注判断——「能说出数据、场景、体验三条线的人,有 AI 竞争格局认知」;也考察「格局」——知道能力同质化是必然趋势。

追问三:模型能力验证没通过,产品就不能上线了吗?

答:不是——分三种处理:能力差一点(任务成功率 70%,边界偶发小错)——上线加人工兜底(关键场景人工复核)加用户知情(页面标注「AI 生成,人工复核中」);能力差很多(核心任务成功率不到 50%)——收缩场景(只上成功率高的子场景,其余灰度)加透明承诺(不承诺做不到的);能力差到有害(客服安抚场景越聊越糟)——坚决不上线加免责机制——「能力验证的目的是划清可上线的边界,不是一刀切——边界内上、边界外等、危险的不碰——三档处理,产品才有节奏」。

面试官想听什么:考察「灰度思维」——验证失败不等于产品判死刑——「能分三档处理的人,管理过真实上线的取舍」;也考察「风险意识」——知道哪些场景坚决不能上线。

⑩ 进阶加分点:第一,能说「PMF 验证的定量仪表盘」——三个核心指标挂墙上:次周留存(需求端)、真实任务成功率(能力端)、单位经济模型(毛利 = 收入 − 推理成本 − 获客成本——「PMF 不是感觉,是仪表盘——三个数天天看,转没转起来一目了然」);第二,能说「模型能力验证的 A/B 双模型」——同一个评估集,老模型 vs 新模型同时跑——「能力升级不是看版本号,是看评估集分数——A/B 双跑,升级才敢上」;第三,能说「移动靶的『复活机制』」——失败功能存档制度:每个验证失败的功能写清「失败原因+当时模型版本+能力缺口」——模型升级后自动复查清单——「失败记录是移动靶时代的资产——能力到位那天,存档就是复活券」;第四,能说「竞品能力扫描」——每季度跑一遍头部竞品的核心功能评测——「移动靶不止你的靶子动,竞品的靶子也在动——季度竞品扫描,别让对手先射中」;第五,能说「PMF 验证与融资节奏的配合」——种子轮验证需求、A 轮验证模型能力可规模复制、B 轮验证单位经济模型——「验证不是一次考试,是融资路上的里程碑——每个阶段的验证重点不一样」。

⑪ 话术库:

开场话术:「AI 的 PMF 是双重验证加移动靶——需求是锚,能力是变量。」

需求话术:「留存是最诚实的 PMF 指标——用一次就跑,是好奇不是需求。」

能力话术:「Demo 是精选样本,量产是真实世界——真实任务成功率才是真能力。」

移动靶话术:「靶子在动,瞄线要跟着动——上季度失败的功能,这季度可能复活。」

防御话术:「模型能力是公共的,产品能力是自己的——护城河在数据、场景、体验里。」

收口话术:「双重验证,三块拼图——需求、能力、动态——拼齐了,AI 产品才立得住。」

⑫ 小白 Q&A:

Q1:PMF 是什么?为什么老听人说「先找 PMF」?

A:PMF 是 Product-Market Fit,产品市场匹配——就是「你的产品被市场真的需要、用户离不开、愿意付费」——「先找 PMF」的意思是:别急着做大功能,先确认有人真的需要——没有 PMF 的产品,做得越精致死得越快——「PMF 是『有人要』,增长是『更多人要』——顺序不能反」。

Q2:为什么 AI 产品要多验一层「模型能力」?

A:因为传统产品的功能做出来就是做出来了(外卖 App 能下单就能用),AI 产品的功能是模型「生成」的——模型可能时好时坏、边界不稳、成本贵——「传统产品买的是确定性,AI 产品买的是概率——概率的产品,就要验概率到底多少」。

Q3:为什么说 PMF 是移动靶?靶子是什么?

A:靶子是模型能力——需求(要写文案、画图、做客服)一直没变,但模型能力一年一个大版本(去年写不好长文案,今年能写了)——靶子动了,你的产品定位就得跟着动——「需求是靶心,能力是靶子——靶心没变,靶子一直在动」。

Q4:验证 PMF 一般要多久?

A:需求验证 4-8 周(看留存曲线和付费),能力验证可以更快(评估集跑起来一周出数)——但 AI 产品还有「动态复验」:每次模型大版本升级都要重跑——「AI 的 PMF 验证不是一次性的考试,是定期的体检——4-8 周第一次,之后跟着版本走」。

Q5:AI 产品 PMF 没过的表现是什么?

A:三件套症状——留存差(次周留存低于 20%,用户来一次就走)、任务崩(核心功能真实成功率不到 60%,用户开始骂)、成本炸(每单推理成本比客单价还高,做得越多亏得越多)——「三个症状凑齐,PMF 基本没戏——别硬撑,回去重验」。

Q6:模型能力会一直涨,那我是不是躺着等就行?

A:不行——能力涨了,竞争也涨了(大厂免费覆盖),而且你的数据积累不会自动发生——「能力是大家的,数据是自己的——等模型涨的时候,你的数据和工作流也要同步涨——躺着等的人,等到的是被覆盖」。

⑬ 没人告诉你的事:第一,「PMF 验证最容易被『老板拍板』跳过」——老板觉得需求明显,直接全量投入——「PMF 验证不是流程,是保命——被跳过的验证,最后都会以十倍成本补回来」;第二,「模型能力验证的评估集,是产品经理的资产」——每个任务样本、每条判定标准都是团队的财富——「评估集是 AI 产品的『测试题』——团队走了,评估集还在,能力验证就有基准」;第三,「『模型升级就重新验证』这句话,80% 的团队没做到」——版本升级时大家忙着追新功能,没人回头重跑评估——「重跑评估集只要半天,但拦住的翻车值一年——复验是便宜的保护伞」;第四,「失败功能的存档,是移动靶时代最被低估的资产」——能力升级那天,存档就是你的复活券——「别人验证失败就删,你把失败留档——模型升级日,就是你抄底日」;第五,「PMF 验证的『单位经济模型』要算上推理成本」——传统产品算毛利只算开发运营,AI 产品每单都有推理费——「AI 产品的毛利 = 收入 − 推理成本 − 获客成本——少算推理成本,赚的钱会被模型悄悄吃掉」;第六,「移动靶时代的红利是『能力日历』」——关注头部模型的发布节奏(一年两次大版本),把验证节点排进日历——「知道模型什么时候升级,产品定位就敢提前半步——能力日历是 AI 产品经理的运营日历」。

⑭ 做一件事:今天选一个你手机里常用的 AI 功能(语音助手、AI 修图、AI 翻译都行),做一次「双重验证」体检:需求端——你上次用它是什么时候?一个月没用过的话,它算不算你的真需求?付费端——如果它每月收 20 元,你还用吗?能力端——挑三个真实场景各试一次(比如语音助手:设闹钟、查天气、问复杂问题),记录成功/失败——最后写三行结论:需求真不真、能力稳不稳、你会不会推荐给别人——「给自己手机里的 AI 做一次 PMF 体检,你就知道『双重验证』是什么手感——练过一次,面试题就有真素材」。

⑮ 求职助手联系:把「双重验证加移动靶」写进你面试「AI 产品 PMF」的答案里,面试官大概率追问「你的评估集哪来的」——答「从真实生产环境抽 100 个样本:正常样本 70 个加边界样本 30 个(方言、错别字、长文本、图片模糊),双人背靠背标注,不一致的讨论定案——评估集是团队的资产,版本升级重跑一遍就有对比」——追问就接住了。如果被问「你练过什么真实案例」,答「我给自己手机里的 AI 修图做过双重验证:需求端——我用它修过 12 张照片但都发在朋友圈,说明照片场景是真需求;能力端——人像磨皮成功率 100%,但文字图片(截图)识别成功率不到 30%,边界不稳——结论:修人像是边界内的功能,修文字图要等模型升级——移动靶:两个月后新版本文字识别明显好了,我重新验证一遍,果然能用了——能力验证失败的功能,模型升级后真的会复活——这个体验让我彻底理解了『移动靶』」。

⑯ 练习:

练习一:把双重验证按顺序排出来——模型能力验证 / 需求验证 / 动态跟踪——各写一句话作用。

练习二:模型能力验证的三连问是什么?各配一个具体指标。

练习三:「移动靶」的三个应对动作是什么?各配一个具体例子。

练习四:用「开餐馆试菜加试后厨」的类比,把双重验证讲给一个不懂产品的人听。

练习五:给一个 AI 文档助手(写周报/写邮件)设计 PMF 验证方案——需求端和模型端各两个指标。

练习六:如果你负责的 AI 功能「模型能力验证失败」(任务成功率 40%),写出你的三档处理方案。

答案要点:练习一顺序——需求验证(市场要不要:留存付费口碑)、模型能力验证(模型撑不撑得起:真实任务成功率)、动态跟踪(模型版本升级重新验证)——「先验需求,再验能力,最后动态跟——顺序就是 AI 产品的验证节奏」;练习二三连问——做得到吗(真实任务成功率,真实样本 100 个)、边界稳吗(边界测试通过率,方言错别字模糊输入)、成本撑得住吗(单位经济模型,毛利 = 收入 − 推理成本 − 获客成本)——「三连问三个数,能力验证不糊弄」;练习三三个动作——能力监控(模型版本升级重新跑评估集,A/B 双模型对比)、机会雷达(失败功能存档,能力到位自动复查)、防御设计(差异化押数据、场景、体验,不押模型能力)——「盯靶子、等靶子、靠熟悉度赢——三动作缺一不可」;练习四复述要点——传统验证像试菜(客人吃不吃回不回头),AI 验证像试菜加试后厨(菜单写的分子料理后厨做不做得出来)——「前厅验客人,后厨验手艺——两半都过了,才算真匹配」;练习五要点——需求端:次周留存(第二周还有多少人回来用)、付费意愿(免费转付费转化率);模型端:周报任务成功率(真实周报样本 100 篇,成功多少)、边界测试(用户乱写、错别字、口语化输入的表现)——「需求问留存付费,能力问成功率边界——四指标跑完,PMF 一目了然」;练习六三档——差一点(成功率 70%):上线加人工兜底加用户知情标注;差很多(40%):收缩场景(只上成功率高的子场景)加透明承诺;有害(越聊越糟):坚决不上线加免责机制——「边界内上、边界外等、危险的不碰——三档处理,产品有节奏」。六题全过,这一题通关。

Product-Model-Fit 产品模型匹配

Product-Model-Fit:承诺 × 兑现 ① 产品承诺 产品对用户承诺的效果 Demo 里展示的样子 菜单上写的菜 承诺越高落差越大 ② 模型兑现 模型真实能做到的效果 真实输入分布下跑 成功率/边界/成本 后厨做不做得出来 ③ 匹配度 承诺 ≤ 兑现 才叫 Fit Demo 是精选样本 量产是真实世界 落差=口碑崩塌点 收口:P-M-Fit 是「承诺不超过兑现」——Fit 了,口碑才是正资产 ① 大白话定义:Product-Model-Fit(产品-模型匹配,简称 P-M-Fit)是指「产品对用户承诺的效果,模型能不能稳定兑现」——产品说「AI 帮你写周报」,模型写的周报是不是真的能用(不只是 Demo 里挑出来的那份)——P-M-Fit 和 PMF 的区别:PMF 是「市场与产品」的匹配(用户要不要),P-M-Fit 是「产品与模型」的匹配(产品承诺的效果,模型做不做得到)——PMF 没解决,产品没人用;P-M-Fit 没解决,用户来了就跑了——「PMF 是开门的钥匙,P-M-Fit 是留客的菜——门开了菜难吃,客人走得更快」。为什么很多 AI 产品 Demo 出色但实际难达市场预期——核心就一句话:Demo 是精选样本,量产是真实世界——Demo 挑的是模型最好的输出(精心设计的提示词、干净的输入、理想场景),量产跑的是真实输入(方言、错别字、模糊图片、长尾需求、嘈杂环境)——模型在真实分布上表现远不如精选样本——再加三个放大器:成本(Demo 跑一次不心疼,量产每单都是钱)、延迟(Demo 等十秒可以,量产十秒用户走了)、稳定性(Demo 跑十次都行,量产百次里出三次错就崩口碑)——「Demo 给投资人看的是上限,量产给用户交付的是下限——上限惊艳、下限崩盘,落差就是口碑崩塌点」。

打个比方:P-M-Fit 像「婚纱照和婚礼现场的差距」——婚纱照(Demo)是精修过的:光线最好、角度最挑、修图师精修三天——婚礼现场(量产)没法选光线、没法重拍、灯光角度全是随机的——「婚纱照惊艳不等于婚礼现场好看——Demo 是精修图,量产是原相机」。另一个比方:像「菜单和后厨」——菜单(产品承诺)写着「分子料理」,后厨(模型)能不能真做出来——菜单写得越漂亮,后厨做不出时客人的失望越大——「承诺是菜单,兑现是后厨——P-M-Fit 就是让菜单和后厨对齐」。

30 秒电梯版:「Product-Model-Fit 是『产品承诺的效果,模型能不能稳定兑现』——PMF 问市场要不要,P-M-Fit 问模型做不做得到。为什么 Demo 出色但实际难达预期:Demo 是精选样本(模型最好的一次输出),量产是真实世界(方言、错别字、长尾需求全来)——真实分布上表现远差于精选样本;再加三个放大器:成本(每单都是钱)、延迟(十秒等不起)、稳定性(百次出错三次口碑就崩)——Demo 给投资人看上限,量产给用户交付下限——上限惊艳、下限崩盘,落差就是口碑崩塌点——P-M-Fit 就是让承诺不超过兑现。」

② 为什么学:第一,它是「AI 产品翻车」的总根因——市面上大量 AI 产品 Demo 惊艳、上线扑街,根子都在 P-M-Fit 没解决——「答得出 P-M-Fit 的人,看 AI 产品翻车一眼看到根——说不出的,还在看热闹」;第二,它考「承诺管理」——产品经理的承诺不只是给老板的,也是给用户的——「P-M-Fit 的本质是承诺管理——承诺超过兑现,口碑就是负资产——会管承诺的人,产品活得久」;第三,它是「Demo 陷阱」的清醒剂——Demo 做得越惊艳,越要警惕 P-M-Fit——「团队最容易死在 Demo 好看里——P-M-Fit 是那盆冷水:上限好看没用,下限稳定才行」;第四,它是面试高频题——「为什么 AI 产品 Demo 出色但实际难达预期」——「答得出『精选样本 vs 真实世界』加三个放大器的人,面试官知道你看过真实 AI 产品」;第五,它连接「模型评估」——P-M-Fit 的验证工具是评估集——「评估集是 P-M-Fit 的体检报告——没有评估集的产品,Fit 全靠感觉」;第六,它是「技术风险预判」的代表——AI 产品的技术风险不在「做不做得出」,在「稳不稳定做得出」——「传统产品上线是交付,AI 产品上线是开始——稳定兑现是 AI 产品的长期仗」;第七,它是「口碑经济学」——一次翻车,十个好评补不回来——「AI 产品的口碑是非线性的——用户对 AI 的容错率低(AI 应该更聪明),出错一次流失一片——P-M-Fit 是口碑的防火墙」。

③ 原理拆解:这一题拆成「三块」:

第一块,P-M-Fit 是什么——「产品承诺的效果」和「模型兑现的能力」之间的匹配:承诺端(产品对外展示的效果——「AI 帮你写周报」「AI 一键修图」——承诺在 Demo、文案、宣传里,用户看到的是承诺);兑现端(模型在真实世界稳定做到的效果——真实任务成功率、边界表现、成本延迟);Fit 的定义(承诺 ≤ 兑现——承诺的效果模型稳定做得到,叫 Fit;承诺 > 兑现——Demo 里能做到、量产做不到,叫 Gap——「P-M-Fit 不是『模型多强』,是『承诺和兑现对齐没对齐』——模型再强,承诺吹得更高,照样不 Fit」)。打个比方:这像「婚纱照和婚礼现场」——婚纱照(承诺)精修到完美,婚礼现场(兑现)是真实光线——承诺和兑现的差距越大,新人婚礼当天的落差越大——「聪明的婚庆公司不修图修过头——留一点真实的预期,婚礼现场才有惊喜——承诺管理,婚纱摄影行业早就懂了」。翻车案例:有 AI 视频产品 Demo 里生成的「古风女子回眸」惊艳全网,播放千万——上线后真实用户生成:人脸崩坏、动作僵硬、一分钟视频等二十分钟——差评潮、退款潮——「Demo 是团队精心调的样本,量产是百万用户乱糟糟的输入——Demo 惊艳不是错,错的是把惊艳当承诺卖」。

第二块,Demo 出色但实际难达预期的五个原因——样本差(Demo 挑精选样本:干净输入加精心提示词;量产跑真实分布:方言、错别字、模糊图片、长尾需求——「Demo 考的是尖子生,量产考的是全班——真实分布比 Demo 分布难十倍」);边界盲区(Demo 只展示模型强项;量产暴露边界——用户会问各种奇怪问题、传各种奇怪图片——「Demo 没展示过的地方,就是量产翻车的地方——用户永远比你想象的会刁难」);成本延迟(Demo 跑一次不计成本;量产每单推理费加等待时间——「Demo 一分钟生成不心疼,量产一分钟生成用户跑了——成本延迟是 P-M-Fit 的隐形缺口」);稳定性(Demo 跑几次都行;量产要跑百万次——百分之一出错率在百万次里就是一万次——「Demo 的成功率是 100 次里 99,量产的口碑是 100 次里 1 次翻车——稳定性的账,要按规模算」);评测过拟合(Demo 阶段团队反复调提示词调参数,把已知样本调到完美——调得越久,对真实世界越没谱——「过拟合的 Demo:给评委的样本全对,给世界的样本全废」)。打个比方:这像「样板间和交付房」——样板间(Demo)精装、灯光、家具全配好;交付房(量产)要过一百户的验收——「样板间是设计师的理想,交付房是施工队的现实——样板间越惊艳,交付落差越大——聪明的开发商,样板间留七分功力,交付才有惊喜」。翻车案例:有 AI 客服产品,Demo 演示「客户骂人也能温柔化解」,高管看完当场拍板投钱——上线两周:真实客户用家乡话骂、发语音、发截图、一次问三个问题——模型全崩,人工接管率 70%——「Demo 里的客户是排练过的,量产里的客户是真实的——拿排练的样本验收产品,等于拿彩排当比赛」。

第三块,怎么解决 P-M-Fit——四个动作:真实评估(建评估集跑真实样本——从生产环境抽样本、双人标注、任务成功率加边界测试——「评估集是 P-M-Fit 的体检报告——先体检,再上线」);承诺分级(按模型真实能力分级承诺——能力 90 分的功能承诺「推荐」、能力 60 分的承诺「参考」——「承诺跟能力对齐——能做的说能,不能做的说清楚——分级承诺,落差可控」);人机兜底(高风险场景模型生成人工复核——「模型负责量,人工负责质——人机兜底是 P-M-Fit 的安全带」);迭代路线(能力缺口列路线图——评估集显示哪个场景不行,就专项优化哪个——「P-M-Fit 不是一次性达标,是持续对齐——模型升级一次,对齐一次」)。打个比方:这像「婚庆公司管理预期」——先看真实婚礼场地的光线(真实评估)、按预算定方案(承诺分级)、重要环节配督导(人机兜底)、每次婚礼后复盘改进(迭代路线)——「靠谱的婚庆不吹效果图,先看场地再承诺——P-M-Fit 的四个动作,婚庆行业早就做明白了」。翻车案例:有 AI 修图产品承诺「一键修复老照片」,用户传 80 年代黑白照、褪色照、破损照——模型对「破损人脸」恢复成诡异形状,用户在评论区晒图吐槽——团队紧急下线该承诺,改成「支持轻微修复」加人工精修服务——「承诺一口气吹太大,翻车来得就快——先小承诺跑稳,再逐步加码——承诺是用户预期,预期管理是 P-M-Fit 的第一课」。

④ 对比表格:

维度PMFProduct-Model-FitDemo vs 量产
匹配对象市场×产品产品承诺×模型能力精选样本×真实分布
回答什么用户要不要模型做不做得到上线稳不稳定
验证工具留存/付费评估集/任务成功率生产环境抽样
翻车后果没人用用了就流失口碑崩塌
类比门开不开菜好不好吃婚纱照 vs 婚礼现场


一句话总结:PMF 管「有人来」,P-M-Fit 管「来了不走」——承诺不超过兑现,口碑才是正资产。

⑤ 3+ 个例子:

例一,面试回答「为什么很多 AI 产品 Demo 出色但实际难达预期」——回答:「核心是 P-M-Fit 没解决——Demo 是精选样本(干净输入、精心提示词、理想场景),量产是真实世界(方言、错别字、模糊图片、长尾需求)——真实分布表现远差于精选样本;再加三个放大器:成本(Demo 跑一次不心疼,量产每单都是钱)、延迟(Demo 等十秒可以,量产十秒用户走了)、稳定性(Demo 跑十次都行,量产百次错三次口碑就崩)——Demo 给投资人看上限,量产给用户交付下限——上限惊艳下限崩盘,落差就是口碑崩塌点——解法:真实评估集、承诺分级、人机兜底、迭代路线」。为什么典型:它演示「一个原因加三个放大器加四步解法」的完整结构——「面试官问『为什么』,你把『是什么、为什么、怎么办』三层答全——完整度就是面试的加分项」。

例二,AI 写作工具的 P-M-Fit 实操——产品承诺「AI 帮你写爆款小红书笔记」——评估集:从真实用户中抽 100 个选题(含「我对象劈腿了帮我写个笔记」「卖二手婴儿车怎么写」这些刁钻题)——结果:常规选题成功率 85%,刁钻选题 40%——结论:承诺要分级——常规选题承诺「直接生成」,刁钻选题引导用户提供更多背景(把 40% 变 65%)——上线后口碑稳定,没有差评潮。为什么典型:它演示「评估集怎么改变承诺」——「评估集跑出来,承诺跟着能力走——P-M-Fit 不是嘴上对齐,是评估集算出来的对齐」。

例三,AI 翻译工具的「稳定性翻车」——Demo:翻译诗歌、古诗词惊艳——量产:用户拿合同、病历、骂人话翻译——合同翻错一个「shall」变成「可以」,法律责任全变——用户投诉「翻译错了要赔钱」——团队紧急加「高风险文本提醒」(合同、病历类提示「请人工复核」)——「Demo 展示的是美,量产考验的是准——美翻车一次可以原谅,准翻车一次要赔钱——高风险场景的承诺分级是保命设计」。为什么典型:它演示「P-M-Fit 的行业差异」——不同场景对错误容忍度不同——「翻译工具的 Fit 标准不是『翻得好』,是『该提醒时提醒』——行业场景决定 Fit 的定义」。

例四,生活场景——手机相册的「AI 一键修图」——广告里(Demo)一键变大片——实际用(量产):废片还是废片、夜拍还是糊——用户评价「AI 修图就是噱头」——后来功能改文案:不承诺「变大片」,改成「智能增强」(真实能力)——差评少了,使用量反而涨了。为什么典型:它演示「承诺降一级,口碑升一级」——「承诺 100 分做到 70 分,差评;承诺 70 分做到 70 分,好评——P-M-Fit 的秘诀不是提升能力,是先对齐承诺——对齐了,能力不变口碑也变好」。

例五,传统产品 vs AI 产品的交付差异——传统外卖 App:功能上线就是交付(点单就能点)——AI 点餐助手:功能上线是开始(每天真实对话进来,模型表现是波动的)——「传统产品上线验一次,AI 产品上线天天验——P-M-Fit 是 AI 产品的常态管理,不是上线前的一次检查」。为什么典型:它演示「AI 产品运营的本质差异」——「P-M-Fit 不是验收表,是运营仪表盘——传统产品上线后管 bug,AI 产品上线后管 Fit」。

⑥ 常见误区:误区一,Demo 好 = 产品好——「Demo 惊艳就是产品过关」——「Demo 是精修图,量产是原相机——Demo 验证的是上限,产品要的是下限」;误区二,P-M-Fit 就是模型强——「换个更强的模型就 Fit 了」——「Fit 是承诺和兑现的对齐——模型再强,承诺吹得更高照样不 Fit——模型强是条件,承诺管理是功夫」;误区三,只测常规不测边界——「评估集都是正常样本」——「边界才是翻车现场——用户永远比你想象的会刁难——评估集要配 30% 边界样本」;误区四,一次验收一劳永逸——「上线前验过就完事」——「模型升级、输入漂移、新场景,Fit 一直在变——P-M-Fit 是持续对齐,不是一次验收」;误区五,承诺宁高勿低——「承诺高才有吸引力」——「承诺高一时吸引,翻车一次流失一片——承诺是用户预期,预期管理的账要算长期」;误区六,翻车了怪模型——「都是模型不行」——「模型不行是事实,但承诺超过能力是你定的——P-M-Fit 是产品经理的职责——怪模型之前,先看看承诺是谁写的」。

⑦ 第一人称面试回答:「Product-Model-Fit 我分三块答:第一,P-M-Fit 是什么——产品承诺的效果和模型兑现的能力对齐——PMF 问市场要不要,P-M-Fit 问模型做不做得到——承诺 ≤ 兑现叫 Fit,承诺 > 兑现叫 Gap;第二,为什么 Demo 出色但实际难达预期——五个原因:样本差(Demo 精选样本、量产真实分布)、边界盲区(Demo 没展示的地方就是翻车的地方)、成本延迟(每单推理费和等待时间)、稳定性(按规模算的成功率)、评测过拟合(调参调过头)——核心一句:Demo 给投资人看上限,量产给用户交付下限——上限惊艳下限崩盘,落差就是口碑崩塌点;第三,怎么解决——真实评估集(生产环境抽样、双人标注)、承诺分级(按能力承诺、高风险场景提醒)、人机兜底(模型生成人工复核)、迭代路线(能力缺口专项优化)。我做景观设计时对『效果图和实景的差距』体会太深了——效果图(Demo)光线、材质都是理想状态,实景(量产)要面对天气、预算、施工误差——行业里都知道『效果图骗人』,所以靠谱的设计师做两件事:一是效果图按真实材料渲染,不夸大(承诺分级);二是先做十米样板段实景验证,再全园铺开(真实评估加人机兜底)——景观设计行业几百年的经验,和 AI 产品的 P-M-Fit 一模一样——承诺对齐、小样先行。」

⑧ 小结口诀:P-M-Fit 口诀——「一承诺,不超过兑现是铁律;二评估,真实样本跑成败;三分级,按能力承诺不吹牛;四兜底,人机配合保口碑——Demo 看上限,量产看下限——承诺对齐,口碑不塌。」

⑨ 三轮追问:

追问一:评估集怎么保证「真实」?

答:三个来源保真——生产环境抽样(从真实用户请求里抽 100 个样本,不自己编——「真实请求里有方言、有错别字、有怪问题,编的样本编不出这些」);边界样本配比(70% 常规加 30% 边界——模糊图片、超长文本、多轮追问——「边界是翻车现场,评估集里必须有它们的位置」);定期更新(每月从新请求里补样本——「用户输入在漂移,评估集要跟着漂——三个月不更新的评估集,就是过期的地图」)。

面试官想听什么:考察「数据工程意识」——评估集不是随便攒的——「能说出抽样、配比、更新的人,搭过真评估体系」;也考察「动态思维」——评估集是活物不是化石。

追问二:承诺分级具体怎么落?用户会接受「分级承诺」吗?

答:分级透明化落地——能力 90 分场景承诺「生成」(直接给结果);60-90 分承诺「辅助」(生成加人工可改);60 分以下承诺「参考」(给思路引导用户完善);高风险场景(合同、医疗、法律)一律加「请人工复核」提示——「分级不是藏着掖着,是透明展示——用户接受『诚实的分级』,不接受『吹破的牛皮』——分级承诺加清晰的提示,反而建立信任」——数据证明:承诺 70 分做到 70 分的产品,留存比承诺 100 分做到 60 分的高。

面试官想听什么:考察「预期管理实战」——知道分级不是降格是管理——「能说出 90/60 三档加高风险提示的人,设计过真实承诺体系」;也考察「用户心理学」——诚实是信任资产。

追问三:P-M-Fit 和模型评估(评测)是一回事吗?

答:不是——模型评估测「模型本身多强」(跑标准基准集,看模型分数——技术团队关心);P-M-Fit 测「承诺和兑现的差距」(从产品承诺出发,看真实用户场景下的兑现率——产品经理关心)——「模型评估回答『模型能考多少分』,P-M-Fit 回答『用户拿到的体验配不配得上宣传』——模型 99 分,承诺吹到 100 分还不 Fit——两者一个管技术基线,一个管商业体验」。

面试官想听什么:考察「概念区分」——不把两个概念混为一谈——「能说清 P-M-Fit 和模型评估区别的人,概念体系是清楚的」;也考察「产品视角」——从承诺出发看模型。

⑩ 进阶加分点:第一,能说「Demo 管理的三个原则」——Demo 必须标注「精选样本」(团队内部共识:Demo 展示上限,宣传材料必须配真实样本示例);Demo 和量产同版本(别用实验室微调版做 Demo——「Demo 用最强版,量产用普通版,落差是自找的」);Demo 后必有评估(Demo 结束当天立评估集项目——「Demo 是开门红,评估是开门后的第一个工作」);第二,能说「P-M-Fit 的量化仪表盘」——三个数挂墙上:真实任务成功率(能力端)、承诺兑现率(抽检用户实际体验 vs 宣传承诺)、口碑指数(差评率和退款率)——「三个数天天看,Fit 不 Fit 一目了然——不量化,Fit 就是感觉」;第三,能说「灰度上线的 Fit 验证」——先放 5% 用户跑真实流量,评估集跑 2 周,Fit 达标再放量——「灰度是 P-M-Fit 的安全测试场——先在 5% 用户身上翻车,别在 100% 用户身上翻车」;第四,能说「模型升级的双刃剑」——升级可能提升能力也可能破坏已有场景(升级后旧评估集分数下降)——「模型升级前跑完整评估集,分数不降才放量——升级有风险,评估是刹车」;第五,能说「P-M-Fit 是组织能力」——产品、算法、测试三方共担 Fit 指标——「Fit 不是产品经理一个人的 KPI——产品管承诺、算法管能力、测试管评估——三方对齐,Fit 才有人负责」。

⑪ 话术库:

开场话术:「P-M-Fit 一句话:承诺不超过兑现——Fit 了,口碑才是正资产。」

Demo 话术:「Demo 是精修图,量产是原相机——Demo 给投资人看上限,量产给用户交付下限。」

评估话术:「评估集是 P-M-Fit 的体检报告——先体检,再上线。」

承诺话术:「承诺 70 分做到 70 分,好评;承诺 100 分做到 60 分,差评——先对齐承诺,再谈提升能力。」

兜底话术:「模型负责量,人工负责质——人机兜底是 P-M-Fit 的安全带。」

收口话术:「PMF 管有人来,P-M-Fit 管来了不走——两件事都做,AI 产品才立得住。」

⑫ 小白 Q&A:

Q1:P-M-Fit 和 PMF 到底差在哪?

A:PMF 问「市场要不要」(用户会不会用、会不会付费),P-M-Fit 问「模型做不做得到」(承诺的效果能不能稳定兑现)——「PMF 是门开不开,P-M-Fit 是菜好不好吃——门开了菜难吃,客人走得更快——两个都要过,顺序是先 PMF 后 P-M-Fit」。

Q2:Demo 为什么不代表真实水平?

A:三个原因——样本是挑的(Demo 用干净输入加精心提示词,量产是方言错别字乱输入)、场景是选的(Demo 展示强项,量产暴露边界)、次数是少的(Demo 跑十次都行,量产跑百万次必出错)——「Demo 是毕业典礼的演讲,量产是每天的日常作业——演讲可以排练,作业不能」。

Q3:怎么快速判断一个 AI 产品 Fit 不 Fit?

A:三问——真实场景试了吗(自己拿刁钻输入试:错别字、模糊图、怪问题);承诺和体验差多少(宣传说的和实际用的差距);出错时怎么办(有兜底吗——人工复核、清晰提示、失败处理)——「三问半小时试完,Fit 不 Fit 心里有数——比看一百个 Demo 视频有用」。

Q4:模型升级了,P-M-Fit 是不是自动就好了?

A:不一定——升级可能提升能力,也可能破坏已有场景(以前好的现在变差)——「升级是双刃剑:升了要重新跑评估集,分数不降才叫真升级——不评估就上线的升级,是赌」。

Q5:为什么用户对 AI 产品容错率特别低?

A:预期错位——用户觉得 AI 应该比人聪明(宣传也是这么说的),出错就是「AI 不靠谱」;传统软件出错是 bug(可理解),AI 出错是「不够聪明」(不可原谅)——「AI 产品的容错率天然低——承诺管理更要谨慎——预期是产品的一部分,管不住预期就管不住口碑」。

Q6:小团队没资源做评估集怎么办?

A:先做迷你版——50 个真实样本加 20 个边界样本,团队内部双人标注,一周跑完——「迷你评估集也是评估集——50 个样本挡住的翻车,值十个完整的评估集——评估的投入和产品规模匹配,先有再全」。

⑬ 没人告诉你的事:第一,「Demo 翻车最大的受害者不是用户,是团队士气」——团队为 Demo 熬了三个月,上线被骂,最自信的人先沉默——「P-M-Fit 管理不只是用户预期管理,还是团队预期管理——Demo 前就跟团队说清『这是上限,不是常态』——预期对内的作用和对外的同等重要」;第二,「『精选样本』四个字,很多团队只敢在内部说」——对外宣传没人愿意写「Demo 为精选样本」——「现实是:宣传材料必须精选(这是传播规律),但团队心里必须清醒(这是职业素养)——外面吹,家里醒,两不误」;第三,「评估集跑出来的『最差 10%』比最好 90% 值钱」——最优样本证明上限,最差样本指出修哪里——「看评估集先看最差的——最差的样本就是产品迭代的路线图——把最差 10% 修好,口碑就翻倍」;第四,「承诺分级的阻力通常来自销售和老板」——「AI 帮你搞定一切」才好卖——「产品经理要顶住:短期吹牛好卖,长期翻车难救——分级承诺短期少卖一点,长期多活几年——这个账要算得清」;第五,「P-M-Fit 是『慢生意』——Fit 对齐没有捷径,只有评估、分级、迭代的循环——「想走捷径的团队都死在『Demo 即 Fit』的幻觉里——慢就是快,Fit 是磨出来的」;第六,「『翻车一次、口碑-10,修复一次、口碑+1』——AI 产品的口碑修复成本极高——「P-M-Fit 不是上线前的检查,是上线后的日常——每一条差评都是 Fit 的警报,警报响了就修,别等」。

⑭ 做一件事:今天做一次「P-M-Fit 体检」——选一个你常用的 AI 产品(AI 修图、AI 写作、语音助手都行):第一,找出它的「承诺」——广告、宣传语、功能名称里说了什么(「一键变大片」「秒出文案」);第二,用真实刁钻输入测三次——错别字输入、模糊图片、怪问题(越刁钻越好),记录结果;第三,算落差——承诺 100 分实际拿到几分,哪些场景翻车了;第四,给它写一个「承诺分级建议」——哪些承诺该降级、哪些场景该加提示——「给一个真实 AI 产品做 P-M-Fit 体检,比背十遍概念有用——体检完你就知道『承诺管理』是什么手感了」。

⑮ 求职助手联系:把「承诺不超过兑现」写进你面试「为什么 AI 产品 Demo 出色但实际难达预期」的答案里,面试官大概率追问「你遇到 Demo 和量产差距怎么办」——答「三步:第一步立评估集——从真实生产环境抽样本(70% 常规加 30% 边界),双人标注跑任务成功率;第二步承诺分级——能力 90 分承诺生成、60-90 分承诺辅助、60 分以下承诺参考,高风险场景一律加人工复核提示;第三步灰度放量——先 5% 用户跑两周,评估集分数和口碑达标再放量——每一步都用数据说话,翻车不会发生在 100% 用户身上」——追问就接住了。如果被问「你练过什么真实案例」,答「我给手机里的 AI 修图做过 P-M-Fit 体检:它的承诺是『一键修复老照片』——我拿一张破损的老照片试,人脸修复成了诡异形状——承诺 100 分,实际 40 分——然后我按承诺分级给了建议:破损人脸场景降级为『轻微修复』加人工精修入口,清晰度增强场景保持承诺——这个体检让我深刻理解了『承诺是产品的一部分』——后来我用同样的方法体检了三个 AI App,写了一份对比笔记,面试时讲出来特别有说服力」。

⑯ 练习:

练习一:把 P-M-Fit 三块按顺序排出来——模型兑现 / 产品承诺 / 承诺分级——各写一句话。

练习二:Demo 出色但实际难达预期的五个原因是什么?

练习三:解决 P-M-Fit 的四个动作是什么?各配一个具体例子。

练习四:用「婚纱照和婚礼现场」的类比,把 P-M-Fit 讲给一个不懂产品的人听。

练习五:给一个「AI 翻译助手」做承诺分级——分别给「合同翻译」「日常聊天」「诗歌翻译」定承诺级别。

练习六:你负责的 AI 功能评估集显示「最差 10%」是方言输入场景,写出你的三步处理方案。

答案要点:练习一顺序——产品承诺(产品对外承诺的效果)、模型兑现(模型真实能做到的效果)、承诺分级(承诺不超过兑现)——「先看承诺、再验兑现、最后对齐——顺序就是 P-M-Fit 的检查顺序」;练习二五个原因——样本差(Demo 精选样本、量产真实分布)、边界盲区(Demo 没展示的地方就是翻车的地方)、成本延迟(每单推理费和等待时间)、稳定性(按规模算成功率)、评测过拟合(调参调过头)——「样本、边界、成本、稳定、过拟合——五个原因五个坑,说全才完整」;练习三四动作——真实评估(生产环境抽样本双人标注——AI 客服案例)、承诺分级(按能力承诺——AI 修图「智能增强」案例)、人机兜底(模型生成人工复核——高风险场景)、迭代路线(能力缺口专项优化——评估集最差样本就是路线图)——「评估、分级、兜底、迭代——四动作循环做,Fit 持续对齐」;练习四复述要点——婚纱照是精修过的 Demo(光线最好角度最挑),婚礼现场是量产(光线角度没法挑)——「婚纱照惊艳不等于婚礼现场好看——Demo 是精修图,量产是原相机——聪明的婚庆不修图修过头,留一点真实预期,婚礼现场才有惊喜」;练习五分级——合同翻译:降级为「参考」加强制「请人工复核」提示(翻译错要赔钱,高风险);日常聊天:承诺「生成」直接出结果(容错率高);诗歌翻译:承诺「辅助」加风格选项(美是主观的,给用户选择权)——「风险越高承诺越低——合同保命、聊天放开、诗歌给选择」;练习六三步——第一步定位:把方言样本单独跑一遍,算出方言成功率(确认是不是方言都差还是某几种差);第二步对策:方言专项优化(加方言语料微调或规则兜底)加分级提示(检测到方言时提示「当前版本方言支持有限」);第三步验证:一个月后重跑评估集,方言场景成功率达标(70%+)再解除提示——「先定位、再对策、后验证——最差 10% 修好,口碑就翻倍」。六题全过,这一题通关。

AI 产品的 MVP 落地

AI 的 MVP:双验证 × 假 AI 先行 ① 传统 MVP 最小可行产品 验需求:砍功能 小窗口试卖 功能减到只剩核心 ② AI MVP 双验证 需求+模型一起验 降功能之外还要验能力 模型投入最小化 防 Demo 惊艳量产拉胯 ③ 假 AI 先行 人工扮演 AI 接需求 不写模型先验需求 需求真了再上真模型 最 MVP 的 MVP 收口:先假 AI 验需求,再真模型验能力——两关都过,MVP 才算立住 ① 大白话定义:这一题拆两半:第一半,精益创业的 MVP(Minimum Viable Product,最小可行产品)方法论怎么在 AI 产品里落地——MVP 的核心是「用最小的投入,验证最关键的假设」:传统产品的最小投入是「砍功能」(只做核心功能,边角全砍),AI 产品的「最小投入」多了一维——「砍模型投入」:先用最便宜的模型、最小的场景、甚至用人工假扮模型,把「需求真不真」先验出来,需求确认了再上真模型——AI 的 MVP 要同时验证两件事:需求(用户要不要)加模型能力(模型做不做得到)——第二半,AI 产品的 MVP 与传统 MVP 有何不同——传统 MVP 减的是「功能数量」(功能从 20 个减到 3 个),AI MVP 减的是「模型投入」(模型从自研减到现成 API、从全场景减到单场景、从真模型减到假 AI 人工扮演)——最 MVP 的形态是「假 AI」:产品界面是真的,背后是人工在回复——用户以为在跟 AI 聊天,其实在跟人聊——「假 AI 是 AI 产品的 MVP 之王——不花一分模型钱,先把需求验明白」——传统 MVP 验证的是「值不值得做」,AI MVP 还要验证「做不做得到」——「先验需求,再验能力——两关都过,MVP 才算立住」。

打个比方:传统 MVP 像「新餐厅先开个小窗口试卖」——不装修大店、不请大厨,先在窗口卖三种招牌菜,看有没有人排队(需求)——排队了就开大店;没人排队就换个菜谱,损失最小。AI 的 MVP 像「试菜时让老板娘自己下厨」——还没请大厨(训练模型)之前,老板娘亲手上阵(假 AI 人工扮演),先验证「这个菜有没有人吃」——客人真爱吃,再花大钱请大厨(上真模型);客人不买账,老板娘自己下厨的成本几乎为零——「先让老板娘试菜,再决定要不要请大厨——假 AI 就是 AI 产品的老板娘下厨」。

30 秒电梯版:「AI 的 MVP 和传统 MVP 有三个不同:第一,验证对象不同——传统只验需求(用户要不要),AI 要验需求加模型能力(模型做不做得到)双重;第二,减的内容不同——传统减功能数量,AI 减模型投入(自研减成现成 API、全场景减成单场景);第三,最 MVP 的形态不同——传统 MVP 是功能最少的真产品,AI 的最 MVP 是『假 AI』:界面是真的、背后人工扮演,不花模型钱先把需求验明白——需求真了,再上真模型验能力——两关都过,MVP 才算立住。」

② 为什么学:第一,它是「精益创业」的落地题——MVP 人人会背概念,落地到 AI 产品才是真功夫——「能把 MVP 落地到 AI 产品的人,面试官知道你不只会背概念」;第二,它考「最小投入思维」——AI 产品最贵的投入是模型(训练、调用、调优)——「会砍模型投入的人,省的是真金白银——MVP 的精髓不是做小,是省对地方」;第三,它是「假 AI」方法的唯一考点——人工扮演验证需求是 AI 产品经理的独门武器——「答得出假 AI 的人,做过 AI 产品从 0 到 1——这是 AI PM 的压箱底技能」;第四,它是「双重验证」的姐妹题——q591 讲验证什么,这一题讲验证的最小成本路径——「PMF 是目标,MVP 是路径——两题连起来答,逻辑闭环」;第五,它是面试高频题——「AI 产品怎么做 MVP」「怎么快速验证需求」——「答得出『假 AI 先行、真模型后上』的人,面试官知道你有落地经验」;第六,它练「资源分配」——模型预算怎么分、先买什么后买什么——「MVP 是资源分配的修行——预算有限时,钱花在刀刃上的能力就是产品力」;第七,它是「失败成本控制」的样板——模型投入动辄百万,假 AI 成本几千——「MVP 的本质是控制试错成本——试错便宜了,创新才敢大胆」。

③ 原理拆解:这一题拆成「三块」:

第一块,传统 MVP 的核心逻辑——验证最关键假设,砍掉一切非核心:识别核心假设(产品的『能不能成』押在哪个假设上——外卖 App 押在「附近的人要不要点外卖」,不是押在「骑手效率」);砍功能到最小(只保留能验证核心假设的功能——先只做「下单加支付」,会员、红包、积分全砍);快迭代(上线两周看数据,验证或推翻假设——假设对就加功能,错了就换方向)。打个比方:这像「新餐厅小窗口试卖」——不装修、不请大厨、不印菜单,窗口只卖三道招牌菜——验证的不是「餐厅好不好看」,是「这个菜有没有人吃」——「MVP 验证的是最关键的那个假设——其他都是噪音——窗口试卖,只问菜好不好卖」。翻车案例:有团队做社区拼团,MVP 做了 20 个功能——拼团、秒杀、直播、积分、分销,半年开发、上线即死——后来复盘:核心假设是「小区邻居愿不愿意一起拼单」,一个「拉个微信群接龙」就能验证——「功能越做越全,验证越来越晚——MVP 做成了产品,假设验证被推迟到产品上市那天——用真产品验假设,是成本最高的验证」。

第二块,AI MVP 的双验证——需求加模型能力,两个假设都要验:假设一「需求」(用户要不要——用户要 AI 写周报吗、愿意付费吗——用留存付费验证);假设二「模型能力」(模型做不做得到——模型写周报的真实质量、成功率、成本——用评估集验证)——两个假设分开验、分先后验:先验需求(需求假的,模型再强也是白做),再验能力(需求真的,能力不行就降级方案)——「两个假设两张卷——需求不及格,模型那张卷都不用打开」。打个比方:这像「菜单上有『分子料理』这道菜」——先验证「有没有客人想吃分子料理」(需求),再验证「厨师做不做得出来」(能力)——客人不想吃,厨师练不练都不用谈;客人想吃,厨师练三个月还是做不出,这道菜就得从菜单撤下或换成「简化版」——「需求决定做不做,能力决定怎么做到——双验证分开考,别混在一张卷子里」。翻车案例:有团队做「AI 简历优化」,直接训练了半年模型才上线——上线发现用户留存 8%,没人愿意为「AI 改简历」付费——需求是假的(用户要的是「帮我把简历改得能过筛」,不是「AI 改简历」这个词)——半年模型投入全打水漂——「先验需求再投模型——需求没验的模型投入,等于没看路就踩油门——假 AI 一周就能验出的结论,用半年模型投入去买单」。

第三块,假 AI 先行——AI 产品 MVP 的独门形态,不写模型先验需求:假 AI 怎么做(产品界面照常做,AI 输出由人工完成——用户在聊天框提问,背后的运营人员手工回复——用户以为跟 AI 聊,其实跟人聊——「假 AI 是 AI 产品的『人肉原型』——模型还没生出来,先用人顶上去」);假 AI 验什么(需求真不真——用户会不会来、留不留、愿不愿意付费——把需求从「以为有」变成「验证过」);假 AI 的边界(人工只撑得住小流量——限制测试用户数(50-100 人),撑不住就排队或限流——「假 AI 的瓶颈是人工——小流量验证需求足够,大流量是模型的事」)。打个比方:这像「新餐厅试营业时老板娘亲自下厨」——还没请大厨(训练模型),先让老板娘做一周,看有没有客人、客人爱不爱吃(需求)——客人多了老板娘忙不过来(人工撑不住),正好说明「该请大厨了」(该上真模型了)——「假 AI 试的是需求,试出来的不只是行不行,还有规模到了该上真模型的信号」。翻车案例:有团队做「AI 法律咨询」App,直接接了大模型 API 上线——模型对法律问题胡编法条(「根据《刑法》第 128 条,欠债不还判三年」——纯属编造),用户截图发网上,品牌口碑一夜崩塌——后来改流程:先人工审核加免责声明,再逐步上模型——「先假 AI 人工兜底,验需求加保口碑——法律医疗这类高风险场景,假 AI 不只是验证,还是保命的过渡方案」。

④ 对比表格:

维度传统 MVPAI MVP假 AI
验证对象需求一项需求+模型能力双重只验需求(最优先)
减什么砍功能数量砍功能+砍模型投入模型投入减到零
最 MVP 形态功能最少的产品单场景小模型人工扮演 AI
成本开发人力开发+模型调用/训练几乎只有人力
类比小窗口试卖试菜+试后厨老板娘亲自下厨


一句话总结:传统 MVP 砍功能,AI MVP 砍模型投入,最 MVP 是假 AI——先验需求再验能力,两关都过产品才立得住。

⑤ 3+ 个例子:

例一,面试回答「AI 产品怎么做 MVP」——回答:「先假 AI 验需求——产品界面照常做,AI 输出人工扮演,50 个种子用户跑两周,看留存和付费——需求验证过了,再上真模型验能力——用现成模型 API 跑真实评估集(任务成功率、边界、成本),能力不够就收缩场景或降级人工兜底——迭代节奏:假 AI(验需求)→ 小模型单场景(验能力)→ 全场景铺开——最 MVP 的 MVP 是假 AI,不花模型钱先把需求验明白」。为什么典型:它演示「AI MVP 的完整落地路径」——三步走清晰、每步验证对象明确——「面试官要的不是概念,是路径——能说出假 AI 到真模型的完整节奏,就是有落地经验的人」。

例二,「AI 周报助手」的 MVP 实战——第一步假 AI:做个简单的输入框页面,用户描述一周工作,背后人工帮忙写周报——两周 50 个用户:留存 60%、12 人愿意付费——需求验证通过;第二步真模型:接现成大模型 API,用 100 份真实周报评估——任务成功率 78%,成本每份 0.2 元——能力基本够;第三步迭代:成功率不够的场景(技术性内容)加模板引导,成本超预算的(长周报)限制字数——上线后留存 65%、付费转化 8%。为什么典型:它演示「双验证落地全流程」——需求、能力、迭代三步都有具体数字——「带数字的 MVP 案例,面试官才信你真的做过——假 AI 两周验证需求,是成本最低的起跑」。

例三,「AI 客服」的假 AI 验证——传统做法是直接上模型,团队先做假 AI:把三个老客服调过来轮班扮 AI,测试客户 20 家,一周后看反馈——结果发现「投诉处理」场景客户满意度反而比真人客服还高(因为 AI 回复有模板感、不情绪化)——结论:需求验证通过,且假 AI 期收集的 200 条真实对话成了后续模型的种子训练数据。为什么典型:它演示「假 AI 的一鱼两吃」——不只验证需求,还顺手积累数据——「假 AI 期的对话数据是模型训练的黄金种子——人工扮演的每一句回复,都是未来模型的教材」。

例四,传统 MVP vs AI MVP 的对比——传统外卖 MVP:只做「浏览菜单+下单+支付」,验证「要不要点外卖」;AI 点餐助手 MVP:先假 AI(人工回复点餐需求)验「要不要 AI 点餐」,再上模型验「模型能不能听懂」——同一个产品,传统验一层、AI 验两层。为什么典型:它演示「同一场景两套 MVP」——让面试官一眼看到差别——「对比是最有说服力的答案结构——同一个产品摆出来,AI MVP 多验的那层一目了然」。

例五,生活场景——小区团购群的「AI 选品助手」MVP——群主先手工扮演:每天用「AI 选品助手」名义推荐 3 个商品(背后是群主自己挑),一周后看群友买不买、有没有人问「这个助手是什么」——有人问了(需求信号)、订单涨了(付费信号)——再决定要不要真做个选品模型——「生活里的 MVP 测试处处能练——手工扮演先验需求,是成本最低的创业测试」。为什么典型:它演示「假 AI 思维的通用性」——不写一行代码也能做 MVP——「假 AI 的本质是『先人工验证再自动化』——这个思维用在哪里都成立」。

⑥ 常见误区:误区一,MVP 就是功能少——「砍到只剩一个功能就是 MVP」——「MVP 不是功能少,是验证快——功能再少,假设验证不出来也不是 MVP——窗口试卖只卖三道菜,但每道菜都在验『有没有人吃』」;误区二,AI 产品 MVP 直接上真模型——「MVP 就是接个 API 上线」——「模型 API 是投入,需求没验证前的模型投入都是浪费——先假 AI,再真模型,顺序不能反」;误区三,假 AI 无限期扮演——「人工回复挺好,就一直人工」——「假 AI 是验证工具不是产品形态——需求验证过了就该上模型,人工扮演撑不起规模——假 AI 试出来该请大厨了,就别让老板娘一直炒菜」;误区四,需求能力一把验——「直接全量上线一起看」——「需求假了模型白投,能力不行需求白验——分开验、分先后验,成本才能分开算」;误区五,假 AI 不限制流量——「来多少用户都人工顶」——「人工撑不住就会漏接、变慢,假 AI 数据失真——限流 50-100 人,验证小样本足够」;误区六,MVP 上线后不迭代——「验证完就等结果」——「MVP 是迭代的起点不是终点——验证通过的假设马上加功能,失败的马上去掉——MVP 转得快,产品才长得快」。

⑦ 第一人称面试回答:「AI 产品的 MVP,我分三块答:第一,传统 MVP 的核心逻辑——验最关键假设、砍一切非核心、快迭代——小窗口试卖,只问菜好不好卖;第二,AI MVP 的双验证——需求加模型能力两个假设分开验、分先后验——先验需求(假的,模型再强也是白做),再验能力(真的,能力不够降级方案);第三,假 AI 先行——界面是真的、背后人工扮演,不花模型钱先验需求——50 个种子用户跑两周,留存付费一出来,需求真假一目了然——需求真了,再上现成模型 API 验能力(真实评估集:任务成功率、边界、成本)——能力不够收缩场景、人工兜底——节奏:假 AI(验需求)→ 小模型单场景(验能力)→ 全场景铺开。我做景观设计时也用过这个思路:接到新项目先做『样板段』——十米长的实景样板,材料和工艺全验证过,再全园铺开——这就是景观设计的 MVP——我汇报方案前还会先给朋友看效果图(假 AI 验证):他们看了第一反应是什么,比我自己想象靠谱得多——『先小样验证,再大干快上』这个习惯,我从设计院带到了产品上。」

⑧ 小结口诀:AI MVP 口诀——「一需求,假 AI 人工先验证;二能力,真模型 API 跑评估;三节奏,假到真、点到面——先验需求再验能力,两关都过才立住。」

⑨ 三轮追问:

追问一:假 AI 的「人工扮演」会不会让验证结果失真?

答:会,所以有三条保真措施——话术标准化(人工回复用固定模板加语气规范,别让用户觉得「对面好像是人」——「假 AI 要像 AI,不像 AI 就失真了——语气太灵活、回复太快太贴心,用户起疑」);限流小样本(只放 50-100 个种子用户,人工质量可控——样本不在多,在于信);结果对照(验证结束后跟用户坦白「测试期是人工」,问他们介不介意——大部分用户不在意,反而觉得产品用心——「失真最大的风险不是人工顶替,是团队自己骗自己——验证结论要经得起『如果当时是模型』的反问」)。

面试官想听什么:考察「实验严谨性」——知道假 AI 不是随便玩玩的——「能说出保真三措施的人,认真设计过验证实验」;也考察「用户知情权意识」——验证结束后的坦白机制。

追问二:需求验证通过了,模型能力不够怎么办?

答:四条降级路径——降场景(先只做成功率高的子场景——「投诉安抚做不了,先做退款咨询」);降承诺(页面标注「AI 生成,人工复核」——「别承诺做不到的,承诺做到的说清楚」);降成本(换便宜模型加规则兜底——「贵模型做核心,便宜模型做边缘」);人机混合(模型生成、人工把关——高风险场景人工终审——「需求真、能力差时,用人工兜住体验,模型边跑边练」)。

面试官想听什么:考察「方案弹跳力」——能力不够不是死局而是降级路径——「能一口气说四条路径的人,处理过真实的能力瓶颈」;也考察「工程务实」——人机混合是常态不是退而求其次。

追问三:假 AI 验证多久、看到什么数据就算「需求通过」?

答:三个信号——时间窗(2-4 周,太短看不出留存,太长等不起);留存线(次周留存超 30%——用一次就走的说明是好奇不是需求);付费或替代信号(愿意付费的转化率,或「没有它就会难受」的依赖反馈——「需求通过不是看热闹,是看三个信号:留得下、付得起、离不开——三选二就算过」)。

面试官想听什么:考察「量化标准」——验证不能凭感觉——「能说出留存线和付费信号的人,带过真实验证项目」;也考察「风险偏好」——知道验证结论是概率不是确定。

⑩ 进阶加分点:第一,能说「假 AI 的灰度设计」——人工扮演期加「模型影子模式」:真模型在后台同步生成回复,人工选择采纳或改写——每一条记录都是「模型 vs 人工」的对照数据——「影子模式让假 AI 期不只验证需求,还白赚一套模型评测数据——一鱼两吃,验证期也是数据积累期」;第二,能说「MVP 的成本结构测算」——真模型方案的每单成本(推理成本+人工复核成本)提前算——「假 AI 验证的是需求,成本测算验证的是商业模型——两个都过了,才敢投模型」;第三,能说「MVP 的功能裁减原则」——AI MVP 砍功能要看「功能对模型质量的影响」——砍掉的功能如果是模型质量的关键输入(用户画像、上下文),就不能砍——「传统砍功能砍的是边角,AI 砍功能要看清功能与模型质量的关系——砍错了,模型质量崩」;第四,能说「数据飞轮提前设计」——MVP 期就开始设计数据回流(用户反馈、纠错行为、人工修正)——「MVP 不只是验证产品,还是验证数据飞轮——飞轮设计晚了,模型迭代就慢了」;第五,能说「多 MVP 并行」——同一时间验证两三个方向的假 AI(A/B 两个假 AI 原型同时跑)——「需求验证也能 A/B——两个假 AI 并行跑两周,用数据选方向,比开会拍板靠谱」。

⑪ 话术库:

开场话术:「AI 的 MVP 三件事:假 AI 验需求、小模型验能力、快节奏迭代。」

假 AI 话术:「界面是真的,背后是人工——最 MVP 的 MVP,不花模型钱先把需求验明白。」

双验证话术:「需求决定做不做,能力决定怎么做到——两个假设分开验,别混一张卷子。」

降级话术:「能力不够不是死局——降场景、降承诺、降成本、人机混合,四条路选一条。」

影子话术:「影子模式让验证期一鱼两吃——需求验证和数据积累同时完成。」

收口话术:「先假 AI 验需求,再真模型验能力——两关都过,MVP 才算立住。」

⑫ 小白 Q&A:

Q1:MVP 和「先做个小功能」有什么区别?

A:MVP 是「验证假设的最小产品」,小功能是「产品的一个零件」——「MVP 回答『这事值不值得做』,小功能回答『这个功能好不好用』——顺序反了:没验证值得做,先做了一堆小功能,等于给不存在的需求装修房子」——先验假设,再谈功能。

Q2:假 AI 是不是骗用户?不道德吧?

A:短期测试(2-4 周)加事后坦白,行业内普遍做法,不构成欺骗——「假 AI 不是长期伪装,是测试期的临时脚手架——验证结束跟用户说清楚『测试期是人工』,用户大多理解还觉得用心」——真正不道德的是长期伪装人工当 AI,那是对用户的欺骗。

Q3:为什么 AI MVP 不能直接用现成模型 API?

A:可以用,但要先问一句「需求验了吗」——「直接接 API 不是不行,是绕过了成本最低的需求验证——API 也有成本和调优投入,需求是假的,API 的钱也白花——假 AI 两天验证需求,API 接入要两周——先便宜的再贵的」。

Q4:人工扮演能撑多久?

A:撑 2-4 周没问题(限流 100 人以内),撑 2-4 个月肯定崩(人累了、回复慢了、质量掉了)——「假 AI 是过渡不是常态——人工撑不住的临界点,就是该上模型的信号——看到运营开始加班了,说明验证通过了,该请大厨了」。

Q5:MVP 验证失败了怎么办?

A:分两种——需求失败:换方向(核心假设换一个再验)——「需求失败不是产品失败,是假设失败——换假设再验,成本才几千块」;能力失败:降级或换方案(降场景、降承诺、人机混合)——「能力失败是技术问题,需求失败是方向问题——技术问题有解,方向问题要转」。

Q6:小公司没资源做假 AI 怎么办?

A:假 AI 恰恰是没资源时的最佳选择——不需要模型、不需要开发,一个人加一个微信就能跑——「假 AI 是穷团队的最强武器——创始人自己下场扮演一周,需求真假比调研报告清楚一百倍——没资源不是不做验证的理由,是更要做验证的理由」。

⑬ 没人告诉你的事:第一,「假 AI 最怕的不是用户识破,是团队当真」——运营把人工扮演当产品形态长期做,模型一直不上——「假 AI 是验证期的脚手架,拆掉才是产品——团队沉浸在『人工真好用』里,模型永远上不了线」;第二,「MVP 验证通过 ≠ 可以全力投入」——需求通过只是第一关,模型能力、单位经济、规模效应都没验——「MVP 通过是绿灯不是全速——绿灯后还有三个路口要看,看清楚了再踩油门」;第三,「MVP 期的用户是最珍贵的资产」——愿意陪你从假 AI 玩到真模型的人,是最早的天使用户——「MVP 用户是产品的第一批股东——他们的反馈、数据、口碑,比广告投流值钱一百倍」;第四,「假 AI 的回复要『留一手』」——别把人工回复做得完美无缺,否则真模型上线落差巨大——「人工回复 90 分,模型上线 60 分,用户会觉得退步了——假 AI 期故意留些小瑕疵,用户预期才真实」;第五,「砍功能最难的是一刀切对地方」——砍掉的如果是用户核心价值,MVP 就变成了摆设——「MVP 砍功能前先问:这个功能是核心假设的一部分吗——是,就不能砍;不是,砍得越狠越好」;第六,「AI MVP 的节奏不是『做出来再看』,是『看完了再做』」——先验证再投入,是 AI 产品少交学费的唯一方法——「传统行业说『先干起来』,AI 产品说『先验起来』——验的成本几千,干的成本几百万」。

⑭ 做一件事:今天做一次「假 AI」练习——选一个你手机里常抱怨的 AI 功能(语音助手听不懂、客服机器人答非所问),用假 AI 思维重构一遍:如果让你重做这个功能,假 AI 阶段你会怎么设计——扮演者是谁(客服团队还是产品经理自己)、验证什么假设(「用户要的是准确还是快」)、验证多久(2 周还是 4 周)、什么数据算通过(留存还是付费)——写完再选一个生活场景(楼下新开的奶茶店、小区的团购群),设计一个「手工扮演版 MVP」:谁扮演、验什么、怎么算过——「两个假 AI 设计写完,你就掌握了 AI 产品经理的独门武器——面试讲出来都是真经验」。

⑮ 求职助手联系:把「假 AI 先行、真模型后上」写进你面试「AI 产品 MVP」的答案里,面试官大概率追问「假 AI 验证通过后,模型上线怎么过渡」——答「三步过渡:第一步影子模式——真模型后台同步回复、人工采纳或改写,积累『模型 vs 人工』对照数据;第二步小流量真模型——5% 用户切真模型,对比留存和满意度;第三步全量切换——数据跑平或更好,再全量上——每一步都有对照,过渡不翻车」——追问就接住了。如果被问「你练过什么真实案例」,答「我用假 AI 思维给小区团购群设计过『AI 选品助手』的 MVP:群主手工扮演三天,每天用助手名义推荐三款商品——结果验证出两个没想到的:一是用户问得最多的是『这个助手怎么加』(需求信号强),二是用户要的不是『推荐』是『帮忙比价』(需求方向偏了)——手工扮演三天,比问卷调研一周还准——这个经历让我彻底相信:AI 产品 MVP 的第一步,永远是假 AI」——「有真实验证经历的人,面试官才信你不是背概念」。

⑯ 练习:

练习一:把 AI MVP 三步走按顺序排出来——小模型单场景 / 全场景铺开 / 假 AI 验需求——各写一句话作用。

练习二:AI MVP 和传统 MVP 的三个不同点是什么?

练习三:假 AI 的三条保真措施是什么?

练习四:用「老板娘亲自下厨」的类比,把假 AI 讲给一个不懂产品的人听。

练习五:给一个「AI 宠物医生问答」产品设计 MVP——需求端和模型端各写两个验证动作。

练习六:模型能力验证失败(任务成功率 40%),写出你的四条降级路径。

答案要点:练习一顺序——假 AI 验需求(不花模型钱先验需求真假)、小模型单场景(现成模型 API 跑评估集验能力)、全场景铺开(数据跑平后全量切换)——「先验需求、再验能力、后铺开——节奏错了,钱就白花」;练习二三个不同——验证对象(传统验需求一项,AI 验需求加模型能力双重)、减的内容(传统砍功能数量,AI 砍模型投入)、最 MVP 形态(传统是功能最少的真产品,AI 是假 AI 人工扮演)——「对象不同、砍法不同、形态不同——三不同说全,AI MVP 就讲透了」;练习三三条——话术标准化(回复用固定模板像 AI)、限流小样本(50-100 人人工质量可控)、结果对照(结束后坦白并反问结论是否成立)——「假 AI 像 AI、小样本控质量、事后坦白——三条保真,验证才可信」;练习四复述要点——新餐厅先让老板娘亲自下厨试菜(假 AI),验证有没有客人爱吃(需求),客人多了老板娘忙不过来(人工瓶颈),正好说明该请大厨了(该上真模型了)——「老板娘下厨试需求,大厨到位再上模型——需求是真,投入才值」;练习五要点——需求端:假 AI 手工扮演问答一周看留存、用户愿不愿意为「24 小时问答」付费;模型端:接现成模型 API 用 100 个真实宠物问题评估(常见病问答成功率、紧急情况识别准确率——识别错会出人命,必须单独测)——「需求问留存付费,能力问成功率加安全线——宠物医生场景,安全线比成功率还重要」;练习六四条——降场景(只上成功率高的常见病问答)、降承诺(页面标注「AI 参考,请遵医嘱」)、降成本(换便宜模型加规则兜底常见病)、人机混合(高危判断人工复核)——「需求真、能力差时四条路——先保场景、再保承诺、再保成本、最后人机兜底」。六题全过,这一题通关。

路径规划与需求预测

三块拼图:序列生成 × 冷启动 × 蚕食效应 ① 路径规划=序列生成 一个决策接一个决策 LLM 逐 token 输出同构 语言条件自然融入 「避开收费路段」也能说 ② 冷启动 新品/新店无历史数据 相似性迁移:找相似老品 特征预测:价格/品类/位置 借数据,不猜数据 ③ 蚕食效应 新品吃掉老品销量 增量模型:净增量 =新品销量−被蚕食量 决策看净增量不看表面 收口:路径规划=生成问题,冷启动=借相似数据,蚕食=算净增量 ① 大白话定义:这一题是「AI 产品里的三块拼图」:第一块,路径规划为什么能建模成序列生成问题——路径规划的本质是「一个决策接一个决策」(先走 A,再选 B,再决定 C),而大模型天生就是「一个词接一个词」地输出(自回归)——两者结构一模一样,所以可以让 AI 直接「生成」路径——还能顺手把「避开收费路段」这种语言要求揉进去。第二块,需求预测怎么解决冷启动——新品/新店没有历史数据,靠两招:相似性迁移(找相似的老品/老店,借它们的销售曲线当基线)加特征预测(用价格、品类、位置这些特征跑需求模型)。第三块,商品蚕食效应——新品可能吃掉老品销量,所以要用增量模型:新品带来的「净增量」= 新品销量 − 被蚕食的老品销量——决策看净增量,不看出货总量。

打个比方:路径规划像「外卖小哥的配送路线」——他在路口要决定「左转还是右转」,每个决定都依赖前一个决定(先到 A 再到 B 才轮到 C)——这就像 AI 写句子:先写「今天」,再写「天气」,再写「真不错」——一步接一步,步步相扣——「路径是一连串的选择,句子是一连串的词——同一个骨架,AI 都能生成」。冷启动像「新餐厅开店备货」——没有老数据不知道备多少菜,聪明的老板会参考隔壁同类餐厅(相似性迁移:借同类店的菜品销量)加自己的定位(特征预测:人均消费、商圈位置)来备货——「没有自己的历史,就借别人的历史——借得到,就不算冷启动」。蚕食效应像「店里上了新菜,老菜卖少了」——你以为是新菜卖得好,其实是老客从老菜换到了新菜——「上新菜赚的钱,要扣掉老菜亏的钱——净增量才是真赚钱」。

30 秒电梯版:「三块拼图:第一,路径规划=序列生成——路径是一步步决策,LLM 是一个个 token,同构,所以能直接生成路径,还能加语言约束(避开收费路段);第二,需求预测的冷启动——新品没历史数据,用相似性迁移(找相似老品的销售曲线做基线)加特征预测(价格/品类/位置进模型);第三,商品蚕食——新品可能吃掉老品销量,用增量模型:净增量=新品销量−被蚕食的老品销量——决策看净增量,不看表面总量。」

② 为什么学:第一,它是「LLM 能力迁移」的代表题——把传统算法问题(路径规划)翻译成生成问题,是 AI 产品经理的基本功——「会翻译问题的人,才知道模型能干什么——翻译错方向,模型再强也白搭」;第二,它考「冷启动方法论」——没有数据怎么做决策,是 AI 产品的常态场景——「冷启动不是没数据,是没自己的数据——会借数据的团队,冷启动就是温启动」;第三,它是「业务计算思维」的标杆——蚕食效应提醒你别被表面数字骗——「看总量会误判——净增量才是决策的依据,算不明白增量,促销就是自残」;第四,它是面试高频综合题——「路径规划+需求预测」两大场景一题考——「答得出序列生成、冷启动迁移、增量模型三个词,面试官知道你真懂 AI 产品」;第五,它练「结构化解题」——一个复杂问题拆成三块,每块一个解法——「拆解能力是产品经理的通用货币——拆得开,才解得动」;第六,它连接「线下场景」——外卖、零售、新店选址——AI 不只活在对话里——「AI 产品一半在屏幕里,一半在物理世界里——线下场景题是 AI PM 的加分项」;第七,它是「防自嗨」的样板——蚕食案例提醒你,功能上线前的账要算全——「上新品先算净增量——不算蚕食的销量增长,是自嗨式增长」。

③ 原理拆解:这一题拆成「三块拼图」:

第一块,路径规划为什么是序列生成——路径规划的本质是「序列决策」:从起点出发,每一步选一个动作,下一步的选择依赖上一步的位置——这和大模型的自回归生成(predict next token)完全同构——所以路径规划可以建模为「条件序列生成」:输入(起点、终点、约束)→ 模型逐 token 输出决策序列 → 解码成路径。打个比方:这像「下棋」——每走一步棋,下一步的走法都依赖棋盘现状——棋手不是一步算完,而是一步步算——「路径规划像下棋:走一步看一步,每步依赖上一步——LLM 生成句子也是这个节奏」。翻车案例:有团队把路径规划当成「分类问题」做——给每个路口单独做分类模型(左转/右转),结果路径不连贯(模型不知道上一个路口选了哪)——后来改成一个序列生成模型,路径一口气生成,连贯又带全局最优——「把序列问题当单点问题做,是 AI 落地最常见的错——序列问题要序列模型解」。落地细节:判断「是不是序列问题」的三问——上一步的结果影响下一步吗(影响→序列)、输出是一个序列还是一个值(一个序列→生成式)、约束能不能写成自然语言(能→加语言条件)——三问问完,建模方向就定——「三问定方向,序列问题不再被当单点做」。

第二块,需求预测的冷启动——新品/新店没有历史销售数据,三招破解:相似性迁移(找相似老品/老店,用它们的销售曲线做基线——新品像哪个老品,就用哪个老品的生命周期曲线);特征预测(价格、品类、商圈位置、季节进需求模型——不靠历史靠特征);小步快跑(先小批量铺货,用真实销售数据快速校准——冷启动的模型越滚越准)。打个比方:这像「新老师第一次带班」——没带过这个班,但带过类似年级(相似性迁移),也看过学生档案(特征预测),开学第一个月边教边调整(小步快跑)——「没有这个班的数据,有类似班的数据——经验加特征加校准,冷启动就不慌」。翻车案例:有连锁咖啡店新品「桂花拿铁」上线,直接按「全网咖啡销量曲线」备货——结果南方门店卖爆、北方门店积压——后来改成按「相似老品(生椰拿铁)的门店级曲线」备货,南北差异拟合出来了——「用全网平均数据做新品预测,等于用全国平均气温决定穿什么——相似对象选得不对,基线就是错的」。落地细节:相似性迁移的实操清单——候选相似对象至少 5 个(同品类同人群同场景),取它们的销售曲线做「区间带」(上下 20% 的包络),新品预测先落在区间带里,再按门店特征修正——「5 个对象一个区间带,预测就立体了——单点基线是赌,区间基线是管理」。

第三块,商品蚕食效应——新品上市可能吃掉老品销量:新增量模型——净增量 = 新品销量 − 被蚕食的老品销量(被蚕食的估算:对照组的同期变化——没有新品的门店老品销量 vs 有新品门店的老品销量);决策逻辑——上新品看净增量(新品销量 1000,但老品掉了 800——净增只有 200,值不值得为 200 承担成本要算);防蚕食策略——差异化定位(新品打新人群新场景,不抢老品客群)、错位定价(不直接替代老品)、组合推荐(新品+老品捆绑,相互引流)。打个比方:这像「家里买了个新冰箱,旧冰箱没坏但被冷落」——你觉得是「买了新家电」,实际是「旧家电闲置了」——要算的是「全家保鲜能力净增了多少」,不是「新冰箱用了多少」——「新品的光鲜背后,是老品的寂寞——算净增量,才看得清真增长」。翻车案例:有品牌推出「XX 果茶」替代老款「XX 奶茶」,新果茶月销 300 万,团队庆祝「增长 300 万」——下季度一看老奶茶从 400 万跌到 150 万——净增量只有 50 万,还搭上了老客怨言——「被蚕食的销量不会消失,只会换个名字出现——不看增量看总量,庆祝会开错方向」。落地细节:净增量的计算公式落地——对照组差值法:选没上新品的老店做对照组,新品店老品跌幅减去对照组跌幅,才是「被蚕食量」——净增量 = 新品销量 − 被蚕食量——每月算一次,挂在经营周报里——「公式写进周报,蚕食就无处遁形——不写进报表的净增量,算完就忘了」。

④ 对比表格:

问题解法典型失误类比
路径规划序列生成(LLM 逐 token)当分类问题做下棋一步步
冷启动相似性迁移+特征预测用全网平均数据新餐厅参考同类
蚕食效应增量模型(净增量)看总量不看净增新冰箱冷落旧冰箱


一句话总结:路径靠生成、冷启动靠借数据、蚕食靠算净增量——三块拼图拼齐,AI 产品决策才不漏项。

⑤ 3+ 个例子:

例一,外卖平台的路径规划——从「规则引擎」改成「LLM 序列生成」:输入(骑手当前位置、订单地址、时间窗口、商家出餐时间),输出(配送顺序序列)——LLM 的好处是能听懂语言约束:「先送易化冻的冰淇淋订单」「避开修路路段」——自然语言条件直接进生成。为什么典型:它演示「语言约束是 LLM 序列生成的核心优势」——传统算法加语言约束要写一堆规则,LLM 一句人话就懂——「把约束说给人听,也顺便说给模型听——语言是序列生成的天然接口」。

例二,需求预测的冷启动——连锁便利店开新店:没有新店数据,用「相似性迁移」——找同商圈、同面积、同品类的老店销售曲线做基线;加「特征预测」——周边小区密度、竞品距离、交通人流进模型;前两周小批量备货校准。为什么典型:它演示「借数据三部曲」——找相似的、看特征的、快校准——「冷启动不是猜,是借——借得到、借得准,预测就不虚」。

例三,商品蚕食的决策——奶茶店上「低卡果茶」:新品月销 300 万,老奶茶从 400 万跌到 150 万——用增量模型算:净增量 = 300 − 250 = 50 万(被蚕食 250 万)——结论:果茶抢的是自家老客,不是新增市场——改策略:果茶主推「下午时段+外卖场景」,奶茶守住堂食——三个月后净增量升到 120 万。为什么典型:它演示「增量模型改变决策」——没算蚕食前是「增长 300 万」的庆祝,算完后是「抢自家人生意」的警钟——「一个公式,两种心情——增量模型是决策的清醒剂」。面试讲这个例子时数字就是记忆点:300 万、400→150、净增 50、改策略后 120——「一串数字,比一段论述更有画面感——面试官记住的是你的数字,不是你的概念」。

例四,面试回答——「为什么路径规划能建模成序列生成?」——回答:「路径规划的本质是序列决策——每一步的选择依赖上一步,这和大模型的自回归生成同构(一个 token 接一个 token);所以可以把规划变成生成:输入起点终点约束,模型逐 token 输出决策序列;还能用语言条件——『避开收费路段』直接说给模型听;生成后用约束校验兜底(超时、超程就重生成或降级到传统算法)」。为什么典型:它演示「结构化的技术表达」——同构→生成→约束→兜底四层递进——「答技术题要层层递进:本质、机制、优势、兜底——四层答全,面试官知道你是真理解」。

例五,生活场景——旅行路线规划——你让 AI「规划三天杭州行程,避开周一闭馆的景点」——AI 把「规划」当序列生成:每天去哪几个点(序列)、顺序怎么排(依赖关系:西湖上午光线好)、语言约束(避开周一闭馆)自然融入——你拿到的是「生成的路线」,不是「查表的路线」。为什么典型:它演示「序列生成就是生活日常」——旅行的每一天都是一连串决策——「旅行规划是最易懂的路径规划——用生活场景理解技术概念,面试讲出来才有温度」。

⑥ 常见误区:误区一,路径规划只能靠传统算法——「LLM 生成路径会不合法」——「序列生成加约束校验兜底——LLM 生成、规则兜底,两段式最稳」;误区二,冷启动等于拍脑袋——「没数据就凭经验猜」——「没自己的数据,有相似的数据加特征——借数据不是猜数据」;误区三,相似性迁移随便找对象——「找相似老品」变成「随便找全网平均」——「相似对象选错,基线就错——相似性要按品类、人群、场景三维对齐」;误区四,蚕食效应只防老品——「只看新品销量就庆祝」——「老品跌了多少不算账,增长就是自嗨——净增量才是真增长」;误区五,序列生成一次到底——「生成完不校验」——「生成是候选,校验是裁判——约束校验不过就重生成或降级」;误区六,冷启动模型一步到位——「想一次预测准」——「冷启动模型是越滚越准的——先小批量校准,再放大——模型和业务一起长大」。

⑦ 第一人称面试回答:「这一题我分三块答:第一,路径规划=序列生成——路径是一步步决策,每一步依赖上一步,和 LLM 自回归同构——所以规划可以变成生成,还能把『避开收费路段』这种语言约束直接说给模型听——生成后加约束校验兜底;第二,冷启动——新品/新店没有历史数据,用相似性迁移(找相似老品老店的销售曲线做基线)加特征预测(价格品类位置进模型),再小批量快校准——借数据,不猜数据;第三,蚕食效应——新品可能吃掉老品销量,用增量模型:净增量=新品销量−被蚕食的老品销量——决策看净增量,不看表面总量。我做景观设计时也处理过类似的账:改造后的广场人流量翻倍,团队庆祝——后来一算,旁边小公园的人流少了一半——人是从小公园被吸过来的,不是新增的——这和商品蚕食一个道理:算增量,不算总量——改造的账要算净增量才诚实。」

⑧ 小结口诀:三块拼图口诀——「一路径,序列生成当生成;二冷启动,相似特征加校准;三蚕食,净增量里看真章——三块拼图拼齐,决策才不漏项。」

⑨ 三轮追问:

追问一:路径规划用 LLM 生成,怎么保证路径合法?

答:三层校验兜底——一是结构校验(生成的路径节点必须连通、起点终点对得上——不连通就重生成);二是约束校验(「避开收费路段」这类条件逐条核对——违反就重生成或局部修正);三是降级策略(重生成两次仍不合法,降级到传统算法——Dijkstra 加约束过滤——保证用户永远有路径可用)——「LLM 负责聪明,规则负责兜底——生成加校验,路径才敢上路」。

面试官想听什么:考察「工程兜底意识」——知道生成模型会出错,也知道怎么兜——「能说出三层校验加降级的人,部署过生成式功能」;也考察「稳字当头」——生成式不等于不可控。追问变体:「重生成也会失败怎么办?」——答「重生成是第二次机会,不是无限次——两次失败就降级,再配一个兜底路径(缓存最近成功路径)——用户永远不会空手等」——「无限重试是灾难,有限重试加降级才是工程」。

追问二:相似性迁移的「相似」怎么定义?

答:三维对齐——品类相似(同类商品/同类门店——咖啡对咖啡,不拿奶茶店当咖啡的基线)、人群相似(客群画像一致——写字楼店不对标社区店)、场景相似(商圈属性、季节、定价带一致)——三维对齐全才算相似——再配一个「基线修正」:相似对象的历史数据乘一个修正系数(面积、位置因子)——「相似不是差不多,是品类、人群、场景三维对齐——对得越齐,借得越准」。

面试官想听什么:考察「颗粒度」——知道相似性要有可操作的定义——「能说出三维对齐的人,做过冷启动方案」;也考察「修正思维」——不直接照搬。

追问三:算蚕食效应时,老品下滑也可能是市场原因,怎么区分?

答:用对照组——找没上新品的老店/区域做对照:对照组老品也在跌,说明是市场原因(季节、竞争);对照组老品没跌,只有上新品的老店跌——蚕食实锤——再加时间窗(新品上市前后的下滑斜率对比)——「区分蚕食和市场下滑:对照组加时间窗——两把尺子量完,才敢归因到蚕食」。

面试官想听什么:考察「归因严谨性」——不把下滑全赖新品也不全赖市场——「会做对照组的人,归因才让人信」;也考察「实验思维」——自然实验也能验证因果。

⑩ 进阶加分点:第一,能说「序列生成的 token 化设计」——路径点怎么转成 token(离散化网格、图节点编码)加「生成解码约束」(强制每一步都落在合法邻接点)——「把路径翻译成模型的语言,是序列生成的关键工程」;第二,能说「冷启动的迁移学习」——不只是借销售曲线,还可以用「预训练模型加少量新店数据微调」——「相似性迁移是手动版,迁移学习是自动版——都是借,自动的更高级」;第三,能说「蚕食效应的动态监测」——不是上线算一次,而是每周看增量——「蚕食不是一次性判断,是持续监测——新品生命周期不同阶段,蚕食程度不同」;第四,能说「序列生成的评估体系」——路径质量四指标:合法性(连通约束)、最优性(比传统算法差多少)、约束满足率、生成速度——「生成质量要可量化——四个指标挂上,效果才有公信力」;第五,能说「三块的组合拳」——路径生成省配送成本、冷启动预测备货、增量模型算净增——「一块是效率、一块是准确、一块是诚实——三块合起来,才是完整的 AI 产品决策链」。

⑪ 话术库:

开场话术:「路径规划=序列生成、冷启动=借相似数据、蚕食=算净增量——三块拼图,一块都不能少。」

路径话术:「路径是一步步决策,LLM 是一个个 token——同构,所以能生成——生成加校验,路径才敢上路。」

冷启动话术:「没有自己的数据,有相似的数据——相似性迁移加特征预测,冷启动就变温启动。」

蚕食话术:「新品的光鲜背后,是老品的寂寞——净增量才是真增长,总量会骗人。」

校验话术:「LLM 负责聪明,规则负责兜底——生成不了就降级,用户永远有路径可用。」

收口话术:「决策链三块拼图——效率、准确、诚实——拼齐了,AI 产品才立得住。」

⑫ 小白 Q&A:

Q1:路径规划不就是导航 App 吗?

A:导航 App 是「查路径」,路径规划是「生成路径」——导航从固定路网里查最优解,生成式是从零「写」出一条路径,还能听懂「避开收费路段」这种自然语言——「查是找现成的,生成是现写的——查得快但刻板,生成的灵活但要有校验」。

Q2:需求预测能预测准吗?

A:不能保证准——预测的本质是「降低不确定性」,不是消灭不确定性——冷启动期误差大,数据多了越来越准——「预测不是算命,是把不确定变成可管理的范围——先小批量校准,就是给预测上保险」。

Q3:为什么新品一定会蚕食老品?

A:不一定会——真正的新品(新人群、新场景)不蚕食;「伪新品」(换个包装、改个名字)大概率蚕食——所以上线前先判断「这算不算真新品」——「真新品开拓增量,伪新品转移存量——上之前先问:这是给谁做的」。

Q4:相似性迁移怎么避免选错对象?

A:三维对齐加数据验证——先按品类、人群、场景对齐选候选,再用「回测」验证:拿候选老品过去的数据预测它自己的近期销量,预测误差小才说明基线靠谱——「候选靠三维选,靠谱靠回测验——选完验证一遍,基线才敢用」。回测的具体做法:取老品过去 12 个月数据,用前 9 个月预测后 3 个月,误差在 15% 以内就算合格基线——「回测是基线的体检报告——误差 15% 以内才敢给新品当参考」。

Q5:序列生成会不会很慢?

A:路径长度和 token 数成正比——路径短(几十个点)生成只要几百毫秒——真慢了有两条路:模型轻量化、或者生成加缓存(高频起终点缓存起来)——「路径短生成快,路径长上缓存——速度和聪明可以兼得」。

Q6:这三块拼图没经验怎么练?

A:生活里全是题——规划旅行路线(路径生成)、判断新餐厅会不会火(冷启动预测)、买新手机后旧手机用不用了(蚕食效应)——「把生活决策当产品题练——练到脱口而出,面试自然流畅」。

⑬ 没人告诉你的事:第一,「路径生成的难点不是生成,是校验」——生成的路径大多不合法,校验逻辑才是工作量的大头——「说『序列生成很酷』的人很多,把校验写明白的人很少——校验是序列生成的隐形工作量」;第二,「冷启动的第一批数据最值钱」——前两周的销售数据校准出来的模型,比算法本身值钱——「冷启动的价值在『校准速度』——越快用真实数据修正,模型越快成熟」;第三,「蚕食效应常被老板选择性忽略」——新品销量好看,老板爱听——「提增量模型要会讲:净增量是帮老板看清真相,不是扫兴——数字诚实,决策才不翻车」;第四,「相似性迁移可能带病迁移」——相似老品本身卖得差,新品借来也是差基线——「借数据要借『健康对象』——相似加健康,两个条件都要满足」;第五,「面试讲这三块要带真实数字」——「我们果茶净增量算出来只有 50 万,改策略后升到 120 万」——「带数字的三块拼图,比背概念强十倍——数字是真实性的指纹」;第六,「三块拼图是同一道题的三个角度」——序列生成讲「模型能干什么」、冷启动讲「数据从哪来」、蚕食讲「账怎么算」——「面试官听的是你的完整度——三块都答,才叫完整」。第七,「路径生成的商业价值常常被低估」——配送路径优化 1 个点,省的是全年运力的 1%——「路径优化是复利生意——每次省一点,全年省一大笔——技术题的商业价值要会算」。第八,「冷启动模型的第一次校准窗口只有两周」——前两周的真实销售数据最金贵,错过就要等下一轮——「校准窗口期比模型本身值钱——数据一到手就校准,别让窗口白白流走」。

⑭ 做一件事:今天找两个生活案例练手——第一个:规划一次三天的周末行程(或回家路线),用「序列生成」的思路写:每天去哪、顺序为什么这么排、有什么「语言约束」(避开高峰、周一闭馆),写完后检查有没有「约束没满足」——第二个:选一款你近期买过的「新品」(新手机/新App/新零食),用「蚕食思维」复盘:它替代了什么老品?净增量算得清吗?是「真新品」还是「伪新品」?——「两个生活案例练完,三块拼图就长在身上了——面试讲出来都是真故事」。

⑮ 求职助手联系:把「三块拼图」写进你面试「路径规划和需求预测」的答案里,面试官大概率追问「生成路径怎么保证合法」——答「三层校验:结构校验(节点连通)、约束校验(条件逐条核对)、降级兜底(重生成两次不行就降级到传统算法)——LLM 负责聪明,规则负责兜底」——再补一句「蚕食效应我用对照组区分:没上新品的老店做对照,对照组没跌只有我们跌——蚕食实锤」——追问就接住了。如果被问「你练过什么真实案例」,答「我复盘过自己的求职——投递 100 份换了 15 个面试,像极了冷启动:没有经验数据,先按相似岗位迁移(JD 对齐),再用前 20 份投递校准策略(小步快跑),最后算净增量——哪些渠道是伪增量(海投无效)哪些是真增量(内推)」——「把方法论用在自己身上的人,面试官更愿意相信他能用在产品上」。

⑯ 练习:

练习一:把三块拼图按顺序排出来——蚕食效应 / 冷启动 / 序列生成——分别写一句话解法。

练习二:「路径规划用 LLM 生成」——写出生成后必须做的三种校验(各配一个例子)。

练习三:「新品/新店没数据」——写出冷启动的三招(各配一个具体动作)。

练习四:给你一组数字算蚕食——新品月销 300 万、老品从 400 万跌到 150 万——净增量是多少?该不该庆祝?

练习五:用「外卖配送」的类比,把三块拼图讲给一个不懂产品的人听。

练习六:找两个生活案例练手——规划一次行程(序列生成思路)+ 复盘一个新品(蚕食思维),各写五行。

答案要点:练习一顺序——序列生成(路径规划怎么建模)、冷启动(数据从哪来)、蚕食效应(账怎么算)——三块互相独立但组合完整——「模型层、数据层、业务层——三块拼图,三层视角」;练习二三种校验——结构校验(生成的路径节点必须连通——断点重生成)、约束校验(「避开收费路段」逐条核对——违反重生成)、降级兜底(重生成两次仍不合法,降级到 Dijkstra 加约束过滤——用户永远有路径可用)——「生成是候选,校验是裁判——三层校验,路径才敢上路」;练习三三招——相似性迁移(找品类、人群、场景三维对齐的相似老品,借销售曲线做基线)、特征预测(价格、品类、商圈位置、季节进需求模型)、小步快跑(先小批量铺货,用真实销售数据快速校准)——「借数据、看特征、快校准——三招连用,冷启动不慌」;练习四算账——净增量 = 300 − 250 = 50 万(老品跌 250 万)——不该庆祝:表面增长 300 万,实际净增 50 万,还搭上老客流失风险——改策略:差异化定位(果茶打下午时段外卖场景,奶茶守堂食),净增量升到 120 万——「总量会骗人,净增量才诚实——算完再庆祝」;练习五复述要点——配送路线一步步决策像 AI 写句子(序列生成)、新门店备货参考同类店(冷启动)、上新菜老菜卖少了要算净账(蚕食)——「外卖小哥、新店老板、餐厅核算——三个场景就是三块拼图」;练习六要点——行程规划按「序列+约束+校验」三行写;新品复盘按「替代了什么、净增量多少、真新品还是伪新品」三行写——写完你会发现三块拼图无处不在——「生活练三块,面试不慌——练过的案例都是面试的弹药」。六题全过,这一题通关。

可灵导演计划冷启动

导演计划冷启动:种子×模板×传播 ① 种子创作者 100 位各领域创作者 免费试用+首批认证 作品=内容样板 证明普通人也能拍 ② 内容模板 热门模板一键套用 提示词+镜头方案 降低创作门槛 小白也能出片 ③ 传播机制 作品即广告 水印+挑战赛 每周主题赛 荣誉+流量双驱动 收口:AI 创作工具的冷启动不是「拉用户」是「造作品」——作品自己会说话 ① 大白话定义:「导演计划」是 AI 视频工具(可灵)的冷启动运营活动——产品刚上线没人知道、没人用、没内容,怎么让第一波用户来、第一波作品出来、第一波传播发生——核心思路三件套:一是种子创作者(邀请 100 位各领域创作者——电影感、动画、广告风格——免费试用加「首批创作者」认证,作品带标识有荣誉感——他们的作品是「内容样板」,证明「普通人也能拍电影感视频」);二是内容模板(上线「热门模板」——一键套用的提示词加镜头方案——不是每个人都会写 prompt,模板让小白也能出片——模板是冷启动的「脚手架」);三是传播机制(作品即广告——生成的作品带水印「由可灵 AI 创作」,二次传播时就是广告;加「导演计划」作品挑战赛——每周主题赛,获奖作品官方推荐——创作者有荣誉加流量,平台有内容库)——冷启动的关键一句话:AI 创作工具的冷启动不是「拉用户」是「造作品」——作品自己会说话。

打个比方:AI 创作工具冷启动像「新开的摄影棚搞开业活动」——先请一批专业模特和摄影师来免费拍(种子创作者),出片挂在门口当样片(作品即样板);再把「怎么打光、怎么摆姿势」写成傻瓜攻略贴在墙上(内容模板);最后办个「每月最佳照片」比赛,获奖照片挂大堂加送礼品(传播机制)——路过的客人看到样片和比赛,自己也想试试——「先有样片再有客人——摄影棚的火爆,是从第一批样片开始的」。

30 秒电梯版:「导演计划冷启动三件套:第一,种子创作者——邀请 100 位各领域创作者免费试用加『首批创作者』认证,他们的作品是内容样板,证明普通人也能拍电影感视频;第二,内容模板——上线热门模板,一键套用提示词加镜头方案,降低创作门槛,小白也能出片;第三,传播机制——作品即广告:生成作品带水印『由可灵 AI 创作』,加每周主题挑战赛,获奖作品官方推荐——创作者有荣誉加流量,平台有内容库——冷启动的关键:不是拉用户,是造作品——作品自己会说话。」

② 为什么学:第一,它是「AI 工具冷启动」的教科书——AI 工具没有老内容沉淀,冷启动比传统工具难十倍——「会设计 AI 工具冷启动的人,是面试官抢着要的人——内容工具冷启动,是 AI PM 的硬通货题」;第二,它考「双边市场思维」——创作者需要观众,观众需要好作品——「冷启动要同时启动供给(创作者)和需求(观众)——只拉一边,市场转不起来」;第三,它是「增长策略设计」的代表——不靠砸钱买量,靠机制自转——「冷启动设计得好,一毛钱广告费不花也能转起来——机制比预算值钱」;第四,它练「人设与荣誉设计」——首批创作者认证、获奖推荐——「荣誉感是最便宜的激励——设计得好,创作者自愿当免费销售」;第五,它是面试高频场景题——「给你一个 AI 产品做冷启动」——「答得出三件套加一句『造作品不拉用户』,面试官知道你有运营手感」;第六,它连接「内容飞轮」——作品多了吸引用户,用户多了创作更多——「冷启动的终点是飞轮转起来——设计时就想好飞轮怎么咬合」;第七,它是「从 0 到 1」的浓缩——产品刚上线的那一个月,就是冷启动的全部——「冷启动做得好,产品上线第一个月就有内容飞轮——做不好,半年都在原地打转」。

③ 原理拆解:导演计划冷启动拆成「三件套加一收口」:

第一件套,种子创作者——先解决「第一波作品从哪来」。选人逻辑:跨领域(电影感、动画、广告、科普、生活方式——覆盖不同人群)、腰部为主(头部贵且排他,腰部创作者有涨粉需求、愿意配合平台活动)、给足激励(免费会员、认证标识、流量扶持、创作基金——利益加荣誉双绑定)。打个比方:这像「新商场招商」——先招几个招牌店(种子商户),它们的客流就是商场的「样片」——再招小店围绕招牌店分布——「种子商户决定商场的调性——先请对种子,商场的气质就定了」。翻车案例:有 AI 绘画工具冷启动砸钱请了 10 位百万粉头部博主——结果博主们发完广告就走,粉丝没留存、平台没内容库、钱全打了水漂——后来改请 100 位万粉腰部创作者长期合作,作品每周更新,平台内容库一个月就厚了起来——「头部是流量烟花,腰部长效是内容水库——冷启动要水库,不要烟花」。

第二件套,内容模板——解决「不会创作的人怎么出片」。模板要三要素:一键套用(用户选模板,提示词自动填好——不用会写 prompt)、镜头方案(分镜脚本、运镜建议——不用懂镜头语言)、成品示范(模板配一支官方出片——用户知道「套这个模板能出什么」)。打个比方:这像「新开的健身房配私教课」——器械摆在那儿,不会练的人一脸懵——配好「新手三件套课程」(热身、器械、拉伸),跟着练就有效果——「模板是创作的私教课——有了模板,小白第一次就有成就感」。翻车案例:有 AI 视频工具上线时只给了提示词框——「请输入你的创意」——结果 90% 新用户输入几个词生成一段糊片就走了,留存崩盘——后来补了 30 个热门模板(「猫咪大片」「婚礼开场」「旅行 Vlog」),新用户留存翻了三倍——「空提示词框是专业用户的工具,模板才是大众用户的入口——冷启动期,模板比提示词框值钱」。

第三件套,传播机制——解决「作品怎么让人看见」。三通道:作品水印(生成内容带「由可灵 AI 创作」角标——作品被转发一次就是一次广告);主题挑战赛(每周一个主题——「城市夜景」「宠物大片」——获奖作品官方推荐位加创作者认证升级——创作者有荣誉,平台有内容库);社交分享引导(一键导出到短视频平台——跨平台传播)。打个比方:这像「新开奶茶店让顾客举着杯子拍照发朋友圈」——杯子印店名,顾客每发一张照片就是一次免费广告——「传播设计要让用户『顺手』替你宣传——水印、话题、分享键,都是顺手设计」。翻车案例:有 AI 创作工具做了水印,但水印加在角落、字小到看不见——用户转发作品没人知道是什么工具做的——传播为零——后来把水印改成醒目角标加「由 XX 创作」动态标识,转发带热度翻了几倍——「水印是传播的种子——藏起来的水印等于没种——传播要素要显眼,别含蓄」。

一收口,冷启动数据——先不管 DAU,先积累「高质量作品库」——作品是 AI 工具最好的评测素材(模型效果看得见)加营销素材(每一支好作品都是广告)——「冷启动的北极星不是用户数,是作品库厚度——作品库厚了,用户和评测都是水到渠成」。

④ 对比表格:

打法做什么典型失误类比
种子创作者腰部跨领域+认证激励砸钱请头部发完就走新商场招商
内容模板一键套用+镜头方案只有提示词框健身房配私教课
传播机制水印+挑战赛+分享水印藏角落看不见奶茶杯印店名
冷启动数据先积作品库一上来追 DAU摄影棚先出样片


一句话总结:种子出样片、模板降门槛、传播靠作品——冷启动是「造作品」,不是「拉用户」。

⑤ 3+ 个例子:

例一,可灵「导演计划」完整方案——邀请 100 位电影感/动画/广告风格腰部创作者(免费会员加首批认证);上线 30 个热门模板(「城市夜景大片」「猫咪大片」「婚礼开场」);水印「由可灵 AI 创作」加每周主题挑战赛(获奖作品官方推荐位);冷启动一个月后作品库 5000 支,模型评测素材和营销素材全齐——DAU 是顺带的。为什么典型:它演示「三件套完整落地」——每个环节都有具体动作——「方案里的每个名词都能落成动作,才叫方案——落不动的方案是口号」。

例二,面试回答「给你一个 AI 产品做冷启动」——回答:「先看产品类型——内容生成工具:种子创作者(腰部跨领域免费试用加认证)、内容模板(一键套用降门槛)、传播机制(水印加挑战赛加分享引导)、冷启动数据(先积作品库,不追 DAU)——关键一句:内容工具的冷启动是造作品,不是拉用户——作品自己会说话」。为什么典型:它演示「通用框架」——不管哪个内容工具都能套——「框架能迁移,面试官才放心让你带产品——只会讲可灵,换一个产品就傻眼的人,不是产品经理」。

例三,AI 写作工具的冷启动——小红书博主赛道:邀请 50 位博主用 AI 写笔记(种子创作者);上线「爆款标题模板」一键套用(内容模板);笔记带「AI 生成」标签加写作挑战赛(传播机制)——两个月后「AI 笔记」话题阅读量破千万。为什么典型:它演示「三件套跨场景复制」——视频工具能用的,写作工具一样能用——「三件套是内容工具冷启动的通用骨架——换赛道,骨架不变」。

例四,AI 修图工具的冷启动——摄影爱好者赛道:邀请摄影师免费试用(种子);「一键修图风格包」(胶片感/日系/复古)上线(模板);修图作品带风格水印加「月度风格大赛」(传播)——摄影师的作品就是工具最好的广告。为什么典型:它演示「创作者生态」——摄影师不只产出作品,还教别人用(教程就是更多模板)——「种子创作者会生长出创作者生态——第一批人带第二批人,飞轮就转起来了」。

例五,生活场景——新开的自习室怎么冷启动——种子用户:请考研党免费体验一周(种子创作者);模板:把「番茄钟学习法」做成打卡表贴墙上(内容模板);传播:考研上岸的人晒打卡记录加自习室地址(传播机制)——「自习室的冷启动和 AI 工具一模一样——种子、模板、传播,三件套通用」。为什么典型:它演示「冷启动思维是通用的」——线下生意也能套——「会三件套的人,看任何新生意都知道怎么起步——冷启动思维是产品人的通用装备」。

⑥ 常见误区:误区一,砸钱请头部——头部博主发完就走,钱打了水漂——「头部是烟花,腰部是水库——冷启动要水库不要烟花」;误区二,只有提示词框——专业用户的工具,大众用不来——「模板是大众的入口——冷启动期,模板比提示词框值钱」;误区三,水印藏角落——含蓄的水印等于没种——「传播要素要显眼——水印是种子,藏起来就不发芽」;误区四,一上来追 DAU——用户来了没作品看,留不住——「先积作品库——作品库厚了,DAU 水到渠成」;误区五,挑战赛只给奖品不给荣誉——「获奖认证和推荐位比奖品值钱——创作者要的是被看见」;误区六,种子创作者只选一个领域——全是电影感风格,其他人群无感——「跨领域覆盖——不同人群都要有样片,市场才铺得开」。

⑦ 第一人称面试回答:「如果让我设计可灵的『导演计划』冷启动,我会做三件套加一收口:第一,种子创作者——邀请 100 位各领域腰部创作者(电影感、动画、广告、科普),免费试用加『首批创作者』认证,作品带标识——他们的作品是内容样板,证明普通人也能拍电影感视频;第二,内容模板——上线 30 个热门模板,一键套用提示词加镜头方案,小白也能出片——模板是冷启动的脚手架;第三,传播机制——作品即广告:水印『由可灵 AI 创作』加每周主题挑战赛,获奖作品官方推荐——创作者有荣誉,平台有内容库;收口:冷启动数据先积累高质量作品库,不追 DAU——作品是评测素材也是营销素材——关键一句:内容工具的冷启动不是拉用户,是造作品——作品自己会说话。我做景观设计时也做过类似的『冷启动』——新公园开放前,先请摄影爱好者来拍样片(种子创作者),把『最佳机位』做成导览图贴在门口(内容模板),再办『最美公园一角』线上摄影赛(传播机制)——公园的热度从样片开始,不是从广告开始——和可灵一个道理。」

⑧ 小结口诀:冷启动四句口诀——「一种子,腰部跨域先出样;二模板,一键套用降门槛;三传播,水印挑战带作品;四收口,作品库先攒不追量——造作品,不拉用户——作品自己会说话。」

⑨ 三轮追问:

追问一:种子创作者为什么选腰部不选头部?

答:三层逻辑——成本(头部博主报价是腰部的几十倍,冷启动预算有限——「同样的钱,请 1 个头部还是请 100 个腰部,答案很清楚」);配合度(头部有排他协议、档期紧张,腰部创作者有涨粉需求、愿意配合平台活动、做模板教程——「腰部要的是机会,头部要的是价码——冷启动需要的是愿意陪你玩的人」);内容结构(100 个腰部跨领域覆盖各人群,1 个头部只覆盖单一人群——「冷启动要的是覆盖面,不是单点引爆——100 个种子撒下去,各领域都有样片」)。

面试官想听什么:考察「资源分配思维」——知道钱花在哪儿回报最高——「能说出腰部逻辑的人,算过冷启动的账」;也考察「生态认知」——明白创作者要的不只是钱。

追问二:模板会不会让作品同质化,平台内容千篇一律?

答:会,所以模板要「半开放设计」——模板给「骨架」不给「全定」:提示词留可替换槽位(主体、场景、风格三处可改——「猫咪大片」把猫咪换成小狗、换成朋友都可以);配「自由创作」入口(模板一键套用旁边永远有空白创作框——想自己写 prompt 的人随时能走);再加「模板排行榜」激励二次创作(每周「最有创意改编奖」——套模板改成自己的故事,反而成为推荐内容——「模板降门槛,开放保多样——门槛和自由度要同时给」)。

面试官想听什么:考察「预判副作用」——想到模板可能带来同质化——「能主动补开放设计的人,设计过完整功能」;也考察「平衡思维」——不因噎废食。

追问三:挑战赛的获奖作品靠什么评?人工评审会不会有猫腻?

答:评审机制四层——数据初筛(播放量、完播率、转发量进前 20 的自动入围——数据不说谎);人工终审(平台编导加外部评委双人评分,去掉最高最低分——「双人背靠背评分,猫腻空间小一半」);公示与申诉(入围名单公示三天,有异议可申诉复核——「公开是最好的防腐剂」);规则写清(评分维度提前公布:创意 40%、完成度 30%、传播潜力 30%——「规则透明,参赛者才服气」)。

面试官想听什么:考察「机制设计完整性」——评审这种容易出争议的事,有没有完整机制——「能说出四层评审的人,设计过活动全流程」;也考察「公正意识」——活动公信力是内容生态的命根子。

⑩ 进阶加分点:第一,能说「冷启动的阶段划分」——0-2 周纯种子期(只服务种子创作者,收集反馈迭代模板)、3-8 周内容爆发期(挑战赛上线、作品库快速积累)、8 周后生态运营期(达人成长体系、商业化分润)——「三个阶段三套打法——冷启动不是一锤子,是节奏」;第二,能说「创作者激励体系设计」——荣誉(首批认证、获奖推荐、等级头衔)、流量(首页推荐位、搜索加权、挑战赛曝光)、收益(广告分润、官方约稿、品牌合作撮合)三螺旋——「荣誉让创作者有面子,流量让作品有曝光,收益让创作有回报——三螺旋转起来,创作者生态才稳」;第三,能说「模板的运营策略」——不是上线 30 个就完事:每周更新 3-5 个新模板、节假日出节日模板(春节、七夕)、追热点模板(爆款电影上映当天出「电影感预告大片」模板)——「模板是内容产品,要持续供给——模板运营和内容运营是一回事」;第四,能说「数据埋点设计」——种子创作者行为全程埋点:注册渠道、首次创作时长、模板使用率、作品分享率——「埋点从冷启动第一天开始——冷启动的数据是下一阶段迭代的依据」;第五,能说「失败预案」——三件套跑两周没起色怎么办:种子没产片(加创作补贴、提供拍摄素材包)、模板没人用(用户调研改模板方向——数据说明一切)、传播不起来(换传播渠道——短视频平台投流测试)——「冷启动要带预案——没预案的活动,出了岔子就停摆」。

⑪ 话术库:

开场话术:「AI 创作工具的冷启动,三件套:种子创作者、内容模板、传播机制——冷启动是造作品,不是拉用户。」

种子话术:「种子创作者是内容样板——他们的作品证明普通人也能拍电影感视频。」

模板话术:「模板是创作的脚手架——一键套用,小白第一次就有成就感。」

传播话术:「作品即广告——水印、挑战赛、分享键,让用户顺手替你宣传。」

阶段话术:「冷启动分三阶段——种子期、爆发期、生态期——每阶段一套打法。」

收口话术:「冷启动的北极星不是 DAU,是作品库厚度——作品库厚了,用户和评测都是水到渠成。」

⑫ 小白 Q&A:

Q1:冷启动为什么不直接砸钱投广告?

A:可以投,但只投广告有个死结——用户来了没内容看,留存不住——「广告拉来人,内容留住人——冷启动要先把内容库建起来,广告才有得可接——三件套是先把『留人的内容』造出来,投流是后面的事」——先造作品再造用户,顺序不能反。

Q2:种子创作者请不来怎么办?

A:两条路——降门槛(不需要大咖:万粉腰部、校园创作者、垂直领域爱好者都可以——「种子不是请明星,是请各领域第一批吃螃蟹的人」);加诚意(免费会员、认证、流量扶持、创作基金——「早期创作者要的是被重视——认证和推荐比钱有时更打动人」)。

Q3:没有头部创作者,平台会不会显得很 low?

A:不会——头部是后来锦上添花的,冷启动期「内容丰富度」比「咖位」重要——「用户第一眼看到的是内容库的丰富程度,不是有几个大咖——100 个领域各有一支好作品,比 1 个明星的广告片更有说服力」。

Q4:挑战赛会不会办了没人参加?

A:会,所以赛制要降低参与门槛——主题要「人人可拍」(「城市夜景」「我的猫咪」这种日常题材);模板直接套用(参赛作品一键套模板生成);奖项分大众奖和专业奖(让普通用户也有获奖机会)——「挑战赛的门槛要低到『顺手就能参加』——门槛高了,比赛就剩主办方自己玩」。

Q5:水印会不会让创作者反感,影响作品传播?

A:会——所以水印要「小而不碍事,但一定认得出来」——角落小水印加生成页面的信息标签(点开作品能看到「由可灵 AI 创作」);再加一个价值交换:带水印作品自动进「推荐池」优先曝光(创作者分享作品本身就有流量回报)——「水印不是强迫是交换——给创作者流量,创作者帮平台宣传——双赢的水印才不惹人烦」。

Q6:冷启动多久算成功?

A:看三个里程碑——第一周:种子创作者产片率超过 80%(没跑路);第一个月:作品库超 5000 支、模板使用率超 60%;第三个月:自然增长占比超 50%(不靠活动也能来新用户)——「冷启动的成功不是看天数,是看飞轮转没转起来——自然增长占比过半,飞轮才真正自转」。

⑬ 没人告诉你的事:第一,「冷启动最大的风险不是没人用,是第一批用户体验崩了」——人少的时候 bug 和卡顿会集中爆发,第一批用户最容易被劝退——「冷启动期要配最强的客服——第一批用户的坏体验会写成差评流传,好体验会变成种子传播」;第二,「种子创作者不是免费的,他们需要被服务」——对接专人、反馈群、问题 24 小时响应——「创作者被服务得好,作品才产得快——种子期运营比产品开发还忙」;第三,「模板不是设计出来的,是『抄』出来的」——先看抖音快手小红书什么内容火,把火的内容反推出模板——「模板的灵感在竞品的爆款里——爆款就是用户用脚投票的模板」;第四,「挑战赛的奖品预算要留 30% 给『意外惊喜』」——临时加个特别奖(当月最佳故事奖),活动才有话题度——「活动的惊喜感来自预算外的彩蛋——全是计划内的,就缺了传播的意外感」;第五,「冷启动期间的产品迭代要快得惊人」——种子创作者反馈的问题今天收到明天上线——「冷启动期的迭代速度决定种子留存——慢一周,种子可能已经跑去别的平台」;第六,「冷启动的成败在第三周见分晓」——前两周是投入期看不出结果,第三周的作品曲线和用户留存数据基本定调——「第三周的数据要天天盯——发现问题还来得及调,再晚就来不及了」。

⑭ 做一件事:今天用「三件套」给一个生活场景设计冷启动——选一个你熟悉的线下场景(新开的面包店、社区健身房、桌游店都行),写三件套方案:种子用户请谁(第一批愿意来的 5 类人)、内容模板是什么(让新手立刻上手的「模板」——比如面包店的试吃菜单卡、健身房的 7 天入门课表)、传播机制怎么设计(怎么让第一批客人帮你带人——打卡拍照、朋友圈集赞、老带新折扣)——写完拿给一个朋友听,问他「听完你想不想去?为什么?」——「三件套方案过一遍人肉测试,你就知道哪件套设计得不够——生活场景练三件套,面试讲可灵就不慌」。

⑮ 求职助手联系:把「三件套加一收口」写进你面试「AI 工具冷启动」的答案里,面试官大概率追问「如果预算只有 10 万怎么分」——答「按『种子占比五成』分:种子创作者 5 万(100 位腰部创作者激励)、模板和运营 3 万(模板制作加挑战赛奖品)、传播 2 万(挑战赛投流测试)——冷启动的钱优先花在种子上,种子出了作品,传播是水到渠成——预算分配的逻辑是:先有作品,再谈曝光」。如果被问「你练过什么真实案例」,答「我练过线下场景——用三件套给一家新开的面包店设计过冷启动:种子是社区里的美食博主和宝妈群(免费试吃加认证),模板是「三明治搭配卡」和「面包储存指南」(新手立刻会用),传播是「带图好评送面包券」加「新客集赞换甜点」——两周后店里周末排起队,一半客人说「朋友发朋友圈看到的」——三件套在线下一样转得起来」。

⑯ 练习:

练习一:把三件套按顺序排出来——内容模板 / 传播机制 / 种子创作者——各写一句话作用。

练习二:种子创作者为什么选腰部不选头部?写出三个理由。

练习三:模板的同质化风险怎么解决?写出「半开放设计」的三个要点。

练习四:用「新开摄影棚搞开业活动」的类比,把冷启动三件套讲给一个不懂产品的人听。

练习五:给一个 AI 写作工具(小红书笔记助手)写冷启动三件套方案,每件套一个具体动作。

练习六:冷启动的失败预案——三件套跑两周没起色,分别给三件套各写一个补救动作。

答案要点:练习一顺序——种子创作者(第一波作品从哪来)、内容模板(不会创作的人怎么出片)、传播机制(作品怎么让人看见)——「种子出样片、模板降门槛、传播靠作品——顺序就是冷启动的推进顺序」;练习二三个理由——成本(头部贵几十倍,同样的钱请 100 个腰部)、配合度(腰部有涨粉需求、愿意配合活动做教程,头部档期紧张还有排他协议)、覆盖面(100 个腰部跨领域覆盖各人群,1 个头部只覆盖单一人群)——「头部是烟花,腰部是水库——冷启动要水库不要烟花」;练习三三个要点——模板留可替换槽位(主体、场景、风格三处可改)、配「自由创作」入口(想自己写 prompt 的人随时走)、模板排行榜激励二次创作(套模板改成自己的故事反而成推荐内容)——「模板降门槛,开放保多样——门槛和自由度同时给」;练习四复述要点——请专业模特摄影师免费拍(种子)、把打光摆姿势写成傻瓜攻略贴墙上(模板)、办每月最佳照片比赛挂大堂(传播)——「先有样片再有客人——摄影棚的火爆,从第一批样片开始」;练习五要点——种子:邀请 50 位小红书博主免费试用加「爆款笔记认证」;模板:上线「爆款标题模板」一键套用加笔记结构卡;传播:笔记带「AI 生成」标签加「AI 笔记大赛」,获奖笔记官方推荐——「三件套跨场景复制——视频工具能用的,写作工具一样能用」;练习六要点——种子没产片:加创作补贴、提供素材包;模板没人用:用户调研改模板方向;传播不起来:换渠道投流测试(短视频平台、社群、线下活动)——「冷启动带预案,出了岔子不停摆——每个环节都有 Plan B,活动才敢开跑」。六题全过,这一题通关。

← 上一章☰ 目录下一章 →
📝 我的备忘录

不认识的蓝色词、不会答的紫色题,点一下就收进来。
两类分开存:词是拿来查的,题是拿来练的。
📌 正文点一下任意一段,或点词/题弹卡里的「先放着」= 暂存待看。

💬 不懂就问
备忘录管存(收藏不会的词和题),这里管问——复制书上任何看不懂的字句粘贴进来,它用大白话讲给你听。
提问后关掉面板也能继续跑,答完了右下角💬会亮红点提醒你。
你好呀,我是你的面试陪练老师👋

书里哪句话看不懂、哪个词不认识、哪道题不知道怎么答,直接粘贴进来问我。我会用大白话讲,讲完还会告诉你怎么在面试里用。

举个例子:粘贴「RAG是检索增强生成…」,问:这句话是什么意思?面试官为什么问这个?
🎤 语音面试
点击🎤开始语音面试
⚙ 设置(AI能力三连 / 我的情况 / 同步)
自动模式按 Gemini → GPT → GLM → DeepSeek 顺序自动选可用模型;选中大模型后只走该模型;千问-VL 专用于看图片,无需配置。价格已卡死:所有模型 ≤ 输入2元/输出4元每百万token

AI 每次对话都会带上这段「我的情况」(改完立即生效);留空 = 用默认设定

✅ 永久同步已开启:…
电脑和手机打开同一网址即自动同步,无需绑定
🤖 智能 = 它自己判断:简单问题不思考直接答;问天气/新闻/行情自动联网;闲聊日常自动切日常口吻。
🗂 对话记录