Gina · AI 原生增长认知日报

VOL.023 · 编辑 / Gina

AI-Native Growth Notes

Gina 增长认知日报

从基础概念、真实案例到系统机制:把 AI Growth、产品分析与客户体验逐步连成一张完整地图。

2026 年 8 月 26 日 · 周三

Concept · Case · System · Practice

01

今日判断

Judgment

找到“最可能流失的人”不等于找到了“最值得挽回的人”。前者预测用户自己会不会走,后者要估计某个具体动作能不能改变她的结果。AI-native 增长系统真正该优化的不是预测分数,而是 incremental effect(增量效果):只在动作比“不动作”更可能创造价值、且不会损害信任时介入。

02

新手先懂

Beginner Primer

传统分群常问:“谁最可能流失、购买或求助?”但这个概率描述的是用户本来的倾向,不是触达造成的变化。

Uplift Modeling(增量效果建模),大白话是:不只预测一个人会怎样,而是估计“对她做这个动作”和“什么都不做”之间,结果可能差多少。它要解决的是反事实问题——同一个人不可能同时既收到消息又没收到消息,所以系统必须从随机对照数据中学习相似人群的差异。

生活类比是下雨天发伞。站在屋檐下的人最可能保持干燥,却未必需要伞;真正值得帮助的,可能是拿到伞就会改变行动的人。还有人本来会带伞,发伞只是浪费;也有人会被突然打断,动作反而制造负价值。

Momcozy APP 的待验证例子是设备绑定帮助。高失败风险用户可能遇到兼容或设备故障,帮助卡改变不了结果,应进入排障或人工接管;低风险用户本来就会成功,不需要打扰。真正适合实验的,是出现可解释卡点、帮助有机会改变下一步且风险边界清楚的人。预测卡住预测帮助有效是两种模型。

03

外部案例

Cases & Signals

Spotify:全量消息有混合效果,于是从“谁会留存”转向“消息对谁有增量”

精准触达的正确目标不是找到最活跃或最可能付费的人,而是找到“收到消息后结果会比不收到更好”的人。

关键事实

Spotify 长期保留随机 holdout(留白对照组,即一部分合格用户不接收站内消息),发现全量消息的整体效果是混合的。因此他们训练 uplift model,同时估计“发”和“不发”下的结果;上线前用历史随机数据做 offline policy evaluation(离线策略评估),比较全发、全不发和模型选择三种策略,之后再做真实 A/B test。官方称实验看到显著留存改善并进入生产,但未公开具体效应值。

编辑视角它证明了什么: 这证明随机留白数据可以让模型学习干预的差异效果,也证明模型的离线评分必须再接受真实 A/B test。它不能证明 uplift 模型天然适合所有渠道,更不能把 Spotify 的娱乐内容触达直接外推到母婴设备场景;目标、时效、干扰成本与隐私风险都不同。

Spotify 2026 研究:让 LLM 模拟用户,仍不能替代真实增量证据

AI 可以帮助筛掉弱候选,却不能因为“模拟用户说会喜欢”就宣布某次干预有效。

关键事实

Spotify 2026 年 8 月用 Upworthy 数千个标题 A/B test 检验 LLM 能否替代真人反应。未经校准的 GPT-4o-mini 只恢复了真实人类 treatment effect(处理效果)的 39%,并系统性把效果压向零。要成立,LLM 必须捕捉干预影响真人反应的全部关键信息,且预测与真人行为的对应关系在新旧实验间稳定。机器学习校准在历史留出实验中表现较好,但普通线性校准偏离真人基准 3.8 个标准误。

编辑视角它证明了什么: LLM 输出可以作为候选代理信号,但可信度来自过去的真人实验校准;越是全新界面、定价或旅程,历史对应关系越可能失效。Upworthy 的标题点击也不能代表 APP 留存。真实随机实验靠设计识别因果,LLM 模拟靠假设推测因果。
04

Lenny 实战深读

Lenny Deep Read

先认识这个人,以及今天新增什么

Elena Verna 是 Lovable 的增长负责人。今天新增一个机制:她为什么把赠送 AI 使用额度视为 marketing cost(获客投入),而不是毛利损失。

核心机制:把资源给能放大产品价值的人

访谈约 51:48–57:42,Elena 说,Lovable 会为用户自发组织的 hackathon(集中共创活动)提供免费额度。逻辑不是“所有人都免费”,而是:当用户愿意向周围人展示产品、组织试用并完成教育与激活时,额度可能形成体验—展示—口碑—新体验的循环。团队把模型成本视为营销投入,并强调先让用户获得第一次 preview(预览)的 wow moment(惊喜时刻)。

这与按“最可能付费”排序不同。本来就准备付费的人即使不给额度也会转化;能组织多人体验的人,当前付费概率未必最高,却可能创造更大增量。要估计的是这次资源投入改变了什么

最容易误解的地方

Lovable 是可快速重试、适合公开分享的 AI 创作工具。Momcozy 有实体设备、母婴和健康语境,不能照抄“多送、多曝光”,也不能用敏感阶段或设备数据寻找“最容易被说服的人”。访谈也没有给出随机实验增量,不能把公司增长与单一打法写成因果。

05

AI-native 机制

System Mechanism

以“干预资格 Agent”为例,链路不能停在预测流失名单。

系统读取什么:已批准的目标与动作;随机分配、真实曝光和留白对照;动作前的最小必要特征;稳定任务结果、再次失败、留存、负面 VOC 和人工接管。敏感数据不得为提高转化被跨场景拼接。

形成什么判断:分别估计“不动作结果”和“执行某个具体动作后的结果”,得到增量及不确定性;再把用户分成可能受益、本来就会成功、难以改变、可能被伤害或证据不足。高流失风险不自动等于应触达。

能做什么:在已批准的低风险实验里建议“帮助、暂不动作或交给人”,保留随机 holdout,控制频率与预算,并输出证据缺口。它不能未经确认发送 Push、EDM、站内信,不能根据敏感阶段自动促销,也不能自主改变生产策略。

如何看结果并更新策略:比较真实增量、稳定任务结果、重复失败、留存与信任护栏;收到帮助后若与留白组无差异,就降低动作优先级;转化增加但退订、负面 VOC 或错误操作恶化,则判为负增长。结果更新下一轮资格规则,而不只更新文案。

何时交给人:样本不足、效果不确定、健康或儿童语境、设备安全、连续失败、隐私不清,以及所有生产触达与放量。预测流失并生成人群包属于 AI-assisted Operations(AI 辅助运营);持续比较动作与不动作、在权限内选择或克制、再用结果更新策略,才接近 AI-native Growth System(AI 原生增长系统)

06

Momcozy 场景

Momcozy Lens

场景一:设备绑定与首次稳定价值。 待验证假设是,一部分卡点用户会被及时帮助改变,一部分属于版本、兼容或设备故障,帮助卡无效甚至延误排障。可以先比较“合格低风险卡点中,展示帮助 vs 留白”的稳定结果与重复失败,不能只看点击帮助或短期完成。最先需要的是把“可被帮助的摩擦”和“必须排障/接管的故障”分开。

场景二:AI 助手与 BBM/VOC。 待验证假设是,主动提示对第一次不知道如何提问的人可能有价值,对已经在完成明确任务的人则可能打断。可以用最小化行为证据定义低风险资格,保留不提示组,并把正确接管记为好结果。不能读取敏感会话去预测谁更容易接受推荐,也不能把更多会话当作帮助有效。

场景三:订阅与阶段性服务。 “最可能流失”可能混合价格、阶段自然结束、体验故障和不再需要服务,所需动作完全不同,阶段结束甚至不该挽回。可以验证某项权益是否创造增量,不能根据推断的孕产育阶段自动触达。先要定义不动作的自然结果,以及什么属于正常结束。

可以借什么、不能照抄什么:可以借随机留白、干预增量、频控和负效果识别;不能照抄 Spotify 的高频触达或 Lovable 的免费分发。Momcozy 首先要证明动作帮助了真实任务,同时没有损害评分、留存和信任。

07

术语卡

Glossary
  • Uplift Modeling|增量效果建模:估计一个具体动作相对不动作改变了多少结果。Momcozy 例子:不是预测谁会绑定失败,而是预测帮助卡能否提高其稳定使用。
  • Treatment Effect|处理效果 / 干预效果:同类人接受动作与不接受动作的结果差。Momcozy 例子:展示连接指导相对留白带来的稳定连接增量。
  • CATE|条件平均处理效果:在某类条件相似的人群里,平均干预效果是多少。Momcozy 例子:特定低风险卡点中,帮助是否有效;它不是对单个人命运的确定判断。
  • Holdout|留白对照组:符合资格但暂不接受动作的一组,用来观察自然结果。Momcozy 例子:一小部分合格用户不显示新帮助,以判断帮助是否真的创造增量。
  • Heterogeneous Treatment Effect|异质干预效果:同一个动作对不同人可能有益、无效或有害。Momcozy 例子:提醒帮助忘记步骤的人,却打扰正在顺利完成任务的人。
08

今日行动

Practice
做一张“预测风险 ≠ 预测可改变”的干预资格卡,不触达真实用户、不改生产:
  1. 选一个假想动作:设备绑定卡点时展示帮助;
  2. 写出四类人:本来会成功、帮助后可能成功、帮助也难改变、可能被打扰或延误接管;
  3. 每类只写一条动作前可观察证据,避免敏感画像;
  4. 规定一个真实结果、两个信任/安全护栏和一个随机留白;
  5. 写清哪类必须交给人,哪类最合理的动作是“不动作”。

产出物是一页“自然结果—干预结果—证据—护栏—留白—接管”卡。完成后能更新的判断是:我们想找的是最可能失败的人,还是最可能因一次合适帮助而改变结果的人?最后只回答一个具体问题:在 Momcozy APP 当前旅程里,哪一种高风险用户即使预测分数很高,也最不应该进入自动触达,而应直接排障、人工接管或保持不动作?