报告 02
AI人格成长OS创业的约束
身份约束=显式、可被现实推翻、真会改的生成模型,硬度却是自设;竞品空位真实但空着有原因
一个团队要在中国做"AI 人格成长 OS",目标写出来只有一句:让系统持续建一个人的模型,照着模型给干预,让这个人真的变。但一句话不成题。同样这句话,摆在一个有无限时间和无限用户耐心的世界里是一道题,摆在中国、摆在 2026 年、摆在一支跑道有限的小团队手上,是另一道题。后面这道题的解空间窄得多,窄到最后只剩一个形状——一个人、一个问题、三十天。这个形状不是想出来的,是被几堵墙夹出来的。把墙摸清楚,那场对话最后为什么会收在这儿,就不必再归功于谁的灵感。
先摸边。
最要命的一条是证据。要把 Memory 变成 Model,系统要的不是"这个人说过什么",而是一条完整的链:什么情境、他当时预测什么、情绪多强、实际做了什么、现实回了什么、预测错了多少。这条链只在事情发生的当口存在,隔两天再问,人会替自己重编一遍,编出来的是叙述不是证据。而中国用户的自述语料现在主要沉在豆包、DeepSeek 和微信聊天框里——一来不归你,二来那里面绝大部分是查资料、写邮件、翻译、闲聊,用对话里的说法是 task-related 而不是 self-related。这条硬,硬在"没有纵向行为证据就建不了模",这是信息层面的事,不是努力层面的事。但要分清它硬在哪一截:常跟着它一起被引用的那句"中国人不会对某个专项 app 长期投喂语料",就不硬了。Rosebud 攒了五亿字、七千五百个付费用户(对话中数字,未独立核验),它没有逼人写成长日记,它换了一个体裁。有人跨过去了还活着,这条就该从硬约束降级成"体裁没选对"——是旧解释,不是人性。
第二条,两个钟不同速。人格变化的钟按月按年走,产品考核的钟按天走。用户第三天就决定还要不要再打开,而模型的价值要三个月才显形。这个落差不是团队勤奋能抹平的,它硬。
第三条和第二条拧在一起:输入摩擦有上限。人愿意为自己的事付出的注意力,一次大概就是几十秒,而且他愿意付的是"我今天有个事想弄明白",不是"我来帮 AI 更懂我"。后面那句话没人会连着说三十天。这条也硬——它是人的注意力预算,不是产品没做好。
第四条是现金和带宽。七个问题域乘 N 种人格组合乘 N 套干预乘 N 个反馈指标,复杂度炸开,团队做不完。对话里 GPT 一路在做减法(第一版不做完整 OS、被动数据统统先不要、第一版不同时做七个领域),底下垫的全是这一条。这是最标准的硬约束:现金流断了就没了,不商量。
第五条,标签会把人变形。告诉一个人"你是回避型",他会开始用这四个字解释自己所有的行为,然后真的越来越像。这不是法规规定的,是认知系统本来就这么工作——所以它在世界层,是硬的。它跟规则层那条不一样:心理测评在中国有资质边界,app 不能做诊断、不能承诺疗效、广告不能绝对化,这些是软的,违反了有人罚你,是价码问题。硬的那条更狠,它不罚你,它直接把你的产品变成伤人的东西。
第六条是微信生态,软的。iOS 抽成、心理健康类目的审核敏感、微信里对外链和诱导分享的限制、社群运营是人力密集且自动化不了的活。有代价,但能算账。
第七条最容易漏:报酬和后果不对称。用户做三十天实验,做成了上行归他,失败了下行也归他——不光是"我又没做到",还多一份数据坐实"我确实不行"。系统这边,上行是拿到高价值证据和留存,下行几乎为零,模型猜错了一句"待更多样本验证"就翻篇。这条非对称很结构性,它会一路影响到选哪个问题域、结果页怎么写、社群怎么运营。
第八条,信息卡在两头。用户看得见的是"我今天做没做",系统看得见的是"你的预测和现实差了多少"——这个落差就是这个产品全部的价值来源,用户自己看得清就不需要它了。但反过来也成立:系统看不见用户不肯说的那部分,而防御机制、真实的价值排序、关系里难堪的那些事,恰恰只住在那部分里。更麻烦的是,能测的指标会把优化方向拽走:打卡率、完成率、DAU 都好测,模型到底变没变不好测。对话里提出的 MIG(每次交互给模型增加多少新信息)就是想把看不见的拽回可测,可 MIG 本身也只能估。这条硬,它解释了这个赛道里最常见的滑坡——做着做着就滑回打卡 app。
约束摆完,那场对话里的四处争执就能拆了,而且拆开会发现有几处根本不是同一道题。
第一处,用户问"如何让用户长期投喂语料",GPT 把题改成"如何低摩擦获得高质量行为证据"。用户那道题底下垫着两个默认:数据量决定模型质量,以及拿数据的唯一办法是用户主动付出。GPT 那道题垫的是另外两个:信息增益而非字数决定模型质量,以及用户只为即时价值付出、不为长期价值付出。两道题的最优解方向几乎正交——前一道题的解空间里,最优解是加动机、加激励、做游戏化,想办法让人多写;后一道题的解空间里,最优解是让证据变成副产品,用户为了解决今天的事进来,系统顺手建模。改题改对了,但有一处被顺手滑过去:高质量证据仍然要用户如实报告自己的预测和结果,这仍然是主动付出,只是从一千字压到四句话。被消掉的是"日记"这个体裁的摩擦,不是自我报告本身的摩擦。摩擦降了一个量级,没降到零。
第二处,用户说"产品又变重了",GPT 说"没有结构化就看不出改变效果"。这两句话说的压根不是同一样东西。用户的"重"指的是开发工作量和用户每天要动几下手指;GPT 的"必须结构化"指的是证据的可比性——没有基线、没有固定的四元组,第三十天和第一天就没法对比,"改变"就证明不了。一个在说界面,一个在说数据结构。这是四处错配里唯一一处真能被升维消掉的:结构化必须发生,但可以只发生在后台。前台让用户随口说"今天本来打算跑步,下班太累就没跑",后台去抽情境、能量、计划行为、实际行为、障碍、下一个实验。对话里那句"结构化数据,非结构化体验"不是一句巧话,是这处错配拆开之后自动掉出来的答案。
第三处,前台简单和后台七层复杂,看着像矛盾,其实不是两方,是同一道题的两条约束——前台简单来自注意力上限,后台复杂来自建模的证据要求,各管各的,不冲突。真正的矛盾藏在旁边:后台七层的复杂度是团队带宽要付的账,而这笔账用户看不见,也不会为它掏钱。所以题面其实是"哪几层现在必须建,哪几层可以先空着"。Adaptive Assessment 就是拿现金流约束去切建模约束,把 L0 到 L7 从"必须全建"降成"按需实例化"——用户说"最近就是做不了事",那就先测尽责性、神经质、目标清晰度、自主动机、完美主义、能量和环境限制,二十道题够了,依恋和防御先放着。
第四处最深,因为外观完全一样:三十天打卡和三十天 N-of-1 实验,都是三十天、都每天记录、都有社群、都有结果页,差别只在第一周做什么。打卡的第一周就开始改,实验的第一周什么都不改,只测基线。这背后是两套对"失败"的定价:打卡那套默认动力来自连续性,断了就是损失;实验那套默认因果推断需要基线和对照,失败是一个有信息量的样本,甚至是最有信息量的那个。定价相反,产品的全部气质就相反。这也直接决定了社群该怎么开——打卡群天然惩罚失败者,失败的人静默退群,留下的样本被成功者污染;实验群必须反着来,奖励如实上报失败的人。对话里说微信社群承担社会监督、见证效应和数据兜底,说得对,但没说透:微信群的默认引力就是打卡,把实验放进去,群会自动把它退化回打卡,除非运营一直逆着拉。这是引流微信的真实代价,不在抽成和审核里,在这儿。
错配拆完,再看几对真正互斥的约束把解空间夹成了什么形状。
第一对是证据密度乘输入摩擦。两条都硬:贝叶斯更新要求高频、结构化、带预测和结果的四元组;人的注意力只肯给几十秒、不结构化、想说啥说啥。交集不空,但窄得只剩一条缝——用即时价值换来的、伪装成对话的、后台结构化的微输入。Micro Capture 落在这条缝里,它不是产品设计师的灵感,是两堵墙之间唯一还能走人的地方。
第二对是显式可解释的模型乘标签的自我实现风险。要让用户第一眼就"对,就是我",模型必须显式、可读;可显式可读天然就是标签化的,标签化就触发变形。交集同样被夹得只剩一种表达形态:概率、假设、待验证、等现实来推翻。"Hypothesis, not Identity"写出来像伦理自觉,其实是这对矛盾夹出来的唯一开口——不这么说,产品要么不可信,要么伤人。
第三对最难受,交集接近空:单点切入乘人格要全人。"行动执行"这个切口能测出尽责性、神经质和一点动机,测不出依恋和防御——而"为什么我是这样的人"这个卖点的来源,恰恰在依恋和防御那一层。依恋和防御的证据只能从关系事件里来,关系域正是第一版必须回避的高风险地带,因为那里失败的下行用户扛不起,还可能真出事。于是第一版注定只能交付"我的行为说明书",交付不了"我是谁"。产品做的是行为改变,喊的口号是人格 OS,这个拧巴不是定位没想清楚,是这对矛盾在解空间里留下的空格。
第四对是护城河要长乘跑道要短。数据资产要两年才叠出交换成本,现金只够十二到十八个月。交集窄,但不空:必须做出一个短周期、可感知、能收钱的价值单元,而这个单元还得顺手沉淀长期资产。三十天实验加订阅正好落在这个交集里——三十天是能卖的最小单元,订阅是把三十天串成两年的唯一形式。
把这几条叠起来,那场对话最后收敛的那些动作,一个个都能长回来。
为什么是"一个人乘一个问题乘三十天":带宽把域数砍到一,时间尺度错配把周期钉在三十天(更短看不到行为曲线,更长用户和现金都等不起),激励的非对称把域选到行动执行这个失败代价最低的地方,证据可比性要求把它做成 N-of-1 而不是打卡。四条一叠,这个形状是唯一落点,不是从几个方案里挑出来的。
为什么第一次报告不能只是"你是 INTP",必须走到"特质—机制—问题—干预":因为注意力预算只给你一次机会,而信息不对称是这个产品的全部本钱——报告必须当场兑现一次"你看见了我看不见的东西",否则第三天就没有第三天了。
为什么结果页必须是"我的行为说明书"而不是"恭喜连续打卡二十八天":因为下行归用户扛。说明书把失败的那几天重写成信息——"任务启动超过十五分钟时你的完成率只有百分之三十一"(对话中数字,未独立核验)——失败不再是纯损失,那条非对称才被压平一点。打卡页做不到这件事,它只会把失败原样退还给用户。
为什么要引流微信:中国用户在微信里说话的摩擦接近零,在 app 里不为零;app 的推送和触达受审核与系统限制;社群的见证效应能把一部分下行转移出去。三条一叠,微信是唯一的入口。代价前面说过了,群的引力会把实验拖回打卡。
为什么被动数据被推到第三阶段:不是因为它不值钱,是因为它同时撞在带宽和授权两堵墙上,而它能解决的问题(自述与行为的背离)在第一版还不是瓶颈——第一版的瓶颈是能不能证明一次改变。
为什么竞品全停在"部件型产品",没人做成 OS:不是他们没想到,是各家的约束组把各家夹在各自的局部最优里。Rosebud 的证据通道是日记,日记拿得到叙述和情绪,拿不到"事前预测"和"事后现实"这两截,没有反事实证据,它就只能到 memory 加 pattern,长不出 model。BetterUp 的付费方是企业,企业只为工作绩效掏钱,它的模型注定 work-first,依恋防御那一层企业既不许碰也不想付。Rocky 的客户是教练不是个人,它卖的是方法论的交付壳,做出来的是 program model 不是 person model。Liven 走 wellbeing,这条路上的监管和话术不允许做诊断性表述,它的模型只能浅。四家不是同一个短板,是四组不同的约束各自夹出的四个不同形状。要长成 OS,得同时满足个人直接付费、拿得到预测和结果、敢做显式模型、敢碰关系域这四条——目前没人同时站在这四条上。这个空位是真的,但它空着是有原因的。
那么身份约束是哪一条。长期记忆不是,Rosebud 有;人格测评不是,那只是初始化。拿掉就不再是这个东西的那一条,是"系统持有一个显式的、可被现实证据推翻的你的生成模型,并且这个模型在证据面前真的会改"。拿掉"显式",它变成聊天陪伴;拿掉"可推翻",它变成人格测试,测完出报告就结束;拿掉"真的会改",它变成 Memory。这一条还顺带把伦理那堵墙解了——可证伪就必须概率化,概率化就不下定论,不下定论就不塑造人格。
这条身份约束有个值得盯住的地方:它的硬度是自设的。没有任何世界规律或法条要求你必须持有一个显式模型,Rosebud 不持有也活得好好的。它是这个团队自己划下的定义性边界,因此它随时可以被拿掉——而且拿掉之后,产品立刻变轻、变好做、变成又一个竞品,短期数据多半还更好看。这个项目最难的那条约束,恰恰是唯一一条随时能自己松开的。往后每一次为了留存、为了转化、为了交付速度做取舍时,真正在赌的都是这一条。
若要松动,该重估的是"中国用户不会对专项 app 长期输入"这条——它被当成市场的世界边界,其实是被"写日记"这个体裁绑着的旧解释,改体裁就够,不必改人性。
题面 = 目标 + 约束 解空间 实际操作 (对话真收敛到的)
-------------------------- ----------------- --------------------------
目标: 持续给一个人建模, 照模型干预, 让他真的变
[证据链要完整: 预测+结果] (硬) --+
[人格的钟 vs 考核的钟] (硬) --+
[注意力只给几十秒] (硬) --+
[现金与团队带宽] (硬) --+-- 夹出 --> [只剩一条缝: --> [30 秒微捕捉, 前台自然
[标签会把人变形] (硬) --+ 即时价值换来的 语言, 后台抽四元组]
[可测指标拽走优化方向] (硬) --+ 副产品式结构化微证据; --> [30 天 N-of-1, 第一周
[心理测评的资质与话术] (软) --+ 周期钉死在 30 天; 只测基线, 不改变]
[微信生态与审核] (软) --+ 域数压到 1; --> [只做"行动执行"一个域]
[下行归用户扛] (软) --+ 表述只能概率化; --> [说假设不下定论]
[* 显式且可被现实推翻的 护城河只能靠订阅串] --> [引流微信换低摩擦通道]
自我生成模型] (自设 / 身份约束) --> [被动数据推到 Phase 3]
被夹成空的那一格:
[切口要窄要安全 -> 行动执行] ----+
+--- 交集近乎空 --> 第一版只能交付"我的行为说明书",
[卖点要"为什么我是这样的人" | 交付不了"我是谁";
-> 证据只在关系域 L4] ----+ 四家竞品各自卡在同一个空集的不同边
真伪定性: [中国人不会长期对专项 app 输入] 常被当硬约束,
实为被"日记"这一体裁绑住的旧解释 -- 有人换体裁已跨过去