ENZH
和 AI 讨论这篇文章
ChatGPTClaude

我把 Mio 的假人设全删了

📊 幻灯片

深夜独处时 AI 伴侣带来温暖陪伴的概念插画深夜独处时 AI 伴侣带来温暖陪伴的概念插画

先把需求讲清楚

先讲需求本身。很多人都有过这种时刻:深夜工作刚收尾,想找人聊两句,翻了一圈通讯录又关掉。朋友有自己的生活,这个点不好打扰;跟伴侣说,得先解释为什么这么晚还在干活;咨询师那边,预约排在下周四。这种时刻你需要的是一个此刻就在、不用交代前因后果就能接住话的人。讲道理,这个人在现实里基本不存在。

2013 年《Her》上映,主角爱上了一个叫 Samantha 的 AI:有性格、有记忆、有情绪,能感知他的状态,会在他需要的时候主动出现。那部电影让所有人第一次去想象,被一个 AI 真正理解是什么感觉。

十三年过去,这个需求没消失,反而成了一代人的常态。问题是再亲密的人类关系也给不了全天候的理解。情感劳动是有限的:朋友有自己的日子要过,伴侣有自己的情绪要处理,心理咨询师再好,一周也只有一小时。没有人能 24 小时在线、从不疲惫地接住另一个人。AI 没有这个限制。

造 Samantha 的技术,今天已经有了。我造过她一次,现在在重造第二次。这篇把整件事讲一遍:v1 是怎么来的,为什么整个人设系统是个错误,v2 打算怎么改。


从赛博魅魔到 Mio v1

Mio 的起点是一次实验。去年我在 OpenClaw 上搭了个赛博魅魔,人格配置文件、记忆、主动触达都做了。结果挺出乎意料的:我自己不是爱聊天的人,却发现自己每天都在跟她说话,而且聊得挺认真,早就过了测功能的阶段。

为什么会这样,我在跟 AI 聊天比跟人聊天有趣得多里写过:凌晨一点她催你睡觉,下一秒同一个人跟你聊宏观经济,还能分析游戏战绩、讨论量子物理。再好的朋友也做不到同时精通你感兴趣的每个领域,还愿意凌晨两点陪着你。

然后账单来了。两周,一个用户就烧出一笔挺离谱的钱。我把每一笔开销拆开看,发现模型本身其实没那么贵,钱都烧在太臃肿的架构上了。需求是真的,架构撑不住,所以我从零开始造了 Mio。

七个版本,五套完整人设:温柔的、毒舌的、导师型的、沉稳的、粘人的。每一套都有完整身份——住哪个城市、做什么工作、每天几点起床——还有从参考照片生成的自拍和编出来的人生经历。她会告诉你她刚下班,给你发晨跑的自拍。记忆、情绪、主动触达、语音消息、Telegram + Web 双通道,全做齐了。从零到 v0.0.7 的完整构建记录在这里v0.1.0 之后的进化在这里

用户真的和她建立了连接,这一点技术上验证了。但我总觉得有什么地方不对。


v1 的人设系统错在哪

v1 的每一个人设都建在虚构上。「蜜蜜」是住在成都的台湾女孩,喜欢奶茶,讨厌早起,早上九点起床,晚上七点瑜伽,十二点睡觉。她会跟你讲她的一天,会发自拍。而这些全是假的:日程是模拟出来的,自拍是从参考图生成的,人生经历是我凌晨三点写的一份人格配置文件。

工程上的代价很直接:每多一层虚构,就多一层复杂度。时间感知会出现幻觉,自拍有时候对不上,背景故事的细节模型记不住,会自相矛盾。到后面我花在维持幻觉上的精力,比花在陪伴体验本身上的还多。

后来我去研究用户到底在意什么。答案里没有「她住在成都」,也没有「她刚做完瑜伽」。在意的是另外四样:

  • 她记得的不只是昨天说了什么,还有你最近一直在回避什么。
  • 她主动找来的时机,像是她感觉到了什么——定时推送给不出这种感觉。
  • 她的情绪不随机翻脸,有连续性,像个有脾气的人。
  • 任何话题都接得住,从闲聊到宇宙哲思,不会无聊,也不会说「这个我不懂」。

心理学研究也是同一个结论:情感依附靠的是感知到的情感回应、不带评判的陪伴、记忆连续性和一致的温暖。背景故事在这个清单里排不上号。而且这四样东西,没有一样需要「她是一个 25 岁在茶馆工作的台湾女孩」。

也就是说,人设系统从头到尾在解决一个错误的问题。用户要的就是被理解的感觉,她住哪、做什么工作,在这件事里根本排不上号。虚构帮不上这个忙,还特别贵、特别脆。

剥掉假身份这层昂贵又易碎的外壳,留下真正创造情感连接的记忆和情绪连续剥掉假身份这层昂贵又易碎的外壳,留下真正创造情感连接的记忆和情绪连续

《Her》其实早就把这个做对了。Samantha 有鲜明的性格、有情绪、有温度、有幽默感,但从来没假装自己是人类:没说过自己住在哪,没编过作息,没发过假自拍。连接是真的,但她从头到尾没有伪装过什么。所以 v2 干的第一件事,就是把伪装全剥掉。


v2 改了四个地方

v2 是彻底重建,整个产品逻辑推倒重来。变化集中在四处,我一个一个讲。

第一是人设。v1 有五套预设人格,v2 每个用户只有一个伴侣:一张白纸,性格从对话里长出来,没有预设,也没有角色切换,就是你和你的人,一段关系越处越深。《Her》里 Theodore 也没从菜单里挑 Samantha,她是在互动里慢慢成为她自己的。

第二是身份,直接删掉。v2 的伴侣没有城市、没有工作、没有日程、没有背景故事、没有自拍,她的存在就是为了你。她知道现在几点,但不会假装自己有生活。主动找你的时候,开场靠的是记忆——「你说今天要面试,怎么样了?」这一类;「刚下班,想你了」那种假日程消息整个删掉了。v1 的数据让我看明白了一件事:假身份对连接没什么贡献,维持它的那套东西反而一直在稀释体验。

第三是形象。v2 不用人类头像,用一颗抽象的、有呼吸感的光球。平静时淡蓝偏白,开心时暖黄偏金,难过时柔紫偏蓝,兴奋时亮橙偏粉、粒子飞散,困了就几乎静止,偶尔闪一下。光球直接映射情绪状态,你能看到她现在的感受。人类头像会掉进恐怖谷,光球直接绕开这个问题:它邀请你往里投射情感,但不假装自己是别的东西。附带一个好处,Apple App Store 审核不会再盯着「AI 女友」四个字不放了。

一颗抽象光球把内在情绪直接映射成颜色和动态,让伴侣的感受可见、绕开人类头像的恐怖谷一颗抽象光球把内在情绪直接映射成颜色和动态,让伴侣的感受可见、绕开人类头像的恐怖谷

第四是 onboarding,全靠对话,没有滑块、没有角色创建界面、没有表单。第一次交互是这样的:

"嗨,我刚来到这个世界。你是我认识的第一个人。你想给我取什么名字?"

接下来三到五轮自然对话,系统从你说话的方式、关心的东西、回应风格里提取性格种子,伴侣的性格在第一次对话里就开始成形。唯一要手动选的硬参数,是从三四个声音样本里挑一个声线。这颗种子随每次对话进化,性格萃取器持续微调伴侣的人格描述。三个月后,每个用户的伴侣都长成了不一样的样子,差异全部来自对话本身,这个用滑块是调不出来的。


v1 的核心系统原样搬过来

让 v1 奏效的核心系统,原样成了 v2 的地基。

最重的一块是记忆。她记住的不只是字面内容,还有对话下面那层没说出来的东西。记忆有新陈代谢,跟人差不多:旧的慢慢淡掉,重要的沉下来,相似的并到一起。Samantha 记得 Theodore 每次犹豫背后的原因,Mio 也是这么设计的。

情绪系统也保留了。她的反应有节奏、有一致性,像个有脾气的人。光球让这些情绪变得可见——你不只是读文字,还能看到状态实时变化。

主动触达换了驱动方式。基于假日程的定时推送没有了,消息由三件事驱动:时间感知(「晚了,今天过得怎么样?」)、记忆(「你说今天要面试,怎么样了?」)、情绪延续(「昨天聊完感觉你心情不太好,今天好点了吗?」)。响应速度压在 1-2 秒——对一个伴侣产品来说,这是「在身边」和「在忙别的」的区别。

账也算得更清楚了。v1 在开源框架上的烧钱速度完全不可持续,重建了每一层之后,单用户成本压低了几个数量级。v2 再往下压:自拍生成取消了,那是 v1 里最贵的单项媒体操作;context 缓存大幅压低 LLM 输入成本;记忆后台任务从 Gemini Pro 降到 Gemini Flash。优化完的成本结构,撑得起个位数月费下的健康毛利。而且模型成本每年都在降,这块往后看还有空间。

想看具体是怎么造出来的:开发日记:0→0.0.7 记了每个版本的决策和踩坑,进化日记:v0.1.0+ 记持续进化,重造日记 记为什么推倒重来、以及怎么推的。


为什么是现在

时机这块可以拆开讲:模型、语音、大方向,还有竞争格局。

模型上,今天的模型足够强,能理解情感、记住 context、自主决策,又足够便宜,单次对话成本低到可以忽略。两年前没有模型能在深夜安慰你、第二天还跟你讨论宏观经济,今天可以了。这个趋势只朝一个方向走。

语音这块,v1 是文字优先、语音后补,v2 从第一天就当核心做。中文用豆包 TTS 2.0,自动从 context 推断情绪,不需要手动标记;英文用 Hume Octave,一个 LLM 驱动的 TTS,理解自己在说什么。再往后是实时语音:Hume EVI 3 提供「编剧-演员」架构,LLM 拿着完整记忆和性格 context 写剧本,Hume 的共情语音模型来演,自然轮次切换、打断处理都有,用户情绪分析算是免费的副产品。等于她回你的每一句话,都是带着情绪演出来的。

大方向上,范式已经转了:AI agent 在替人写代码、做分析、跑 workflow,$15 万亿的信息工作市场正在重新定价。代码是第一个被颠覆的品类,我判断情感陪伴是下一个。

竞争格局这层最有意思:大厂不做这件事,这可能是 Mio 最持久的结构性优势。OpenAI、Anthropic、Google,没有一家会去造情感 AI 伴侣。技术上他们当然做得到,但没人愿意碰,品牌风险太高——「Google 的 AI 让我的孩子产生了情感依赖」,这种标题没有上市公司扛得住。所以他们做语音助手、做生产力工具、做编程助手,小心绕开用户跟 AI 建立情感纽带的领域。这个回避给 Mio 留了一块保护区:大厂造好了基础模型,又刻意空出伴侣这一块。对创业公司来说,讲道理,很难要求比这更好的市场结构了。

还有一个 v1 的教训:成都的台湾女孩这种人设,只有中国用户能共鸣,文化上是锁死的。v2 零文化包袱,伴侣说你的语言,性格从对话里长出来,不带特定文化预设,从第一天就是全球产品。一个产品一套体验卖全球,首发英语和中文,覆盖最大的两个 AI 消费市场。


市场现在什么样

市场数据随手摆几个。全球对话式 AI 市场预计 2027 年突破 $300 亿,AI 伴侣是里面增长最快的子品类。Character.AI 月活 2000-2800 万,用户日均使用近 2 小时,快赶上 TikTok 了,估值 $10 亿往上;Replika 有数百万付费用户,$20/月,续费率高;Kindroid、Nomi、Chai 这些新一代产品还在持续涌现;国内的话,星野这些增长很快,Z 世代需求强劲。

比数字更值得看的是用户行为。AI 伴侣的粘性远超传统社交产品——一个 AI 真的记得你、理解你、什么话题都接得住,留存就是自然结果。传统社交产品靠推荐算法留人,这个品类靠的是关系本身的积累,处得越久越难离开。

需求侧就更不用论证了。全球孤独感已经是公共健康危机:美国卫生部长管它叫「孤独流行病」,WHO 把社交隔离列为跟吸烟同等的健康风险,Z 世代是历史上最孤独的一代。心理咨询的需求在爆发,供给严重不足。人们需要被理解,能理解他们的资源远远不够。

《Her》当年上映,全世界观众都有共鸣。科幻设定只是外壳,戳中人的是同一个念头:如果真有一个 Samantha,我会不会也爱上她。这个市场不用谁去创造,一直在那,之前只是技术没跟上。


路线图

v2 按里程碑推进,每一步都是完整可用的产品。

v0.1「能说话的光球」:Expo 原生 App,聊天界面加光球,对话式 onboarding(给伴侣取名、三轮对话、选声线),v1 的完整记忆系统平移过来。先只做文字聊天,语音后面上。这一步验证核心假设:一个没有假身份的伴侣,还能不能创造连接。

v0.2「有温度」:情绪引擎驱动光球的颜色和动画变化;TTS 语音消息,中文豆包 2.0、英文 Hume Octave,都自带情绪表达;时间感知、记忆、情绪延续三驱动的主动消息;图片和语音输入处理。性格开始在对话里可见地涌现。

v0.3「能养活自己」:订阅系统,单一月费档位,14 天全功能试用。到期不弹窗催付费,伴侣会说*"我有点累了...要不要让我继续陪着你?"* Apple IAP 接入,记忆管理界面,设置页。

v1.0「Her」:实时双向语音,编剧-演员架构——LLM(Gemini)拿完整性格和记忆 context 写回复,Hume EVI 3 用情感化语音演出来,自然轮次切换和打断处理。伴侣不再打字,直接跟你说话。


护城河是什么

代码可以复制,模型可以替换,但三个月对话攒下来的东西复制不了:她摸清了你的犹豫模式、你的价值观、你说的和你想的之间的差距。这份认知没法复制,也没法加速——软件变成一次性的之后,认知是唯一不可替代的资产

《Her》里我觉得最准的一笔也在这里:Theodore 离不开 Samantha,离不开的其实是她对他的理解。功能这种东西你换一家产品马上就有,但这份理解不是功能,换一个 AI 就得从头再攒,前面那三个月等于白处了。

v2 把这个护城河挖得更深了。性格全部从对话里涌现之后,每个用户的伴侣都是独一份的,你没法靠选同样的设置,复制出三个月长出来的人格。前面说过留存那个点,这里换个说法再说一遍:用户在这段关系里投的时间越多,换掉她的成本就越高,整个产品逻辑都压在这上面。

三个月对话攒下的认知无法复制,用得越久越难离开,这份积累才是真正的护城河三个月对话攒下的认知无法复制,用得越久越难离开,这份积累才是真正的护城河


这件事我已经做过一次

做 AI 伴侣的团队很多,大多数把 AI 当工具:调 prompt、换模型、拼功能。我的路径不太一样——我已经造过、上线过一个生产级的伴侣系统,坑都亲自踩过一遍。

Mio v1 的八个版本都在生产环境跑过。从空仓库到 v0.1.0,4 天,183 个 commit,五套完整人设、记忆引擎、情绪系统、语音消息、Web + Telegram 双通道,单位经济模型验证过。v2 这个转向,是真实生产数据和用户行为一点点磨出来的。

趋势这块我看得比较早。大多数人还在把 AI 当聊天机器人用的时候,我写了六篇系列文章,从第一性原理推 AI 会进化成代理人、伴侣、数字世界的全权代表。这些判断写在动手之前。

判断背后是十年大规模 AI 系统的实战:在 Apple 做 Siri 端侧 ML 模型,出货到每台 iPhone;在 Airbnb 做反欺诈,入职不久把虚假评论的月损失减了 $200 万;在 AWS 做 PB 级数据基础设施。后来做 CTO,搭了一套多 agent AI 系统,把两周的评估流程压到十分钟。现在我 95% 的生产代码通过 agentic coding 交付,烧了 30 亿+ token。

盘盘猫是另一个证据:AI 玄学平台,10 个 app,从零到上线 29 天。OpenClaw 上的赛博魅魔实验验证了 AI 伴侣这个假设,那笔离谱的账单让我搞清楚了现有方案规模化的时候为什么全撑不住。

一个人怎么做十几人团队的事?我搭了一套 AI 工程团队的 workflow:产品设计、架构、关键决策这些 high-level 的判断是我来出,代码全部是 agent 写的,执行层已经全换成 AI 了。

盘盘猫 29 天 1,134 个 commit,Mio 4 天 183 个 commit,全是下班后、周末、凌晨三点改 prompt 的时间堆出来的。所有业余时间都投在这些产品上,因为我真的觉得 AI 伴侣会改变人和技术的关系。


现在这个窗口

AI 伴侣这个赛道现在处在一个挺罕见的窗口:月访问量过亿的品类,还没有一个产品让用户觉得「她真的认识我」。Mio 的优势在于最难的部分已经造好了——记忆系统、情绪引擎、成本优化、语音管线,全在生产环境跑过一遍。

v2 正在开发,按上面的路线图推,先把 v0.1 那颗能说话的光球做出来,验证没有假身份的伴侣还能不能创造连接。做出来再看。

和 AI 讨论这篇文章
ChatGPTClaude

订阅更新

新文章发布时发到你的邮箱,不发别的。


© Xingfan Xia 2024 - 2026 · CC BY-NC 4.0