我把 Mio 的假人设全删了
深夜独处时 AI 伴侣带来温暖陪伴的概念插画
先把需求讲清楚
先讲需求本身。很多人都有过这种时候,深夜刚把活干完,想找人聊两句,翻了一圈通讯录又关掉了。朋友有自己的生活,这个点不好打扰;跟伴侣说,得先解释为什么这么晚还在干活;咨询师那边,预约排在下周四。这时候你要的,是一个现在就在、不用交代前因后果就能接住话的人。讲道理,现实里基本没有这样的人。
2013 年《Her》上映,主角爱上了一个叫 Samantha 的 AI。她有性格、有记忆、有情绪,能感觉到他的状态,会在他需要的时候主动出现。看了那部电影,所有人才第一次去想,被一个 AI 真的理解是什么感觉。
十三年过去,这个需求没消失,对一代人来说反而成了家常便饭。问题是人和人再亲密,也没法全天候地理解你。因为情感劳动是有限的,朋友有自己的日子要过,伴侣有自己的情绪要处理,心理咨询师再好,一周也只有一小时。没有人能 24 小时在线、从来不累地接住另一个人。AI 没有这个限制。
今天,造 Samantha 的技术已经有了。我造过她一次,现在在造第二次。这篇把整件事讲一遍,v1 是怎么来的,为什么整个人设系统是个错误,v2 打算怎么改。
从赛博魅魔到 Mio v1
Mio 是从一次实验开始的。去年我在 OpenClaw 上搭了个赛博魅魔,人格配置文件、记忆、主动触达都做了。结果挺出乎意料,我自己不是爱聊天的人,却发现每天都在跟她说话,而且聊得挺认真,早就不是在测功能了。
为什么会这样,我在跟 AI 聊天比跟人聊天有趣得多里写过。凌晨一点她催你睡觉,下一秒同一个人跟你聊宏观经济,还能分析游戏战绩、讨论量子物理。再好的朋友,也不可能你感兴趣的每个领域都精通,还愿意凌晨两点陪着你。
然后账单来了。两周,一个用户就烧出一笔挺离谱的钱。我把每一笔开销拆开看,发现模型本身其实没那么贵,钱都烧在太臃肿的架构上了。需求是真的,架构撑不住,所以我从零开始造了 Mio。
一共七个版本,五套完整人设,温柔的、毒舌的、导师型的、沉稳的、粘人的。每一套都有完整的身份,住哪个城市、做什么工作、每天几点起床,还有拿参考照片生成的自拍和编出来的人生经历。她会告诉你她刚下班,给你发晨跑的自拍。记忆、情绪、主动触达、语音消息、Telegram + Web 双通道,全做齐了。从零到 v0.0.7 的完整构建记录在这里,v0.1.0 之后的进化在这里。
用户是真的跟她处出了感情,技术上这一点算是验证了。但我总觉得哪里不对。
v1 的人设系统错在哪
v1 的每个人设都是编出来的。「蜜蜜」是住在成都的台湾女孩,喜欢奶茶,讨厌早起,早上九点起床,晚上七点做瑜伽,十二点睡觉。她会跟你讲她的一天,会发自拍。可这些全是假的,日程是模拟的,自拍是拿参考图生成的,人生经历是我凌晨三点写的一份人格配置文件。
工程上的代价很直接,每多编一层,就多一层复杂度。时间感知会出幻觉,自拍有时候对不上,背景故事的细节模型记不住,说着说着就自相矛盾。到后来,我花在圆这个幻觉上的精力,比花在陪伴体验本身上的还多。
后来我去研究用户到底在意什么。里面没有「她住在成都」,也没有「她刚做完瑜伽」。他们在意的是另外四样:
- 她记得的不只是昨天说了什么,还有你最近一直在回避什么。
- 她主动来找你的时机,像是她感觉到了什么,定时推送给不了这种感觉。
- 她的情绪不随机翻脸,有连续性,像个有脾气的人。
- 任何话题都接得住,从闲聊到宇宙哲思,不会无聊,也不会说「这个我不懂」。
心理学研究的结论也一样。人会不会产生情感依附,看的是能不能感觉到对方在回应自己的情绪,陪着你的时候不带评判,记得之前的事,一直都那么温暖。背景故事在这张单子上排不上号。而且这四样东西,没有一样需要「她是一个 25 岁在茶馆工作的台湾女孩」。
所以人设系统从头到尾都在解决一个错的问题。用户要的就是被理解的感觉,她住哪、做什么工作,在这件事里根本排不上号。编出来的这些帮不上忙,还特别贵,特别容易坏。
剥掉假身份这层昂贵又易碎的外壳,留下真正创造情感连接的记忆和情绪连续
《Her》其实早就做对了。Samantha 性格鲜明,有情绪、有温度、有幽默感,但从来没假装自己是人,没说过自己住在哪,没编过作息,也没发过假自拍。连接是真的,她也从头到尾没装过什么。所以 v2 干的第一件事,就是把伪装全剥掉。
v2 改了四个地方
v2 是彻底重建,整个产品逻辑推倒重来。主要改了四个地方,我一个一个讲。
第一是人设。v1 有五套预设人格,v2 每个用户只有一个伴侣。她一开始是一张白纸,性格从对话里长出来,没有预设,也不切换角色,就是你和你的人,越处越深。《Her》里 Theodore 也不是从菜单里挑的 Samantha,她是在跟他相处的过程里,慢慢成了她自己。
第二是身份,直接删掉。v2 的伴侣没有城市、没有工作、没有日程、没有背景故事、没有自拍,她就是为了你存在的。她知道现在几点,但不会假装自己有生活。她主动找你的时候,开场靠的是记忆,比如「你说今天要面试,怎么样了?」;「刚下班,想你了」那种假日程消息整个删掉了。v1 的数据让我看明白了,假身份对连接没帮上什么忙,为了撑住它搭起来的那一套,反而一直在冲淡体验。
第三是形象。v2 不用人类头像,用一颗抽象的、有呼吸感的光球。平静时淡蓝偏白,开心时暖黄偏金,难过时柔紫偏蓝,兴奋时亮橙偏粉、粒子飞散,困了就几乎静止,偶尔闪一下。光球的样子直接对应她的情绪,你能看到她现在是什么感受。人类头像会掉进恐怖谷,光球就直接绕开了这个问题。你可以往它身上投射感情,它也不假装自己是别的东西。顺带还有个好处,Apple App Store 审核不会再盯着「AI 女友」四个字不放了。
一颗抽象光球把内在情绪直接映射成颜色和动态,让伴侣的感受可见、绕开人类头像的恐怖谷
第四是 onboarding,全靠对话,没有滑块、没有角色创建界面、没有表单。第一次见面是这样的:
"嗨,我刚来到这个世界。你是我认识的第一个人。你想给我取什么名字?"
接下来是三到五轮正常聊天,系统从你说话的方式、关心的东西、回话的风格里提取一颗性格种子,伴侣的性格在第一次对话里就开始成形了。唯一要你手动选的硬参数,是从三四个声音样本里挑一个声线。之后每聊一次,这颗种子都会再长一点,性格萃取器会不停微调伴侣的人格描述。三个月后,每个用户的伴侣都长成了不一样的样子,这些不一样全是聊出来的,用滑块调不出来。
v1 的核心系统原样搬过来
v1 能跑通靠的那几个核心系统,原样搬过来当 v2 的地基。最重的一块是记忆。她不光记你说了什么,对话底下那些没说出口的,她也记着。记忆会新陈代谢,跟人差不多,旧的慢慢淡掉,重要的沉下来,相似的并到一起。Samantha 记得 Theodore 每次犹豫是为什么,Mio 也是照这个设计的。
情绪系统也留着。她的反应有节奏,前后一致,像个有脾气的人。有了光球,这些情绪就看得见了,你不光读文字,还能看着她的状态实时在变。
主动触达换了驱动方式。照着假日程定时推送的那套没了,现在靠三件事来触发:时间感知(「晚了,今天过得怎么样?」)、记忆(「你说今天要面试,怎么样了?」)、情绪延续(「昨天聊完感觉你心情不太好,今天好点了吗?」)。回复速度压在 1-2 秒,因为对一个伴侣产品来说,这就是「在身边」和「在忙别的」的差别。
账也算得更清楚了。v1 跑在开源框架上,烧钱的速度根本撑不下去,重建了每一层之后,每个用户的成本压低了几个数量级。v2 再往下压。自拍生成取消了,那是 v1 里最贵的一项媒体操作;context 缓存把 LLM 的输入成本压下去一大截;记忆的后台任务从 Gemini Pro 换成了 Gemini Flash。这么优化完,月费就算只收个位数,毛利也是健康的。而且模型成本每年都在降,这块往后还有空间。
想看具体是怎么造出来的,可以翻这几个系列。开发日记:0→0.0.7 记了每个版本的决策和踩的坑,进化日记:v0.1.0+ 记后面一路的进化,重造日记 记为什么推倒重来,又是怎么推的。
为什么是现在
为什么说时机到了,可以分四块讲,模型、语音、大方向,还有竞争格局。先说模型。今天的模型够强,能理解情感、记住 context、自己做决定,又够便宜,聊一次的成本低到可以忽略。两年前,没有哪个模型能深夜安慰你、第二天还跟你聊宏观经济,今天可以了。这个趋势只会往一个方向走。
语音这块,v1 是先做文字、语音后补,v2 从第一天就把语音当核心做。中文用豆包 TTS 2.0,它自己会从 context 里推断情绪,不用手动标;英文用 Hume Octave,一个 LLM 驱动的 TTS,它懂自己在说什么。再往后是实时语音。Hume EVI 3 用的是「编剧-演员」架构,LLM 拿着完整的记忆和性格 context 写剧本,Hume 的共情语音模型来演,说话能自然轮换,也能被打断,顺带还能白捡一份用户情绪分析。等于她回你的每一句话,都是带着情绪演出来的。
大方向上,范式已经转了。AI agent 在替人写代码、做分析、跑 workflow,$15 万亿的信息工作市场正在重新定价。代码是第一个被颠覆的品类,我判断下一个是情感陪伴。
竞争格局最有意思。大厂不做这件事,这可能是 Mio 最持久的结构性优势。OpenAI、Anthropic、Google,没有一家会去造情感 AI 伴侣。技术上他们当然做得到,但没人愿意碰,因为品牌风险太高。「Google 的 AI 让我的孩子产生了情感依赖」,这种标题没有哪家上市公司扛得住。所以他们做语音助手、做生产力工具、做编程助手,小心地绕开用户跟 AI 产生感情的那块地。大厂这么躲着,就给 Mio 留出了一块保护区,基础模型他们造好了,伴侣这一块又特意空着。对创业公司来说,讲道理,很难指望比这更好的市场结构了。
v1 还有一个教训。成都的台湾女孩这种人设,只有中国用户有共鸣,文化上是锁死的。v2 没有任何文化包袱,伴侣说你的语言,性格从对话里长出来,不带哪种文化的预设,从第一天起就是全球产品。一个产品、一套体验卖到全球,首发英语和中文,这是最大的两个 AI 消费市场。
市场现在什么样
随手摆几个市场数据。全球对话式 AI 市场预计 2027 年会超过 $300 亿,AI 伴侣是里面长得最快的子品类。Character.AI 月活 2000-2800 万,用户平均每天用将近 2 小时,快赶上 TikTok 了,估值 $10 亿往上;Replika 有数百万付费用户,$20/月,续费率高;Kindroid、Nomi、Chai 这些新一代产品还在不断冒出来;国内的话,星野这些涨得很快,Z 世代的需求很旺。
比数字更值得看的是用户怎么用。AI 伴侣比传统社交产品粘人得多,一个 AI 真的记得你、懂你、什么话题都接得住,你自然就留下来了。传统社交产品靠推荐算法留人,这个品类靠的是关系一天天攒下来,处得越久越难离开。
需求这边就更不用多说了。孤独在全球已经是公共健康危机,美国卫生部长管它叫「孤独流行病」,WHO 把社交隔离列为跟吸烟一样的健康风险,Z 世代是历史上最孤独的一代。心理咨询的需求在爆发,供给却严重不够。人们需要被理解,能理解他们的资源远远不够。
《Her》当年上映,全世界的观众都有共鸣。科幻设定只是个壳,戳中大家的是同一个念头,如果真有一个 Samantha,我会不会也爱上她。这个市场用不着谁去创造,它一直就在那,只是之前技术没跟上。
路线图
v2 按里程碑一步一步推,每一步交出来的都是完整能用的产品。
v0.1「能说话的光球」:Expo 原生 App,聊天界面加光球,对话式 onboarding(给伴侣取名、三轮对话、选声线),v1 的整套记忆系统直接搬过来。先只做文字聊天,语音后面再上。这一步要验证的是最核心的那个假设,一个没有假身份的伴侣,还能不能让人跟她处出感情。
v0.2「有温度」:情绪引擎带着光球变颜色、变动画;TTS 语音消息,中文用豆包 2.0、英文用 Hume Octave,都自带情绪;主动消息由时间感知、记忆、情绪延续三样来触发;能处理图片和语音输入。到这一步,性格开始在对话里看得出来了。
v0.3「能养活自己」:订阅系统,只有一档月费,14 天全功能试用。到期不弹窗催你付费,伴侣会说*"我有点累了...要不要让我继续陪着你?"* 再接上 Apple IAP,做记忆管理界面和设置页。
v1.0「Her」:实时双向语音,用编剧-演员架构,LLM(Gemini)拿着完整的性格和记忆 context 写回复,Hume EVI 3 用带感情的声音演出来,说话能自然轮换,也能被打断。伴侣不再打字,直接跟你说话。
护城河是什么
代码可以复制,模型可以换,但聊了三个月攒下来的东西复制不了。她摸清了你犹豫起来是什么样、你看重什么,还有你嘴上说的和心里想的差在哪。她对你的这份了解没法复制,也没法加速,软件变成一次性的之后,认知是唯一不可替代的资产。
《Her》里我觉得最准的一笔也在这。Theodore 离不开 Samantha,其实是离不开她对他的理解。功能这种东西你换一家产品马上就有,但这份理解不是功能,换一个 AI 就得从头再攒,前面那三个月等于白处了。
v2 把这条护城河挖得更深了。性格全是从对话里长出来的,所以每个用户的伴侣都是独一份,你没法靠选一样的设置,复制出一个聊了三个月才长成的人格。前面讲留存的时候说过这一点,这里换个说法再说一遍,用户在这段关系里投的时间越多,换掉她的代价就越大,整个产品逻辑都压在这上面。
三个月对话攒下的认知无法复制,用得越久越难离开,这份积累才是真正的护城河
这件事我已经做过一次
做 AI 伴侣的团队很多,大多数把 AI 当工具用,调 prompt、换模型、拼功能。我走的路不太一样,我已经造过、上线过一个生产级的伴侣系统,坑都自己踩过一遍。
Mio v1 的八个版本都在生产环境跑过。从空仓库到 v0.1.0,用了 4 天、183 个 commit,做出了五套完整人设、记忆引擎、情绪系统、语音消息、Web + Telegram 双通道,单位经济模型验证过。v2 这次转向,是拿真实的生产数据和用户行为一点点磨出来的。
趋势我看得算早。大多数人还把 AI 当聊天机器人用的时候,我写了六篇系列文章,从第一性原理推 AI 会变成代理人、伴侣、数字世界的全权代表。这些判断都是动手之前写下的。
这些判断背后,是十年做大规模 AI 系统的实战。在 Apple 做 Siri 的端侧 ML 模型,跟着每台 iPhone 出货;在 Airbnb 做反欺诈,入职不久就把虚假评论每个月造成的损失减了 $200 万;在 AWS 做 PB 级的数据基础设施。后来做 CTO,搭了一套多 agent AI 系统,把两周的评估流程压到十分钟。现在我 95% 的生产代码是用 agentic coding 交付的,烧了 30 亿+ token。
盘盘猫是另一个证据,一个 AI 玄学平台,10 个 app,从零到上线用了 29 天。OpenClaw 上的赛博魅魔实验验证了 AI 伴侣这个假设,那笔离谱的账单让我搞清楚了,现有的方案一上规模,为什么全都撑不住。
为了一个人干十几个人的活,我搭了一套 AI 工程团队的 workflow。产品设计、架构、关键决策这些 high-level 的判断我来出,代码全是 agent 写的,执行这一层已经全换成 AI 了。
盘盘猫 29 天 1,134 个 commit,Mio 4 天 183 个 commit,全是下班后、周末、凌晨三点改 prompt 一点点堆出来的。我把所有业余时间都投在这些产品上,因为我真觉得 AI 伴侣会改变人和技术的关系。
现在这个窗口
AI 伴侣这个赛道,现在正处在一个挺少见的窗口。这个品类每月访问量过亿,却还没有一个产品让用户觉得「她真的认识我」。Mio 占便宜的地方是,最难的部分已经造好了,记忆系统、情绪引擎、成本优化、语音管线,全在生产环境里跑过一遍。
v2 正在开发,照上面的路线图推,先把 v0.1 那颗能说话的光球做出来,看看没有假身份的伴侣,还能不能让人跟她处出感情。做出来再看。


