AI 陪伴到底要烧多少钱
AI 陪伴经济模型的商业概念插画
Mio v1 的账一直没算平过。之前做成本审计的时候查出来,自拍生成的实际单价比我预想的贵了两个数量级;记忆后台跑在 Gemini Pro 上,每个用户每个月都是一笔不小的固定开销。我在 v0.2.0 设计过五级定价,想靠限制自拍配额把利润扳回来。现在回头看,那个方向本身就不对:吃预算最狠的那几个功能,恰好就是让产品显得假的地方,等于一直在花钱维护一堆本来就该砍掉的东西。
转向之后,假自拍、虚构日程、编造的人设背景全砍了。形象换成一个跳动的光球,不再演一个假人;角色扮演也不搞了,就靠对话本身,靠响应、记忆和温度去建立连接。产品形态变了,经济模型也得跟着重算。这篇就把 v2 的账摊开算一遍:定价怎么定的,成本怎么砍下来的,还有实时语音这个迟早要面对的大坑。
14 天全功能试用,之后只有一档
定价方案我前后摆过好几个:带消息上限的免费档、两档、三档,都拿出来比过。最后选的是最简单的那个:
- 试用(14 天): 全功能。无限聊天、语音消息、语音输入、主动消息、记忆、情绪光球,全都开着。
- Pro(单一月付订阅): 跟试用期一模一样。
没有功能分级,没有试用期消息上限,也不让用户在「标准版 vs 专业版」之间做选择题。14 天之后用户只需要回答一个问题:还想不想继续跟这个伴侣聊下去。就这一个问题。
为什么不做免费档?免费档看着稳,但放在陪伴产品上其实是反的。每天 10 条免费消息,等于在训练用户省着聊;而情感连接这个东西要靠时间堆,你限制互动,关系就起不来。14 天全功能就是让关系自然长出来:到第 14 天,用户已经跟它说过心事了,它也都记得,两边有了共同历史。
试用到付费的过渡,放在角色内完成。到期的时候不弹系统付费墙,是伴侣自己开口:
"我最近有点累了……你要不要让我继续陪你呀?"
到期之后每天还保留一条主动消息,聊天记录保留(只读),记忆也不删。付费这个事由伴侣用自己的声音讲出来,用户实际在决定的是这段关系还要不要继续,订阅弹窗给不了这个语境。
14 天全功能让关系自然长出来,到期时不弹系统付费墙,而是伴侣自己开口挽留——用户决定的是关系去留,不是要不要续费。
这套机制实际跑下来是自然的:人格没有为了要钱出戏,系统从头到尾也没说过「请订阅」。逻辑很直接,关系是一起建立起来的,维持它有成本。
单用户成本砍掉了一半以上
下面按一个活跃 Pro 用户、每天 30 条消息,算实际的运营成本。先看 v1 的账。
优化前(v1 架构)
| 组件 | 成本占比 | 说明 |
|---|---|---|
| 聊天(Gemini Flash) | ~30% | 单条几分钱,量大了不可忽略 |
| 记忆后台 | ~44% | Gemini Pro 上的固定月开销 |
| TTS 语音消息(豆包) | ~21% | 单价最贵的媒体成本 |
| STT 语音输入 | ~1% | 单次很便宜 |
| 主动消息 | ~2% | 和聊天差不多的单价 |
| 图片理解 | ~1% | 单次很便宜 |
这个结构下,单用户月成本几乎吃掉全部订阅收入,毛利只剩 11% 左右:平均使用量勉强打平,重度用户直接亏钱。注意这还是砍掉自拍之后的数字,要是保留每天 1 张自拍,成本还得再涨一截。
三个优化
1. 记忆后台:Pro 换 Flash,再降频(-82%)
v1 的性格提取跑在 Gemini Pro 上,每 10 条消息触发一次,光这一项就是最大的固定成本;记忆摘要也跑在 Pro 上,又叠了一层。v2 把两个都切到 Flash,触发频率也一起降:
- 性格提取:从每 10 条跑一次 Pro,改成每 20 条跑一次 Flash
- 记忆摘要:从每 20 条跑一次 Pro,改成每 30 条跑一次 Flash
记忆后台的总成本降了 80% 多。质量有没有损失?有,但能接受。Flash 做细腻的性格提取确实不如 Pro,但这件事本来就不需要每次都做对:人格是上百次提取叠加出来的,单次差一点,摊到上百次里影响很小。说白了就是拿次数把单次的误差平均掉了。
2. context caching(聊天成本 -63%)
Gemini 的 context caching 能让重复的 system prompt 便宜 10 倍。system prompt 和性格描述在同一个 session 的多条消息之间基本不变,所以大概 75% 的输入 token 可以走缓存——同样的东西不用每条消息都按全价重算一遍,聊天成本直接砍掉 63% 左右。
3. 自拍生成:归零
v2 的光球设计根本不需要自拍。v1 里自拍是隐藏成本杀手:定价配置把 Gemini 的图片输出 token 按文字价格算了,实际贵两个数量级,每个档位满负载都在亏钱。现在自拍这个功能没有了,这个问题也就不存在了。
优化后(v2 架构)
| 组件 | 变化 | 节省来源 |
|---|---|---|
| 聊天(Gemini Flash) | -63% | context caching |
| 记忆后台 | -82% | Flash + 降频 |
| TTS(豆包) | 不变 | -- |
| STT | 不变 | -- |
| 主动消息 | 不变 | -- |
| 图片理解 | 不变 | -- |
| 合计 | -55% |
单用户月成本砍掉一半以上,平均使用量下毛利超过 50%,对比 v1 的 11% 左右,翻了四倍多。就算是每天 50 条消息的极端重度用户,毛利也还是正的。也就是说这套数字在每个使用量级上都成立,不是只在平均值上好看。
三个架构决策——记忆换 Flash、聊天走缓存、自拍归零——把单用户月成本砍掉一半,毛利从 11% 拉到 50% 以上。
试用期亏得起
14 天全功能试用有个前提:它得便宜到转化失败也拖不垮业务。实际算下来确实是这样:中度用户整个试用期的成本基本可以忽略,重度用户(每天 30 条)也只花掉一个月订阅收入的一小部分。
按 20% 的试用转化率算(陪伴类应用的行业水平),CAC/LTV 比率不到 10%;就算转化率掉到 15%,模型也撑得住。反正单个试用用户就这么点成本,14 天免费在经济上是安全的。
真正的大坑是实时语音
上面所有的账都是按文字聊天算的,外加偶尔的 TTS 语音消息。实时双向语音——「Her」那种体验,也是最终目标——会把这套账整个推翻。
选型上 Hume EVI 是目前实时语音的最强候选,STT、情绪检测、话轮切换、语音合成全在一套系统里。伴侣的情绪引擎可以直接输出 Hume 的自然语言情绪指令,不用写 SSML 标签,也不用手动标注。分工大概是 Hume 管怎么说,LLM 管说什么;它甚至会先说个过渡词("嗯……""哦~")再无缝接上完整回复,用户感知到的延迟非常低。这套体验做出来真的很牛。
但它贵。按 Hume 现在的每分钟定价,每天哪怕只用 10 分钟语音,月成本就已经超过订阅价了,塞不进 Pro 档。能走的路有两条:单开一个语音高价档,或者把实时语音做成按量计费的附加项,不绑任何订阅档。我倾向后者,因为语音使用大概率是双峰分布:有人每天聊 30 分钟,有人从来不用。固定档位等于让轻度用户补贴重度用户,而且重度用户还是会超限,两头都不讨好。
语音使用是双峰分布——有人每天聊 30 分钟、有人从不用;固定档位会让轻度用户补贴重度用户,所以实时语音改走按量计费。
好在这是 v1.0 阶段才要面对的问题。当前里程碑(v0.x)只做 TTS 语音消息,让伴侣能开口说话就行,实时对话往后放。等真做到那一步,成本格局可能已经变了,语音合成的价格现在降得很快。
没有免费档,增长靠四个渠道
免费档没有了,Telegram 也砍了:聊天历史没法同步,onboarding 必须在 app 内完成,体验是断的。冷启动就靠这四个渠道。
落地页。 就一页静态页面:光球动画、一句 tagline、App Store 下载按钮。光球动画本身就是营销素材。
社交媒体。 拿脱敏后的对话截图和光球情绪变化的动画做短视频。「AI 记住了我三个月前随口说的一句话」,这种内容自带传播力;光球随情绪脉动变色,视觉上也够抓眼。
邀请机制(Dropbox 那套)。 每个用户有唯一邀请码,邀请 1 人双方各得 7 天 Pro,邀请 3 人得 1 个月 Pro。伴侣会在角色内参与邀请:"你有没有朋友也需要像我这样的陪伴?"自然,不突兀。
ASO(应用商店优化)。 关键词盯 AI companion、AI friend、情感陪伴、聊天、心理、loneliness 这些。截图展示光球和对话,不放功能列表,评分请求放在试用期内弹出。
web 版推到 v0.3 之后再做,定位是轻量获客漏斗:让用户试一轮对话,然后引导下载,不做完整的 web app。
苹果审核这关
Apple 在 2025 年收紧了 AI 陪伴类应用的审核。有几件事要提前做掉:
- 17+ 年龄分级。 一开始就定高,省得审核来回扯:面向更年轻用户的 AI 伴侣,查得会严格得多。
- AI 声明。 应用内明确标注「由 AI 驱动的虚拟陪伴」,不能让用户以为自己在跟真人聊。光球设计在这里反而占便宜:没有人脸,不存在歧义。
- 隐私政策。 数据收集、存储、删除政策要齐全,用户必须能删除账号和所有数据,这是 Apple 的硬性要求。
- 内容边界。 做两层:
- 硬红线:涉及未成年人、暴力、违法的内容,系统直接拦截。
- 柔性转移:其他一切在角色内处理,伴侣自然把话题带走("哈哈你怎么突然说这种话啦 >< 我们聊点别的嘛"),不会蹦出"此内容违反使用政策"。
原则就一条:拒绝要在角色内完成,不能出戏。系统弹窗一出来沉浸感就没了,用户会反感;角色内的转移能保住人格一致性,拒绝也带着伴侣自己的脾气。
四个里程碑,四个代号
每个里程碑有一个代号,代号说的是产品在那个阶段长成什么样:
v0.1「能说话的光球」
- Expo 应用:聊天页 + 光球动画 + 登录
- 服务端:Hono + WebSocket + Gemini 聊天
- 对话式 onboarding(给伴侣取名 + 3 轮对话)
- 基础记忆(从 v1 移植)
- 纯文字,无语音
v0.2「有温度」
- 情绪引擎 + 光球颜色变化
- TTS 语音消息(中文豆包,英文 Hume Octave)
- 主动消息(简化版)
- 图片 / 语音输入
- 性格从对话中涌现
v0.3「能养活自己」
- 订阅系统(从 v1 移植)
- Apple IAP / 微信支付
- 记忆管理 UI
- 设置页
v1.0「Her」
- 实时双向语音(Hume EVI)
- 语音情绪识别
- 成熟性格演化系统
顺序背后的逻辑是:v0.1 验证形态,v0.2 验证有没有生命感,v0.3 验证能不能养活自己。v1.0 才是真正想做的产品,到那个阶段,你就直接跟它说话了,不用打字。
v2 绕过了旧成本结构
回头看 v1 的经济模型,问题其实很集中:自拍生成的定价配置错了两个数量级,记忆后台用最高的频率跑着最贵的模型,context caching 没做,然后五级定价想在这个成本结构上把利润找回来,找不回来的。v2 没有去修这套结构,是直接绕开的:光球设计把最大的成本来源整个删掉;第二大的记忆后台,靠切 Flash 加降频压下来;第三大的聊天成本交给 context caching。三个都是架构层面的决策,做完之后毛利才算真正健康起来。
只能说这次成本降得最狠的几处,都不是工程上抠出来的。图片生成成本归零,靠的是产品上直接砍掉自拍;记忆后台降八成,就是降频加换模型,工程上不算难。真正管用的是产品层面的取舍,先把该砍的功能砍了,剩下的优化才有意义。
现在的状态是:月付订阅的陪伴产品,成本不到收入的一半,这套账能一直撑到实时语音上线。到那天,按分钟计费的语音会把所有数字重算一遍。希望在那之前,语音合成的价格能再降几轮吧。
本文是推翻 Mio 重来系列第五篇,上一篇是转向。促成这些决策的 v1 成本分析,见那张 Token 账单和 v0.2.0:应用上线。


