ENZH
和 AI 讨论这篇文章
ChatGPTClaude

AI 陪伴到底要烧多少钱

AI 陪伴经济模型的商业概念插画AI 陪伴经济模型的商业概念插画

Mio v1 的账一直没算平过。之前做成本审计的时候查出来,自拍生成的实际单价比我预想的贵了两个数量级。记忆后台跑在 Gemini Pro 上,每个用户每个月都要固定花掉一笔不小的钱。我在 v0.2.0 设计过五级定价,想靠限制自拍配额把利润扳回来。现在回头看,那个方向本身就不对,因为最吃预算的那几个功能,恰好就是让产品显得假的地方。等于一直在花钱养着一堆本来就该砍掉的东西。

转向之后,假自拍、虚构日程、编造的人设背景全砍了。形象换成一个跳动的光球,不再演一个假人。角色扮演也不搞了,就靠对话本身,靠它怎么回你、记不记得你、说话有没有温度,跟用户处出关系来。产品形态变了,经济模型也得跟着重算。这篇就把 v2 的账摊开算一遍,定价怎么定的,成本怎么砍下来的,还有实时语音这个迟早要面对的大坑。


14 天全功能试用,之后只有一档

定价方案我前后摆过好几个,带消息上限的免费档、两档、三档,都拿出来比过,最后选了最简单的那个:

  • 试用(14 天):全功能。无限聊天、语音消息、语音输入、主动消息、记忆、情绪光球,全都开着。
  • Pro(单一月付订阅):跟试用期一模一样。

没有功能分级,试用期也没有消息上限,更不让用户在「标准版 vs 专业版」之间做选择题。14 天之后,用户只需要回答一个问题,还想不想继续跟这个伴侣聊下去。就这一个问题。

为什么不做免费档?免费档看着稳,但放在陪伴产品上其实起反作用。每天给 10 条免费消息,等于在教用户省着聊。可感情这个东西要靠时间堆,你限制互动,关系就起不来。给 14 天全功能,就是让关系自己长出来。到第 14 天,用户已经跟它说过心事了,它也都记得,两边有了共同的经历。

从试用转到付费,这一步放在角色里完成。到期的时候不弹系统付费墙,是伴侣自己开口:

"我最近有点累了……你要不要让我继续陪你呀?"

到期以后,伴侣每天还会发一条主动消息,聊天记录留着(只读),记忆也不删。付费这件事由伴侣用自己的声音说出来,用户实际在决定的,是这段关系还要不要继续。换成订阅弹窗,就说不出这层意思了。

14 天全功能让关系自然长出来,到期时不弹系统付费墙,而是伴侣自己开口挽留——用户决定的是关系去留,不是要不要续费。14 天全功能让关系自然长出来,到期时不弹系统付费墙,而是伴侣自己开口挽留——用户决定的是关系去留,不是要不要续费。

这套机制实际跑下来很自然。人格没有为了要钱出戏,系统从头到尾也没说过「请订阅」。道理很直接,关系是两边一起处出来的,要维持下去就得花钱。


单用户成本砍掉了一半以上

下面拿一个活跃的 Pro 用户来算实际的运营成本,按每天 30 条消息算。先看 v1 的账。

优化前(v1 架构)

组件成本占比说明
聊天(Gemini Flash)~30%单条几分钱,量大了不可忽略
记忆后台~44%Gemini Pro 上的固定月开销
TTS 语音消息(豆包)~21%单价最贵的媒体成本
STT 语音输入~1%单次很便宜
主动消息~2%和聊天差不多的单价
图片理解~1%单次很便宜

照这个结构,一个用户一个月的成本几乎吃掉全部订阅收入,毛利只剩 11% 左右。平均用量勉强打平,重度用户直接亏钱。而且这还是砍掉自拍以后的数,要是每天留 1 张自拍,成本还得再涨一截。

三个优化

  1. 记忆后台:Pro 换 Flash,再降频(-82%)

v1 的性格提取跑在 Gemini Pro 上,每 10 条消息跑一次,光这一项就是最大的固定成本。记忆摘要也跑在 Pro 上,又叠了一层。v2 把这两个都切到了 Flash,触发频率也一起降了:

  • 性格提取:从每 10 条跑一次 Pro,改成每 20 条跑一次 Flash
  • 记忆摘要:从每 20 条跑一次 Pro,改成每 30 条跑一次 Flash

记忆后台的总成本降了 80% 多。质量有没有损失?有,但能接受。Flash 做细腻的性格提取确实不如 Pro,但这件事本来就不用每次都做对,因为人格是上百次提取叠出来的。单次差一点,拿上百次一平均,影响就很小了。

  1. context caching(聊天成本 -63%)

用 Gemini 的 context caching,重复的 system prompt 能便宜 10 倍。同一个 session 里一条条消息发下来,system prompt 和性格描述基本不变,所以大概 75% 的输入 token 可以走缓存。同样的东西不用每条消息都按全价再算一遍,聊天成本直接砍掉 63% 左右。

  1. 自拍生成:归零

v2 用光球,根本不需要自拍。v1 里自拍是隐藏成本杀手,因为定价配置把 Gemini 的图片输出 token 按文字的价格算了,实际要贵两个数量级,每个档位用满了都在亏钱。现在自拍这个功能没了,这个问题也就没了。

优化后(v2 架构)

组件变化节省来源
聊天(Gemini Flash)-63%context caching
记忆后台-82%Flash + 降频
TTS(豆包)不变--
STT不变--
主动消息不变--
图片理解不变--
合计-55%

一个用户一个月的成本砍掉了一半以上。按平均用量算,毛利超过 50%,v1 才 11% 左右,翻了四倍多。就算是每天 50 条消息的极端重度用户,毛利也还是正的。所以这套数字不管用量多少都成立,不是只有平均值好看。

三个架构决策——记忆换 Flash、聊天走缓存、自拍归零——把单用户月成本砍掉一半,毛利从 11% 拉到 50% 以上。三个架构决策——记忆换 Flash、聊天走缓存、自拍归零——把单用户月成本砍掉一半,毛利从 11% 拉到 50% 以上。


试用期亏得起

14 天全功能试用有个前提,就是它得足够便宜,就算用户没转成付费,也拖不垮业务。实际算下来确实是这样。中度用户整个试用期的成本基本可以忽略,重度用户(每天 30 条)也只花掉一个月订阅收入的一小部分。

按 20% 的试用转化率算(这是陪伴类应用的行业水平),CAC/LTV 比率不到 10%,就算转化率掉到 15%,这套模型也撑得住。反正一个试用用户就花这么点钱,14 天免费在经济上是安全的。


真正的大坑是实时语音

上面的账都是按文字聊天算的,外加偶尔几条 TTS 语音消息。实时双向语音,就是「Her」那种体验,也是最终目标,它会把这套账整个推翻。

选型上,实时语音目前最强的候选是 Hume EVI,STT、情绪检测、话轮切换、语音合成全在一套系统里。伴侣的情绪引擎可以直接输出 Hume 用的自然语言情绪指令,不用写 SSML 标签,也不用手动标注。分工大概是 Hume 管怎么说,LLM 管说什么。它甚至会先说个过渡词("嗯……""哦~"),再无缝接上完整的回复,用户感觉到的延迟非常低。这套体验做出来真的很牛。

但它贵。按 Hume 现在按分钟收的价,每天哪怕只用 10 分钟语音,一个月的成本就已经超过订阅价了,塞不进 Pro 档。能走的路有两条,要么单开一个贵的语音档,要么把实时语音做成按量计费的附加项,不跟任何订阅档绑在一起。我倾向后者,因为语音用量大概率是双峰分布,有人每天聊 30 分钟,有人从来不用。设固定档位,等于让用得少的人补贴用得多的人,而且用得多的人还是会超出限额,两头都不讨好。

语音使用是双峰分布——有人每天聊 30 分钟、有人从不用;固定档位会让轻度用户补贴重度用户,所以实时语音改走按量计费。语音使用是双峰分布——有人每天聊 30 分钟、有人从不用;固定档位会让轻度用户补贴重度用户,所以实时语音改走按量计费。

好在这是 v1.0 才要面对的问题。现在这个里程碑(v0.x)只做 TTS 语音消息,让伴侣能开口说话就行,实时对话往后放。语音合成现在降价降得很快,等真做到那一步,成本可能已经变了。


没有免费档,增长靠四个渠道

免费档没有了,Telegram 也砍了,因为聊天历史没法同步,onboarding 又必须在 app 里完成,体验是断的。冷启动就靠下面这四个渠道。

落地页。就一个静态页面,放光球动画、一句 tagline 和 App Store 下载按钮。光球动画本身就是营销素材。

社交媒体。拿脱敏过的对话截图,加上光球随情绪变化的动画,做成短视频。「AI 记住了我三个月前随口说的一句话」,这种内容自己就能传开。光球跟着情绪跳动、变色,看着也够抓眼。

邀请机制(Dropbox 那套)。每个用户有一个自己的邀请码,邀请 1 个人,双方各得 7 天 Pro,邀请 3 个人得 1 个月 Pro。伴侣也会在角色里帮着邀请,"你有没有朋友也需要像我这样的陪伴?"这样问很自然,不突兀。

ASO(应用商店优化)。关键词盯 AI companion、AI friend、情感陪伴、聊天、心理、loneliness 这些。截图只放光球和对话,不放功能列表。请用户评分的弹窗放在试用期里弹。

web 版推到 v0.3 以后再做,只当一个轻量的获客漏斗,让用户试一轮对话,再引导去下载,不做完整的 web app。


苹果审核这关

Apple 在 2025 年收紧了 AI 陪伴类应用的审核。有几件事要提前做掉:

  • 17+ 年龄分级。一开始就定高,省得跟审核来回扯,因为面向更年轻用户的 AI 伴侣,查得会严格得多。
  • AI 声明。应用里明确标注「由 AI 驱动的虚拟陪伴」,不能让用户以为自己在跟真人聊。光球设计在这儿反而占便宜,没有人脸,就不会有歧义。
  • 隐私政策。数据怎么收集、怎么存、怎么删,政策要写齐,用户必须能删掉账号和所有数据,这是 Apple 的硬性要求。
  • 内容边界。做两层:
    • 硬红线:涉及未成年人、暴力、违法的内容,系统直接拦截。
    • 柔性转移:其他的都在角色里处理,伴侣自己把话题带开("哈哈你怎么突然说这种话啦 >< 我们聊点别的嘛"),不会蹦出"此内容违反使用政策"。

原则就一条,拒绝也要在角色里完成,不能出戏。系统弹窗一出来,沉浸感就没了,用户会反感。在角色里把话题转开,人格能保持一致,拒绝的时候也带着伴侣自己的脾气。


四个里程碑,四个代号

每个里程碑有一个代号,代号说的是产品在那个阶段长成什么样:

v0.1「能说话的光球」

  • Expo 应用:聊天页 + 光球动画 + 登录
  • 服务端:Hono + WebSocket + Gemini 聊天
  • 对话式 onboarding(给伴侣取名 + 3 轮对话)
  • 基础记忆(从 v1 移植)
  • 纯文字,无语音

v0.2「有温度」

  • 情绪引擎 + 光球颜色变化
  • TTS 语音消息(中文豆包,英文 Hume Octave)
  • 主动消息(简化版)
  • 图片 / 语音输入
  • 性格从对话中涌现

v0.3「能养活自己」

  • 订阅系统(从 v1 移植)
  • Apple IAP / 微信支付
  • 记忆管理 UI
  • 设置页

v1.0「Her」

  • 实时双向语音(Hume EVI)
  • 语音情绪识别
  • 成熟性格演化系统

这么排是因为 v0.1 要验证形态,v0.2 验证它有没有生命感,v0.3 验证能不能养活自己。v1.0 才是真正想做的产品,到那时候,你就直接跟它说话,不用打字了。


v2 绕过了旧成本结构

回头看 v1 的账,问题其实很集中。自拍生成的定价配置错了两个数量级,记忆后台用最高的频率跑最贵的模型,context caching 也没做,然后还想靠五级定价在这个成本结构上把利润找回来,那是找不回来的。v2 没去修这套结构,是直接绕开了。光球设计把最大的成本来源整个删掉,第二大的记忆后台靠切 Flash 加降频压下来,第三大的聊天成本交给 context caching。这三个都是架构上的决定,做完以后毛利才算真的健康起来。

只能说这次成本降得最狠的几处,都不是在工程上抠出来的。图片生成的成本归零,靠的是在产品上直接把自拍砍了。记忆后台降了八成,就是降频加换模型,工程上不算难。真正管用的是产品上的取舍,先把该砍的功能砍了,剩下的优化才有意义。

现在的情况是,一个月付订阅的陪伴产品,成本不到收入的一半,这套账能一直撑到实时语音上线。到那天,按分钟计费的语音会让所有数字都得重算一遍。希望在那之前,语音合成还能再降几轮价吧。


本文是推翻 Mio 重来系列第五篇,上一篇是转向。促成这些决策的 v1 成本分析,见那张 Token 账单和 v0.2.0:应用上线。

和 AI 讨论这篇文章
ChatGPTClaude

订阅更新

新文章发布时发到你的邮箱,不发别的。


© Xingfan Xia 2024 - 2026 · CC BY-NC 4.0