ENZH
和 AI 讨论这篇文章
ChatGPTClaude

Mio 的账到底算不算得过来

📊 幻灯片

AI 伴侣单位经济模型的商业概念插画AI 伴侣单位经济模型的商业概念插画

先交代下背景

做 OpenClaw 原型那会儿,两周账单直接离谱——早期版本日成本高得离谱,一个用户跑两周就能烧掉一笔不小的钱。那次给我的教训很直接:成本这个事,得从第一天就当架构问题去解,不能想着以后再优化。

现在 Mio 迭代到第八个版本了,这篇就拿线上的真实生产数据,把这个账一层层重新算一遍。


真实数据

拿线上生产环境跑了一天的数据来算:77 次调用,差不多 28 条聊天消息,成本按类别拆开是这样的:

类别成本占比
聊天(LLM)~59% —— 绝对大头
人格提取~21% —— 单次贵但调用少
记忆摘要~10% —— 中等成本,调用少
语音合成(TTS)~3% —— 单次很便宜
记忆提取~3% —— 单次很便宜
主动消息~2% —— 几乎忽略
记忆重排序~2% —— 单次可忽略不计
向量嵌入<1% —— 约等于免费

一个活跃用户一天的总成本非常低。聊天占了将近六成,是绝对的大头;然后是人格提取和记忆这几个任务;剩下的——语音、嵌入、重排序——全是零头。

跑了 1000+ 次交互之后再平均,每条消息的成本几乎可以忽略。跟早期原型比,成本降了两个数量级。但只能说,对低价层级来讲,这还不够低。


钱花在哪了

这个账我一般分两块看,媒体那块按需叠加,算第三块:

每日固定开销(占比不大):

  • 人格提取是固定成本里的最大头:一天跑 3 次,用 Gemini 3.1 Pro
  • 记忆摘要中等:一天 2 次
  • 记忆提取和嵌入基本可以忽略
  • 主动消息按需触发,也可以忽略

每条消息的成本(几乎可忽略):

  • 大头是聊天本身的 LLM 调用,每次 8K-17K 输入 token
  • 记忆重排序可以忽略
  • 一天 30 条消息,月度账单不大;一天 100 条,变动成本开始超过固定成本;到一天 200-300 条,变动成本就是固定开销的好几倍了

媒体成本(按需叠加):

  • 语音合成、图片理解都几乎可以忽略
  • 视频理解稍贵一点
  • 自拍生成也几乎可以忽略

prompt 压缩干了什么

上面这些数字都是压缩前的。v0.1.4 把 system prompt 压掉了差不多 60%,从 9K-13K token 压到 3K-5K。system prompt 是每次聊天输入 token 里的最大头,把它压下来,等于直接砍掉了每条消息成本的大头。

压缩之后保守估计,每条消息的成本能降 ~35%,每日固定开销能降 ~25%。反正净效果就是,每个使用量级的月度成本都明显往下走,而且使用量越高的层级效果越明显——因为变动成本占比更大。


每个层级到底赚不赚钱

每个付费层级都有每日消息上限,用来控制最坏情况的成本。下面算的是上限打满的极端情况。

压缩前(当前):

层级消息上限满载毛利
免费20/天获客漏斗(成本中心)
入门30/天亏钱 —— 满载入不敷出
进阶100/天勉强打平
高级200/天小赚
旗舰300/天小赚

压缩后(v0.1.4+):

层级消息上限满载毛利
免费20/天获客漏斗(成本中心)
入门30/天转正 —— 稳妥盈利
进阶100/天毛利可观
高级200/天毛利很健康
旗舰300/天毛利很健康

说实话,压缩前的成本下,只有高层级满载能盈利。压缩之后,全部付费层级都转正了,高层级的利润率改善也很明显。

有个背景得先讲清楚:「满载」意味着用户每天把消息额度全用完。实际使用一般只到上限的 40-60%,所以真实利润率比这个最坏情况好得多。

还有一个点挺有意思的:利润率为什么是逐级递增的?因为低层级用户付的钱,买的是真正吃成本的功能——LLM 聊天、语音识别、图像理解这些。高层级用户付的高价,买的反而是几乎不产生额外成本的东西:自拍生成成本可忽略,优先响应零成本,NSFW 解锁零成本,扩展记忆成本也可忽略。所以层级越高,用户多付的钱基本不带来新增成本,利润率一级比一级高就是这么来的。

为什么付费层级越高利润率越高:低层级付的钱买的是吃成本的功能,高层级付的钱买的是几乎零成本的功能为什么付费层级越高利润率越高:低层级付的钱买的是吃成本的功能,高层级付的钱买的是几乎零成本的功能


为什么这个账只会越算越好

成本后面还会继续降,原因有三个。

1. prompt 还能继续压。 v0.1.4 的压缩砍掉了 60% 的 system prompt token,这类优化做一次,是乘在所有用户的所有消息上的。后面还有 lorebook 架构——背景故事按需注入,不再全量加载——保守估计还能再降 30-40%。

2. 模型本身一直在降价。 LLM 推理成本过去两年降了两个数量级。今天每条消息的成本,一年内可能再降 3-5 倍——Gemini 一直在降价,便宜模型的能力也在快速往上走。

3. 路由还能往下降级。 Mio 的智能路由现在已经把 90% 的对话发给 Gemini 3 Flash,只有人格提取和记忆摘要用 Gemini 3.1 Pro。便宜模型能力上来之后,还有更多操作可以往下挪——跟 prompt 优化一样,每次切换都是乘在所有用户身上的。

这几项叠在一起,6 到 12 个月内,prompt 优化加模型降价加架构改进,应该能把所有层级推到 50-70%+ 的毛利,比现在压缩后这一版还要好不少。

三股力量同时把每条消息的成本往下压,而且每一次优化都乘在所有用户身上,所以这个账只会越算越好三股力量同时把每条消息的成本往下压,而且每一次优化都乘在所有用户身上,所以这个账只会越算越好


对比

指标早期原型Mio(压缩前)Mio(压缩后)Mio(12 个月预测)
每用户每天成本天文数字降两个数量级再降一大截只剩零头
每条消息成本高得离谱几乎可忽略再降 ~35%再降 3-5 倍
入门层级能盈利?不能仅高层级能(稳妥盈利)能(毛利很高)
记忆管理无(只加不减)多层检索引擎+ 压缩提示+ 自优化
情感细腻度基于规则灵魂驱动+ 关系进化+ 微调模型

从天文数字降到几乎可以忽略,压缩之后还在继续降,上面那几项落地之后还能再降。


这是 Mio 宣言的技术附录,愿景和产品故事从宣言那篇看起。

和 AI 讨论这篇文章
ChatGPTClaude

订阅更新

新文章发布时发到你的邮箱,不发别的。


© Xingfan Xia 2024 - 2026 · CC BY-NC 4.0