Mio 的账到底算不算得过来
AI 伴侣单位经济模型的商业概念插画
先交代下背景
做 OpenClaw 原型那会儿,两周账单直接离谱——早期版本日成本高得离谱,一个用户跑两周就能烧掉一笔不小的钱。那次给我的教训很直接:成本这个事,得从第一天就当架构问题去解,不能想着以后再优化。
现在 Mio 迭代到第八个版本了,这篇就拿线上的真实生产数据,把这个账一层层重新算一遍。
真实数据
拿线上生产环境跑了一天的数据来算:77 次调用,差不多 28 条聊天消息,成本按类别拆开是这样的:
| 类别 | 成本占比 |
|---|---|
| 聊天(LLM) | ~59% —— 绝对大头 |
| 人格提取 | ~21% —— 单次贵但调用少 |
| 记忆摘要 | ~10% —— 中等成本,调用少 |
| 语音合成(TTS) | ~3% —— 单次很便宜 |
| 记忆提取 | ~3% —— 单次很便宜 |
| 主动消息 | ~2% —— 几乎忽略 |
| 记忆重排序 | ~2% —— 单次可忽略不计 |
| 向量嵌入 | <1% —— 约等于免费 |
一个活跃用户一天的总成本非常低。聊天占了将近六成,是绝对的大头;然后是人格提取和记忆这几个任务;剩下的——语音、嵌入、重排序——全是零头。
跑了 1000+ 次交互之后再平均,每条消息的成本几乎可以忽略。跟早期原型比,成本降了两个数量级。但只能说,对低价层级来讲,这还不够低。
钱花在哪了
这个账我一般分两块看,媒体那块按需叠加,算第三块:
每日固定开销(占比不大):
- 人格提取是固定成本里的最大头:一天跑 3 次,用 Gemini 3.1 Pro
- 记忆摘要中等:一天 2 次
- 记忆提取和嵌入基本可以忽略
- 主动消息按需触发,也可以忽略
每条消息的成本(几乎可忽略):
- 大头是聊天本身的 LLM 调用,每次 8K-17K 输入 token
- 记忆重排序可以忽略
- 一天 30 条消息,月度账单不大;一天 100 条,变动成本开始超过固定成本;到一天 200-300 条,变动成本就是固定开销的好几倍了
媒体成本(按需叠加):
- 语音合成、图片理解都几乎可以忽略
- 视频理解稍贵一点
- 自拍生成也几乎可以忽略
prompt 压缩干了什么
上面这些数字都是压缩前的。v0.1.4 把 system prompt 压掉了差不多 60%,从 9K-13K token 压到 3K-5K。system prompt 是每次聊天输入 token 里的最大头,把它压下来,等于直接砍掉了每条消息成本的大头。
压缩之后保守估计,每条消息的成本能降 ~35%,每日固定开销能降 ~25%。反正净效果就是,每个使用量级的月度成本都明显往下走,而且使用量越高的层级效果越明显——因为变动成本占比更大。
每个层级到底赚不赚钱
每个付费层级都有每日消息上限,用来控制最坏情况的成本。下面算的是上限打满的极端情况。
压缩前(当前):
| 层级 | 消息上限 | 满载毛利 |
|---|---|---|
| 免费 | 20/天 | 获客漏斗(成本中心) |
| 入门 | 30/天 | 亏钱 —— 满载入不敷出 |
| 进阶 | 100/天 | 勉强打平 |
| 高级 | 200/天 | 小赚 |
| 旗舰 | 300/天 | 小赚 |
压缩后(v0.1.4+):
| 层级 | 消息上限 | 满载毛利 |
|---|---|---|
| 免费 | 20/天 | 获客漏斗(成本中心) |
| 入门 | 30/天 | 转正 —— 稳妥盈利 |
| 进阶 | 100/天 | 毛利可观 |
| 高级 | 200/天 | 毛利很健康 |
| 旗舰 | 300/天 | 毛利很健康 |
说实话,压缩前的成本下,只有高层级满载能盈利。压缩之后,全部付费层级都转正了,高层级的利润率改善也很明显。
有个背景得先讲清楚:「满载」意味着用户每天把消息额度全用完。实际使用一般只到上限的 40-60%,所以真实利润率比这个最坏情况好得多。
还有一个点挺有意思的:利润率为什么是逐级递增的?因为低层级用户付的钱,买的是真正吃成本的功能——LLM 聊天、语音识别、图像理解这些。高层级用户付的高价,买的反而是几乎不产生额外成本的东西:自拍生成成本可忽略,优先响应零成本,NSFW 解锁零成本,扩展记忆成本也可忽略。所以层级越高,用户多付的钱基本不带来新增成本,利润率一级比一级高就是这么来的。
为什么付费层级越高利润率越高:低层级付的钱买的是吃成本的功能,高层级付的钱买的是几乎零成本的功能
为什么这个账只会越算越好
成本后面还会继续降,原因有三个。
1. prompt 还能继续压。 v0.1.4 的压缩砍掉了 60% 的 system prompt token,这类优化做一次,是乘在所有用户的所有消息上的。后面还有 lorebook 架构——背景故事按需注入,不再全量加载——保守估计还能再降 30-40%。
2. 模型本身一直在降价。 LLM 推理成本过去两年降了两个数量级。今天每条消息的成本,一年内可能再降 3-5 倍——Gemini 一直在降价,便宜模型的能力也在快速往上走。
3. 路由还能往下降级。 Mio 的智能路由现在已经把 90% 的对话发给 Gemini 3 Flash,只有人格提取和记忆摘要用 Gemini 3.1 Pro。便宜模型能力上来之后,还有更多操作可以往下挪——跟 prompt 优化一样,每次切换都是乘在所有用户身上的。
这几项叠在一起,6 到 12 个月内,prompt 优化加模型降价加架构改进,应该能把所有层级推到 50-70%+ 的毛利,比现在压缩后这一版还要好不少。
三股力量同时把每条消息的成本往下压,而且每一次优化都乘在所有用户身上,所以这个账只会越算越好
对比
| 指标 | 早期原型 | Mio(压缩前) | Mio(压缩后) | Mio(12 个月预测) |
|---|---|---|---|---|
| 每用户每天成本 | 天文数字 | 降两个数量级 | 再降一大截 | 只剩零头 |
| 每条消息成本 | 高得离谱 | 几乎可忽略 | 再降 ~35% | 再降 3-5 倍 |
| 入门层级能盈利? | 不能 | 仅高层级 | 能(稳妥盈利) | 能(毛利很高) |
| 记忆管理 | 无(只加不减) | 多层检索引擎 | + 压缩提示 | + 自优化 |
| 情感细腻度 | 基于规则 | 灵魂驱动 | + 关系进化 | + 微调模型 |
从天文数字降到几乎可以忽略,压缩之后还在继续降,上面那几项落地之后还能再降。
这是 Mio 宣言的技术附录,愿景和产品故事从宣言那篇看起。


