ENZH
和 AI 讨论这篇文章
ChatGPTClaude

AI 能补上领域知识,产品判断还得靠人

📊 幻灯片

盘盘猫这个项目做完,回头看,最难的地方全不在我一开始以为的位置。工程问题基本都有解法,真正卡住我的是语气、定价、landing page 这些事。前两篇写过为什么一个零基础的人敢做算命产品,还有技术上是怎么搭起来的。这一篇把真教训摊开讲,「一切顺利」的版本就不写了,那种没什么好写的。

盘盘猫坐在扶手椅上翻看经验笔记,周围浮着关键洞察盘盘猫坐在扶手椅上翻看经验笔记,周围浮着关键洞察

AI 能把领域知识补上,前提是你会提问

整个项目押的核心假设,就是 AI 能把领域知识的空白补上。这个假设是成立的。八字计算逻辑现在有 20,000 行,梦境符号做了 1,000 多个,每个都带文化语境,塔罗那边是 78 张牌各一套解读框架,生肖计算器、太岁分析引擎、流年飞星系统这些也都有,162 个领域测试全过。反正全是靠 AI research 加实现一点一点堆出来的。练八字的用户说计算是对的,熟塔罗的人说解读有深度。

但有一个大前提:你得知道在什么抽象层级上提问。头几天我基本没让 claude 写什么代码,主要是让它教我。你问「八字是怎么运作的」,拿到的就是维基百科级别的概述,没法用;你问「判断日主强弱的具体五行生克规则是什么」,拿到的才是可以直接写成代码的逻辑。

同一个 AI,问在错误的抽象层级只给维基百科级概述,问在具体规则层级才给出能写成代码的逻辑同一个 AI,问在错误的抽象层级只给维基百科级概述,问在具体规则层级才给出能写成代码的逻辑

反正就是要先把自己的心智模型建起来,建起来之后,你才问得出实现层面的问题。没有那个模型,最后做出来的就是一个花哨的计算器,看着像那么回事,其实没有深度。所以零领域知识不是问题,AI 补得上;但你自己得有好奇心,得愿意先当学生,这个 AI 替不了你。

语气这个事真的难调

PR #38 处理的是一条挺要命的用户反馈:AI 的解读太「讨好型」了。所有解读都往正面说,连健康、感情这种该给警示的地方,也永远是「没问题」「有希望」。但真的算命先生不这么说话,他会直接告诉你八字里有什么障碍,指出哪几个月不利,说「今年太岁正冲,这些方面要注意」。

这次修复把全部 6 个领域的 prompt 都改了一遍。健康解读从「混合分析」改成「中立偏负面」,该给的警示直接给;负面指标从委婉的「诚恳指出」改成直接写「凶」「不利」,后面跟上化解方案。

讲道理,这是整个项目里最难做对的一件事,而且 AI 自己搞不定。语气校准需要你理解一种文化对诚实、共情、权威感的期望是什么样的,现在的模型不擅长这个,只能手动去迭代 prompt:拿用户反馈,调一版,再拿反馈,再调。踩了一圈下来我只能说,领域知识 AI 补得上,领域文化这个东西还是得靠人一点一点去调。

几个被我低估的产品决策

有几件事我是严重低估了的。

Landing page 推翻了三次。第一版暖棕加金色,走温馨亲切路线,结果用户以为是儿童应用。第二版改成干净极简,又被当成了个技术 demo。第三版干脆换成暗色奢华,深黑底、金色点缀,猫也改成神秘的神谕者形象,这一版用户的评价才变成「值得信赖」「专业」。三次重做,改的其实都是定位问题。

定价比写代码费脑子。给积分套餐起名字花的时间,比做任何一个 API endpoint 都多。最后积分叫「小鱼干」,没用 token 也没用 credits,就是为了减轻花钱的心理负担:「花 5 条小鱼干」这个动作,比直接面对一个具体的美元数字轻松得多。

邀请奖励这块也挺有意思。PR #46 把奖励从不对称的(邀请人 10 条、被邀请人 3 条)改成对称的各 5 条。用户觉得不对称那个版本是在「利用朋友换积分」,改成对称之后,分享这个动作感觉像送礼,邀请量反而上去了,跟我一开始想的不太一样。

转化漏斗是个精细活。UpgradePrompt 组件(PR #2)有 7 种触发 context,每一种对应不同的情绪时刻:算命算到一半积分用完了,跟随便逛逛枢纽页,是完全不同的两个场景。另外加了 24 小时的关闭冷却,不能让用户觉得被骚扰。

反过来讲,被我高估的是架构完美度和测试覆盖率。关键路径盖住就可以发布了,打磨的事,等找到 product-market fit 再说。

97% 的代码是 AI 写的

97% 的代码是 AI 生成的,但工作量没有少 97%,少的主要是打字,整体速度大概快 10 倍。日常的工作流程具体是这样的:

  1. 架构设计:决定做什么,以及怎么融入现有系统
  2. Prompt:向 claude code 描述功能,给足现有模式的 context
  3. Review:每一行都要看,AI 偶尔会幻觉出不存在的 API 方法,或者 import 一个不存在的包
  4. Prompt engineering:领域相关的 AI prompt 100% 是我手写的
  5. 测试:验证 AI 没想到的边界情况
  6. 纠偏:AI 走偏了就拉回来

git 历史里散落着 claude/codex/ 分支,那是 AI agent 提交变更、review 通过后合并进来的地方。

AI 比人强的地方是一致性。claude 在 15 个 endpoint 上应用 createAIStreamResponse() 模式(PR #16),做得比人还统一;createRouteCostLogger 那次重构(PR #21),要在 20 个文件里做同一个改动,这种活完全是 AI 的领地。这种重复的事人做会烦,做着做着就开始犯低级错误,AI 做就没这个问题。

AI 吃力的地方,是所有需要判断用户体验的事。内容过滤器迭代了三次(从全拦截改到内联遮蔽)、语气那次大改、邀请系统重新设计,靠的都是人的产品直觉。

一个人做产品,到底是什么体验

自由这个东西是会上瘾的。不用开会,也没有站会和 Jira 这些东西,每天就是 commit 和发布,从想法到生产环境是以小时计的,sprint 这个词根本用不上。

但盲区也是真的。没人拦着你去做用户不需要的东西,也没有人问你一句「你确定吗」。什么时候该停手,一个人判断起来要难得多。landing page 重做三次就是例子:要是有团队,定位问题可能第一版就被人指出来了。

好架构的复利是真的很夸张。第一条产品线最难,做到第九条的时候,新增一条几乎就是机械操作:建一个领域知识 package,按 createAIStreamResponse() 模式加 API 路由,用共享组件库把 UI 搭起来,注册进积分、历史记录、数据分析系统,然后部署。2 月 15 日那天,一天上线了三个全新产品:起名、合婚、流年运程。基础设施不到位的话,这种事想都不用想。

共享架构底座让第一条产品线最难、第九条几乎机械化,复利累积到一天能上线三个全新产品共享架构底座让第一条产品线最难、第九条几乎机械化,复利累积到一天能上线三个全新产品

CI 顶的是代码审查搭档的位置。没有团队,就只能重度依赖自动化的质量门禁:TypeScript strict mode,2,021 个测试,每个 PR 都跑 GitHub Actions。后来引入 claude code 的 agent team,又加了 hooks:队友手里有没 commit 的代码就不许 idle,有 TypeScript 错误就不许把任务标成完成。

合规要从第一天就规划进去

中国市场的合规是个大活。PR #83 把法律页面拆成中英文两个版本,把中国 AI 法规的合规要求补齐:生成式 AI 暂行办法、深度合成规定、算法推荐规定,外加 PIPL 的跨境传输、敏感个人信息同意、自动化决策透明度和数据泄露应急流程。

内容过滤器做成了双重架构(PR #104):输入端一个严格过滤器,拦广告、政治、色情、犯罪;输出端一个宽松过滤器,专门把「广告」这一类排除掉。为什么要这么拆?因为算命内容天然就会生成「兼职」「招聘」「桑拿」这类词,粗暴的关键词过滤会大量误杀。反正面向中国用户做产品,合规就是要从第一天规划进去,别想着最后再补。

最小团队,现在是一个人加一套工具

「AI 增强开发者」这个说法我觉得不太准,听上去 AI 只是个辅助。盘盘猫跑下来,分工其实很清楚:产品经理的活(定位、定价、语气、转化设计)、架构师的活(系统设计、package 边界、数据模型),还有每一行代码合并前的 review,都在人这边;AI 承担的是执行引擎和领域专家两个角色——写代码、应用模式、做机械化重构,再加上供给算命知识、计算逻辑和文化语境。

人负责产品、架构、代码审查,AI 当执行引擎和领域专家,于是最小可行团队从七个人缩成一个人加一套 AI 工具人负责产品、架构、代码审查,AI 当执行引擎和领域专家,于是最小可行团队从七个人缩成一个人加一套 AI 工具

照这个分工,做一个多产品平台的最小可行团队,从「5 个工程师、1 个 PM、1 个设计师」缩成了 1 个有品味的工程师,加一套 AI 工具。盘盘猫就是这个配置跑出来的一个完整样本。


PanPanMao 已上线:panpanmao.ai。1,134 个 commit,109 个 PR,9 个产品线。

和 AI 讨论这篇文章
ChatGPTClaude
盘盘猫第 10 篇 · 共 12 篇

订阅更新

新文章发布时发到你的邮箱,不发别的。


© Xingfan Xia 2024 - 2026 · CC BY-NC 4.0