教 AI 写出没有翻译腔的中文
AI 学习中文写作
前阵子有个读者给我发消息:
"blog现在的中文版的阅读体验不是很好, 用语很生硬"
我第一反应是不太服的,中文文章都是认真写过的,怎么就生硬了。结果回去重新读了一遍,只能说人家讲得对,确实生硬。而且这个生硬不是语法错误,也不是用词不当,是一种更微妙的东西。每句话单看都没毛病,但整篇读下来不像一个中文博客,像英文博客的翻译稿。
翻译腔长什么样
随便挑一段早期的文章(我改写过,味道是一样的):
该系统的核心特征在于其能够在无需人类持续干预的情况下,独立执行一系列复杂任务。
这句话语法没有任何毛病,信息也传达清楚了,但你在微信上不会看到有人这么写。这种句子一般只出现在两个地方:翻译教材和大学论文。
拆开看的话,问题大概有三层。从句套从句,这是英语的定语结构直接搬过来的。「在……的情况下」是典型的英文 without 翻出来的痕迹。先给抽象定义、再给例子,这是英文论文的展开方式。反正整句话没有一点活人说话的感觉。
同样的意思,换个写法:
agent和普通AI助手有什么区别?打个比方:AI助手像听话的员工——你说什么它干什么。agent呢?更像靠谱的合伙人。你说"帮我把这个项目搞定",它自己拆任务、自己干活、干完了还给你写个总结。
内容完全一样,读感完全是两回事。前面那段像维基百科,后面这段像朋友在饭桌上给你解释一个东西。
换几个词救不回来
我一开始以为这是个用词问题,把几个书面词换成口语词就行了。后来发现不是,问题出在思维结构上,比用词深一层。
英文写作的思路是演绎式的:先亮观点,再摆证据,最后总结。整篇文章像在做一个陈述,目的是说服你,所以结论放最前面,然后用数据和逻辑一层层往上堆。
中文自媒体不是这个路子。它的思路是归纳式的、螺旋式的:先给你看一个场景,让你有感觉了,再把道理点出来。它不直接告诉你什么是对的,它带你看一个东西,看完你自己会得出那个感觉,靠的是共鸣,不是靠逻辑一层层推给你。
这两种传统没有谁好谁差,都能写出好东西。但拿英文的修辞结构去装中文的内容,出来的东西就是不对味,读者说不出具体哪里不对,但一下就能感觉到。
先去研究别人是怎么写的
搞清楚问题之后,我去认真研究了一圈公众号爆款文章是怎么写的。研究对象是半佛仙人、九边、卢克文、差评、虎嗅、36氪这几家。他们风格差别挺大,但有几个共同点很明显:
- 开头绝对不会是
本文将分析……。半佛仙人用一句骚话把你钩住,九边直接丢一个违反直觉的判断,卢克文从历史故事讲起,差评一张截图加一句吐槽。没有任何人会在第一段告诉你这篇文章要讨论什么,那是论文的写法。 - 段落非常短。一句话一段是常规操作,两句话算长的,三句话以上就是在做重大论述了。
- 「但是」是最重要的词。好文章的节奏全靠转折:给你一个判断,「但是」打破它;再给一个更深的判断,「问题是」再打破。一波三折,读者才不会中途走掉。
- 金句是社交货币。每篇爆款里都有一两句适合截图发朋友圈的话,比如「速度就是护城河」「AI不是来抢你饭碗的,是来抢你饭碗里最好吃的那块肉的」。读者分享一篇文章很多时候不是因为它有用,是分享它能让自己显得聪明。
我把这些分析整理成了一份写作风格参考文档,写完一看有 435 行,后面所有的规则都是从这份文档里长出来的。
第一版规则没用,太抽象了
有了这份研究,我立刻给 AI 的指令加了一堆规则:用短段落、语气要口语化、写得像跟朋友聊天。然后让它重新写一篇,写出来一看,跟没加规则的时候基本一模一样。
想了一下为什么。「语气要口语化」根本不是一条可执行的指令。这就跟对一个从小只读法律文书的人说「你写轻松点」一样,他不知道轻松长什么样,参考系里没有这个东西。
AI 也是同一个处境。它的训练数据里,中文正式文本——新闻、百科、教材、翻译内容——占比远高于口语化的自媒体文本。你告诉它「说人话」,它写出来的人话还是翻译腔,因为那就是它见过最多的中文。
抽象规则「说人话」在生成时被 AI 丢掉、输出仍是翻译腔;具体到正则级的禁用词表才真正执行、写出原生中文。
真正管用的做法是具体到没有解释空间
后来我想明白了一件事:规则必须具体到 AI 完全没有解释空间。照这个思路,具体做了这么几样东西。
第一样是禁用词表。不要说「不要用学术语言」,直接列表:
| 杀掉这个 | 换成这个 |
|---|---|
| 值得注意的是 | 有意思的是 / 可能没注意到 |
| 综上所述 | 所以你看 / 说到底 |
| 首先...其次...再次...最后 | 第一个 / 更重要的是 / 最狠的是 |
| 作为一个... | 直接说身份——"他是工程师"不要"作为一个工程师" |
| 进行了...分析 | 直接说——"分析了"不要"对此进行了分析" |
| 本文将... | 直接开始。永远不要预告你要做什么。 |
这个表一加进去,效果立竿见影,因为它是正则匹配级别的具体。AI 不需要理解什么叫口语化,它只需要看到左边那个词,就换成右边那个。
第二样是 before/after 对比,就是让 AI 看同一个意思的两种写法,实测下来这个最有效。
翻译腔的版本:
该公司的商业模式面临着一个根本性的挑战。随着AI agent技术的普及,传统的SaaS订阅模式正在被按使用量计费的消费模式所取代。
公众号风格的版本:
这家公司的商业模式,说难听点,快走不下去了。原因很简单:以前你卖SaaS,客户按月付费,管你用不用,钱照收。现在呢?客户说,我有agent了,用多少付多少,不用就不付。
AI 能从这个变换里直接看到什么变了。单句成段了,「面临根本性挑战」变成了「说难听点,快走不下去了」,抽象描述变成了对话。这种东西你拿规则描述半天都说不清楚,摆一对例子它直接就看懂了。
第三样是结构模板,不要说「用螺旋结构」,直接给步骤:
模板A:现象拆解
1. 钩子:反常识 or 场景代入(1段)
2. "你可能觉得...但其实..."(设反差)
3. 第一层:表面原因(场景+洞察)
4. "但这还不是最关键的"(转折加深)
5. 第二层:底层逻辑(场景+洞察)
6. "所以你看..."(回到读者的现实)
7. 金句收尾 or 行动建议
有了这个脚手架,它才知道第一段该干什么、第五段该干什么,不至于拿着「螺旋结构」四个字自己发挥。
第四样是口语化的刻度尺。我定义了一条频谱,两头都不要,要的是「聪明朋友在饭桌上聊天」的那个度:
论文 ←————— 甜区 —————→ 段子手
"基于上述分析" "说白了" "笑死,绷不住了"
"值得注意的是" "这事儿有意思" "家人们谁懂啊"
"综上所述" "所以你看" "绝绝子"
目标就是中间那个甜区,不端着,也不油。
口语化是一把刻度尺,两头是论文腔和段子手,要的是正中间那个「甜区」。
最后还有一道校对关。上面这些规则全部到位,第一稿还是会漏翻译腔。所以写完之后强制扫一遍全文,搜 作为、之一、进行、综上、值得注意 这些词,看到一个改一个。然后整篇读出声,读起来别扭的句子,写出来一定也别扭。
这事比教 AI 写代码难多了
整个过程里我感受最深的一点:教 AI 写出一种文化特定的风格,比教它写代码难太多了。
代码有明确的对错,测试跑过就是过,lint 报错就去修,反馈循环又紧又客观。写作风格不是这样。「读起来像原生的」和「读起来像翻译的」之间差距巨大,但你很难把这个差距精确地描述出来。
翻译腔麻烦就麻烦在它不是错的。每句话语法都对,信息传达都准确,语法检查器跑一遍能给满分。但问题恰恰出在这里:它不是语法问题,是文化 register 的问题。文本的模式匹配到了翻译教材而不是原生内容,中文读者一秒就能感觉到,哪怕说不出具体哪里不对。
所以最后沉淀下来的经验大概是这么几条。「语气要口语化」这种抽象规则基本没用,AI 到生成那一步就把它丢了,规则要具体到接近正则的程度,才执行得动。例子比描述好用得多,同一个意思的两种写法摆在一起,它一眼就能看出差别在哪。禁用词表是杠杆最高的一个干预,一张简单的替换表就能干掉八成的翻译腔。剩下的结构、节奏、语气,再靠迭代慢慢磨。还有一点,风格没法用一条指令修好,它需要研究、参考文档、显式规则、示例、结构模板、校对流程,整个是一条管线,你得把这条管线搭起来,调一个开关是不够的。
风格修不了靠一个开关,得搭一条从研究爆款到校对关的多级管线,中文才能变原生。
对了,这篇本身也是走这条管线出来的。
This post is also available in English.


