给 AI 一篇范文,让它改成那个味
AI 提取范文风格 DNA
上一篇讲了怎么把一套 435 行的指南扩成一个多风格库:半佛仙人式杂谈、卡兹克式科技口语、虎嗅式商业拆解,一共六套模板。用户选一套,AI 照着改。这套东西能用,但用了一阵就碰到一个很现实的问题:用户想要的风格,库里没有。
有人喜欢远方青木,库里没有。有人喜欢一个叫「差评」的号,也没有。还有一种更麻烦的情况:用户根本说不出自己喜欢谁,就是今天刷到一篇文章,觉得这篇读着真舒服,想写成这样。你让他选风格标签,他是选不出来的,他要的就是那篇具体文章的那个味,标签这个颗粒度根本对不上。
那把库做大行不行?六套不够做六十套?维护成本先炸了。而且风格这个东西颗粒度可以无限细,同一个作者不同时期的写法都不一样。我们提炼出来的「半佛仙人风格」,其实就是十几篇文章的平均值,每篇自己的节奏和语感在取平均的时候已经被抹掉了。反正预置风格是从一堆文章里抽象出来的,用户想要的那个味是具象的,就长在他看到的那一篇上。这个 gap 靠堆库的数量是堆不平的。
抄作业这个思路
后来有一天跟一个做公众号的朋友聊,他说他平时提高写作水平的办法,就是看到好文章,照着它的结构和节奏重新写一遍。小学老师教的那招,抄作业。
我觉得这个思路是对的。注意抄的不是内容,是抄写法。观点是你的,素材是你的,但节奏怎么走、段落切多长、转折放在哪、金句给多密,这些手艺层面的东西照着范文来。
想明白这个,产品逻辑就清楚了:用户不需要从库里选。他给一篇自己觉得写得好的文章,AI 现场把这篇文章的写作 DNA 提取出来,再拿这套 DNA 去改他的稿子。相当于菜单点餐换成了自己带一道菜来,我照着给你做一份。
风格库像照菜单点抽象的平均风格,抄作业模式是自带一篇具体范文让 AI 照着做
流程拆开是三步
说起来简单,做起来有讲究,把一篇文章的「风格」拆出来,比看上去难得多。整个流程大概是这样的:
第一步,AI 读范文,提取风格 DNA。用户贴一篇喜欢的文章进来,AI 不关心它写了什么,讲区块链的也行,讲育儿的也行,无所谓。它只关心一件事:这篇文章是怎么写的。具体看这么几个维度。叙事结构:怎么开头的,是场景代入,是反常识判断,还是一句骚话钩人。段落节奏:段落多长,多久来一次转折,短段和长段怎么交替。语言习惯:口语化到什么程度,爱用什么语气词,说白了 你想想 这事儿 这类词出现的频率多高。金句模式:金句长什么样,是「X 不是 Y,X 是 Z」那种重新定义式的,还是短句连发靠节奏的。情绪节奏:分析和情绪怎么交替,每隔多少段来一次情绪锚点。这五个维度提取完,输出一份临时的 style profile,或者说一份结构化的写作配方。
第二步,拿这份配方去改用户的稿子。AI 把 profile 当系统指令用,读用户的原稿,按范文的节奏和语感重新写一遍。内容、观点、数据、案例都不动,只动表达层:怎么开头、怎么推进、怎么收尾、在哪个位置放一句让人想截图的话。
第三步,输出改写稿,外加一份风格分析报告。报告写的是 AI 从范文里提取到了什么。用户看完会发现,哦,原来这篇文章的节奏是这么设计的,原来它的金句都放在转折之后。这份报告本身就相当于上了一次写作课。
抄作业的三步流程:AI 读范文提取风格 DNA,用配方改写用户稿子,最后输出改写稿加一份风格分析报告
看一个真实的例子
说再多不如看 before/after。用户原稿是那种标准的科技分析文,翻译腔浓度拉满:
近年来,人工智能技术在自然语言处理领域取得了显著进展。大语言模型的出现使得文本生成、翻译和分析等任务的处理效率大幅提升。本文将探讨当前AI写作工具的局限性,并提出改进方向。值得注意的是,现有工具在风格控制方面仍然存在根本性的挑战。
参考范文用的是半佛仙人的一篇文章,话题跟这个完全不相干。AI 从里面提取出来的风格 DNA 是:场景代入式开头,一两句话一段,高密度转折,冷幽默加自嘲,口语化程度中高,金句放在转折后面。改写出来长这样:
你有没有发现一件很讽刺的事?
市面上那些 AI 写作工具,号称能帮你写文章。但你用过之后会发现——它写出来的东西,一股子翻译味儿。
对,帮你写中文的 AI,它自己写的中文就不太行。
这不是模型不够大的问题。GPT 也好,claude 也好,参数量早就够了。问题出在一个更尴尬的地方:这些模型训练的中文数据里,正式文本远多于口语化内容。新闻、百科、论文、翻译稿——这些是它见过最多的中文。
所以你让它"写一篇文章",它给你的就是一篇维基百科。不是它不会写,是它不知道别的中文长什么样。
但这还不是最要命的。
同样的信息,读起来完全是两个东西。观点一个没丢,数据一个没变,就是整篇从论文味变成了聊天味,该系统面临根本性挑战 变成了 说白了就是不太行。
为什么提取这一步最难
风格迁移最直接的做法是换词,把 值得注意的是 换成 有意思的是,把 综上所述 换成 所以你看。换词确实管用,第一篇讲过,光一张禁用词表就干掉了 80% 的翻译腔。但剩下那 20% 才是硬骨头。一篇好的公众号文章,哪里埋伏笔、哪里放转折、哪里让读者喘口气、哪里突然加速把情绪推上去,这些是全文层面设计出来的。就跟装修似的,你把家具全换一遍,房子格局没动,那还是原来那个房子。
具体拆的话,AI 做风格迁移至少要理解三层。词汇层,用什么词、不用什么词,这层最简单,一张禁用词表就能搞定。句式层,句子多长、在哪断、语气词放哪、怎么做出节奏感。架构层,全文怎么展开:先给场景还是先给判断,多久放一次转折,金句放在什么位置效果最好,情绪的波峰波谷怎么分布。
风格迁移要理解三层:词汇层最简单,句式层次之,架构层是承重墙最难,换词只动表面动不了格局
风格库里的预置模板,因为是从十几篇文章里提炼出来的,天然三层信息都有。抄作业模式手里只有一篇范文,AI 得从一个样本里把三层全读出来,所以提取的质量特别关键。让 AI 说一句「这篇文章语气口语化」是没用的,等于废话。要让它说到这个程度:这篇开头用了场景代入,第一段结尾故意留了个悬念钩子。段落平均 50 到 80 字,每两三段一次转折,转折词偏好 但是 和 问题是,不太用 然而 和 不过。金句出现在每个模块的最后一段,句式是「X 不是 Y,是 Z」那种重新定义式。具体到这个程度,AI 才能真的照着改。
产品到这里齐了
到这一步,Ghost Writer 的三条腿就齐了。风格库,预置六套验证过的模板,给「我不知道自己想要什么,帮我推荐」的用户。抄作业,用户自带范文,AI 现场提取风格,给「我就想写成这篇那样」的用户。个人风格训练,用户交自己写过的 3 到 5 篇满意的文章,AI 提炼出一套专属模板,以后所有文章都用这套改。这个给「我有自己的风格,帮我保持一致」的用户。三种模式对着三种需求,从没有偏好,到有明确偏好,到想保持自己的风格,都有得选。
这个系列写到第三篇了,从一份 435 行的指南,到多风格库,再到抄作业模式。做下来我的感受是,AI 写中文,生成这一层早就不是问题了,语法正确、信息完整、逻辑通顺,每个大模型都做得到。卡住的地方在「正确的中文」和「好看的中文」中间,隔着一层文化的东西。翻译腔和公众号文章的区别不是用词,是世界观:你是在陈述事实,还是在制造共鸣;是在说服读者的大脑,还是在打动读者的情绪;写出来的是一篇报告,还是一次对话。这层东西模型自己长不出来,得有人把它拆开,写成模型能照着执行的规则。
This post is also available in English.
