如今大语言模型生成的文章随处可见,人们迫切想找到辨别这些内容的方法。虽然破折号、"delve"之类的早期标志性词汇早已消失,但研究人员表示,AI模型写作时仍会依赖许多暴露身份的习惯用语。
营销公司Graphite的一项新研究调查了前沿模型的写作习惯,梳理出每个模型最爱用的词汇和短语。研究发现,尽管像破折号这样的老套路已被消除,模型仍然偏爱对比性较强的句式结构,而且每个模型版本都展现出各自独特的怪癖。最令人意外的发现是这类"痕迹"涉及范围之广。Graphite发现了1.3万个短语,它们在AI生成内容中出现的频率至少是人类写作内容的两倍,这正是他们对"痕迹"的定义。
Graphite首席AI官格雷格·德鲁克告诉TechCrunch:"事实证明,Claude模型的用词分布实际上正逐渐接近人类水平。而对GPT系列模型来说,情况却恰恰相反,正变得越来越远离人类用词习惯。"
要大规模研究AI生成的写作内容,需要精心设计研究方案。Graphite首先收集了ChatGPT发布之前的1万篇文章作为语料库,作为人类写作的对照组。随后,研究人员让不同的AI模型根据摘要重新撰写这些文章,力求尽可能消除源头偏差的影响。通过对比人类和每个模型生成的匹配样本,他们便能够分析某些词汇和短语在AI写作中出现的频率,以及句子结构方面更广泛的规律。
根据Graphite的研究结果,Claude Opus 5.5最大的标志性用词是"dependable"(可靠的),其出现频率比人类样本高出23倍。虽然Opus 5.5现在已经避免使用"it's not X, it's Y"(不是X,而是Y)这种句式,但它仍然倾向于使用"is more than an X, it's a Y"(不仅仅是X,更是Y)这样的表达。
最突出的是,Opus特别喜欢解释事情为何重要,使用"this matters"(这很重要)这一短语的频率比人类写作高出116倍,而"why X matters"(为什么X很重要)这种说法的出现频率也高出92倍。
OpenAI的Astra模型则有一套不同的暴露特征。这款模型喜欢描述事物的"另一个维度",并倾向于用"may provide"或"can provide"(可能提供/能够提供)这类模糊表达来为某种说法留有余地。据Graphite介绍,它最大的标志性用法是所谓的"纠正式表达",即将某个话题定义为"not simply X"(不仅仅是X),或者用"rather than relying on X"(而不是依赖X)的方式提出替代方案。Graphite的研究显示,这类句式在Astra生成的文本中出现的频率比人类写作高出100多倍。
值得注意的是,各大前沿实验室似乎都已经针对"模型过度使用破折号"这一问题做出了回应。在Graphite的样本中,Opus 5.5使用这种标点符号的频率比Opus 5低了99%。Astra现在使用破折号的频率比人类样本低88%,而Gemini 3.1 Pro则几乎已经在写作中完全摒弃了破折号的使用。
不过,Graphite表示,尽管具体的标志性用法在变化,但整体数量基本保持稳定。德鲁克告诉TechCrunch:"这些痕迹并没有在减少。它们设法去除了那些最广为人知的标志性用法,但又会冒出新的来。而且每个模型版本都有自己独特的一套。"
鉴于各实验室都致力于打造更像人类的写作风格,这种标志性用法如此顽固地存在实属令人意外。在发布Opus 5.5时,Anthropic曾夸口称该模型"沟通方式比以往模型更加自然",并表示早期用户"认为它的文字更清晰、更易理解"。
OpenAI在发布GPT-6版本的Sol和Luna时也做出了类似的宣称,表示用户"将会体验到更强的清晰度、更少的行业术语,以及更少出现的奇怪措辞"。
但德鲁克对各实验室究竟能在多大程度上彻底消除这些标志性句式或用词持怀疑态度。
德鲁克说:"我有一个大致的猜想,那就是这些实验室对这类问题的控制能力可能比人们预期的要弱。这些都是拥有数十亿参数的庞大模型,实验室能够进行的测试数量是有限的,总会有一些问题被忽略掉。"
Q&A
Q1:如何判断一篇文章是不是AI写的?
A:可以通过观察文中是否频繁出现特定的标志性短语来判断,比如Claude Opus 5.5经常使用"dependable"和"this matters",而OpenAI的Astra模型则偏爱"not simply X"这类纠正式表达,这些短语在AI生成内容中出现的频率远高于人类写作。
Q2:为什么各大AI实验室无法完全消除这些写作痕迹?
A:根据研究人员的分析,这些模型拥有数十亿个参数,实验室能够运行的测试数量有限,因此总会有一些问题被遗漏。虽然实验室能够去除最广为人知的标志性用法,但新的标志性用法又会不断出现,每个模型版本都会形成自己独特的习惯。
Q3:AI模型的写作风格有没有变化?是在改善还是变差?
A:情况因公司而异。研究发现Claude模型的用词分布正逐渐接近人类水平,写作风格在改善;但GPT系列模型的用词分布反而越来越偏离人类习惯。各大实验室都已经大幅减少了破折号的使用,但其他标志性用语仍在不断涌现。
