一项新研究表明,你以为自己更喜欢人类写的文章,但实际上,你可能只是喜欢听起来像人类写的东西。

这项研究由剑桥大学出版社与维拉诺瓦大学的研究人员联合主导,共招募了1682名年龄在18至81岁之间的参与者,要求他们阅读若干虚构故事,判断是否为AI生成,并对每篇故事的质量进行评分。

研究共分三个独立实验。第一个实验中,所有参与者均被分配到一篇故事,其中部分人被告知该故事由AI生成,其余人则被告知由人类撰写,随后对其质量和吸引力进行评分。第二和第三个实验则将参与者分成两组,分别包含424人和481人,每人各获得一篇人类撰写和一篇由ChatGPT生成的故事,但并不告知哪篇来自何处,要求他们自行判断哪篇出自ChatGPT之手。

结果显示,参与者对ChatGPT生成的故事评分最高,尤其是在被错误告知该故事由人类撰写时,评分更为突出。研究还发现,有相当比例的参与者无法正确识别AI生成的内容——第二个实验中超过60%,第三个实验中超过48%。

维拉诺瓦大学心理与脑科学系教授、该研究的资深作者迪娜·韦斯伯格表示,这一现象说明人们存在一种偏向"真实人类叙事"的心理定势。

"我们通常认为创意写作需要具备人类独有的特质,例如情感理解和生活经验,这使得人们低估了AI的实际能力,"她说,"可以说,公众对AI能力的认知已经越来越落后于现实。"

已有越来越多的证据表明,人们普遍喜欢AI生成的写作内容,涵盖短篇小说、散文和诗歌等多种形式。

麻省理工学院研究员蕾妮·理查森·戈斯林于2023年主导的一项研究也得出了类似结论:AI生成内容以及"增强型AI"内容(即AI在参考人类输出后做出最终判断)在质量上被评为高于人类专家所写的内容,也高于"增强型人类"内容(即人类在参考AI输出后做出最终判断)。

韦斯伯格推测,这可能是因为AI撰写的故事更加直白、明确、简洁,而人类写作往往更为含蓄或复杂,留有更多解读空间。

以实验中使用的一个AI生成片段为例:

"此刻,我坐在池塘边,秋叶轻轻飘落,我想起了母亲,想起她讲述的故事,以及她传授的智慧。锦鲤依然在水面下翩翩游动,对它们所见证的我生命中的变化浑然不觉。在那个简单而亘古不变的世界里,我感到了一丝慰藉——那是一种提醒,提醒我生命在其全部的复杂与不确定中,终将延续。"

相比之下,人类撰写的故事中有这样一段:

"也许,我想,我们所有人都在经历某种意义上的诞生——她在阵痛,我在助产,她的丈夫扮演着忐忑的父亲角色,不知神圣时刻过后该何去何从,此刻也不知道该做什么。我们在彼此间不安地打转,而金色的阳光依然日升日落,守着它自己神秘的节律。"

AI生成的文本整体上更为直白,句子更简短,不依赖轶事或比喻等文学手法,段落也更为精炼。

本质上,问题并不在于参与者品味不佳,也不在于驱动聊天机器人的大语言模型拥有人类作家所欠缺的某种能力,而是AI写作往往融入了人们本就喜爱的套路、句式、语言风格和表达方式。考虑到这些AI系统正是用几十年来人类享用和消费的文字内容训练出来的,这一结果或许并不令人意外。

"我们经常听到关于读写危机、注意力缩短以及TikTok等平台影响的讨论,"韦斯伯格说,"但我认为,我们的研究结论并不能完全用当代媒体消费习惯来解释。"

"更准确地说,这些技术是在放大人类本就存在的倾向,而非凭空制造出新的倾向。"

Q&A

Q1:研究发现人们为什么更喜欢ChatGPT写的故事?

A:研究发现,ChatGPT生成的故事更直白、简洁,句子结构清晰,不依赖复杂的文学手法。而人类写作往往更含蓄、留白更多,反而让读者觉得不如AI写的流畅易读。根本原因在于,AI本身就是用人类几十年来喜爱的文字内容训练的,自然会输出符合大众口味的表达风格。

Q2:这项研究中有多少人能分辨出哪篇故事是AI写的?

A:识别率并不高。在第二个实验中,超过60%的参与者无法正确判断哪篇是AI生成的;在第三个实验中,也有超过48%的人判断失误。这说明普通人在不加提示的情况下,很难通过阅读本身来区分AI与人类的写作。

Q3:维拉诺瓦大学的研究对公众认知有什么启示?

A:该研究的资深作者迪娜·韦斯伯格指出,人们普遍认为创意写作需要情感理解和生活经验等人类独有特质,因此低估了AI的实际写作能力。她认为,公众对AI能力的认知已经明显滞后于现实,需要重新审视AI在创作领域的表现。

CNET