你现在读到的文字,是AI写的吗?皮尤研究中心本周发布的一项研究表明,这种可能性正在迅速上升。

如果你了解"死亡互联网理论",这并不令人惊讶。这一理论最早出现于2021年,其核心观点是:互联网实际上在2016年前后就已"死亡",我们如今在网上看到的大量内容,都是由AI生成的。

这一说法并非空穴来风。皮尤研究人员借助网络存档项目Common Crawl,对过去五年间近50万个英文网页进行了扫描,时间范围早于ChatGPT于2022年11月向公众开放之前。研究人员使用AI检测工具Open Pangram,判断这些页面是否由AI撰写或编辑。此外,他们还对上月随机抽取的1万个网页样本进行了分析,重点识别AI写作的典型特征,包括某些在AI生成文本中比人类写作更常见的词汇、短语和语言习惯。

研究人员明确指出,AI检测模型并非万无一失——有时会将人类写作误判为AI生成,也会将AI内容误判为人类所写。

尽管如此,研究结果仍然显示,10%的样本网页"表现出明显的AI写作特征"。

研究报告指出:"截至2026年7月,每10个网页中就有1个疑似由AI生成,这一比例乍看似乎不高。但互联网上新旧内容并存,随机样本中有大量页面不可能是由AI撰写的。如果将旧页面排除在外,只看ChatGPT发布之后上线的内容,这一趋势则更加显著。"

研究人员认为,这一趋势从2022年ChatGPT发布时开始显现,并随着Claude、谷歌Gemini等AI产品的相继推出而持续扩大。

从域名类型来看,AI生成文本在.com域名下最为集中,约占该类网页的十分之一;其他域名下的占比相对较低,.org域名约为4.6%,.edu和.gov类网页则约为1%。

如何识别AI写作?研究人员发现,某些标点、词汇和句式在AI生成文本中出现的频率远高于人类写作。例如,破折号(em dash)在AI文本中出现的频率是人类写作的两倍,否定并列结构更为常见,牛津逗号的使用频率则比人类高出63%。这是因为AI模型在人类文本数据集上训练,习得了这些写作风格,并且在使用上往往有过之而无不及。此外,AI还倾向于使用某些特定词汇,如"深入探讨"(delve)和"相互作用"(interplay)。

研究人员表示:"AI模型还会学习识别词语选择和句子结构中更为微妙的统计规律,从而判断某段文字是否出自AI之手。"

其他常见的AI写作标志还包括:提示词中的关键词被反复使用、解释内容重复冗余,以及整体语气机械而缺乏自然感。更值得关注的是,AI本身也会提示其回答可能存在错误,建议用户在其他地方交叉核实。然而,皮尤研究中心的这项发现表明,我们用于核实信息的来源,本身也可能是AI生成的内容——这让信息核实这件事变得愈发复杂。

Q&A

Q1:皮尤研究中心是如何检测网页是否由AI写作的?

A:研究人员使用了Common Crawl网络存档中近50万个英文网页,通过AI检测工具Open Pangram进行分析,同时对1万个网页样本逐一比对AI写作的语言特征,包括特定词汇、标点习惯和句式结构等。需要注意的是,AI检测工具本身存在一定的误判率,研究结论存在一定误差范围。

Q2:怎么判断一篇文章是不是AI写的?

A:研究人员总结了几个常见特征:破折号(em dash)使用频率是人类的两倍,牛津逗号比人类多用63%,还会反复出现提示词中的关键词,解释内容冗余重复,整体语气偏机械。此外,AI特别喜欢用"delve"(深入探讨)和"interplay"(相互作用)等词汇。

Q3:AI生成内容在哪类网站上最多?

A:根据皮尤研究中心的数据,AI生成内容在.com商业域名下最为集中,约占该类网页的10%。.org域名约为4.6%,而.edu教育类和.gov政府类网页的占比均约为1%,相对较低。

CNET