早在ChatGPT出现之前,教育工作者和编辑们就已经在使用反抄袭工具,来核查作者的内容是否真实原创。这些工具通过将书面内容与网络数据库、学术文章等来源进行比对,检测是否存在相同的句子或段落。Turnitin等工具还会给出一个百分比,用以说明学生的写作与其他作品的重叠程度。然而,由于存在误判风险,以及难以判断内容是否属于故意抄袭,部分教育工作者已逐渐放弃使用此类工具。
如今,对"抄袭内容"的追踪已演变为一场针对AI生成内容的全面围剿。学生们争相使用ChatGPT、谷歌Gemini和微软Copilot的同时,教师们也迅速跟进,采用了各类所谓的AI检测工具。美国民主与技术中心的一项调查显示,2024年至2025年间,美国43%的六至十二年级教师定期使用AI检测工具。部分已在学习管理系统中使用Turnitin的高校发现,该服务在2023年推出AI检测功能时便已自动开启。
与比对文本不同,GPTZero、Pangram以及Turnitin自家的AI检测工具,依赖各自的AI模型来推断一段文字是否并非人类所写——这一过程甚至比网络文本比对更加模糊。据GPTZero介绍,AI检测工具通过算法分析文本的措辞、节奏和结构,同时识别AI写作中更常见的篇幅与语气规律。这种相对主观的判断方式,远不如在线文本匹配那样客观有据,且容易对以英语为第二语言的写作者产生误判。尽管如此,Turnitin声称其AI检测工具对人类写作内容的误报率低于1%,Pangram则宣称误报率仅为万分之一,GPTZero也声称将人类内容误判为AI的概率同样极低。
AI检测工具滥用引发的信任危机
网络上已经出现了相互指责"听起来像AI写的"的现象,而AI检测工具的唾手可得,更是为这场针对大语言模型的"猎巫行动"火上浇油。在一些备受关注的案例中,被指控使用AI写作已直接影响到当事人的生计和声誉。上个月,出版商Minotaur因担心作者Jerry Falade使用了AI,取消了一笔价值200万美元的出版合同,而Falade本人对此强烈否认。
法国公民Thierry Rignol去年将耶鲁大学告上法庭,起因是一名教授指控他在期末考试中使用AI作答,导致他不及格并被停课一年。该教授使用GPTZero扫描了Rignol的文章,但诉状指出,"AI监控和检测工具已知会对非母语英语使用者存在不公平偏见",而Rignol正是其中之一。今年2月,阿德菲大学一名学生在诉讼中胜诉,原因同样是教授指控其用AI撰写论文。诉状虽未说明教授使用了哪款检测工具,但阿德菲大学与Turnitin签有许可协议。
斯坦福大学2023年的一项研究发现,AI检测工具将非母语英语写作者的文章误判为AI的概率,高于母语写作者。(许多服务商仍坚称,其工具在处理非母语写作者的文本时准确率有保障。)这些工具还可能对神经多样性写作者存在偏见。
据加州大学洛杉矶分校指出,AI检测工具被训练用于识别可能表明AI使用的规律,例如重复性词汇和短语、过于正式或过于随意的语气,以及无意义的措辞。QuillBot等工具还会测量文本的"不可预测性",因为"与人类写作相比,AI倾向于做出最'显而易见'或最常见的语言选择"。这些工具还可能将全篇句式结构一致视为AI写作的另一个信号。但这些特征本身并不足以证明文章由AI生成,因为部分写作者的风格本就带有这些特点。
尽管Turnitin标榜极低的误报率,却仍承认其工具"未必总是准确的",不应以此对学生采取处罚措施。Grammarly也提醒用户"永远不要单独依赖AI检测结果",GPTZero则表示"没有任何AI检测工具能真正做到100%准确"。OpenAI甚至在2023年以准确率过低为由,关闭了自己的AI写作检测工具。
然而,AI写作的指控依然在网络上四处蔓延。上周,Ozzy Osbourne之子杰克在面向全平台逾350万粉丝的直播视频中,指控记者、The Verge撰稿人Kat Tenbarge在为《滚石》杂志撰写的一篇文章中使用了AI,并以AI检测工具Getsolved的检测结果作为"证据"大加炫耀。Tenbarge已通过视频和个人网站帖文予以反驳,但Osbourne至今未撤回指控,也未删除该视频,Tenbarge不得不持续应对随之而来的网络骚扰。
错误指控的案例比比皆是,涉及作家和学生等各类群体,而许多发起指控的人往往忽视了这些AI检测工具本身附带的免责声明。
未来走向
围绕AI检测工具的种种不确定性,已促使部分教育机构彻底停止使用。耶鲁大学、约翰斯·霍普金斯大学、范德堡大学、乔治城大学等高校已停用或限制使用AI检测工具。麻省理工学院也明确警告称,"AI检测工具并不可靠"。
与其依赖工具来甄别AI写作,许多学校正鼓励教育工作者重新思考教学方式。例如,芝加哥大学建议教师引导学生放慢阅读节奏、将较长的写作任务拆分,并要求学生对自己的作品进行反思。斯坦福大学建议教授考虑在课堂内进行评估,麻省理工学院则建议教授为学生留出空间,让他们在不受处罚的前提下主动说明是否在作业中使用了AI辅助。
随着AI在校内外日益普及,甄别人类写作与机器生成内容的努力也在持续升级。部分在线平台更是加剧了对AI使用的疑虑:Substack已将Pangram内置于应用程序,允许用户扫描博客文章中疑似AI生成的内容;LinkedIn则增设了"疑似AI水文"的标注按钮。由此,一个充斥着不信任的新时代已然来临——读者不断质疑所读内容是否出自AI之手,而真正的人类写作者则竭力证明自己的写作不像是机器所为。
延伸阅读
美国作家协会正在帮助写作者提前应对指控,为其颁发"人类创作"认证。此外,还有"非AI创作"和"人类书写"徽章,供用户添加到自己的在线作品中。
维基百科制作了一份指南,帮助编辑识别AI写作,其中包括留意那些"夸大"话题重要性或"对信息进行表面化分析"的文字。该网站还禁止了AI生成的文章。
《纽约时报》推出了一个有趣的测验,要求读者从五组段落中选出自己更喜欢的版本,而其中一段正是由AI撰写的。
《Inside Higher Ed》采访了一些教育工作者,探讨他们如何在课堂中应对AI问题,其中一位讲师对让作业"防AI化"所需投入的成本和资源表达了担忧。
The Verge的同事Jess Weatherbed详细描述了同人小说社区正在经历的内部纷争——如何判定哪些故事是由AI生成的。
Q&A
Q1:AI检测工具的准确率到底有多高?
A:各家工具的声明不一。Turnitin称误报率低于1%,Pangram声称误报率为万分之一,GPTZero也声称误判率极低。但斯坦福大学2023年的研究显示,这些工具更容易将非母语英语写作者的内容误判为AI。Turnitin自己也承认工具"未必总是准确的",OpenAI更因准确率过低在2023年直接关闭了自家的AI写作检测工具。因此,这些工具的实际可靠性存在相当大的争议。
Q2:AI检测工具误判会带来哪些真实危害?
A:已有多起案例造成严重后果。出版商Minotaur因AI疑虑取消了一笔200万美元的书稿合同;法国学生Thierry Rignol被耶鲁大学教授用GPTZero判定作弊,遭到不及格处理并停课一年,随后提起诉讼;阿德菲大学一名学生也因同类指控告赢了学校。此外,记者Kat Tenbarge在社交媒体上遭遇公开指控,尽管已发文反驳,仍持续受到网络骚扰。
Q3:有哪些学校或机构不再使用AI检测工具?
A:耶鲁大学、约翰斯·霍普金斯大学、范德堡大学、乔治城大学等多所高校已停用或限制使用AI检测工具。麻省理工学院明确表示"AI检测工具并不可靠"。这些学校转而鼓励教师改进教学设计,例如要求学生在课堂内完成作业、对作业进行反思,或允许学生自愿说明是否借助了AI辅助,且不予处罚。
