提到AI生成文本,人们对那些老套标志早已熟悉:动辄出现的"深入探讨"、满篇的破折号,以及"不是X,而是Y"这类生硬的句式结构。
但情况会不会变得更糟?
上周末,Anthropic发布了一则更新公告,宣布将改变旗下Claude大语言模型的文本生成方式。此举旨在遵守欧盟一项法规——该法规要求所有AI生成的文本从今年12月起必须添加水印。
Anthropic表示,相关改动将在模型生成文本时的底层随机采样层面实施,普通读者无从察觉。
然而,至少有一位评论人士对此持不同意见。资深科技博主约翰·格鲁伯写道:"这整件事是对写作本质的一种荒谬扭曲。"他认为,水印机制会束缚Claude,迫使其在遣词造句时做出更差、更不精准的选择。他的观点是,这些限制虽然未必影响模型输出内容的准确性,但会使文章整体质量有所下滑。
AI模型在组织句子时,对具体用词的选择本就存在一定的随机性:比如是用"阴沉"还是"多云"来描述某一天的天气,或是将流水称为"溪流"还是"小河"。
Anthropic表示,新的水印机制将干预这些随机选择,留下一种特定规律,Anthropic自身及持有解码密钥的机构均可识别。
伦敦大学学院计算机科学教授史蒂文·默多克则表示,此次变化"大概不会产生任何可察觉的影响"。
格鲁伯的批评,核心在于水印机制会让大语言模型在选词时失去充分的自由,进而可能错过最佳选项。
然而,大语言模型本来就不总是做出"最优"的选择。默多克说:"这些大语言模型本来就存在随机性,这对它们的运作至关重要。如果没有这种随机性,它们就会陷入循环,不断重复同样的内容。"
换句话说,聊天机器人选择"溪流"而非"小河",并非因为后者带有更古朴的语感,而只是碰巧如此——这些选择本质上是随机的。
一个近期的案例也印证了这一点。某权威化学期刊上的一篇论文不得不撤稿,原因是作者似乎使用了AI工具起草了部分内容,而该工具竟将"最终解决方案"替换成了"对某一族群的大规模屠杀"——而这段话所在的段落明明是在讨论一种锌纳米凝胶。
对于此次更新,默多克表示:"不会有任何可察觉的差异。随机数生成器还在那里——只是以前是完全随机的,现在变成了统计上可预测的随机,但本质上仍是随机的。"
该法规适用于所有在欧盟运营的AI公司,意味着它们必须在数月内完成水印部署。这将使学生、律师和大学教授等人更难将聊天机器人写的内容冒充为自己的原创作品。
不过,默多克还指出了为AI内容添加水印的另一层深意:目前网络上已存在大量AI生成的内容,这些内容可能会反过来"伤害"模型本身。用AI生成的内容训练AI,会导致"模型崩塌",使模型开始混淆各种概念。
换言之,水印机制不仅仅是悄然有力地打击虚假信息的手段,更是确保聊天机器人不会"失控"的重要保障机制。
Q&A
Q1:为什么Anthropic要给Claude的生成文本添加水印?
A:此举是为了遵守欧盟的相关法规。根据该法规,所有在欧盟运营的AI公司必须从今年12月起,为AI生成的文本添加水印。Anthropic表示,水印将在底层随机采样层面实施,普通读者无法察觉,但Anthropic自身及持有解码密钥的机构可以识别。
Q2:Claude的文本水印机制会影响文章质量吗?
A:目前存在争议。科技博主约翰·格鲁伯认为,水印会限制Claude的选词自由,导致用词不够精准。但伦敦大学学院教授史蒂文·默多克表示,大语言模型本身就依赖随机性工作,水印只是让这种随机性从"完全随机"变为"统计上可预测的随机",对实际输出质量不会产生可察觉的影响。
Q3:为AI生成内容添加水印,除了防止冒充原创,还有什么意义?
A:水印还有助于防止"模型崩塌"。如果大量AI生成的内容被用于训练新的AI模型,会导致模型混淆概念、性能下降。通过为AI内容打上水印,可以在训练阶段更好地识别和过滤这些内容,从而保障模型的长期健康运行。此外,水印也是打击虚假信息的重要手段。
