多年来,微软和OpenAI一直在努力将某些信息隐藏在公众视野之外,因为新闻机构指控这些AI公司联手窃取大量新闻内容来训练AI,从而违反版权法,双方一直在为此争斗。

然而,如今这些本不该被标记为机密的细节开始外泄。周四,由《纽约时报》牵头的新闻原告方提交的一份简易判决动议被解封,其中曝光的内部文件显示了微软和OpenAI在推出ChatGPT和Copilot等新AI产品之前,是如何看待其对新闻业造成的威胁的。

也许最具爆炸性的是,微软应用科学总监布伦特·赫克特(Brent Hecht)在文件中反复警告称,为AI训练抓取新闻内容是"一场规模空前的惊人盗窃",并称其可能是"人类历史上最大规模的劳动盗窃",新闻机构方面表示。在另一份文件中,赫克特反驳了微软和OpenAI关于使用新闻内容训练AI属于合理使用的论点,暗示大规模抓取新闻的计划"彻底嘲弄了'合理使用'这一概念"。

在OpenAI方面,ChatGPT业务负责人尼克·特利(Nick Turley)在一条内部消息中写道,出版商将面临"生存威胁",因为经过新闻内容训练的商业产品可以被用来替代新闻提供商。新闻机构方面表示,一份微软文件甚至描述了一种"死亡循环","这将同时损害我们模型的性能和整个网络"。

该文件写道:"一个终端产品威胁到其关键供应商的经济基础,这种情况极不寻常,但这正是我们为大语言模型业务的'内容供应链'所制造出的局面。"

两家公司的数据显示,这一预测是准确的。微软记录显示,部分新闻原告方的点击率下降了83%至93%,其他原告方的下降幅度为51%至94%。再加上关于ChatGPT搜索结果点击率低的报道,以及新闻机构自身关于流量下滑的报道,人们就更容易理解,新闻收入的下降最终可能会剥夺聊天机器人所依赖的大量可靠信息来源,而这些信息正是这些工具号称具有开创性的原因所在。

与此同时,赫克特在一份微软文件中承认:"几乎没有人愿意让自己创作的内容被这样使用,他们也没有因此获得任何补偿。"

新闻机构表示,他们已准备好出庭应诉,因为存在大量"替代效应的有力证据"。如果他们能够证明聊天机器人正在其自身市场中取代它们的地位,同时还能逐字吐出文章摘录内容,他们认为这一双重打击可能会彻底摧毁微软和OpenAI的合理使用论点。

新闻机构方面辩称:"不仅是新闻业的未来,负责任的AI的未来同样取决于能否保留人类创作优质内容的激励机制,而一个健康的社会正是依赖于这些创作。"

聊天机器人"基本上就是替代品,仅此而已"

微软首席执行官萨提亚·纳德拉在宣誓作证时表示,AI公司不应该通过绕过付费墙的方式违反新闻网站的使用条款。但在OpenAI内部,内部消息显示,当一名员工尼克·瑞德(Nick Ryder)告诉总裁格雷格·布罗克曼(Greg Brockman),已经找到"一个漏洞"能让OpenAI的爬虫"绕过"《纽约时报》的付费墙时,布罗克曼回复道:"啊,不错。"

纳德拉还承认,聊天机器人确实充当了新闻平台的替代品,他将聊天机器人描述为通过"直接在AI平台的网站上向你提供信息,而不需要你再去访问原始来源"来窃取新闻网站的点击量。

Q&A

Q1:微软和OpenAI被指控的核心问题是什么?

A:新闻机构指控微软和OpenAI在训练AI模型时未经授权大规模抓取新闻内容,违反版权法,并主张这种行为不属于合理使用。

Q2:AI聊天机器人对新闻网站流量造成了多大影响?

A:根据微软内部数据,部分新闻原告方的点击率下降了83%至93%,其他原告方的下降幅度为51%至94%,显示出明显的替代效应。

Q3:OpenAI内部是否知道绕过《纽约时报》付费墙的问题?

A:是的,内部消息显示员工尼克·瑞德曾告知总裁格雷格·布罗克曼,OpenAI的爬虫找到了绕过《纽约时报》付费墙的方法,布罗克曼对此回复表示认可。

ArsTechnica - AI