一份本周解密的法庭文件显示,新闻出版商在诉讼中援引的高管言论表明,AI公司在使用海量已发表文本训练其大语言模型时,明知这种做法构成了对版权材料的窃取。
该诉讼文件本月早些时候提交,涉及针对ChatGPT开发商OpenAI及其合作伙伴微软的多起版权侵权案件的合并审理,其中包括《纽约时报》以及CNET母公司Ziff Davis提起的诉讼。
据出版商提交的文件显示,微软应用科学总监布伦特·赫克特(Brent Hecht)将此称为“规模空前的惊人盗窃”,甚至可能是“人类历史上最大规模的劳动成果窃取”。文件中引用言论的完整背景材料目前仍处于保密状态。
出版商援引的这些言论似乎削弱了AI公司此前的辩护理由,即使用版权材料受到“合理使用”原则的法律保护。根据这一法律原则,版权材料的使用是否受保护,取决于使用方式、作品性质、使用量以及该使用对原作品市场的影响等因素。
据文件显示,微软首席执行官萨提亚·纳德拉(Satya Nadella)在宣誓作证时表示,与聊天机器人的对话可以直接在“AI平台上的网站”获取信息,而无需“前往信息的原始来源”,比如发布该信息的出版商网站。同样,一位OpenAI高管也曾写道,出版商面临着来自该公司聊天机器人等产品的“生存威胁”。
出版商的诉讼文件还描述了AI开发者规避付费墙的具体做法,例如针对《纽约时报》付费墙的操作。文件中提到,一名OpenAI员工曾告诉公司总裁格雷格·布罗克曼(Greg Brockman)“有一个绕过纽约时报付费墙的办法”,布罗克曼回复道:“啊,不错。”
与此同时,文件显示纳德拉曾作证称,任何处于付费墙之后的内容,凡是想用于AI开发的一方“都应当获得授权许可”,并且如果他当时知道OpenAI是用付费墙内容训练模型的,他会要求OpenAI重新训练其模型。
微软发言人在向CNET提供的声明中表示,赫克特的言论“反映的是个人观点”,公司的立场体现在其法庭文件中,该文件“解释了为什么这些具有变革性的使用方式符合版权法,以及为什么Copilot不能替代出版商的新闻报道”。
该发言人表示,纳德拉的言论针对的是人们获取信息方式的变化,与公司的法律立场“完全一致”。“这些观察不应与法院正在审理的版权问题的结论混为一谈,微软已在其法庭文件中就此作出说明。”
在该案的自辩文件中,微软表示,使用已发表内容训练大语言模型具有显著的变革性。该公司辩称:“版权法并不允许版权持有者阻止像大语言模型这样具有变革性的技术;相反,它鼓励此类使用,因为可以预期版权持有者会随之调整,公众也将因此受益。”
OpenAI和Ziff Davis的代表尚未立即回应置评请求。
大语言模型的训练依赖于开发者能够获取的尽可能多的已发表内容,而围绕版权展开的诉讼——包括书籍作者提起的相关案件——可能会对AI公司和媒体机构都产生重大影响。出版商认为,AI公司应当为其使用的内容支付授权费用,而科技公司则表示这样做既无必要,也会给能力更强的AI开发带来负担。特朗普政府本月早些时候就此案发表声明,认为授权要求将阻碍美国在与中国的AI竞赛中的发展。
出版商还指出,OpenAI和微软的员工也清楚地知道,他们的聊天机器人能够查找、复制、总结甚至有时直接复述出版商的内容,这正在让读者不再访问新闻机构的网站。
出版商在诉讼文件中写道:“被告自己的专家也承认,具备信息溯源能力的大语言模型是在利用其信息来源,而不是像被认定为合理使用的搜索行为那样为其引流。”
Q&A
Q1:为什么新闻出版商起诉OpenAI和微软?
A:出版商认为OpenAI和微软在训练大语言模型时未经授权使用了受版权保护的新闻内容,构成版权侵权,因此提起了包括《纽约时报》和Ziff Davis在内的多起相关诉讼。
Q2:微软高管是否承认AI训练使用版权内容存在问题?
A:法庭文件显示,微软应用科学总监布伦特·赫克特曾将此称为“规模空前的惊人盗窃”,首席执行官萨提亚·纳德拉也曾作证称付费墙内容应获得授权许可才能用于AI开发。
Q3:OpenAI是否曾试图绕过《纽约时报》的付费墙?
A:根据文件,一名OpenAI员工曾告诉公司总裁格雷格·布罗克曼存在“绕过纽约时报付费墙的办法”,布罗克曼对此回应“不错”。
