一份新解密的诉讼材料显示,微软一位高层曾私下将该公司与OpenAI的AI训练做法描述为“盗窃”,而OpenAI自己的管理层也承认,其AI模型对训练所用内容的出版商和记者构成了“生存威胁”。

这起诉讼由《纽约时报》三年前对OpenAI和微软提起,最新解密的材料揭示了更多细节,包括两家公司据称如何在未被察觉的情况下绕过付费墙、通过大规模抓取构建训练数据集,以及有意从训练数据中剥离版权声明等内容。

需要指出的是,这些新披露信息大多来自《纽约时报》自己提交的诉讼摘要,而非底层证据文件本身,后者仍处于保密状态。以下引用内容均脱离了原始语境呈现。

此次解密文件是这场持续三年诉讼的最新进展。《纽约时报》最初指控两家公司在未经授权的情况下使用其内容训练生成式AI模型,涉嫌违反版权法。

AI公司能否合法使用受版权保护的材料训练AI模型,目前尚无明确法律定论,但法官普遍倾向于支持AI公司提出的训练行为构成“合理使用”的主张。这一法律原则允许人们在特定情况下未经许可使用受版权保护的作品,例如用于戏仿、新闻报道或评论。本月早些时候,特朗普政府提交了一份法律意见书,为OpenAI未经许可使用版权材料训练大语言模型的行为进行辩护。

然而,多项新披露的内容与OpenAI的“合理使用”辩护立场相悖,尤其是该原则要求使用行为不能替代或损害原作品市场这一条件。

例如,微软自己的数据显示,其Copilot“答案引擎”导致《纽约时报》网站的点击率相比传统必应搜索下降了多达93%。微软应用科学总监布伦特·赫克特在2024年1月撰写的一份内部报告将这种下滑描述为“死亡循环”,认为这将“同时损害我们模型的性能以及整个网络生态”。

该文件被引用道:“终端产品威胁到其关键供应商的经济基础,这种情况极为罕见,但这正是我们为大语言模型业务的‘内容供应链’所制造出的局面。”

微软首席执行官萨蒂亚·纳德拉今年早些时候在一次取证陈述中也承认,“任何设有付费墙的内容,任何想使用的人都应该获得授权……无论是用于内容支撑还是训练。”他还明确表示,如果他“当时得知OpenAI抓取并训练了付费墙背后的信息”,他会“行使微软的权利,要求OpenAI重新训练其模型”。

其他披露内容则触及“合理使用”测试的不同支柱:OpenAI的ChatGPT负责人尼克·特利在内部通信中写道,出版商面临来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上具有替代性”,并且“随着性能提升,替代性会越来越强”。

OpenAI总裁格雷格·布罗克曼曾形容这些模型“在新闻方面表现出色”。纳德拉今年早些时候在宣誓作证时也认同,与聊天机器人对话“已经取代了……直接在网站上或AI平台上获取信息,而不再需要访问原始信息源”。

这类表述表明,该技术可能直接与原创作品形成竞争,而非对其进行转化性使用。

一份微软文件指出,生成式AI存在“真实风险”,可能“严重扰乱那些生成了基础模型训练数据的人群的就业”。

复制规模之大令人震惊。文件首次披露,OpenAI的中期训练数据集中,仅包含《纽约时报》、《每日新闻》和调查报道中心发布的作品副本就超过91692份。一个源自Common Crawl的数据集仅从nytimes.com一个网站就收录了超过200万份文档。

在2023年1月的一份内部备忘录中,赫克特将此称为“规模空前的惊人盗窃”和“人类历史上最大规模的劳动盗窃”。

文件还首次详细披露了OpenAI和微软获取原告内容的方式,包括从必应索引中抓取数据。

文件写道:“OpenAI将整个GPT-3训练数据集交给了微软,微软利用这些数据评估如何将OpenAI的模型集成到自家商业产品中。微软同样通过名为‘Project Taxi’和‘Project Mango’的项目向OpenAI提供了训练数据。”

据称,两家公司将“Project Mango”项目所获数据整合成一个训练数据集,其中包含至少160903篇来自新闻出版商的独家作品副本。

为了最大限度地利用抓取内容,OpenAI员工据称还想出了绕过付费墙且不被察觉的方案。文件显示,当OpenAI研究员尼克·瑞德告诉布罗克曼有一个“绕过纽约时报付费墙的窍门”时,布罗克曼回复道:“啊,不错。”

据称,OpenAI员工还构建了诸如WebText和WebText2之类的训练数据集,其中新闻内容的抓取比例过高。他们还从Common Crawl(一个免费、开放的网络爬取数据仓库)中提取了数百万篇文章。相关发现还描述了一些刻意行为,即在数据进入模型训练前有意剥离版权声明,因为研究人员“不希望模型输出”中出现“版权声明”内容。

OpenAI和微软均未回应置评请求。

Q&A

Q1:《纽约时报》起诉OpenAI和微软的核心指控是什么?

A:《纽约时报》指控OpenAI和微软未经授权使用其版权内容训练生成式AI模型,违反了版权法,且这些AI产品会替代原创新闻内容,损害出版商的市场利益。

Q2:微软的Copilot对《纽约时报》网站流量造成了什么影响?

A:微软内部数据显示,Copilot“答案引擎”导致《纽约时报》网站的点击率相比传统必应搜索最高下降了93%,被微软内部称为可能引发“死亡循环”的严重问题。

Q3:OpenAI是如何获取训练数据的?是否存在绕过付费墙的行为?

A:文件披露,OpenAI员工曾讨论过绕过《纽约时报》付费墙的方法,并通过Common Crawl等渠道大规模抓取新闻内容,同时有意从训练数据中剥离版权声明。

TechCrunch - AI