创作者会员平台Patreon正在对AI抓取其内容用于训练的行为采取更强硬的措施。该公司日前宣布,正与互联网基础设施提供商Cloudflare合作,对未经授权抓取创作者作品、用于训练AI模型的爬虫机器人实施直接封锁。

Patreon表示,自2023年首次部署针对AI爬虫的防范措施以来,AI抓取技术已变得愈发复杂,原有手段已难以应对当前形势,因此有必要升级相关措施。此前,Patreon的付费墙已将大量创作者内容置于爬虫的访问范围之外。但近期该平台推出了全新的内容发现工具,包括经过重新设计的主页信息流,以及类似推文形式的"Quips"短内容功能,这些新功能可能会将更多内容暴露在爬虫的抓取范围之内。

此次调整的背景是,越来越多的在线媒体和内容创作者开始正视AI大量摄取其作品、用以提升模型能力这一问题。为此,Cloudflare已推出一系列工具,允许网站发布方对AI爬虫进行限制,其中包括一个名为"按爬取计费"(Pay Per Crawl)的市场化方案,支持网站向AI爬虫收取抓取费用。本月早些时候,Cloudflare还更新了相关政策,规定"混合用途"爬虫——即同时对网站内容进行索引和训练的爬虫——在任何投放广告的页面上均默认被屏蔽。

Patreon表示,将在现有Cloudflare合作基础上,进一步采用其AI爬取控制(AI Crawl Control)技术,对平台的AI相关政策及执行工具进行升级。与以往做法的核心区别在于:过去平台仅通过robots.txt文件"请求"AI爬虫不要抓取内容——这是一种向爬虫传达使用规则的标准方式——而如今Patreon将主动封锁AI训练爬虫。

Patreon在官方博客中写道:"是否遵守规则不应取决于爬虫自身的意愿。"这句话道出了此次强化措施的核心逻辑。

在测试阶段,针对特定AI训练爬虫的监测数据显示,其每周尝试访问Patreon的次数从"数千次骤降至零"。这表明,此前这些AI爬虫早已无视Patreon的robots.txt文件,在收到明确请求的情况下依然我行我素。

不过,Patreon表示,平台将继续允许那些用于页面索引、帮助整合信息以将用户引流回Patreon的爬虫正常访问。

Patreon产品负责人Drew Rowny在公告中表示:"随着AI智能体的能力日益强大、应用日趋普及,创作者理应对自己的作品如何被AI公司使用拥有实质性的话语权。在互联网的大多数平台上,创作者为了触达并扩大受众,不得不接受AI对其作品进行训练。Patreon有着不同的愿景:创作者应该能够在扩大受众的同时,掌控自己作品的使用方式。"

Q&A

Q1:Patreon为什么要主动封锁AI爬虫,而不是继续使用robots.txt文件?

A:因为测试数据显示,AI爬虫此前早已无视Patreon的robots.txt请求,每周仍尝试访问数千次。Patreon认为,是否遵守规则不应取决于爬虫自身的意愿,因此转而采用Cloudflare的AI爬取控制技术,从被动"请求"升级为主动拦截,将爬虫每周访问次数从数千次降至零。

Q2:Patreon使用的Cloudflare AI爬取控制技术具体是怎么运作的?

A:Cloudflare的AI爬取控制(AI Crawl Control)技术能够识别并直接封锁用于AI模型训练的爬虫机器人,而非仅依赖robots.txt这类"君子协定"。此外,Cloudflare还提供"按爬取计费"市场方案,并规定混合用途爬虫在含广告页面上默认被屏蔽,为网站发布方提供多层次的防护手段。

Q3:Patreon封锁AI爬虫后,是否所有爬虫都无法访问平台内容了?

A:并非如此。Patreon明确表示,只封锁用于AI模型训练的爬虫,对于那些以页面索引为目的、帮助整合信息并将用户引流回Patreon的爬虫,平台仍会允许其正常访问,以确保内容的正常传播与发现不受影响。

TechCrunch - AI