← 返回 2026-09-18 简报

微软高管称AI数据抓取是“人类历史上最大的劳动窃取行为”,新披露的未删减文件揭示真相

语音播报
摘要
事件:纽约时报诉微软OpenAI版权案披露未删减文件,高管承认AI抓取数据如盗窃,并绕过付费墙训练模型。 要点:Copilot致 NYT 点击率降93%;GPT-3含超9万份NYT作品;员工讨论绕过付费墙技巧并删除版权声明。 影响:挑战合理使用辩护,揭示AI对新闻业生存威胁,可能推动强制授权立法,重塑数据获取合规标准。

纽约时报三年前对OpenAI和微软提起的版权诉讼中,新披露的未删减信息揭示了一项承认:AI抓取行为等同于盗窃,且AI产品对出版业构成了重大威胁。

根据诉讼文件,一位微软高管私下将公司的AI训练实践描述为“盗窃”,而OpenAI的高层领导则表示,其AI模型对那些用于训练它们内容的出版商和记者构成了“生存威胁”。

未解封的材料还详细说明了这些公司如何 allegedly 通过无视检测地绕过付费墙来获取和使用内容,通过大规模抓取构建训练数据集,并故意从训练数据中删除版权声明。

值得注意的是,许多新信息来自《纽约时报》自己的简报,而非仍然密封的基础证据材料。以下引用的内容均未提供其原始语境。

这份未删减的 filing 是这起三年诉讼的最新升级,在诉讼中,《纽约时报》最初指控这些公司通过在其内容上训练生成式AI模型违反了版权法。

关于AI公司是否可以合法使用受版权保护的材料来训练AI的问题,目前尚无明确答案,但法官们大多倾向于支持AI公司的论点,即训练构成“合理使用”。这一法律规则允许人们在某些情况下(如戏仿、新闻报道或批评)未经许可使用受版权保护的作品。本月早些时候,特朗普政府提交了一份简报,为OpenAI未经授权使用受版权保护的材料来训练其大型语言模型(LLMs)进行辩护。

然而,几项新承认的内容与OpenAI的合理使用抗辩相悖,特别是该规则要求使用行为不得替代或损害原作品的市场。

例如,微软自己的数据显示,其Copilot“答案引擎”导致《纽约时报》域名的点击率较传统必应搜索下降了多达93%。微软应用科学总监布伦特·赫希(Brent Hecht)于2024年1月撰写的一份内部微软演示文稿将这种下降描述为一种“死亡循环”,这将“同时损害我们模型的性能和整个网络”。

该文件引用的微软文档写道:“最终产品威胁其关键供应商的经济基础是非常不寻常的,但这就是我们为LLM业务相对于其‘内容供应链’所创造的局面。”

微软首席执行官萨提亚·纳德拉(Satya Nadella)也在今年早些时候的一次证词中作证称,“任何受付费墙保护的内容都应被任何希望使用它的人授权……用于 grounding 或训练”,并明确表示,如果他“得知OpenAI抓取并训练了位于付费墙后的信息”,他将“援引[微软的权利]要求OpenAI重新训练其模型”。

其他承认内容则削弱了合理使用测试的其他支柱:ChatGPT负责人尼克·特利(Nick Turley)在内部通信中写道,出版商面临着来自此类聊天机器人产品的“生存威胁”,这些产品“很大程度上具有替代性”,并且“随着它们变得更好,将变得越来越具有替代性”。

OpenAI总裁格雷格·布罗克曼(Greg Brockman)形容这些模型“擅长新闻”。纳德拉今年早些时候在宣誓作证时也同意,与聊天机器人对话“已经取代了……直接在AI平台上提供信息,而不需要去访问底层来源”。

这类措辞表明,该技术可能直接与原作竞争,而非对其进行转化。

一份微软文件指出,生成式AI存在“真实风险”,可能会“严重扰乱那些为基础模型训练生成数据的人的就业”。

这种复制的规模令人震惊。文件首次披露,仅OpenAI的中期训练数据集就包含了来自《纽约时报》、《每日新闻》和调查报道中心发表的作品的91,692多份副本。一个源自Common Crawl的数据集仅包含来自nytimes.com的超过200万份文档。

在2023年1月的一份内部备忘录中,Hecht称其为“史无前例的大规模盗窃”,并称之为“人类历史上最大的劳动窃取”。

该文件详细阐述了OpenAI和Microsoft如何获取原告的内容,包括从Bing索引中抓取这些数据。

“OpenAI将整个GPT-3训练数据集交付给Microsoft,后者利用它来评估如何在自己的商业产品中实施OpenAI的模型。”文件写道。“同样地,Microsoft通过名为Project Taxi和Project Mango的计划向OpenAI提供了训练数据。”

据称,这些公司将Project Mango的数据组装成一个训练数据集,其中包含至少160,903个来自新闻出版商的独特作品的副本。

为了最大化抓取效果,OpenAI员工 allegedly 策划了一项计划以在不被检测到的情况下绕过付费墙。文件显示,当OpenAI研究员Nick Ryder告诉Brockman有关“绕过nytimes付费墙的hack”时,Brockman回复道:“ah nice。”

据称,OpenAI员工还构建了像WebText和WebText2这样的训练数据集,这些数据集过度依赖抓取的新闻内容。他们还从Common Crawl(一个免费的网络抓取数据开放存储库)中获取了数百万篇文章。调查结果还描述了在数据进入模型之前故意删除版权声明的努力,因为研究人员“不希望模型向用户输出”“版权声明”。

OpenAI和Microsoft均未回应置评请求。

← 返回简报