解封的法庭文件显示,微软与OpenAI高管内部承认,AI抓取数据是对新闻出版业的巨大伤害,甚至称其为史上最大劳动盗窃。

在《纽约时报》起诉OpenAI和微软版权侵权的诉讼中,最新提交给法院的解封法律文书揭示了一系列内部细节。这些文件包含了两家公司高管的内部备忘录、证词以及沟通记录,展现出他们在构建人工智能大模型时,对数据抓取行为后果的真实看法。

根据解封的文件,微软应用科学总监Brent Hecht在2023年1月的内部备忘录中写道,全球数百万人很快就会意识到,大模型吸走他们所有作品的行为,是一场前所未有且令人吃惊的盗窃,他甚至直接将其称为人类历史上最大规模的劳动盗窃。微软的另一份内部文件也指出,几乎没有人希望自己创作的内容以这种方式被使用,也没有人为此获得过报酬。

除了对数据抓取性质的坦白,文件还揭示了这些人工智能产品对传统出版业带来的替代性威胁。OpenAI的ChatGPT负责人Nick Turley在内部沟通中承认,新闻出版商面临着来自聊天机器人产品的生存威胁。他表示,这类产品在很大程度上具有替代性,而且随着技术的改进,这种替代效应还会越来越强。OpenAI总裁Greg Brockman曾指出模型非常擅长处理新闻,而微软首席执行官Satya Nadella也在宣誓证词中同意,与聊天机器人对话已经取代了用户前往原始网站获取信息的传统方式。

为了获取海量训练数据,两家公司采取了大规模的网络抓取手段。文件显示,仅OpenAI的预训练数据集中,就包含了超过91692份来自《纽约时报》、《纽约每日新闻》和调查报道中心等机构的出版物副本。在一个基于Common Crawl的数据集中,仅来自nytimes.com的文档就超过200万份。此外,微软与OpenAI还通过内部项目共享数据,例如Project Mango数据集中就包含了至少160903份来自新闻出版商的独特作品。

令人关注的是,文件还指出了避开付费墙与删除版权信息的操作。据记载,当OpenAI研究人员Nick Ryder向Greg Brockman报告找到了一种绕过《纽约时报》付费墙的技术手段时,Greg Brockman回应表示赞许。同时,团队在构建训练数据集时,还故意删除了数据中的版权声明,因为研究人员不希望模型在向用户输出内容时附带版权提示。

尽管科技公司在法庭上普遍主张,抓取互联网公开数据用于模型训练属于法律上的合理使用,但这些内部表态和具体做法无疑为其辩护增添了复杂性。Satya Nadella在证词中明确表示,任何处于付费墙之后的内容都应当经过授权许可才能用于训练。他补充道,如果自己早先得知OpenAI抓取并使用了付费墙之后的信息,微软将会要求OpenAI重新训练其模型。目前,这场涉及科技巨头与新闻出版业的法律诉讼仍在持续进行中。

原文:https://www.tomshardware.com/tech-industry/artificial-intelligence/microsoft-director-called-ai-scraping-the-largest-theft-of-labor-in-human-history-while-openai-head-brands-chatgpt-an-existential-threat-to-publishers-revelations-come-from-legal-briefs-filed-in-nyt-lawsuit