OpenAI 与微软未删节文件曝光:Copilot 把纽约时报点击率打掉 93%,内部称抓取是「史上最大劳动盗窃」

93%。这是微软自己的数据里,纽约时报的文章被 Copilot「答案引擎」消化成答案之后,点击率相对传统 Bing 搜索的跌幅上限。

而在同一批文件里,微软的一位总监在 2023 年 1 月的内部备忘录中写下这样一句话:这是「一次规模空前的惊人盗窃」,是「人类历史上最大规模的劳动盗窃」

写下这句话的人叫 Brent Hecht,职务是微软应用科学总监。被他称作「被盗窃者」的,正是给他所服务的 AI 产品提供养料的新闻机构。

9 月 17 日,纽约时报诉 OpenAI 与微软版权案的大批未删节文件公开。TechCrunch、金融时报、纽约时报当天先后报道了文件内容。这些内部记录第一次把三件事同时摆在台面上:两家公司早知道自己在做什么、早知道会造成什么后果、也早就在内部承认了这件事的性质。

事件速览:一批文件,几段原话

案件本身并不新。2023 年 12 月 27 日,纽约时报在纽约南区联邦法院起诉 OpenAI 和微软,指控两家公司未经授权用其数百万篇文章训练 ChatGPT,案号 1:23-cv-11195,主审法官是 Sidney Stein,后来并入「In re: OpenAI Copyright Infringement Litigation」合并诉讼。

新的是 9 月 17 日公开的这批未删节材料。其中被引用最多的几段:

数字 出处与含义
93% 微软内部数据:Copilot 答案引擎让纽约时报域名的点击率相对 Bing 搜索最多下降 93%(另一家媒体给出的区间是 87%–93%)
91,692 OpenAI 中期训练数据集中,来自纽约时报、每日新闻与调查报道中心的受版权作品份数
200 万+ 一个源自 Common Crawl 的数据集中,仅 nytimes.com 一个站点就包含超过 200 万份文档
160,903 Project Mango 数据整合后,训练数据集含至少 160,903 部新闻出版商的独有作品

原话比数字更直白。

Hecht 在 2024 年 1 月的一份内部演示里,把点击率下滑描述成一个「doom loop」(死亡循环),说它会「同时伤害我们模型的表现和整个网络」。同一份文件里还有一句:一个终端产品威胁到它关键供应商的经济基础,这是「极不寻常的」,「但这正是我们为 LLM 业务创造的处境」。

OpenAI 这边,ChatGPT 负责人 Nick Turley 在内部沟通中写道,出版商面临的是「生存威胁」,因为这类产品「在很大程度上就是替代性的,句号」,而且「随着模型变好,会越来越具有替代性」。OpenAI 总裁 Greg Brockman 对模型的评价则是:「非常擅长新闻」。

微软 CEO 纳德拉今年早前的证词也被引入:任何放在付费墙后面的内容,「想用它做 grounding 或训练的人都应该去获得授权」;他还表示,如果早被告知 OpenAI 抓取并训练了付费墙后的信息,他会「行使要求 OpenAI 重新训练模型的权利」。

微软另一份文件则直接写明了人群影响:生成式 AI 存在「真实风险」,会「严重扰乱那些生产了基础模型训练数据的人的就业」。

为什么这份材料会要命:它撞的是「市场替代」

要理解这批文件的分量,得先知道美国的「合理使用」四要素里,最不好辩解的是哪一条:使用是否替代了原作的市场、是否损害了原作的价值。

前面那些数字和原话,恰好全部指向这一条。点击率跌 93% 不是技术指标,是市场损害的量化;「largely substitutive」(很大程度是替代性的)是模型产品的自我定性;「生存威胁」是对被替代方处境的承认;CTR(点击率)是内容行业最直接的收入变量。

三家公司的公开立场与此正好相反。OpenAI 在自家网站上专门做过一份《纽约时报》诉讼的事实声明,主张 AI 训练属于合理使用,并称诉讼「毫无根据」。而这次公开的记录显示,公司内部对「替代」这件事早有共识。

还有一层细节比数字更难解释。文件描述了获取内容的路径,其中提到 OpenAI 把整个 GPT-3 训练数据集交给了微软,微软用它评估如何在自家商用产品里落地 OpenAI 的模型;微软则通过代号 Project Taxi 和 Project Mango 的项目向 OpenAI 反向提供训练数据。也就是说,两边不只是各自抓取,而是互相供货。

更麻烦的是「明知」的证据。文件称,OpenAI 研究员 Nick Ryder 曾告诉 Brockman 有一个「绕过纽约时报付费墙的 hack」,Brockman 回复了一句「ah nice」。文件还描述了训练数据在进入模型前被刻意剥离版权声明的做法,理由是研究人员「不想让模型向用户输出版权声明」。

绕开付费墙、抹掉版权声明,这两件事在美国法律实践里都属于「故意」的范畴——不是不知道,而是知道还做。

需要说明的是,TechCrunch 在报道中给出了一个重要限定:这批新增信息大部分来自纽约时报自己提交的简报,而非仍处于封存状态的基础证据,引语也脱离了原始语境。截至报道时,OpenAI 与微软均未回应置评请求。

放回背景里看,这会是一场更长的仗

把时间线铺开,能看出这次爆料出现的时机并不偶然。

2026 年 9 月初,纽约时报、OpenAI、微软三方几乎同时提交了简易判决动议,案件进入法官可以直接裁定的阶段。微软一方当时公开了 820 万条 Copilot 真实对话记录,主张其聊天机器人「极少」逐字复制纽约时报内容,抄袭率低于 1%。纽约时报则在这之前赢了取证战——2026 年 1 月,法官确认 OpenAI 必须交出2000 万条匿名化的 ChatGPT 对话日志。据今年 7 月的统计,纽约时报为这一起诉讼已经花了 2000 万美元。

外部环境对 AI 公司并不算差。9 月 2 日,特朗普政府的司法部提交意见书支持 OpenAI,称纽约时报若胜诉会「威胁国家安全」并伤害小型新闻编辑室。在更早的同类案件里,法官 Alsup 也裁定用书籍训练模型属合理使用——但也明确表示,使用盗版书库不受这层保护。Anthropic 随后为「下载盗版数据集」这件事在 2025 年同意支付 15 亿美元和解,成为美国版权史上金额最高的和解,2026 年 7 月获法院最终批准。

中国法院的口径更值得对照。杭州互联网法院与上海知识产权法院在此类案件中的思路接近:仅把作品用于训练输入,不当然侵犯复制权;只有模型生成的内容实质性再现了原作品表达,才构成侵权。也就是说,对「输入」相对宽松,对「输出」严格。

这条差异恰好点出了这次文件的杀伤力在哪。美国法下的合理使用要综合四要素判断,而中国法院的路径更看输出端;但这批文件里被反复强调的,恰恰不是「训练本身」,而是绕付费墙、抹版权声明、以及明知会摧毁供给方的那些内部表述——这些属于主观故意的证据,在任何法域都不好解释。

一句话判断

这场官司真正的变量,已经不再是「训练算不算合理使用」这个抽象问题,而是「一家公司内部承认自己在摧毁供应商、却对外主张自己无害」这种行为能被法庭容忍到什么程度。对做内容的人,这份文件意味着你的稿件在成为训练数据这件事上,几乎没有被通知、被谈判的机会;对做 AI 产品的人,它是一个更实用的提醒:内部文档会变成呈堂证供,写「我们知道这会损害 X」的时候,最好同时写下你们准备怎么补偿 X。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

来源:TechCrunch(2026-09-17)、金融时报、纽约时报(2026-09-17)、彭博法律、Axios、Nieman Lab、TheWrap、法院公开案卷(1:23-cv-11195)。

发表评论