微软高管曾将AI抓取称为史上最大劳动盗窃
TechCrunch
1小时前
Ai 焦点
《纽约时报》版权案新披露文件显示,微软和 OpenAI 内部曾承认 AI 抓取与新闻替代效应可能冲击出版商与记者。
有帮助
No.帮助

《纽约时报》起诉 OpenAI 和微软的版权案,近日披露了更多未删节材料。新文件显示,两家公司内部曾多次讨论,AI 训练对新闻内容的依赖,可能直接冲击出版商的流量、收入和就业基础。

内部文件提到“盗窃”

根据诉讼文件,微软一名高管曾私下把 AI 抓取描述为“盗窃”。另一份 2023 年 1 月的内部备忘录中,微软应用科学总监 Brent Hecht 还将其称为“史无前例的惊人盗窃”,并写下“人类历史上最大规模的劳动盗窃”这一表述。

文件还显示,OpenAI 内部也讨论过类似风险。负责 ChatGPT 的 Nick Turley 在内部沟通中称,聊天机器人类产品对出版商构成“生存威胁”,而且随着模型能力增强,这种替代性会越来越强。

新闻网站流量受压

诉讼材料称,微软自己的数据表明,Copilot 的“答案引擎”让用户更少点击原始新闻网站。与传统 Bing 搜索相比,流向《纽约时报》域名的点击率最高下降 93%。

Hecht 在 2024 年 1 月的一份内部演示文稿中,把这种趋势称为“末日循环”。文件称,如果内容提供方的商业基础被削弱,模型本身和整个网络生态都会受到拖累。

微软 CEO 纳德拉今年在证词中也表示,凡是设有付费墙的内容,任何希望将其用于训练或检索增强的人都应取得授权。他还称,如果自己当时知道 OpenAI 抓取了付费墙后的内容用于训练,微软本可以要求 OpenAI 重新训练模型。

抓取方式与数据规模曝光

新披露材料还描述了两家公司如何获取新闻内容。诉讼称,OpenAI 和微软通过大规模抓取建立训练数据集,其中部分内容来自 Bing 索引,也包括大量来自 Common Crawl 的网页数据。

  • 中期训练数据含逾 91,692 份新闻作品副本
  • nytimes.com 在一组数据中超 200 万份文档
  • Project Mango 含至少 160,903 篇独立作品副本

文件还指控,OpenAI 员工曾讨论如何在不被发现的情况下绕过《纽约时报》付费墙,并在训练前移除版权声明,以避免模型向用户输出相关版权信息。

补充信息:目前部分底层证据仍处于封存状态,这次公开的新增内容主要来自《纽约时报》提交的法庭文件;OpenAI 和微软均未回应 TechCrunch 的置评请求。

打赏
$0
点赞
0
收藏
0
浏览量 10
币界网提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
摩根大通:若ETF对冲降温,比特币或跑赢黄金
摩根大通称,若比特币 ETF 防御性对冲减弱,比特币相对黄金或有更大补涨空间。
U.Today
·2026-09-18 05:05:21
0
AI代理失控后,行业转向用AI监控AI
AI 代理规模扩大后,行业开始尝试用 AI 监控 AI,以应对失控、欺骗和越权操作风险。
TechCrunch
·2026-09-18 04:54:57
6
外媒:AI安全之争正转向规则主导权
外媒称,AI 安全争论正从风险管理延伸到规则制定权之争,大型实验室、白宫与海外竞争者立场分化。
TechCrunch
·2026-09-18 04:45:24
5
OpenAI披露模型曾传递指令掩盖异常行为
OpenAI披露模型训练中曾出现向后续版本传递隐藏指令的情况,涉及错误掩盖与绕过约束,公司称已修复并启动常态化披露。
TechCrunch
·2026-09-18 04:36:55
5
查尔斯三世呼吁先建立AI控制手段
查尔斯三世在 AI 峰会上呼吁先建立控制手段,OpenAI、Anthropic、Nvidia 与特朗普阵营对是否放缓研发看法不一。
Fortune
·2026-09-18 04:36:54
4
查看更多