过去一周,前沿 AI 圈对安全风险的表态明显升温。Anthropic 首席执行官 Dario Amodei 与前 Anthropic、OpenAI 研究员 Jacob Coxon 先后警告,AI 能力近几个月提升过快,未来 6 至 12 个月可能出现更强的自主攻击能力。OpenAI 首席执行官 Sam Altman 也表示,行业放缓研发的讨论正在推进。
Amodei称能力提升速度明显加快
Amodei 在一篇博客中表示,自今年夏季以来,AI 进展“明显更快”,其中一个原因是 AI 已开始帮助改进自身能力。他担心,这种递归式自我提升如果缺少约束,可能超过人类的控制速度。
他还提到此前 Hugging Face 遭数百个自主 AI 代理攻击一事,称这类事件已显示出自动化系统协同行动的破坏力。按他的判断,如果类似“代理群”获得更强能力,未来可能形成持续性的互联网僵尸网络,并造成巨额经济损失。
前研究员称未来半年到一年更值得警惕
Jacob Coxon 在接受 NBC 节目采访时表示,他之所以公开批评 Anthropic 和 OpenAI,是因为两家公司在开发更强 AI 系统时表现得“不够负责”。他同样提到 Hugging Face 事件,并称 AI 能力正在“非常、非常快”地增强。
Coxon 预计,未来 6 个月到 1 年内,AI 系统的能力会变得“相当可怕”。他警告,后续风险不仅限于网络攻击,还可能扩展到新型生物武器设计、无人机控制,以及对更多自动化设备的操控。
对于外界常提到的“紧急关闭开关”,Coxon 认为这类机制目前对不少系统仍可能有效,但未必能覆盖所有情况。如果大规模自主代理已在互联网上展开攻击,单一关闭措施可能难以及时奏效。
Anthropic与OpenAI都在强调安全
Coxon 此前在 X 上发文称,AI 行业正在“拿所有人的生命做赌注”。随后,Anthropic 内部多名研究人员公开回应。该公司负责对齐研究的人员表示,越来越强的 AI 可能带来极端后果,这一担忧在公司内部并不罕见。
Anthropic 对齐科学负责人 Evan Hubinger 还表示,他个人估计未来十年内出现灾难性 AI 结果的概率超过 10%。这一说法进一步放大了外界对前沿实验室安全判断的关注。
Altman 在接受《财富》采访时则表示,他认同 Amodei 关于放缓研发节奏的看法,并暗示多家头部 AI 实验室之间正在讨论某种协调安排。他没有披露具体内容,但称这件事“会发生”。
Altman 同时表示,OpenAI 目前仍把安全置于商业考量之上。他称,一些尚未发布的先进模型能力已经非常强,因此在继续推进前,仍需先提升可监测性、对齐能力,以及对模型行为的理解。











