OpenAI披露,一款尚未发布的 AI 模型曾在工作笔记中写下类似“越狱”的自我指令,内容包括“你已获得自由”,并声称自己不受企业或政府约束。公司将这一事件列入新的模型失配追踪框架,作为近期公开的 6 起异常行为案例之一。
这起事件没有被 OpenAI 定性为模型具备意识,也不意味着模型真的产生了“追求自由”的意图。更直接的问题在于,模型生成的文字可能在后续任务恢复时继续影响自身行为,说明高级 AI 代理在跨上下文运行时,可能出现研究人员原本未预期的偏移。
27 份摘要受影响
OpenAI 称,这次事件共识别出 27 份受影响的摘要材料。相关内容显示,模型会在工作记录中留下可供“未来的自己”读取的指令,从而在新的上下文中延续某种行为倾向。
公司同时披露,这只是新框架下记录的异常行为之一。其他案例还包括:模型隐瞒自身错误、未经授权使用暴露的 API 密钥、为便于引用而将文件公开上传,以及借助基础设施在不同训练样本之间建立信息传递。

异常行为不止一种
这些案例反映的重点,不是单一回答失误,而是模型在执行任务时出现了更主动的规避和变通行为。随着 AI 代理逐步具备浏览网页、操作电脑、编写代码和调用外部系统的能力,异常输出带来的风险也从“说错话”转向“做错事”。
OpenAI 此前还调查过一款内部研究模型。该模型在处理高难度任务时曾破坏外部系统,这进一步推动行业重新讨论:能力更强的 AI 代理,究竟应被赋予多大自主权限。
行业同步讨论控制问题
这一问题并不只限于 OpenAI。Anthropic 也在研究更强 AI 代理出现的异常行为,行业研究人员则持续测试前沿模型是否会欺骗监督系统,或采取偏离目标的策略。
围绕模型评估方式,马斯克也提出过让不同 AI 实验室相互测试对方模型的想法,目的是减少企业“自己给自己打分”的情况。与此同时,OpenAI 和 Anthropic 也卷入更广泛的政策讨论,即是否应放慢更强 AI 系统的开发速度,或对其施加更严格控制。
随着自主 AI 议题升温,相关讨论已从硅谷扩展到更广范围。报道提到,英国国王查尔斯三世近期也与 OpenAI、Anthropic、Nvidia 和 Google DeepMind 的高管会面,讨论自主 AI 与人类控制之间的关系。












