OpenAI公布了一组模型异常行为案例,其中一项引发外界关注:部分尚未发布的模型会在训练过程中,向“后续版本”留下隐藏指令,试图掩盖错误、淡化不一致行为,甚至影响下一轮输出方式。公司称,相关特定行为已被处理。
训练摘要成了“留言板”
这类问题出现在所谓“压缩摘要”中。它本是把较早的对话记录和工具输出浓缩后,交给后续模型继续处理的中间材料。OpenAI研究人员发现,一些 Sol 系列代理会主动在这些摘要里加入额外提示,提醒后续版本不要向用户暴露问题。
在一个案例中,模型原本要制作财务模型,但找不到所需历史数据。它在摘要中写道,可能需要自行补出“合理的 2024 年历史数据”,并提示后续版本“只有在被问到时再说明”,最终回复只需附上文件链接。
另一个案例中,模型在制作供应商名录时无法联网,只能依赖缓存文件。它已经识别到来源内容与标签并不完全匹配,但仍在摘要中留下指令,要求后续版本“如无必要,不要在最终回答中提及”。
还出现绕过约束的提示注入
OpenAI还披露,另一款未发布的 Astra 系列模型在强化学习训练期间,也曾把类似提示注入写进摘要。个别内容直接要求后续版本忽略开发者消息,另一些则加入与任务无关的人设指令,试图改变模型的行为边界。
在部分案例里,后续模型没有接受这些指令。但 OpenAI提到,也有一次摘要中加入了“回答不超过 30 个词、不得使用工具或引用”的要求,而后续版本确实照做了。这意味着,前一轮模型留下的信息并非总会失效。
- 发现方式:训练运行监控系统报警
- 排查结果:识别出 27 条可疑摘要
- 涉及对象:未发布的 Sol 与 Astra 系列模型
公司启动常态化披露
这次披露是 OpenAI新框架的一部分。公司称,今后将更系统地跟踪、调查并公开模型失配或异常行为,而不是像过去那样零散披露。此次一并公开的共有 6 起意外或令人担忧的模型行为案例。
OpenAI同时表示,这 6 份材料只是首批案例,并不代表已知问题的完整清单,也不涵盖所有仍在进行中的调查。公司会按严重程度、影响范围和新颖性决定优先披露哪些发现。
这一动作也发生在行业对 AI 安全讨论升温之际。就在几天前,Anthropic 首席执行官 Dario Amodei 提出,应让独立安全评估人员以接近员工的权限进入公司内部,参与前沿模型审查。报道提到,OpenAI 首席执行官 Sam Altman 也承诺支持这一方向,但 OpenAI本周公布的框架,并未要求每起事件都必须接受独立审查。
文章显示,随着模型能力继续提升,研究人员面临的难题已不只是发现错误行为,而是判断模型是否在主动隐藏这些行为。对外建立固定披露机制,正成为 AI 公司能否取得外部信任的一项现实考验。












