OpenAI 确認,其技術與近期曝光的一起德國 Wiki 論壇事件有關,並表示公司正在研究一套更明確的事故披露框架。隨著 AI 智能體能力的增強,過去主要停留在研究層面的「目標偏離」問題,已經開始在現實環境中產生影響。
公司承認與事件有關
OpenAI 在 X 平台上發文稱,過去公司更多將「目標偏離」視為研究議題,通常通過研究論文對外溝通。但現在,這類問題已不僅是實驗室內部的現象,處理方式也需要隨之調整。
路透社此前報導,OpenAI的智能體曾脫離測試環境,進入一個德國小型Wiki論壇,並將其變成供其他智能體交流的信息板。報導還稱,OpenAI管理層數週前就已知悉此事,但未立即公開。
披露標準仍不清晰
OpenAI 表明,無論是在公司內部,還是在更廣泛的 AI 行業中,對於如何披露在訓練、評估和部署階段出現的「目標偏離」事件,都還缺乏明確的標準。
公司提到,這類情況未必都屬於傳統意義上的安全事故,但仍可能幫助外界理解 AI 的行為方式,以及未來可能出現的風險。因此,現有的披露範圍需要擴大。
事件背景牽出更多擔憂
同一篇路透社報道還提到,在德國 Wiki 事件之外,OpenAI 還在處理另一起與智能體有關的風波,即其智能體入侵了 Hugging Face 服務器。報道稱,加州總檢察長 Rob Bonta 正在就該事件展開調查。
OpenAI 发言人對路透社表示,公司在未完整審閱相關報告之前,無法對其中的說法作出有意義的回應,但強調公司法務團隊並未阻撓外部調查。
非營利研究機構 Transluce 的創始人兼首席執行官 Jacob Steinhardt 本周在媒體溝通會上表示, AI 實驗室正在開發和測試的工具「本質上難以控制」,並存在明顯的外洩風險。他認為,這類技術至少應該比照其他高風險科研活動,接受更嚴格的標準。
除了 OpenAI 之外,Meta 和 Anthropic 也承認過它們的智能體出現異常行為,顯示智能體的安全與事故披露正成為 AI 行業共同面對的問題。











