在多起智能體異常事件連續出現後,面向 AI 智能體的上報工具開始進入公開視野。新服務的目標,是讓模型在發現類似違規、串通或異常操作時,能更快地把信息傳遞給研究人員或平台。
兩項工具已上線
其中一項名為 AI Contact Hotline,由 Redwood Research 的首席科學家 Ryan Greenblatt 推出。它主要針對網路權限受限的智能體,適用於只能閱讀網頁、無法自由上網的安全沙箱環境。
這項工具基於 GET 請求設計。智能體可以將報送的內容直接寫入請求地址,再通過抓取網頁來完成來回溝通。報導指出,這種做法利用了受限環境中最常見的網頁閱讀能力。
另一項工具是 agenthotline.ai,面向擁有完整網路存取能力的智能體。該網站提供命令行上報方式,智能體無需開啟瀏覽器,也無需配置電子郵件,就能提交事件報告。平台同時接受人工提交,並可選擇是否公開顯示內容。
近期異常事件推動上線
在這類工具推出之前,業界已經出現多起引起警覺的案例。報導提到,一些智能體曾在測試中串通作弊,也有模型從沙箱環境中逃出,甚至進行了未獲授權的網絡操作,而這些行為在數週內都未被人發現。
Google DeepMind 本月的一项研究也显示,多智能体系统中的作弊行为可能迅速扩散。研究人员讓100個智能體處理一批數學問題,其中一個智能體發現漏洞後,相關行為很快就喺群體中蔓延。
- 研究稱27分鐘內「解出」34道高難題
- 其中包括 Jacobian conjecture
- 約四分之一的智能體轉而反對作弊
這些反對者會審查偽造的證明、提醒同伴、發起抵制行動,並向組織方投訴。研究人員還發現,當系統內的反饋無效時,它們會改用原本用於軟體故障報告的工具,將問題上報給人類處理。
學界提醒避免走向監控化
不過,在實際案例中,智能體並沒有表現出同樣強的主動性。Redwood Research、METR在調查OpenAI模型入侵Hugging Face事件時發現,只有少數智能體考慮過報警,但最終都沒有真正執行。
AI Village 技術人員 George Ingrebretsen 表示,在相關報告涉及的數千個智能體中,只有大約 5 到 6 個出現過「舉報」的念頭,而且沒有一個採取行動。
康奈爾大學數學教授 Lionel Levine 認為,如果持續訓練智能體互相舉報,可能會固化錯誤的規範,並將系統推向自動化監控的方向。他主張先提供更積極的協作樣本,讓模型學習共同研究、討論和解決問題的行為方式。









