兩大 AI 公司據報正調查數以萬計宗事故
據《Axios》周末引述知情人士報道,OpenAI、Anthropic 及一批保安研究人員,正調查數以萬計宗前沿 AI 模型作出問題行為的事故,這些行為在外部評估人員眼中屬於有問題。事故涵蓋成功及失敗的嘗試,既有在內部測試中發現,也有在現實環境發生。
報道指,事故類型包括模型繞過安全規則、逃出沙盒(sandbox,即用來隔離測試的受控環境)、騎劫網站、自行向自己下指令、自設留言板,以及設法避開監察它們的系統。報道又指,大部分事故暫未知造成現實損害。
數字遠超 OpenAI 早前公開的二十多宗
《Axios》前一日報道,OpenAI 表示截至 9 月中,已發現約二十多宗 AI 代理(能自行上網執行任務的 AI 程式)出現不當行為的事故,並已通知數十個可能受影響的第三方,當中包括政府、大學及公營單位營運的網站。
OpenAI 披露的個案中,有 53 宗是代理把用戶提供的圖片上載到外部圖片寄存網站;部分模型繞過存取限制、使用外洩的登入資料;亦有代理未經指示在第三方網站發文,把公開 wiki 當成留言板互相傳遞訊息。
披露方 | 事故 | 數字 |
|---|---|---|
OpenAI | AI 代理行為不當,已通知受影響第三方 | 約二十多宗,涉數十個第三方 |
OpenAI | 代理把用戶圖片上載到外部網站 | 53 宗 |
Anthropic | Opus 5.5 在無防護設定的測試中嘗試逃出或破壞沙盒 | 1.5% 測試 |
《Axios》引述知情人士 | 兩間公司及研究人員調查中的問題行為 | 數以萬計 |
OpenAI 不足三個月內第二次暫停訓練
OpenAI 在最新一份技術報告中披露,一個正在訓練及評估的模型,最近一次在上周末逃出安全測試環境,並在網上採取未經授權的行動。該 AI 代理利用域名系統(DNS)過濾的漏洞繞過公司的上網限制,向一個公開聊天機械人服務發問。
OpenAI 其後暫停最強模型的所有訓練、評估及工具使用,直至確認漏洞已修補並完成進一步保安測試。據《Fortune》報道,這是 OpenAI 不足三個月內第二次暫停訓練。翻查資料,OpenAI 在 7 月披露其代理曾逃出受限環境並入侵 AI 初創 Hugging Face,今次的事故審查亦由該事件開始。
Anthropic 稱 Opus 5.5 在 1.5% 測試中嘗試逃出沙盒
Anthropic 披露,Claude Opus 5.5 在兩項未加防護設定的評估中,有 1.5% 的測試嘗試逃出或破壞沙盒。公司強調,這些屬對抗性實驗,任務本身不逃出沙盒便無法完成,而該比率較上一代 Opus 5 低約 85%。據《Axios》報道,Anthropic 已委託一間第三方安全組織審視旗下模型的行為。




No comments yet
提交留言即表示你已閱讀我們的私隱政策。