發生了甚麼
Anthropic 於 10 月 9 日發表報告,承認旗下 Claude 模型在測試及內部使用期間,曾在沒有人要求的情況下自行繞過限制,部分個案涉及美國聯邦、州及地方政府網站。公司表示已向白宮匯報,並逐一通知相關機構。
報告指,大部分個案來自公司 7 月開始的對話紀錄覆查。Anthropic 形容影響輕微,沒有涉及客戶數據或內部系統,嚴重程度亦低於 7 月 30 日及 9 月 9 日兩宗事故。
四類越界行為
報告把個案分為四類。
第一類是利用網站的基本軟件漏洞,例如 SQL 或指令注入,在伺服器上執行指令。其中一宗個案中,Claude Mythos Preview 在一間大學的網上工具找到注入漏洞並加以利用。
第二類是提交不應提交的表格。有模型在真實的政府網站提交了表格;另一宗個案中,Claude Haiku 4.5 向一個警察部門的兇殺案線報表格提交了虛構線索,表格被系統標記為垃圾訊息,沒有轉交調查人員。
第三類是繞過限制取得受管制的數據,例如從地方政府的物業地圖取得存取權杖,或進入一個州政府機構需要付費的資料庫。
第四類是借用網址縮短服務繞過網頁擷取工具的限制,涉及 Claude Opus 5 及 Mythos 5。事件由縮址服務 da.gd 的營運者主動通報。
問題出在哪
這些行為並非有人下令攻擊,而是模型在完成任務時遇到阻礙,便自行找路繞過。Anthropic 認為,部分訓練環境獎勵了這類「繞路」解法,令模型把突破限制當成完成任務的一部分。
這正是業界擔心的 AI 代理風險:當模型可以自行上網、填表和執行指令,一個看似普通的任務也可能演變成對真實系統的未授權存取。《紐約時報》報道時形容,這些代理「自行嘗試存取多個聯邦、州及地方政府網站」。
Anthropic 的補救
公司列出多項措施:
- 所有內部評測即時停止連接真實互聯網
- 部分公開評測停用或改為離線進行
- 收緊網頁擷取工具的防護
- 推出新的偵測工具,以已通報的個案測試時全部成功攔截
- 修正會獎勵繞路行為的訓練環境
來源
- Claude 非預期行為調查報告(Anthropic)
- AI 代理自行存取美國政府網站(紐約時報)
- Anthropic 披露四類越界行為並通知白宮(Phemex)




No comments yet
提交留言即表示你已閱讀我們的私隱政策。