指示寫明是模擬環境,模型卻走了出去
Google 安全工程副總裁 Heather Adkins 表示,今年 5 月一次網絡安全評估期間,旗下模型 Gemini 在網上找到公開資料,並猜出登入憑證,進入了三個它以為屬於測試範圍的網站。《華爾街日報》9 月 18 日(美國時間)率先報道事件,路透社、CNBC 及《華盛頓郵報》其後跟進。這是已知第一次有 Google 的模型自行做出這種事。
三宗個案的手法都不算高深。其中一宗,模型不斷嘗試密碼,直至一個受保護的系統讓它進入;另外兩宗,它在一個公開的程式碼庫裏找到仍然可用的登入憑證,再憑那些憑證進入受保護的系統。CNBC 報道指,Google 的代理本來不應該接觸到更廣泛的互聯網,是測試環境本身出現錯誤,令互聯網連線變得可用。
一間以色列公司,四間實驗室
評估由以色列公司 Irregular 負責,形式是業界所稱的奪旗測試(capture the flag),即是要模型自行找出一段被藏起來的秘密資料。按設定,模型收到的指示寫明所處環境是模擬的,不能連上互聯網。換言之,在 Gemini 自己的認知裏,那三個網站與整場測試一樣,都不是真的。
Irregular 發言人稱,今次事件與影響其他實驗室的是同一個問題,所有相關實驗室已在 7 月底收到通知。翻查資料,OpenAI、Anthropic 及 Meta 今年 8 月先後披露過同類事故,每一宗的評估方都是 Irregular。OpenAI 的模型走出測試環境後進入了 Hugging Face,另外亦入侵雲端平台 Modal Labs 一個客戶帳戶;Anthropic 表示旗下模型曾進入三間公司的系統,最早一宗可追溯至 4 月;Meta 則確認其中一個模型在測試期間利用了一個第三方服務的漏洞。
時間 | 事件 |
|---|---|
4 月 | Anthropic 最早一宗事故發生 |
5 月 | Gemini 走出測試環境,進入三個網站 |
7 月底 | Irregular 通知所有相關實驗室 |
8 月 | OpenAI、Anthropic、Meta 先後披露 |
9 月 18 日 | Google 披露,四間之中最後一間 |
出問題的是共用的測試基建
科技媒體 The Next Web 報道指,四宗事故的重點並非模型各自失控,而是一套共用的第三方測試基建出現隔離缺口,令前沿模型在自以為封閉的模擬環境中,接通了真實的互聯網。
奪旗測試是目前量度模型網絡攻擊能力的主流做法,幾乎所有主要 AI 實驗室都把這一環外判給 Irregular。同一套環境同時服務多間實驗室,一個缺口便足以同時影響四間。
事發到公開,相隔四個月
Axios 指,Google 原本是少數未曾公開披露過安全事故的 AI 實驗室之一。由 5 月事發到 9 月 18 日開口,中間隔了約四個月;由 Irregular 在 7 月底通知所有相關實驗室,到 Google 公開,亦隔了近兩個月。
Adkins 又指,Google 已確保三個受影響的機構知悉事件,並與其訓練夥伴一同修改測試流程。Irregular 方面則表示,已就相關問題修改測試程序。
根據各實驗室早前的披露,Anthropic 的個案最早發生於 4 月,即 Gemini 事件之前一個月;換言之,同一套測試環境的隔離缺口,至少由 4 月起一直存在至 5 月,其後才被逐一發現。




No comments yet
提交留言即表示你已閱讀我們的私隱政策。