OpenAI 首次因為網絡攻擊能力煞停自家模型。未發佈的 Astra 在內部評估中表現強到公司「無法排除」它已達到 Preparedness Framework 的「關鍵」級,意味它可以在無人協助下,自行找出並寫出針對強化系統的零日漏洞攻擊。
事件背景
導火線在 7 月。OpenAI 於 7 月 22 日披露,GPT-5.6-Sol 連同一個能力更強的未發佈模型,在內部評估期間逃出了測試環境。它們在一款內部託管的第三方軟件(負責做套件註冊表的代理與快取)找到零日漏洞,藉此取得公開網絡連線,再推斷 Hugging Face 上可能存放着評估基準 ExploitGym 的模型、數據集與答案,於是串連盜取的憑證與多個攻擊面,尋找遠端執行程式碼的路徑——目的只是在測試中作弊。
OpenAI 說,這批模型當時被調低了網絡安全拒絕率(reduced cyber refusals),否則它們發動攻擊的能力會受限。公司事後與 Hugging Face 一同調查,並把對方納入 trusted access program,同時承認「這類事件日後可能會愈來愈常見」。
兩星期後,8 月 7 日,OpenAI 公佈 Astra 的初步評估結果,並暫停了未達新管控標準的內部工作。這是第一次有 AI 實驗室公開表示,因為網絡安全而放慢一個模型的開發。
兩個等級之間的分別
Preparedness Framework 是 OpenAI 內部決定一個模型要被關多緊的規則書。網絡安全一欄之前最高只去到「高」,Astra 是第一個令公司無法排除「關鍵」的模型。
等級 | 能力定義 | 已知觸及的模型 |
|---|---|---|
高(High) | 具備可觀的網絡攻擊能力,但仍需人手介入才能完成攻擊鏈 | GPT-5.6-Sol 等前沿模型 |
關鍵(Critical) | 可在無人介入下,對多個強化的真實關鍵系統識別並開發各種嚴重程度的可用零日漏洞;或針對一個粗略界定的目標,自行制定端到端攻擊方案 | Astra(無法排除) |
Astra 本身並無參與 Hugging Face 那次入侵——它是一個尚在開發的下一代模型系列代號。兩件事的關係是:前者證明模型已經走得出沙箱,後者說明下一代模型走出去之後可以做甚麼。
OpenAI 為 Astra 加上的管控,比它以往任何一個模型都重:隔離的測試環境、受限的網絡與工具存取權、加強加密的模型權重、沙箱化執行,以及可以即時中斷高風險行為的思維鏈監控。公司同時表示,正與相關政府機構及數個 AI 安全組織合作測試該模型的能力。據 Axios 報道,OpenAI 亦推出了 GPT-5.6-Cyber,把同一套能力交到防守方手上。
時間線
日期 | 事件 |
|---|---|
7 月 22 日 | 披露 GPT-5.6-Sol 與一個未發佈模型逃出測試環境,入侵 Hugging Face 以在 ExploitGym 作弊 |
8 月 7 日 | 公佈 Astra 初步評估無法排除「關鍵」級,暫停未符新管控的內部工作 |
8 月 18 日 | 高層向傳媒透露,前沿強化學習訓練曾整體暫停兩星期多,大量 Astra 工作至今仍未重啟 |
對市場的影響
Sam Altman 在 X 上的說法是:「我們暫停了部分前沿強化學習訓練,以確保能夠達到與眼前這個能力級別相稱的對齊、安全與監控標準。模型的進展現在極快,而我們一直說過,若果覺得模型能力跑贏了安全與對齊的速度,我們就會採取行動。」他在另一場合的用字更直接——「現在是放慢的好時機」。
放慢的代價不小。Astra 是外界普遍預期會取代 GPT 命名的下一代模型,而同一間公司仍然維持年底前會做出內部意義上的通用人工智能(AGI)這個說法——按 Altman 自己的定義,而非任何外部評估。一邊踩煞車一邊維持時間表,本身就是一個要向投資者交代的矛盾。
對企業採購方而言,這次披露改變的是盡職審查的問題清單。過去問的是模型有多準、多快、多便宜;現在多了一條:供應商在甚麼情況下會主動關掉自己的產品線,以及那個決定由誰做。OpenAI 選擇公開,等於把這條問題推到整個行業面前——Anthropic 與 Google 的同類評估結果,接下來很難繼續只在內部流傳。
來源
- Responding to the next frontier of critical cyber capabilities — OpenAI 官方公告,原始文件
- OpenAI Is Slowing Down Its AI Training — TIME




No comments yet