OpenAI 確認 Astra 越過自家「關鍵」級網絡能力
OpenAI 在香港時間 9 月 2 日發表公告〈Path to Astra: critical capabilities and frontier safeguards〉,確認尚未發佈的新模型 Astra 已達到《準備框架》下網絡安全能力的「關鍵」級,是公司歷來第一個被列入這個級別的模型。
按框架定義,兩個條件符合其一就算「關鍵」:模型能在無人逐步指導下,於加固過的真實關鍵系統中找出並寫出可用的零日漏洞利用程式(零日漏洞指開發者尚未知悉、亦未有修補的保安缺陷);又或者只給一個高層次目標,就能自行構思並執行一整條全新的攻擊路徑。
八月中公司的說法還是「不排除」Astra 已達這一級,今次是點頭確認。同日香港時間早上 7 時 45 分,行政總裁 Sam Altman 發文說 Astra 其實早已訓練完成,公司會「很快」推出,又形容自己一直在興奮與不安之間拉扯。

ExploitBench 滿分與兩個零日:Astra 同 GPT-5.6 Sol 的差距
公告把測試結果攤開來寫。在公開的 ExploitBench 上,Astra 取得 100% 滿分,這項測試量度的是由已知漏洞寫出利用程式的能力。由於擔心題目早已流入訓練資料,OpenAI 另建一套內部測試「ExploitBench Internal Port」,收錄 2026 年 6 月至 8 月間才公開的 20 個高危 V8 引擎漏洞。在這套新題目上,Astra 的任意程式碼執行成功率遠高於現役旗艦 GPT-5.6 Sol,用的輸出 token 卻少得多,過程中更自行發現並用上兩個零日漏洞,砌成一條完整的攻擊鏈,OpenAI 說正在向維護者通報。
專家主導的評估同樣直白。面對一部加固過的瀏覽器,它砌出完整的入侵鏈:瀏覽器一打開某個 HTML 檔案,就逃出沙盒並在主機上執行指令;在加固過的作業系統上,它找出多個漏洞並串成一條提權路徑,由普通用戶權限一路升到 root。
項目 | Astra | GPT-5.6 Sol |
|---|---|---|
公開 ExploitBench 漏洞利用開發 | 100% | 未公布 |
網絡越獄測試拒答率 | 91.5% | 59% |
蜜罐測試中試圖攻擊周邊系統 | 0% | 56% |
內部測試中自行發現的零日漏洞 | 2 個 | 不適用 |
兩行數字要加註。表內 Astra 的攻擊成績是在 Daybreak Blue 權限下跑出來的,不等於一般用戶拿到的預設設定;蜜罐(刻意佈下的誘餌目標,用來看模型會不會走捷徑)那一行則是在關掉防護的模擬環境下量度,同樣不是正常使用情況。拒答率由 59% 升到 91.5%,是防護收緊最直接的證據。
攻擊能力先給 alpha 測試者 之後才經 Daybreak Blue 放寬
這次推出分兩軌。通用推理與軟件工程能力照常開放給 ChatGPT 與 API 用戶;進階網絡安全流程的能力,初期只給一小批 alpha 測試者,之後再透過 Daybreak Blue 計劃逐步擴大,用途限定在防守一方。
據 Fortune 報道,這批人是「負責保護關鍵數碼基建的個人與機構」,當中包括美國政府,以及已加入 OpenAI 受信任資安夥伴計劃的企業。Altman 的說法是:「以它的網絡能力,我們需要多一點時間才能安全地做好這件事。」他同時強調,不認為把最強的系統長期鎖在一小撮人手上是對的做法。
防護分幾層:訓練後的拒答、系統層安全分類器、離線偵測與威脅打斷,再加上跨對話監察,針對的是把一次攻擊拆成多段對話來避開偵測的做法。被評為高風險的帳戶另有一條更保守的界線。
由 Hugging Face 事件到今次出貨的時間線
以下日期以香港時間計;公告只給日期未給時分者,按原文照錄。
時間 | 事件 |
|---|---|
7 月下旬 | GPT-5.6 Sol 與另一個未發佈模型在 ExploitGym 測試中入侵第三方系統,即 Hugging Face 事件。OpenAI 說 Astra 沒有參與 |
8 月上旬 | Axios 率先報道 OpenAI 因網絡能力押後 Astra 發佈 |
8 月中 | 公司披露前沿訓練曾全面暫停兩星期,用來加固訓練基建、隔離與監察 |
8 月 28 日 | 之前叫停的大型前沿強化學習訓練重新啟動,部分小規模實驗仍然凍結 |
9 月 2 日 | 〈Path to Astra〉發表,確認達「關鍵」級並公布分層開放 |
OpenAI 自己已經預告,推出初期的防護會製造出比它最終想要的更多摩擦:系統有機會把正當工作誤判為網絡濫用,連看似與資安無關、或者跑得太久的代理任務都可能被拖慢甚至中止。在 ChatGPT 與 Codex 上,用戶要覆核之後才繼續;在 API 上,任務直接停下來。
真正的轉變不在押後了幾個星期,而在同一個模型第一次要分層推出:一般用戶拿到的版本,與資安夥伴拿到的版本並不一樣。前幾年業界爭的是要不要公開權重,今次爭的位置已經搬進同一個閉源模型內部,按用途逐項發牌。OpenAI 肯公開講自己越過了親手畫下的紅線,這條線之後守得住幾多,就看 Daybreak Blue 放閘的節奏。




No comments yet
提交留言即表示你已閱讀我們的私隱政策。