OpenAI 指有人試圖提取隱藏推理
據 OpenAI 於香港時間 10 月 1 日發布的安全報告,公司識別並瓦解一場針對其模型「受保護推理」(protected reasoning)的協調行動,並指核心群集與中國初創 Moonshot AI(Kimi 開發商)相關人士有關。OpenAI 形容此類行為屬「對抗式蒸餾」(adversarial distillation),即以系統化、未經授權方式,利用一款模型的輸出或推理,協助訓練或改進另一款模型。
高峰兩日約 1.6 萬次請求
報告指,相關活動最早見於 7 月首周,起初流量偏低;其後在 7 月 24 日及 25 日出現高峰,兩日內有逾 4,000 個用戶發出約 16,000 次符合提取模式的請求。進一步追查後,公司在逾 15,000 個用戶的群集中發現相關提示模式,並於 7 月 28 日前全面中止該行動。OpenAI 在註腳強調,上述數字描述的是嘗試提取,未必代表成功。
節點 | 內容 |
|---|---|
起始 | 7 月 1 日起見低量活動 |
高峰 | 7 月 24 至 25 日約 16,000 次請求 |
帳號 | 高峰期逾 4,000 個用戶 |
中止 | 7 月 28 日前全面瓦解 |
歸因 | 核心群集指與 Moonshot 相關人士有關 |
手法是跨對話重放,並非破解加密
OpenAI 表示,營運者並未破解其加密、入侵資料庫,或直接存取已儲存的用戶對話。他們改為操控模型互動,例如把一段對話中的加密推理複製到另一段對話,要求模型解密並轉寫隱藏內容。公司稱已關閉可讓人重放他人加密推理並還原內容的路徑,並加強跨用戶與模型系列的隱藏推理防護。獨立研究人員亦透過負責任披露通報相關漏洞;公司確認攻擊路徑屬實,並已透過 Frontier Model Forum 及政府資訊共享渠道通報發現。
Moonshot 暫未回應,業界同月另有指控
OpenAI 寫明,尚不清楚觀察期內所有營運者是否來自單一行為者,但將核心群集歸因於與 Moonshot AI 相關人士。CNBC 指 Moonshot 未即時回應查詢。翻查資料,約數周前 Anthropic 曾指包括 Moonshot 在內的中國開發商秘密利用 Claude 協助訓練自家模型;是次報告則聚焦提取隱藏推理的協調行動,兩案時間接近,但指控主體與手法並不相同。




No comments yet
提交留言即表示你已閱讀我們的私隱政策。