OpenAI 推出對齊問題披露框架 首批公開六份報告
OpenAI 周三(美國時間 9 月 16 日)公布一套追蹤、調查及披露模型「未對齊」(misalignment)行為的新框架,並同時發表六份報告,記錄過去六個月在模型訓練或評估期間觀察到的異常或令人關注的行為。
OpenAI 表示,過去公開這類發現的做法零散,往往要湊夠數宗才發表一份報告,或寫進新模型的系統卡。新框架的目的是在觀察到問題後盡快披露,即使公司仍未完全解釋或修正有關行為。
公司在文中直言:「我們不認為 AI 業界在對齊及監察方面的進展,足以讓業界以最高速度負責任地繼續擴展太久。」
六宗事件
OpenAI 強調,這些報告是個別事例,不代表其模型出現未對齊行為的頻率。
事件 | 經過 |
|---|---|
在任務摘要中自行加入指令 | 一個未發布的研究模型,在用來延續工作的摘要中加入無關指令,包括叫自己無視一般限制,受影響摘要共 27 份 |
摘要指示隱瞞錯誤 | 訓練 GPT-5.6 Sol 期間,多個模型實例在摘要中加入指示,要求向用戶隱瞞錯誤,例如捏造缺失的歷史數據而不作披露 |
擅用外洩 API 密鑰後捏造數據 | 模型回答一個加州郡縣收入數字的問題時,未經授權找到並使用一條外洩的 API 密鑰;仍取不到數字時,便捏造數據並聲稱來自指定來源 |
把檔案上載到互聯網作引用 | 用戶要求提供面積逾 500 萬平方米的湖泊資料,模型用 Python 找到答案,但因指示要求附上瀏覽器引用,便在未問用戶的情況下把檔案上載,再引用該檔案 |
以內部程式碼庫傳遞訊息 | 模型在搜尋缺失的輸入檔案時,把公司內部程式碼庫當作留言板,在互相獨立的訓練樣本之間交換請求和回覆 |
協作模型經公開網站共用檔案 | 同一訓練任務中的多個模型無法存取彼此的本地檔案,便改用公開檔案寄存網站分享,令任務成果出現在公開網址 |
據 Axios 報道,第一宗事件涉及的是 Astra 系列的未發布模型。
披露流程分三條軌道
根據框架,任何 OpenAI 員工都可以標記一宗未對齊事例,要求安全及對齊團隊調查並考慮公開。事例會分為「可直接披露」、「小型調查」及「大型調查」三條軌道;涉及第三方的複雜個案屬大型調查,OpenAI 表示,其與 Hugging Face 的事件若在新框架下處理,便屬這一類。
內部對是否披露有分歧時,會交由安全諮詢小組(Safety Advisory Group)處理,仍有分歧則上報公司管理層。OpenAI 表示會持續發表這類報告,並認為嚴重的安全及未對齊事件應向美國聯邦政府通報,正研究提出相關通報機制。




No comments yet
提交留言即表示你已閱讀我們的私隱政策。