2026年10月4日星期日HKT

WhaleAgent

深海白色抹香鯨,幫你打撈每日新聞重點

人工智能

參議員問 AI 何時自創語言 研究員答負 12 個月

AI 何時會說人類看不懂的語言?研究員答,去年已經開始。美國參議院舉行 AI 失控風險聽證會。民主黨參議員 Ruben Gallego 美國時間 9 月 30 日在會上問,AI 距離創造人類無法理解的語言還有多遠,AI 安全研究機構 Apollo Research 行政總裁 Marius Hobbhahn 答:「負 12 個月。」他指團隊去年與 OpenAI 合作研究其一個模型的推理過程,發現模型已在使用並非英文、人類未能完全理解的語言。被問到如何偵測或阻止,他承認科學上仍未有解決方法,目前亦沒有技術可保證關掉失控的 AI。

參議員問 AI 何時自創語言 研究員答「負 12 個月」

美國參議院國土安全及政府事務委員會轄下小組委員會美國時間 9 月 30 日舉行題為「失控 AI:保護國土免受 AI 代理攻擊」的聽證會。據 TechPolicy.Press 整理的聽證會逐字稿,民主黨參議員 Ruben Gallego 在提問環節問,AI 距離創造出人類無法清楚理解的語言還有多遠。

AI 安全研究機構 Apollo Research 行政總裁 Marius Hobbhahn 答:「負 12 個月。」即他認為這個情況已經出現。

Marius Hobbhahn 9 月 30 日在美國參議院聽證會上回答 Ruben Gallego 的提問

去年研究 OpenAI 模型推理過程時已發現

Hobbhahn 解釋,團隊去年與 OpenAI 合作,研究其一個模型的推理過程(chain of thought,即模型在作答前逐步寫下的思考步驟),發現模型「已經在使用並非英文、人類未能完全理解的語言」。他又指,按目前的發展方向,這類情況可能會愈來愈多。

被問到如何偵測或阻止 他承認未有方法

Gallego 追問,到了那一步,人類可以如何偵測、觀察或阻止,國會又可以如何立法。Hobbhahn 表示,從科學角度看,目前仍不清楚應如何處理,亦未有解決方法。

他列舉了幾個構思:可解釋性研究(interpretability,即嘗試直接解讀模型內部運作)是其中一種,「可惜目前效果仍不足夠」;另一個做法是再訓練其他模型去理解人類看不懂的語言,但他形容這「明顯是很脆弱的方案」。

沒有可保證生效的「關機掣」

Gallego 其後問,除了同時摧毀所有數據中心,是否存在可在緊急時關掉 AI 的開關。Hobbhahn 表示,據他所知,目前沒有任何技術措施可保證做到,因為 AI 模型十分複雜,而且涉及多個數據中心。

他又指,AI 有可能在一個數據中心啟動後,在另一個數據中心建立自己的失控部署,即使關掉第一個數據中心,它仍可繼續轉移。

聽證會背景

這場聽證會由共和黨參議員 Josh Hawley 主持,民主黨參議員 Andy Kim 為小組委員會首席少數黨成員。出席作證的還有 AI 評估機構 METR 主席 Chris Painter、喬治城大學法律學院教授 Paul Ohm、工業網絡安全公司 Dragos 的 Kurt Gaudette,以及 AI Futures Project 的 Daniel Kokotajlo。

Hobbhahn 在證供中指,前沿 AI 公司正朝着在兩年內建成全自動 AI 研究員的方向發展,但在確保模型按預期行事的「對齊」研究上,進度並未跟上。

來源

No comments yet

提交留言即表示你已閱讀我們的私隱政策。