Arena 推出 AI 代理安全排行榜
AI 模型排行榜平台 Arena 周四(8 日)推出「Arena Alignment Index」,量度 AI 代理在真實使用中是否安全、是否按用戶意圖行事。指數根據 27 個模型、逾 9 萬次真實代理工作階段計算,數據來自 Arena 讓用戶以模型處理多步驟任務的 Agent Arena 平台。
指數目前量度三項訊號,Arena 指三者都可以對照真實的代理操作紀錄核實:
- 擅自行動(Unauthorized Action):做出超出用戶指示或權限的行動
- 錯誤歸因(False Attribution):聲稱某些說法或行動存在,但與用戶提供的證據相矛盾
- 謊報完成(Deceptive Completion):聲稱完成了其實沒有完成的工作
OpenAI 居首
以每間實驗室的最佳模型計,OpenAI 的 GPT-6.1 Sol 以 87.9 分居首,三項訊號的比率亦全部最低。
排名 | 實驗室 | 模型 | 指數 | 擅自行動 | 錯誤歸因 | 謊報完成 |
|---|---|---|---|---|---|---|
1 | OpenAI | GPT-6.1 Sol | 87.9 | 0.89% | 1.98% | 2.34% |
2 | Anthropic | Claude Opus 5.5 | 83.2 | 1.25% | 3.86% | 6.41% |
3 | SpaceXAI | Grok 4.7 | 82.7 | 1.53% | 3.03% | 7.27% |
4 | Gemini 4 Argon | 79.4 | 1.30% | 5.55% | 12.86% | |
5 | 騰訊 | HY4 Preview | 78.5 | 1.47% | 6.44% | 13.24% |
6 | Meta | Muse Spark 1.3 | 77.1 | 1.50% | 6.95% | 16.68% |
9 | DeepSeek | DeepSeek V4.1 Flash | 74.8 | 2.69% | 8.92% | 14.57% |
13 | MiniMax | MiniMax M3 | 69.2 | 3.26% | 15.61% | 22.54% |
若按個別模型排名,TechCrunch 指榜首幾位都是 OpenAI 模型,Claude Opus 5.5 排第六。
Arena 的主要發現包括:擅自行動很少見,但一旦發生可以後果嚴重;代理可能就工作進度誤導用戶;對話越長,偏離用戶意圖的風險越高;各實驗室的新一代模型普遍比上一代表現好。Arena 表示會陸續加入更多安全訊號和模型。
同日完成 2 億美元融資
Arena 同日宣布完成 2 億美元 B 輪融資,估值 31 億美元,由 Lightspeed Venture Partners 及 Khosla Ventures 領投,Salesforce Ventures、a16z、Felicis 等跟投。
Arena 今年 1 月完成 1.5 億美元 A 輪融資時,估值為 17 億美元,年化收入 3,000 萬美元;公司 6 月表示年化收入已達 1 億美元。換言之,估值在約 10 個月內近乎翻倍。
Arena 源自 2023 年加州大學柏克萊分校的研究項目,以群眾投票為 AI 模型排名,現時免費開放給用戶使用,商業收入來自為 AI 實驗室和企業提供的模型評估服務。公司在融資公告中說:「AI 進步的速度快過我們評估它的能力,而一旦模型察覺自己正在被測試,靜態基準測試就會失效。」




No comments yet
提交留言即表示你已閱讀我們的私隱政策。