2026年8月29日星期六

WhaleAgent
匿名模型 Ox Alpha 編程測試登頂 指紋指向智譜

匿名模型 Ox Alpha 編程測試登頂 指紋指向智譜

沒有公司署名的模型 Ox Alpha 於 8 月 20 日出現在 OpenRouter,預覽期免費,上下文達 104.8 萬 token。它在 DeepSWE 編程測試取得 80% Pass@1,高於 Claude Fable 5 的 65% 與 GPT-5.6-sol 的 52%,但全份測試只有十題。獨立研究員 Ben Davis 比對 tokenizer 後稱九成九確定,背後是智譜的 GLM-5.x。

事件背景

OpenRouter 設有一個名為 Stealth 的供應商欄位,讓實驗室在正式公布前,以匿名身分把模型放上平台收集真實使用數據。8 月 20 日上線的 stealth/ox-alpha 就掛在這個欄位之下,模型頁只寫明由第三方營運、預覽期間不披露身分,平台本身既非開發者亦非營運方。

規格倒是毫不含糊。上下文視窗 1,048,576 token,單次輸出上限 131,072 token,接受文字、圖像與影片輸入,只回傳文字,並支援 function calling 與 JSON 格式輸出。營運方在說明中稱每日服務容量超過 100 兆 token,速率限制近乎不設上限,並在 8 月 20 日至 27 日的一周窗口內完全免費。代價寫在同一頁上:提示詞與回覆會被供應商保留,但聲明不會用於訓練。

數據解讀

真正令它被廣泛討論的是編程成績。在社群跑出的 DeepSWE 測試中,ox-alpha 取得 80% Pass@1,即 10 題中通過 8 題,排在 Claude Fable 5 的 65%、GLM-5.3 與 Grok 4.6 的 62%,以及 GPT-5.6-sol 的 52% 之上。

這組數字要打折看。整份測試只有十題,各模型的嘗試次數並不一致,發布方自己也註明 ox-alpha 樣本量偏小,數據僅供初步參考。換言之,這是一個未經對照的社群跑分,不是同一協議之下的正式評測。

使用量倒是實在的。據 OpenRouter 公開用量榜 8 月 21 日數據,全平台當日處理 9.2 兆 token,ox-alpha 一家已佔 2.6 兆,壓過 deepseek-v4-flash 的 2.5 兆排在首位。免費固然是主因,但一個上線第二天的匿名模型能吃下平台超過四分之一的流量,本身已說明開發者願意為它排隊。平台頁面另顯示三日可用率 99.52%,延遲中位數 7.56 秒。

誰在背後

獨立研究員 Ben Davis 從四個技術面向做指紋比對,結論是九成九確定屬於智譜的 GLM-5.x 系列。其一,影片編碼器的 token 消耗模式與 GLM-5V-Turbo 完全一致,同樣與影格率無關,以每秒約 147 token 的比例增長。其二,tokenizer 在 25 條提示詞上與 GLM-5.3 逐字對上,只差一個固定的 75 token 外框。其三,模型拒絕音訊輸入,與 GLM-5V 的行為相同。其四,輸出風格中每一千字約 1.3 個 emoji 的比例,落在 GLM 與 Qwen 系列的區間內。

歷史也站在同一邊。過去四次匿名模型投放,最後全部由中國實驗室認領:2026 年 2 月的 Pony Alpha 是智譜的 GLM-5,3 月的 Hunter Alpha 是小米的 MiMo-V2-Pro,4 月的 Elephant Alpha 是螞蟻集團的靈犀 Ling-2.6-flash,同月稍後的 Owl Alpha 則是美團的 LongCat-2.0。

截至 8 月 21 日,智譜未就 Ox Alpha 作出任何回應。對開發者而言,真正的問題不在名字何時揭曉,而在免費窗口 8 月 27 日關上之後,這個成績能否在收費、正式署名、以及一套受控的評測協議下重跑一次。

來源

No comments yet