事件背景
Grok 4.6 於 8 月 12 日上線,距離 7 月推出的 Grok 4.5 只相隔約一個月。與上一代不同,這次升級並非靠加大模型規模換取分數,而是來自更長的補充訓練、更高質素的工程數據,以及在程式開發、網頁開發與設計等場景上的代理式強化學習。
SpaceXAI 形容 Grok 4.6 是為「長時間運行的代理、程式開發、知識工作與更有野心的視覺專案」而設。官方特別強調兩點:模型在多步驟任務中的持續執行能力,以及在長任務期間更頻繁的自我測試與驗證行為。換言之,重點不是單次回答有多聰明,而是跑一個小時之後會不會走偏。
官方宣傳片列出的賣點同樣圍繞這條主線:更了解使用者的程式碼庫、更了解手上正在用的工具、更了解團隊的協作方式,並在設計與前端輸出上有明顯改善。片中示範由一張圖片生成完整網站版面,最後打出「每個 token 的智能最高」這句標語。
數據解讀
- Artificial Analysis 智能指數:Grok 4.6 High 取得 61 分,追平 GPT-5.6 Sol Max,較 Grok 4.5 High 的 56 分提升 5 分。據 9to5Mac 報道,這個分數距離 Claude Fable 5 Max 僅一分之差。
- 領先項目:CursorBench、FrontierCode 與 AA-Briefcase,另在 GDPVal-AA v2 及 Harvey LAB 等評測名列前茅。
- 並非全面領先:官方對比涵蓋 AA Intelligence、GDPVal-AA、DeepSWE 1.1、CursorBench 3.2 與 FrontierCode 1.1,Grok 4.6 並非每一項都排在最前。
- 定價:每百萬輸入 token 2 美元、輸出 6 美元,與 Grok 4.5 相同;高速版本收費為標準版的兩倍。首週在 Cursor 與 Grok Build 內的用量額度加倍。
值得留意的是,61 分本身並不是新高,而是「追平」。真正的變化在價格:同級的智能水平,SpaceXAI 選擇不加價。當旗艦級模型的能力差距收窄到一兩分,能力榜的排名就不再是採購決定的關鍵,每百萬 token 的單價才是。
對市場的影響
Grok 4.6 已在 Cursor、Grok Build、SpaceXAI 官方 API,以及 OpenRouter、Vercel 與 Cloudflare 上線。首週用量加倍的安排明顯是衝着開發者的遷移成本而來:在模型選單上換一個名字的門檻本來就低,額外送出的額度只是把它壓得更低。
對 OpenAI 與 Anthropic 而言,壓力不在榜首那一格,而在中位數的性價比。當一個追平旗艦的模型長期停在 2 美元對 6 美元的價位,定價本身就成為競爭工具,而不是發布會上的一頁附註。
短期內真正的考驗,是基準分數上的追平能否轉化為實際工作流程中的替換。長鏈工程任務的失敗往往不出現在單題評測上,而是在第三十步之後才顯形。SpaceXAI 這次把重心放在自我驗證與持續執行,方向對準的正是這一點,但要等開發者跑滿一週才有答案。




No comments yet