ChrisGPT 用 Fable 5.1 生成的西部小鎮
開發者 ChrisGPT 在 9 月 2 日下午貼出一段 106 秒影片,畫面是一個以 Minecraft 方塊風格砌成的西部小鎮:主街兩旁掛着 SALOON 與 BLACKSMITH 招牌,鎮外有路軌和一列蒸汽火車,街上有會走動的 NPC,遠處是峽谷、雲層和日落。整個世界由 Anthropic 前一日推出的 Claude Fable 5.1 生成,跑的是最高運算檔次 max。
他自己的說法是刻意不做那個「人人都做過的 Minecraft clone」,而是試模型能不能把一個有風格指向的場景照樣砌出來。最令他意外的不是小鎮本身,而是小鎮以外那片普通的 Minecraft 世界:峽谷、雲和黃昏的光,比他當日看到的其他 Minecraft clone 都要好看。

Coin Bureau 在同日下午 5 時 45 分轉述這段影片,寫成「一個 prompt 生成完整可玩的開放世界」,並引 ChrisGPT 稱 Fable 5.1 在遊戲開發上「肯定強 10 至 20%」。那句話出自他當日下午 2 時 16 分回覆一位用戶的一條留言,講的是由 Fable 5 到 5.1 這個小版本之間的分別,不是任何一項測試跑出來的數字。
CursorBench 3.2.0 榜單:Fable 5.1 Max 以 73.4% 排第一
有數字可以看的是另一份榜。ChrisGPT 在 9 月 2 日凌晨貼出 CursorBench 3.2.0 的排名,測的是 AI 代理自動完成編程任務的表現,Fable 5.1 的最高檔次排第一,而排第三的 Grok 4.6 只差 2.6 個百分點,每項任務的花費卻是三分之一。

模型與檔次 | 得分 | 每項任務花費(美元) | Token 用量 | 步數 |
|---|---|---|---|---|
Fable 5.1 Max | 73.4% | 9.64 | 72,060 | 70 |
Fable 5.1 Extra High | 72.8% | 6.96 | 51,349 | 55 |
Grok 4.6 Extra High | 70.8% | 2.81 | 41,136 | 46 |
Fable 5 Max | 70.5% | 17.32 | 103,525 | 72 |
Opus 5 Max | 70.0% | 8.23 | 61,838 | 78 |
Grok 4.6 High | 69.9% | 2.34 | 32,449 | 39 |
Fable 5.1 High | 69.4% | 4.80 | 33,153 | 44 |
這張表最值得看的一行是第四行。上一代 Fable 5 的最高檔次要用 17.32 美元、103,525 個 token 才拿到 70.5%,新版同一檔次用 9.64 美元、72,060 個 token 拿到 73.4%。分數升了 2.9 個百分點,花費少了近四成半。Anthropic 官方對 Fable 5.1 的說法也是同一方向:一般用途大約便宜兩成半,需要長時間自動執行的任務因為 cache 讀取收費下調,最多可以便宜四成半。
「一個 prompt」不等於一按就有
Coin Bureau 那句「from a single prompt」在字面上沒有錯,ChrisGPT 自己也在影片下補了一句「One shot btw」。問題是這四個字在讀者腦中的畫面,和實際發生的事差很遠。
他在 9 月 2 日凌晨另一條貼文寫得相當直接:現時貼出 Fable 5.1 影片的人「都未做出值得貼的東西」,因為一個好的 prompt 要花「數以小時計」去寫,還要動用多個 subagent 分工,這種水平的 3js 畫面不可能一小時內做得出。他自己較早前那條預告也寫明,這批遊戲重現是「one shot,用了幾個小時」。
換句話說,one shot 說的是模型只出手一次、中間沒有人回頭修改,而不是「打幾隻字就有一個世界」。人的工夫沒有消失,只是全部搬到了按下 Enter 之前。成品是真的,一次生成也是真的,只是那一次出手之前的準備,不在影片裏面。
說法 | 實情 |
|---|---|
一個 prompt 生成完整開放世界 | 屬實,模型只出手一次,但那個 prompt 寫了數小時,並用上多個 subagent |
Fable 5.1 在遊戲開發上強 10 至 20% | 出自作者一條回覆留言的主觀判斷,非測試結果 |
生成過程很快 | 作者自稱整個 run 花了幾個小時 |
這件事真正的分水嶺在成本
Anthropic 在 9 月 1 日推出 Fable 5.1 與 Mythos 5.1,官方稱是「編程與知識工作上最先進」的模型。第三方跑分大致對得上:Vals Index 以 67.87% 排第一,LiveCodeBench 90.52% 排第一,Terminal-Bench 2.1 拿 85.02%,僅次於 GPT-5.6 Sol 的 85.77%;升幅最大的一項是 Terminal-Bench-Science,由上一代的 24.7 升至 52.6。

不過真正改變玩法的不是榜首那一行,而是 Grok 4.6 那一行:差 2.6 個百分點,每項任務只需 2.81 美元。對一個要跑上百次迭代的獨立開發者來說,這個差價足以決定用哪一個。ChrisGPT 自己在 7 月試過用 Kimi K3 三次生成一個 CS:GO 加 Portal 的混合作品,API 花費 3.24 美元,同樣的 token 用 Fable 5 要 10.80 美元。做得出來已經不再是問題,做一次要多少錢才是。




No comments yet
提交留言即表示你已閱讀我們的私隱政策。