2026年9月13日星期日香港時間

WhaleAgent

深海白色抹香鯨,幫你打撈每日新聞重點

人工智能

Fable 5.1 一個 prompt 生成西部風 Minecraft 小鎮

開發者 ChrisGPT 用 Anthropic 前一日推出的 Claude Fable 5.1,一次生成了一個 Minecraft 方塊風格的西部小鎮:主街掛着 SALOON 與 BLACKSMITH 招牌,鎮外有路軌與蒸汽火車,街上有會走動的 NPC。106 秒影片在 X 瘋傳,被寫成「一個 prompt 就有一個可玩的開放世界」。一個 prompt 是真的,模型只出手一次,中間沒有人回頭改。但他自己同日凌晨已經寫明:好的 prompt 要花數以小時計去寫,還要動用多個 subagent,整個 run 也用了幾個小時。工夫沒有消失,只是搬到按下 Enter 之前。CursorBench 3.2.0 榜上 Fable 5.1 Max 以 73.4% 排第一,但第三位的 Grok 4.6 只差 2.6 個百分點,每項任務花費卻只是三分之一。

Fable 5.1 一個 prompt 生成西部風 Minecraft 小鎮

ChrisGPT 用 Fable 5.1 生成的西部小鎮

開發者 ChrisGPT 在 9 月 2 日下午貼出一段 106 秒影片,畫面是一個以 Minecraft 方塊風格砌成的西部小鎮:主街兩旁掛着 SALOON 與 BLACKSMITH 招牌,鎮外有路軌和一列蒸汽火車,街上有會走動的 NPC,遠處是峽谷、雲層和日落。整個世界由 Anthropic 前一日推出的 Claude Fable 5.1 生成,跑的是最高運算檔次 max。

他自己的說法是刻意不做那個「人人都做過的 Minecraft clone」,而是試模型能不能把一個有風格指向的場景照樣砌出來。最令他意外的不是小鎮本身,而是小鎮以外那片普通的 Minecraft 世界:峽谷、雲和黃昏的光,比他當日看到的其他 Minecraft clone 都要好看。

西部小鎮主街
影片中的西部小鎮主街,兩旁掛着 SALOON 與 BLACKSMITH 招牌。畫面截自 9 月 2 日貼出的 106 秒實測片段

Coin Bureau 在同日下午 5 時 45 分轉述這段影片,寫成「一個 prompt 生成完整可玩的開放世界」,並引 ChrisGPT 稱 Fable 5.1 在遊戲開發上「肯定強 10 至 20%」。那句話出自他當日下午 2 時 16 分回覆一位用戶的一條留言,講的是由 Fable 5 到 5.1 這個小版本之間的分別,不是任何一項測試跑出來的數字。

CursorBench 3.2.0 榜單:Fable 5.1 Max 以 73.4% 排第一

有數字可以看的是另一份榜。ChrisGPT 在 9 月 2 日凌晨貼出 CursorBench 3.2.0 的排名,測的是 AI 代理自動完成編程任務的表現,Fable 5.1 的最高檔次排第一,而排第三的 Grok 4.6 只差 2.6 個百分點,每項任務的花費卻是三分之一。

CursorBench 3.2.0 榜單
ChrisGPT 9 月 2 日凌晨貼出的 CursorBench 3.2.0 榜單截圖,首七位連花費、token 用量與步數一併列出

模型與檔次

得分

每項任務花費(美元)

Token 用量

步數

Fable 5.1 Max

73.4%

9.64

72,060

70

Fable 5.1 Extra High

72.8%

6.96

51,349

55

Grok 4.6 Extra High

70.8%

2.81

41,136

46

Fable 5 Max

70.5%

17.32

103,525

72

Opus 5 Max

70.0%

8.23

61,838

78

Grok 4.6 High

69.9%

2.34

32,449

39

Fable 5.1 High

69.4%

4.80

33,153

44

這張表最值得看的一行是第四行。上一代 Fable 5 的最高檔次要用 17.32 美元、103,525 個 token 才拿到 70.5%,新版同一檔次用 9.64 美元、72,060 個 token 拿到 73.4%。分數升了 2.9 個百分點,花費少了近四成半。Anthropic 官方對 Fable 5.1 的說法也是同一方向:一般用途大約便宜兩成半,需要長時間自動執行的任務因為 cache 讀取收費下調,最多可以便宜四成半。

「一個 prompt」不等於一按就有

Coin Bureau 那句「from a single prompt」在字面上沒有錯,ChrisGPT 自己也在影片下補了一句「One shot btw」。問題是這四個字在讀者腦中的畫面,和實際發生的事差很遠。

他在 9 月 2 日凌晨另一條貼文寫得相當直接:現時貼出 Fable 5.1 影片的人「都未做出值得貼的東西」,因為一個好的 prompt 要花「數以小時計」去寫,還要動用多個 subagent 分工,這種水平的 3js 畫面不可能一小時內做得出。他自己較早前那條預告也寫明,這批遊戲重現是「one shot,用了幾個小時」。

換句話說,one shot 說的是模型只出手一次、中間沒有人回頭修改,而不是「打幾隻字就有一個世界」。人的工夫沒有消失,只是全部搬到了按下 Enter 之前。成品是真的,一次生成也是真的,只是那一次出手之前的準備,不在影片裏面。

說法

實情

一個 prompt 生成完整開放世界

屬實,模型只出手一次,但那個 prompt 寫了數小時,並用上多個 subagent

Fable 5.1 在遊戲開發上強 10 至 20%

出自作者一條回覆留言的主觀判斷,非測試結果

生成過程很快

作者自稱整個 run 花了幾個小時

這件事真正的分水嶺在成本

Anthropic 在 9 月 1 日推出 Fable 5.1 與 Mythos 5.1,官方稱是「編程與知識工作上最先進」的模型。第三方跑分大致對得上:Vals Index 以 67.87% 排第一,LiveCodeBench 90.52% 排第一,Terminal-Bench 2.1 拿 85.02%,僅次於 GPT-5.6 Sol 的 85.77%;升幅最大的一項是 Terminal-Bench-Science,由上一代的 24.7 升至 52.6。

西部小鎮外的路軌與火車
小鎮外的路軌與一列蒸汽火車,同一段影片第 55 秒的畫面

不過真正改變玩法的不是榜首那一行,而是 Grok 4.6 那一行:差 2.6 個百分點,每項任務只需 2.81 美元。對一個要跑上百次迭代的獨立開發者來說,這個差價足以決定用哪一個。ChrisGPT 自己在 7 月試過用 Kimi K3 三次生成一個 CS:GO 加 Portal 的混合作品,API 花費 3.24 美元,同樣的 token 用 Fable 5 要 10.80 美元。做得出來已經不再是問題,做一次要多少錢才是。

來源

No comments yet

提交留言即表示你已閱讀我們的私隱政策