AI 玩《星海爭霸》:Brood War Bench 評測了什麼?
Brood War Bench 是由 Ben Swerdlow 開發的開源 AI 評測基準與工具(採用 Freestyle 虛擬機環境運作),旨在測試大型語言模型(LLM Agent)在經典即時戰略遊戲《星海爭霸:怒火燎原》(StarCraft: Brood War)中的實時決策與對戰能力。這項基準測量的不是一般的文字問答能力,而是模型能否在持續變動的戰場時間軸中,同時處理資源採集、建築生產、地圖偵察與多單位作戰。
評測結果與排行榜
在包含 19 個模型/推理設定組合的循環賽(Round-Robin Matrix)測試中,官方公布的勝率排行榜如下:
- 冠軍:Codex Astra / xhigh — 取得 100.0% 勝率(18 勝 0 敗),平均每場 APM 為 12.6,單場平均成本約 $10.54 美元。
- 亞軍:Codex Astra / medium — 取得 88.9% 勝率(16 勝 2 敗),APM 17.2。
- 季軍:Claude Fable — 取得 83.3% 勝率(15 勝 3 敗),APM 12.6。
- 其他模型表現:Claude Opus 5 勝率為 66.7%(12 勝 6 敗);Grok 4.6 在不同強度下勝率偏低(xhigh 為 11.1%、medium 為 5.6%、low 為 0.0%);Claude Haiku 則為 0% 勝率。
關鍵測試發現與能力邊界
官方報告指出,在這組測試中,沒有任何 AI Agent 的表現超過遊戲「初學者(Beginner level)」水準。報告也表示,初學者採用簡單的「光子砲快攻(Photon Rush)」即可擊敗這些測試中的模型。
詳細實戰現象包含:
- 騷擾(Cheese)優於營運(Macro):Codex 最成功的戰術是開局派遣探測機(Probe)騷擾敵方農民或建築。由於對手模型常花費數十秒「思考」如何應對探測機而導致行動癱瘓,這種騷擾戰術極為有效;但在長期的兵種科技推進與持續生產上,各模型的表現普遍薄弱。
- 多代理(Subagents)缺乏溝通:Codex 嘗試使用獨立的子代理分別管理經濟、生產與兵力控制,但子代理之間缺乏溝通,導致產出的單位往往單兵送死(Trickling units),無法組建大軍進行大規模協同進攻。
- 推理延遲陷阱:部分模型(如 Grok 4.6 / xhigh)陷入過度思考(Reasoning Stalls),在單場 43 分鐘的對戰中產生了 11,138 個思考 Token,卻僅下達 6 批指令,且未能生產任何戰鬥單位。
對開發者與 Agent 架構的啟示
作為一項評測工具而非模型本身,Brood War Bench 將 LLM 評測從靜態的「會不會回答」轉變為動態的「能否持續執行」。它適合用來觀察 AI Agent 在即時環境下的反應延遲、狀態記憶、資源調配以及工具調用(Tool Calls)的失誤,並比較不同子代理架構與推理預算對即時任務影響的差異。

