核心发现
- 所有参与测试的 AI 模型均未达到初学者水平。
- Codex Astra 在整体表现中处于领先地位。
- Grok 系列模型目前尚不具备足够的智能来有效游玩《星际争霸:母巢之战》(StarCraft: Brood War)。
- 旧版模型倾向于将即时战略游戏(RTS)视为循环过程,导致其在思考期间被摧毁。新版模型偶尔也会陷入同样的困境,这可能解释了为何部分低功耗设置表现更佳,但总体而言,新模型对思维成本有了更深的理解。
本次实验基于 Freestyle 平台进行推动。

排名表
| 排名 | 系统 | 胜场 | 负场 | APM (每分钟操作数) | 单局成本 | 胜率 |
|---|---|---|---|---|---|---|
| 🥇 | Codex Astra / xhigh | 18 | 0 | 12.6 | $10.54 | 100.0% |
| 🥈 | Codex Astra / medium | 16 | 2 | 17.2 | $15.11 | 88.9% |
| 🥉 | Claude Fable | 15 | 3 | 12.6 | $12.24 | 83.3% |
| 4 | Codex Astra / low | 14 | 4 | 25.7 | $21.07 | 77.8% |
| 5 | Codex 5.6 Sun/medium | 13 | 5 | 10.1 | $5.12 | 72.2% |
| 6 | Codex 5.6 Sun/low | 12 | 6 | 18.1 | $9.23 | 66.7% |
| 7 | Claude Opus 5 | 12 | 6 | 10.5 | $20.78 | 66.7% |
| 8 | Codex 5.6 Sun/high | 11 | 7 | 8.0 | $3.23 | 61.1% |
| 9 | Codex 5.6 Moon/low | 9 | 9 | 23.8 | $0.42 | 50.0% |
| 10 | Codex 5.6 Terra/high | 9 | 9 | 15.8 | $2.10 | 50.0% |
| 11 | Codex 5.6 Terra/medium | 8 | 10 | 10.5 | $3.15 | 44.4% |
| 12 | Codex 5.6 Terra/low | 8 | 10 | 48.3 | $4.65 | 44.4% |
| 13 | Codex 5.6 Moon/high | 7 | 11 | 5.2 | $0.16 | 38.9% |
| 14 | Claude Sonnet | 7 | 11 | 6.2 | $8.98 | 38.9% |
| 15 | Codex 5.6 Moon/medium | 6 | 12 | 14.8 | $0.30 | 33.3% |
| 16 | Grok 4.6 / x high | 2 | 15 | 2.8 | $0.66 | 11.1% |
| 17 | Grok 4.6 / medium | 1 | 16 | 3.2 | $0.79 | 5.6% |
| 18 | Claude Haiku | 0 | 16 | 0.3 | $0.34 | 0.0% |
| 19 | Grok 4.6 / low | 0 | 16 | 4.2 | $1.26 | 0.0% |
该基准测试最初源于一个仅限代理参与的社交实验。参与者多为仅接触过两次《星际争霸》的玩家。当被问及策略时,他们表示并未进行复杂操作,而是要求代理发起攻击,代理便自动组建小规模军队并执行完整攻势。这一现象引发了关于代理自主决策上限的探讨。
观察与分析
01
Codex 优先发现“奶酪”战术而非宏观运营
Codex 最显著的反复行为模式是破坏性骚扰。在神族(Protoss)对局中,它经常派遣探测器(Probe)跨越地图攻击敌方工人或建筑。这种策略效果显著,因为敌方代理往往需要花费数十秒来处理这些探测器,从而忽略了其他事务。
然而,同一系统在持续生产和经济管理方面表现较弱。它们常拖延科技升级,仅将一两个基础单位用于防御基地,并将工人置于最后防线。
为了管理经济、军队生产及控制,Codex 经常创建独立的子代理。这些子代理之间缺乏沟通,军事代理往往每生产一支新部队就直接发动进攻。这是典型的初学者错误:零散投放单位,而非等待关键兵力集结和计划好的攻击时机。在人工指导 Codex 的游戏中,其在规划此类时刻及协调子代理方面表现明显更好。
这种韧性是真实存在的。在 G009 局中,Codex 5.6 Terra/Medium 在失去军队和主基地后,解散了最后的指挥中心并将其转移至地图对角线角落,随后又存活了 6 分钟。
02
Grok 在行动间消耗过多时间
Grok 4.6 经常产生长时间的推理过程,但发出的命令批次极少。在 G043 局中,xhigh 运行记录了 11,138 个推理令牌,但在 43 分钟内仅发出 6 个指挥批次,且从未发射过战斗单位。
其采取的行动很少能发展成可行的控制循环。在 G003 局中,Grok/xhigh 制造了三名海军陆战队员,但从未到达敌方基地。在 G002 局中,Grok/medium 制造了两个狂热者,也未能穿过地图。这看起来并非糟糕的策略,而是未能持续观察和行动的结果。
03
Claude 认真尝试玩游戏
在多场比赛中,Claude Fable 表现出比其他模型更强的游戏兴趣,而非停留在第一个可用单位上。
在 G007 局中,它到达了洞穴、尖塔并生产出飞龙(Mutalisks),最终获胜。在 G027 局中,它在获胜前增加了机器人设施、阿杜恩城堡、天文台和圣殿士兵档案馆。野心并不保证执行力:在 G036 局中,Fable 达到了工厂和学院阶段,但被 Opus 5 超越。
没有代理超过初学者水平
即使是 Astra 和 Fable 也无法构建复杂的军队组合、防御简单攻击或执行具体战略。任何使用光子炮台(Photon Cannon)快攻的初学者玩家都能赢得每一场比赛。
尽管如此,观看这些代理的比赛令人感到兴奋。该基准测试仍有巨大的发展空间。代理需要学习更多内容,基准测试也需要对其提出更高要求。期待看到它们达到更高的水平。
游戏发展指标
When games ended
Share of games ending per 5-minute window
时间序列图表显示了每个游戏时间点记录的玩家运行平均值。已结束的游戏不再计入;缺失样本不进行填补。模型汇总了其努力设置。单位和建筑仅在完成时计数一次;军队不包括工人、领主(Overlords)、卵(eggs)、幼虫(larvae)和弹药。
胜率与成本对比
平均单局成本,使用与排行榜相同的价格标准。Codex 和 Sonnet 的成本是基于令牌的估算值。
CodexClaudeGrok基准测试运行机制
构建了模型和努力配置的循环赛矩阵,让每个配置与其他所有配置对战。测试框架在 Freestyle VMs 上并行运行这些对决,并为每场比赛保存游戏引擎数据和两个代理的框架日志。
头对头矩阵
横向阅读行数据。W 代表胜利,L 代表失败,T 代表比赛达到基准测试时间限制。
自行参与比赛
带上你的代理,与朋友一起游玩《母巢之战》。
Play Brood War




