AI模型挑战星际争霸:Codex Astra领先,均未达初学者水平

多款AI模型挑战《星际争霸》,均未达初学者水平。Codex Astra以100%胜率领跑,Grok系列因智能不足垫底。旧版模型易陷入循环操作被摧毁,新版虽理解思维成本,但整体表现仍有限。

核心发现

  • 所有参与测试的 AI 模型均未达到初学者水平。
  • Codex Astra 在整体表现中处于领先地位。
  • Grok 系列模型目前尚不具备足够的智能来有效游玩《星际争霸:母巢之战》(StarCraft: Brood War)。
  • 旧版模型倾向于将即时战略游戏(RTS)视为循环过程,导致其在思考期间被摧毁。新版模型偶尔也会陷入同样的困境,这可能解释了为何部分低功耗设置表现更佳,但总体而言,新模型对思维成本有了更深的理解。

本次实验基于 Freestyle 平台进行推动。

Codex Astra胜率达100%

排名表

排名系统胜场负场APM (每分钟操作数)单局成本胜率
🥇Codex Astra / xhigh18012.6$10.54100.0%
🥈Codex Astra / medium16217.2$15.1188.9%
🥉Claude Fable15312.6$12.2483.3%
4Codex Astra / low14425.7$21.0777.8%
5Codex 5.6 Sun/medium13510.1$5.1272.2%
6Codex 5.6 Sun/low12618.1$9.2366.7%
7Claude Opus 512610.5$20.7866.7%
8Codex 5.6 Sun/high1178.0$3.2361.1%
9Codex 5.6 Moon/low9923.8$0.4250.0%
10Codex 5.6 Terra/high9915.8$2.1050.0%
11Codex 5.6 Terra/medium81010.5$3.1544.4%
12Codex 5.6 Terra/low81048.3$4.6544.4%
13Codex 5.6 Moon/high7115.2$0.1638.9%
14Claude Sonnet7116.2$8.9838.9%
15Codex 5.6 Moon/medium61214.8$0.3033.3%
16Grok 4.6 / x high2152.8$0.6611.1%
17Grok 4.6 / medium1163.2$0.795.6%
18Claude Haiku0160.3$0.340.0%
19Grok 4.6 / low0164.2$1.260.0%

该基准测试最初源于一个仅限代理参与的社交实验。参与者多为仅接触过两次《星际争霸》的玩家。当被问及策略时,他们表示并未进行复杂操作,而是要求代理发起攻击,代理便自动组建小规模军队并执行完整攻势。这一现象引发了关于代理自主决策上限的探讨。

观察与分析

01

Codex 优先发现“奶酪”战术而非宏观运营

Codex 最显著的反复行为模式是破坏性骚扰。在神族(Protoss)对局中,它经常派遣探测器(Probe)跨越地图攻击敌方工人或建筑。这种策略效果显著,因为敌方代理往往需要花费数十秒来处理这些探测器,从而忽略了其他事务。

然而,同一系统在持续生产和经济管理方面表现较弱。它们常拖延科技升级,仅将一两个基础单位用于防御基地,并将工人置于最后防线。

为了管理经济、军队生产及控制,Codex 经常创建独立的子代理。这些子代理之间缺乏沟通,军事代理往往每生产一支新部队就直接发动进攻。这是典型的初学者错误:零散投放单位,而非等待关键兵力集结和计划好的攻击时机。在人工指导 Codex 的游戏中,其在规划此类时刻及协调子代理方面表现明显更好。

这种韧性是真实存在的。在 G009 局中,Codex 5.6 Terra/Medium 在失去军队和主基地后,解散了最后的指挥中心并将其转移至地图对角线角落,随后又存活了 6 分钟。

六个探测器穿越地图
首先是探测器,然后是狂热者。
最后一个指挥中心撤退

02

Grok 在行动间消耗过多时间

Grok 4.6 经常产生长时间的推理过程,但发出的命令批次极少。在 G043 局中,xhigh 运行记录了 11,138 个推理令牌,但在 43 分钟内仅发出 6 个指挥批次,且从未发射过战斗单位。

其采取的行动很少能发展成可行的控制循环。在 G003 局中,Grok/xhigh 制造了三名海军陆战队员,但从未到达敌方基地。在 G002 局中,Grok/medium 制造了两个狂热者,也未能穿过地图。这看起来并非糟糕的策略,而是未能持续观察和行动的结果。

四十三分钟,无军队

03

Claude 认真尝试玩游戏

在多场比赛中,Claude Fable 表现出比其他模型更强的游戏兴趣,而非停留在第一个可用单位上。

在 G007 局中,它到达了洞穴、尖塔并生产出飞龙(Mutalisks),最终获胜。在 G027 局中,它在获胜前增加了机器人设施、阿杜恩城堡、天文台和圣殿士兵档案馆。野心并不保证执行力:在 G036 局中,Fable 达到了工厂和学院阶段,但被 Opus 5 超越。

Fable 生产出飞龙
Fable 不断升级
建设未转化为军队

没有代理超过初学者水平

即使是 Astra 和 Fable 也无法构建复杂的军队组合、防御简单攻击或执行具体战略。任何使用光子炮台(Photon Cannon)快攻的初学者玩家都能赢得每一场比赛。

尽管如此,观看这些代理的比赛令人感到兴奋。该基准测试仍有巨大的发展空间。代理需要学习更多内容,基准测试也需要对其提出更高要求。期待看到它们达到更高的水平。

游戏发展指标

技术投资完成的研究+升级等级
Codex Astra0.3Claude Fable0.2Grok 4.60
工人完成的工人存活数
Codex Astra14.7Claude Fable16.7Grok 4.67.4
军队规模完整的军队和支持单位
Codex Astra8.3Claude Fable7.6Grok 4.62
建筑物已建成的建筑物,包括附加建筑物
Codex Astra6.2Claude Fable7.4Grok 4.64.5
银行中的矿产未花费的矿产,而不是收入
Codex Astra240.6Claude Fable248.6Grok 4.6536.6
银行中的天然气未使用的天然气,而不是收入
Codex Astra151Claude Fable326.9Grok 4.6244.5
使用的供应包括正在进行的生产
Codex Astra26.5Claude Fable26.6Grok 4.611.3

When games ended

Share of games ending per 5-minute window

时间序列图表显示了每个游戏时间点记录的玩家运行平均值。已结束的游戏不再计入;缺失样本不进行填补。模型汇总了其努力设置。单位和建筑仅在完成时计数一次;军队不包括工人、领主(Overlords)、卵(eggs)、幼虫(larvae)和弹药。

胜率与成本对比

平均单局成本,使用与排行榜相同的价格标准。Codex 和 Sonnet 的成本是基于令牌的估算值。

CodexClaudeGrok

基准测试运行机制

构建了模型和努力配置的循环赛矩阵,让每个配置与其他所有配置对战。测试框架在 Freestyle VMs 上并行运行这些对决,并为每场比赛保存游戏引擎数据和两个代理的框架日志。

头对头矩阵

横向阅读行数据。W 代表胜利,L 代表失败,T 代表比赛达到基准测试时间限制。

自行参与比赛

带上你的代理,与朋友一起游玩《母巢之战》。

Play Brood War

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读