在硅谷程序员聚集的Hacker News上,一份名为Brood War Bench的榜单突然爆火。这份榜单聚焦AI在经典即时战略游戏《星际争霸:母巢之战》中的表现,结果令人大跌眼镜:最聪明的AI竟被自己的“过度思考”拖垮,连人类新手都打不过。
榜单中,GPT-6 Astra以18战全胜的战绩登顶,而Grok 4.6却在最高推理档位下苦思冥想43分钟,连一个作战单位都没造出来,最终以2胜15负的惨淡成绩垫底。更讽刺的是,Grok的“国库”里躺着巨额存款,却因“思考”太久而“挂机等死”。评论区有人一针见血:“它们不是玩不了,只是需要太多时间。你要是在模型思考时暂停游戏,它就能玩。”
这场AI大乱斗的起因颇具戏剧性。开发者Ben最初只是做了个全靠AI操作的星际版本,拉朋友一起玩时发现:人类只需喊一句“进攻”,造兵、集结、开打全交给AI,竟能轻松击败老玩家。这让他好奇:如果人类彻底闭嘴,让AI自己玩,它们能活多久?于是,GPT、Claude、Grok三大家族的19名AI选手登场,在Freestyle云端虚拟机上展开171局对决。比赛规则残酷:没有回合制,只有实时战场,AI思考的每一秒,对手都在疯狂挖矿、爆兵、进攻。
老一代模型沿用回合制思维,结果“脑子还在转,家已被推平”。Grok是典型代表:在编号G043的对局中,它疯狂输出战略推理,43分钟仅发出6批指令,平均7分钟才动一次手。最终,它造出的兵要么没走到敌方基地,要么被对手轻松消灭。数据曲线显示:比赛打到11分半,Astra已兵强马壮,而Grok场上平均只有不到7个农民和几个兵。
与Grok的“拖延症”形成鲜明对比的是Astra的“骚扰战术”。它常派一个采矿农民横穿地图到敌人家溜达,看似无害,却能让对手陷入几十秒的疯狂计算,基地彻底停摆。这种“降维打击”让对手直接宕机。不过,Astra也有弱点:内部像“草台班子”,经济、造兵、打仗各干各的,新兵刚造出来就被拉去前线“白给”。但只要开发者亲自下场当总指挥,Astra立刻懂得攒兵、挑时机。
另一款模型Fable则像“老实学生”:老老实实搞经济,踏踏实实发展科技树,很少投机取巧。有一局,它憋出了飞龙;另一局,它盖齐了神族高级建筑,连圣堂档案馆都造好了。然而,好学生未必能拿第一。Fable虽以83.3%的胜率排在第三,却因节奏太慢(对局时长中位数10分37秒)被Astra(8分10秒)甩在身后。有一局,它科技摆满一桌子,还没转化成战斗力就被Claude Opus 5乱拳打死。
榜单还暴露了一个反直觉现象:想得越久,不一定打得越好。GPT-5.6 Sol开到最高推理档时胜率垫底,还不如medium档;而Astra却“想得越深赢面越大”,最高档直接拿下100%胜率。更有趣的是成本:Astra开最高档时,每分钟仅操作12.6次,平均一局花10.54美元;换成最低档,操作频率翻倍,一局却要烧掉21.07美元。这说明新一代模型已懂得“思考需要成本”,也知道何时该停下脑子去动手。
有人质疑:7年前DeepMind的AlphaStar不是早就击败过职业选手了吗?为何今天这些AI连新手都打不过?关键在于“专才”与“通才”的区别。AlphaStar是“应试机器”:靠吃海量录像和自我对战堆出来的星际特长生,这辈子只学了这一件事;而今天的大模型是“通才”,没有任何星际基础,全靠临场读题、调用工具、现学现卖,每一步都得先想完才能出手。专才打败职业选手不稀奇,通才想要跨界通关,还需更多时间。
这场测试也暴露了AI走向自主行动时的致命短板:烧掉更多思考token,未必换来更强的智能体。下一阶段的Agent之争,比的可能不再是谁想得更深,而是谁能在有限时间内,把观察、决策、执行连成一个不停转动的闭环。星际里的翻车,或许正是AI进入真实世界前的一次预演。












