
2025年7月军棋史上头衔最多的选手Pim Niemeijer输给了一台机器。比分是15胜4平1负AI以85%的有效胜率碾过这位四届世界冠军。更反常的是成本整个训练只花了几千美元不是百万美元。这个系统叫Ataraxos论文于2025年11月挂上arXiv编号2511.07312。作者来自卡耐基梅隆、纽约大学、斯坦福和MIT领头的是Samuel Sokota。2026年10月HN首页挂出两百多分的讨论帖链接直指这篇工作的Nature版本。军棋在西方叫Stratego是一种带隐藏军衔的双人战棋。吃掉对方的军旗即获胜但你不知道对面哪枚棋子是军旗。炸弹、工兵、司令、间谍各有克制关系间谍能杀司令却死于任何棋子。它不只是一个棋类新闻而是不完美信息决策范式的一次成本雪崩。这篇文章拆解Ataraxos做对了什么以及几千美元到底买到了什么。军棋为什么是最难啃的经典博弈军棋的每方四十枚棋子身份全程保密只有发生战斗时才短暂亮明。开局布阵的可能组合超过10的33次方这个量级决定了一切。作为对比德州扑克的底牌组合只有1326种可以显式枚举。围棋和国际象棋则是完全信息棋盘上没有对手看不见的东西。扑克里成熟的子博弈求解技术其成本随隐藏信息量增长而爆炸。到了军棋这个量级那套方法从数学上就失去了可操作性。军棋还有两格规则和连续追击规则用来禁止无限循环的磨棋。这些规则让模拟器的状态转移逻辑比普通棋类繁琐得多。DeepMind的DeepNash曾在2022年打到人类专家水平被视为突破。它用无模型的正则化纳什动力学自对弈避开了显式搜索。但DeepNash对顶级选手的胜率并不压倒且训练算力以百万美元计。军棋因此成了一个尴尬的存在砸钱最多的经典博弈却没被打穿。在不完美信息下一步棋的价值还取决于你过去会怎么走。因为对手的信念由你全部历史行为共同塑造决策之间互相纠缠。你这一步的走法会更新对手对全盘棋子身份的后验猜测。同一时刻的多个反事实分支彼此拉扯跨时间的依赖更加复杂。这正是强化学习在不完美信息下容易震荡、循环乃至发散的根源。论文用一张依赖图展示了这种纠缠一个决策频率的改变会改变另一个决策的边际价值。方向还不固定可能增强也可能削弱全看信念结构。核心创新动态阻尼的自对弈Ataraxos的答案是让三个量协同调度正则强度、更新步长、策略强度。策略还弱的时候用强正则配合大胆的更新快速推进。策略变强之后把正则和更新同时收小避免破坏已有成果。作者把这套机制称为动态阻尼专门压制不完美信息的学习混沌。更新步长与正则强度匹配能把循环发散的训练动力学拉回稳定。两者再随策略强度退火早期快速进步后期持续精进不停摆。这避免了两个极端步长小到进步不动或正则大到压垮策略。得益于这个改进算子Ataraxos可以直接消费近端策略数据训练。过去处理不完美信息常用的轨迹重要性重加权、策略平均都被省掉了。省去这些重型机制本身就是训练成本雪崩的第一块基石。近端数据意味着策略永远在学习自己当下的棋风信号最干净。正则项的设计很克制布阵网络加一个最大熵项保持多样性。走子网络则对均匀随机策略施加短视的反向KL惩罚。所谓短视指只约束当前一步的动作分布不向前递推。两组正则系数各自按幂律曲线随训练进程退火衰减。团队把正则比作能量储备退火太慢会让棋力发育不足。退火太快则前期猛涨后熵崩塌策略失去可塑性还容易被针对。论文的训练曲线显示布阵与走子的熵被平缓地护送下行。全程没有出现熵的突然塌缩这正是阻尼生效的直接证据。更新尺寸则由四重机制共同把守彼此互补。它们是对数采策略的反向KL、重要性比率裁剪、梯度范数裁剪和学习率。走子网络的学习率按幂律调度论文称这对防平台期至关重要。四个机制单独看都不新鲜组合起来第一次覆盖了不完美信息。两个Transformer各司其职军棋的两个阶段被拆成两个相互依赖的自对弈进程。秘密布阵阶段由一个进程管交替走子阶段由另一个进程管。布阵网络决定走子网络的初始棋盘走子结果回灌给两者更新。分开训练避开了架构和超参数上的折衷各用各的最优配置。布阵网络是decoder-only结构按行优先顺序自回归地摆完四十子。单次前反向传播就能在整个布阵上训练效率天然占优。它对每个布阵前缀同时输出胜负平概率、条件熵和落子分布。条件熵头专门用来监控布阵多样性防止布阵策略过早僵化。走子网络是encoder-only结构为每个可走格子和目标格子打分。动作概率用key-query矩阵乘来参数化比朴素参数化学得更快。key对应出发格子query对应目标格子点积给出走法logits。走子网络的尺寸在样本效率和迭代速度之间做了刻意平衡。网络太小样本效率好但棋力天花板低太大则迭代缓慢。输入token附带学习到的绝对位置编码棋盘几何被显式注入。数据生成的两个反直觉选择AlphaGo一脉的做法是用搜索产数据Ataraxos偏偏不用。它直接从策略网络采样对局把搜索全部留到测试时。原因是军棋的布阵分布需要大支撑集对局数量比单局质量更要紧。每一对布阵组合都对应不同的后验分布必须靠局数覆盖。团队试过搜索产数据拖慢的数据流抵消了质量收益。走子数据用两套不同λ的λ-returns估计优势和累积量。然后只保留估计优势绝对值大的样本参与训练。这个过滤把每轮迭代的墙钟时间压缩了约2.5倍。意外的是过滤后样本效率和最终棋力不降反升值得后续研究。一个合理解释是小优势样本多为噪声过滤相当于在线去噪。布阵侧则用蒙特卡洛回报做优势估计不做任何过滤。MC回报在RL里通常方差太大但布阵是单步决策的bandit结构。同样的现象在大语言模型推理训练里也被观察到两者结构同构。这两个选择合起来把数据管线的吞吐优先级提到了最高。测试时搜索把一次RL更新当搜索用此前的工作认为军棋这种隐藏信息量下做测试时搜索不现实。Ataraxos把它简化成一件事每步棋前多做一次阻尼RL更新。支撑这个简化的是一个专门训练的信念网络。它用encoder消化已知信息用decoder按行优先解码隐藏棋子类型。训练目标是最大化最终自对弈策略轨迹上隐藏棋子的对数似然。信念网络上加了dropout专门泛化到风格迥异的人类对手局面。没有这一步信念网络会过拟合到自对弈分布遇到人类就失真。每步棋前系统从信念网络采样一批可能的完整世界状态。对每个候选走法从这些状态出发做深度受限的模拟推演。推演双方都由走子网络扮演末端局面用价值网络打分取平均。因为信念近似自对弈后验、推演由自对弈策略执行均值近似动作价值。这个性质与对手是谁无关对人类选手同样成立。拿到动作价值后策略用一步表格化的magnetic mirror descent完成更新。更新仍由训练时那两个反向KL散度做正则和步长控制。测试时更新可以比训练时激进因为表格式更新不会波及其他局面。更准的优势估计也允许更激进的更新两个自由度同时放大。核心用法压缩后如下对每个候选走法 a 从信念网络采样 K 个可能世界状态 以 a 开局做深度受限 rollout双方由策略网络自演 用价值网络给末端局面打分跨状态取平均得 Q(a) 用 magnetic mirror descent 更新表格策略 π(a) ∝ π(a) · exp(Q(a) / η) η 由两条反向 KL 约束自动定 从更新后的 π 采样落子评测配置是40层深度、每次1000条推演单张H100运行。折算下来平均每步只用1.26秒比人类选手的落子节奏还快。论文还给出扫描曲线推演越深条数越多棋力越高时间线性上涨。工程底座GPU上零检索的模拟器学术预算要撑起这个计划先要一个足够快的军棋模拟器。团队用CUDA C写了一个GPU加速模拟器。它在单张H100上能稳定吞吐约每秒一千万次状态更新。更关键的设计是把回放缓冲直接集成进GPU模拟器内部。轨迹在显存里生成、用紧凑表示存储、需要时在显存里重建。传统做法的回放池挂在CPU内存每次取数都要跨总线搬运。对现代加速器来说现场重算大张量比从CPU取回旧张量更快。这套零检索思路同样服务于搜索信念样本在GPU上直接物化。主机与设备之间的通信被压缩到接近零管线没有搬运瓶颈。模拟器的设计取舍压缩后如下传统管线GPU 模拟 → 传轨迹到 CPU 回放池 → 训练时取回 AtaraxosGPU 模拟 → 紧凑表示留在显存 → 训练时显存内重建 搜索管线信念网络采样 → GPU 直接物化状态 → 原地 rollout 配套bfloat16 训练提速约 3 倍EMA 参数降低调参方差bfloat16数据格式让自对弈迭代提速约三倍且不伤性能。参数的指数滑动平均更快达到指示性棋力短跑调参更可靠。最终训练在2025年5月底启动用PyTorch分布式数据并行。布阵和走子网络用16张H100训了一周。信念网络随后用4张H100训了四天。按云算力市价折算整笔开销落在几千美元量级。其中大头是模拟器带来的数据吞吐网络本身并不大。这个算力规模在今天的学术实验室里已经完全可及。评测设计本身就值得读对手Pim Niemeijer的履历包括四次世界冠军和十五次荷兰全国冠军。他还有两次线上世界冠军累计六百多周排名世界第一。自1997年以来全勤世锦赛的老将评价他是史上最强没有之一。评测打满二十局平局按半胜计入有效胜率。局数多是为了压方差也给人类足够机会找AI的策略破绽。军棋的随机性让弱手对强手的偷胜率远高于围棋局数必须够多。三周打完是为了防疲劳并留出局间战术准备时间。Pim拿到1000美元出场费每赢一局加100每平一局加50。奖金与成绩挂钩是为了让人类选手的激励与真实对抗对齐。最关键的不对称条款是AI全程冻结人类可以逐局适应。三届世界冠军Vincent de Boer认为这等于让了AI一个大让子。结果是15胜4平1负顶级对决史上从未出现过这种分差。三届世锦赛亚军解释过顶级圈的分差本该薄如刀刃。因为顶级对局必须承担风险风险天然会压缩胜率差距。若把各局当作独立同分布胜率优势的p值小于0.00026。论文还附了财富比率分析用虚拟投注市场刻画优势的统计强度。用Elo衡量军棋棋力有缺陷随机化会压缩强弱之间的分差。2025年8月的世锦赛现场观众还能排队挑战Ataraxos。四十局表演赛交出38胜2负有效胜率95%。面对五花八门的业余风格信念网络的dropout泛化经受住了考验。两场评测的核心数字汇总如下评测场景局数胜平负有效胜率对Pim Niemeijer正式评测20154185%世锦赛现场观众挑战40380295%学习到的布阵也被公开分析风格与人类棋手的主流定势明显不同。和DeepNash的真正差距在哪DeepNash在2022年达到人类专家水平已是当时的顶峰。但它对顶级人类没有压倒性优势训练成本又是工业级的。Ataraxos把性能和成本两个轴同时推进了一个数量级。两个系统的关键差异对照如下维度DeepNash2022Ataraxos2025对人类最高水平专家级未压倒85%有效胜率碾压训练成本量级百万美元级算力几千美元测试时搜索事实上放弃信念采样加阻尼更新数据生成无模型自对弈策略直采加优势过滤核心稳定机制正则化纳什动力学正则与步长随强度退火差距的本质不是更大的模型而是训练动力学的可调度性。动态阻尼让近端策略优化第一次在大隐藏信息下稳定收敛。测试时搜索又把每步决策变成一次受控的小型策略改进。训练和测试共用同一套阻尼机制理论上也更干净。论文专门用一节和DeepNash对账把成本口径对齐到云端租价。这套方法的边界与去向Ataraxos的方法论全部建立在有快速准确模拟器的前提上。军棋恰好可以被CUDA模拟器每秒推演千万次现实问题未必。信念网络假设对手接近自对弈分布dropout只是缓解而非根治。熵退火的幂律参数目前仍依赖经验理论刻画还没有完成。优势过滤为何同时提升效率和上限论文坦承需要更多研究。作者在附录里列出改进空间学习侧和搜索侧都还有余量。搜索侧可以增加推演深度和采样数学习侧可以放大网络。但方向已经足够清晰RL加搜索的配方穿透了隐藏信息壁垒。金融交易、谈判、安全对抗都共享这种大量隐藏信息的结构。只要能为这些领域造出快而准的模拟器超人类决策就不再昂贵。军棋曾是砸钱也打不穿的例外如今它成了成本雪崩的证据。几千美元击败史上最强选手这句话本身就是范式转移的注脚。下一个被重写的成本曲线可能就轮到你所在的领域。