[论文解读] SAI: a Sensible Artificial Intelligence that plays with handicap and targets high scores in 9x9 Go (extended version)
本文提出 SAI(Sensible Artificial Intelligence),一种新颖的强化学习框架,可提升类似 AlphaGo 的智能体在 9×9 围棋中最大化终局得分的能力,而不仅限于提升胜率。通过将胜率建模为奖励分数的双参数 Sigmoid 函数,并采用具有中间位置分支的双价值头神经网络,SAI 实现了超人类水平的表现,能有效应对得分和位置性让子规则,并从严重劣势中恢复——经验证,即使在大幅减去目外(komi)的情况下,仍能击败职业棋手。
We develop a new model that can be applied to any perfect information two-player zero-sum game to target a high score, and thus a perfect play. We integrate this model into the Monte Carlo tree search-policy iteration learning pipeline introduced by Google DeepMind with AlphaGo. Training this model on 9x9 Go produces a superhuman Go player, thus proving that it is stable and robust. We show that this model can be used to effectively play with both positional and score handicap, and to minimize suboptimal moves. We develop a family of agents that can target high scores against any opponent, and recover from very severe disadvantage against weak opponents. To the best of our knowledge, these are the first effective achievements in this direction.
研究动机与目标
- 开发一种强化学习智能体,以在完美信息双人零和博弈中最大化终局得分,而非仅关注胜负结果。
- 解决现有类似 AlphaGo 的智能体因采用二元胜负奖励而导致的不稳定性和次优终局策略问题。
- 在不同技能水平下,实现训练与评估中的有效让子对弈(包括得分与位置性让子)。
- 使强智能体在对阵较弱对手时具备从严重劣势中恢复的能力。
- 通过人类职业棋手对弈验证该框架的鲁棒性与超人类强度。
提出的方法
- 将胜率建模为针对目标得分差的双参数 Sigmoid 函数,实现对终局得分的连续监督。
- 通过在神经网络中复制价值头,使其同时预测胜率与期望得分,从而改进 AlphaGo 强化学习流程。
- 在自我对弈训练中从中间棋位引入分支,以稳定基于得分目标的学习过程。
- 在训练中使用参数化的价值函数族,以泛化不同得分让子情况下的表现。
- 使用两块入门级 GPU 在 9×9 围棋上进行训练,结合大规模蒙特卡洛树搜索模拟。
- 通过自我对弈以及与弱网络和人类职业棋手的交叉评估,校准模型并验证性能。
实验结果
研究问题
- RQ1是否可以训练一个深度强化学习智能体,使其在不依赖人类知识或特定领域奖励设计的前提下,专注于最大化围棋终局得分,而非仅提升胜率?
- RQ2该智能体是否能有效应对得分与位置性让子规则,并在不同劣势程度下保持高水平表现?
- RQ3当对阵较弱对手时,该智能体是否展现出从严重劣势中恢复的能力,从而体现其战略深度与得分意识?
- RQ4即使在给予大幅减去目外(komi)或让子的情况下,该智能体是否仍能在真实对局中实现超人类水平表现,击败职业棋手?
- RQ5所提出的 SAI 框架是否具备稳定性与泛化能力,表现为在多次训练运行与多种评估设置下表现一致?
主要发现
- SAI 在 9×9 围棋中实现了超人类水平表现,即使在 13.5 目外惩罚下,仍击败了一位职业七段棋手,展现出高水平的战略与得分意识。
- 对阵职业棋手时,SAI 在五局中赢下四局,包括以 1.5 目(白方认输)和 3.5 目(白方认输)获胜,以及以黑方身份在 13.5 目外下以 1.5 分优势取胜。
- 在得分让子规则下,SAI 作为白方在最高达 6 分减益下对战弱网络(W1、W2)时胜率超过 70%,即使在 8 分减益下仍赢得 5.6% 的对局。
- 在位置性让子(H2)规则下,SAI 作为白方在获得 0.5 目外奖励时,对最弱网络(W3)的胜率为 16.4%,表明其能有效适应复杂让子规则。
- 该模型在多次训练运行中展现出稳定且鲁棒的学习能力,强弱网络间校准一致,性能指标方差极低。
- SAI 框架成功实现了从严重劣势中的恢复,即使在开局即处于 6 分得分劣势下仍能取胜,证实其具备战略深度与得分目标导向能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。