Skip to main content
QUICK REVIEW

[论文解读] Transfer of Fully Convolutional Policy-Value Networks Between Games and Game Variants

Dennis J. N. J. Soemers, Vegard Mella|arXiv (Cornell University)|Feb 24, 2021
Artificial Intelligence in Games参考文献 29被引用 5
一句话总结

本文提出了一种跨多种桌游及其变体的全卷积策略-价值网络迁移学习框架,利用Ludii的一致张量表示实现。通过利用不同游戏中通道级特征的共享语义,实现了有效的零样本迁移与微调,即使在棋盘尺寸、形状和规则不同的情况下也能取得优异性能,关键迁移场景中的胜率超过90%。

ABSTRACT

In this paper, we use fully convolutional architectures in AlphaZero-like self-play training setups to facilitate transfer between variants of board games as well as distinct games. We explore how to transfer trained parameters of these architectures based on shared semantics of channels in the state and action representations of the Ludii general game system. We use Ludii's large library of games and game variants for extensive transfer learning evaluations, in zero-shot transfer experiments as well as experiments with additional fine-tuning time.

研究动机与目标

  • 在具有不同棋盘尺寸、形状和规则的多种桌游及其变体之间实现有效的迁移学习。
  • 解决在最小架构修改或重新训练的前提下,将策略与价值函数在不同游戏间迁移的挑战。
  • 利用Ludii的与游戏无关的张量表示,识别状态与动作表征中的共享语义通道。
  • 在广泛的棋类及其变体上评估迁移性能,包括零样本与微调设置。
  • 将Ludii的游戏库确立为游戏AI中迁移学习的新基准。

提出的方法

  • 使用来自Polygames框架的全卷积神经网络并结合全局池化,以在迁移过程中处理可变的空间维度。
  • 采用Ludii的一致性、与游戏无关的张量表示来表示状态与动作,通过共享通道语义实现在不同游戏间的特征对齐。
  • 通过映射不同游戏间等价的语义通道(例如,玩家棋子、控制区域)来迁移预训练的策略-价值网络权重。
  • 通过直接在具有对齐通道语义的游戏间迁移权重实现零样本迁移,随后通过微调适应目标领域的动态特性。
  • 在微调实验中调整隐藏层通道数,以确保架构兼容性,同时保持可迁移性。
  • 采用自我对弈结合蒙特卡洛树搜索(MCTS)以及对MCTS轨迹进行监督学习的方式,训练并评估策略-价值网络。

实验结果

研究问题

  • RQ1全卷积策略-价值网络是否能有效迁移至具有不同棋盘尺寸、形状和规则集的独立桌游之间?
  • RQ2当Ludii张量格式中游戏的通道表示具有语义对齐时,零样本迁移的成功程度如何?
  • RQ3微调在存在架构或语义不匹配的游戏之间如何提升迁移性能?
  • RQ4状态与动作表征中共享的语义通道在实现跨游戏迁移中起到何种作用?
  • RQ5Ludii庞大的游戏库能否作为游戏AI中迁移学习的可扩展基准?

主要发现

  • 在从Hasami Shogi向Shogi迁移时,零样本迁移在Shogi中取得了89.00%的胜率,表明在不同游戏中具有强大的泛化能力。
  • 微调后,从LineSize5Square向Yavalath迁移的胜率为70.00%,表明能有效适应新的游戏机制。
  • 在Shogi变体之间的迁移中,微调后胜率最高达到86.67%(Minishogi到Shogi),表明在棋子数量和棋盘尺寸变化下仍具鲁棒性。
  • 在Hex变体中,从$11 \times 11$对角线Hex向$13 \times 13$标准Hex迁移,微调后胜率达到97.33%,凸显在对称游戏中强大的可迁移性。
  • 即使在通道数调整的情况下,从Connect6到Gomoku等线性连接类游戏的迁移在微调设置下也达到了93.00%的胜率,证明在架构约束下依然有效。
  • 在最具挑战性的案例中——从$19 \times 19$ Hex misère向$13 \times 13$标准Hex迁移,微调后胜率高达99.33%,表明在复杂且对称的领域中具有极高的可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。