Skip to main content
QUICK REVIEW

[论文解读] Multi-Labelled Value Networks for Computer Go

Ti-Rong Wu, I‐Chen Wu|arXiv (Cornell University)|May 30, 2017
Artificial Intelligence in Games参考文献 25被引用 5
一句话总结

本文提出一种用于计算机围棋的多标签(ML)价值网络,通过同时训练多种先手补偿值(komi),实现动态 komi 调整并降低均方误差(MSE)。该 ML 价值网络提升了策略表现,对标准价值网络基线实现 67.6% 的胜率,并实现了此前基于价值网络系统无法达成的强水平段位对局。

ABSTRACT

This paper proposes a new approach to a novel value network architecture for the game Go, called a multi-labelled (ML) value network. In the ML value network, different values (win rates) are trained simultaneously for different settings of komi, a compensation given to balance the initiative of playing first. The ML value network has three advantages, (a) it outputs values for different komi, (b) it supports dynamic komi, and (c) it lowers the mean squared error (MSE). This paper also proposes a new dynamic komi method to improve game-playing strength. This paper also performs experiments to demonstrate the merits of the architecture. First, the MSE of the ML value network is generally lower than the value network alone. Second, the program based on the ML value network wins by a rate of 67.6% against the program based on the value network alone. Third, the program with the proposed dynamic komi method significantly improves the playing strength over the baseline that does not use dynamic komi, especially for handicap games. To our knowledge, up to date, no handicap games have been played openly by programs using value networks. This paper provides these programs with a useful approach to playing handicap games.

研究动机与目标

  • 解决单一定值 komi 价值网络在对局过程中难以实现动态 komi 调整的局限性。
  • 通过同时训练多种 komi 设定,降低价值网络预测的均方误差(MSE)。
  • 使计算机围棋程序能够实现高水平段位对局,这是此前基于价值网络的系统未能达成的能力。
  • 通过新颖的动态 komi 机制提升整体对弈水平。

提出的方法

  • ML 价值网络通过单次前向传播输出多个 komi 值的胜率,采用共享主干网络与多个输出头的结构。
  • 每个输出头对应不同的 komi 设定,使网络在自对弈与评估过程中能跨 komi 值进行泛化。
  • 网络架构采用共享的卷积特征提取器,后接多个全连接输出头以对应不同 komi 值。
  • 采用多标签训练目标,同时最小化所有 komi 设定下的 MSE,提升泛化能力并降低误差。
  • 提出一种新的动态 komi 方法,根据网络预测在对局过程中调整 komi,增强适应性。
  • 将该方法集成至蒙特卡洛树搜索(MCTS)框架中,以引导探索并优化策略选择。

实验结果

研究问题

  • RQ1单一价值网络架构能否有效同时预测多个 komi 值的胜率?
  • RQ2与单一定值 komi 网络相比,同时训练多种 komi 值是否能降低均方误差?
  • RQ3动态 komi 调整能否提升对局水平,尤其是在段位对局中?
  • RQ4价值网络能否被有效用于实现高水平段位对局,这一目标此前尚未达成?
  • RQ5ML 价值网络是否能相对于标准价值网络基线带来可测量的胜率提升?

主要发现

  • ML 价值网络在所有 komi 设定下均表现出低于标准价值网络的均方误差(MSE)。
  • 使用 ML 价值网络的程序在对阵采用单一定值 komi 价值网络的基线程序时,取得了 67.6% 的胜率。
  • 所提出的动态 komi 方法显著提升了对弈水平,尤其在段位对局中表现突出,此前基于价值网络的程序未能实现此目标。
  • ML 价值网络首次实现了基于价值网络的公开对局段位对局,证明了其实际可行性。
  • 该架构能够同时预测多个 komi 值,增强了泛化能力并降低了对单一 komi 设定的过拟合风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。