Skip to main content
QUICK REVIEW

[論文レビュー] Teaching Deep Convolutional Neural Networks to Play Go

Christopher Clark, Amos Storkey|arXiv (Cornell University)|Dec 10, 2014
Artificial Intelligence in Games参考文献 19被引用数 13
ひとこと要約

本論文は、重みの縛りを用いて回転および反転対称性を符号化することで、教師あり学習を用いて専門家によるゴ ​​ーの手を予測する深層畳み込みニューラルネットワーク(DCNN)の学習を提案する。得られたネットワークは、44.4%の予測精度という最先端の成績を達成し、モンテカルロ木探索(MCTS)に依存せずに、強力な対局戦術を効果的に学習していることが示され、計算量を最小限に抑えた状態でGNU Goに勝利し、Fuegoに対しても勝利を挙げた。

ABSTRACT

Mastering the game of Go has remained a long standing challenge to the field of AI. Modern computer Go systems rely on processing millions of possible future positions to play well, but intuitively a stronger and more 'humanlike' way to play the game would be to rely on pattern recognition abilities rather then brute force computation. Following this sentiment, we train deep convolutional neural networks to play Go by training them to predict the moves made by expert Go players. To solve this problem we introduce a number of novel techniques, including a method of tying weights in the network to 'hard code' symmetries that are expect to exist in the target function, and demonstrate in an ablation study they considerably improve performance. Our final networks are able to achieve move prediction accuracies of 41.1% and 44.4% on two different Go datasets, surpassing previous state of the art on this task by significant margins. Additionally, while previous move prediction programs have not yielded strong Go playing programs, we show that the networks trained in this work acquired high levels of skill. Our convolutional neural networks can consistently defeat the well known Go program GNU Go, indicating it is state of the art among programs that do not use Monte Carlo Tree Search. It is also able to win some games against state of the art Go playing program Fuego while using a fraction of the play time. This success at playing Go indicates high level principles of the game were learned.

研究の動機と目的

  • 深層学習アプローチを開発し、ニューラルネットワークが高い精度で専門家によるゴーの手を予測できるようにすること。
  • ネットワークアーキテクチャにおける重みの縛りを用いて、ゴー盤の既知の対称性を符号化することで、一般化性能と性能を向上させること。
  • 専門家による対局データで学習した手の予測ネットワークが、MCTSや前方探索を用いずに、強力な単体のゴーAIとして機能できるかどうかを評価すること。
  • DCNNがモンテカルロ木探索や前方探索に依存せずに、専門家による対局から高レベルのゴー戦略を学習できるかどうかを評価すること。
  • 特に計算量が限られた環境下で、ゴーの対局に supervised deep learning を適用する可能性を検討すること。

提案手法

  • プロのゴー対局データの大量データセットを用いて、深層畳み込みニューラルネットワークを訓練し、次の手を予測する。
  • 回転および反転対称性をネットワークに強制する、新しい重みの縛り技術を実装し、パラメータ数を削減するとともに一般化性能を向上させる。
  • 入力として過去の手を含めず、現在の盤面配置のみを入力とすることで、入力分布のずれに対して頑健になるように促進する。
  • KGSおよびGoGoDデータセットの保留テストセットを用いた手の予測精度によって性能を評価する。
  • 訓練済みのネットワークを単体のプレイヤーとしてテストするため、GNU GoおよびFuegoと対戦させ、無限ループを避けるためにパスエミュレーションを実装する。
  • 相手のスコアリング関数を用いてゲームをスコア化し、標準的なゴープレイヤーのランク(例:4-5段)と比較する。

実験結果

リサーチクエスチョン

  • RQ1専門家による手のデータで学習した深層畳み込みニューラルネットワークは、ゴーにおいて最先端の手の予測精度に到達できるか?
  • RQ2重みの縛りによる対称性の強制は、手の予測精度および一般化性能を顕著に向上させるか?
  • RQ3教師あり学習で学習した手の予測ネットワークは、前方探索やMCTSを用いずに、強力な単体のゴーAIとして機能できるか?
  • RQ4DCNNは、専門家による対局からのみ学習することで、どの程度高レベルのゴー戦略を習得できるか?
  • RQ5ネットワークのサイズとデータセットの質に応じて性能はどのようにスケーリングするか?また、予測精度が低いにもかかわらず、より小さなネットワークが対局でより優れた成績を上げられるか?

主な発見

  • DCNNは、KGSデータセットでは41.1%、GoGoDデータセットでは44.4%の手の予測精度を達成し、以前の最先端の結果を上回った。
  • GoGoDデータで学習したネットワークは、KGSデータで学習したネットワークを上回った。これは、GoGoDデータセットに品質の高いプロの対局が多数含まれているためと推測される。
  • 過去の手を入力として使っていなくても、ネットワークは良好に一般化され、4-5段相当の実力で対局し、GNU Go(6-8段)を上回り、Fuego(2-3段)に対しても勝利を挙げた。
  • 計算時間の一部にしかならないにもかかわらず、ネットワークはGNU Goを常に破り、Fuegoに対しても一部のゲームで勝利した。前方探索機能もMCTSも搭載していない。
  • アブレーションスタディの結果、重みの縛りが性能を顕著に向上させたことが確認され、ターゲット関数に対称性を符号化することが重要であることが示された。
  • 予測精度が低いにもかかわらず、小さなネットワークが成功を収めたことから、過去の手に依存しないアプローチが、実際の対局シナリオへの一般化を向上させる可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。