Skip to main content
QUICK REVIEW

[論文レビュー] Hyper-Parameter Sweep on AlphaZero General

Hui Wang, Michael Emmerich|arXiv (Cornell University)|Mar 19, 2019
Artificial Intelligence in Games参考文献 24被引用数 8
ひとこと要約

この論文は、6×6 Othelloにおける学習損失、Eloレーティング、時間コストの観点から、AlphaZeroGeneralにおける12の主要パラメータについて包括的なハイパーパrameterスイープを実施している。時間に敏感なパラメータと時間に余裕のあるパラメータを特定し、非単調な性能トレンド(例:最大値を超えた最適値が存在)を明らかにした。本研究は、AlphaZeroベースのエージェントにおけるハイパーパrameter最適化のデータ駆動的根拠を提供する。

ABSTRACT

Since AlphaGo and AlphaGo Zero have achieved breakground successes in the game of Go, the programs have been generalized to solve other tasks. Subsequently, AlphaZero was developed to play Go, Chess and Shogi. In the literature, the algorithms are explained well. However, AlphaZero contains many parameters, and for neither AlphaGo, AlphaGo Zero nor AlphaZero, there is sufficient discussion about how to set parameter values in these algorithms. Therefore, in this paper, we choose 12 parameters in AlphaZero and evaluate how these parameters contribute to training. We focus on three objectives~(training loss, time cost and playing strength). For each parameter, we train 3 models using 3 different values~(minimum value, default value, maximum value). We use the game of play 6$ imes$6 Othello, on the AlphaZeroGeneral open source re-implementation of AlphaZero. Overall, experimental results show that different values can lead to different training results, proving the importance of such a parameter sweep. We categorize these 12 parameters into time-sensitive parameters and time-friendly parameters. Moreover, through multi-objective analysis, this paper provides an insightful basis for further hyper-parameter optimization.

研究の動機と目的

  • AlphaZeroおよび関連アルゴリズムにおける体系的なパrameterチューニングの指針の欠如に応えること、特に元のDeepMindの発表で十分に文書化されていないハイパーパラメータについて。
  • 12のコアハイパーパラメータが、学習損失、対戦力(Eloレーティング)、計算時間コストという3つの主要目的に与える影響を評価すること。
  • 訓練時間への影響に基づいて、パラメータを時間に敏感なタイプと時間に余裕のあるタイプに分類し、より効率的な最適化戦略を可能にすること。
  • AlphaZeroGeneralにおけるハイパーパラメータ選択のためのデータ駆動的で実証的な根拠を提供することにより、他のゲームやタスクへの応用可能性を支援すること。

提案手法

  • 本研究では、AlphaZeroの軽量オープンソース再実装であるAlphaZeroGeneralを用い、各パラメータについて最小値、デフォルト値、最大値の3つの値を用いて、3つのモデルを訓練した。
  • 各実験では、1つのパラメータを除き、他のすべてのパラメータをデフォルト値に固定することで、制御された評価を実現した。
  • 3つの評価指標を用いた:1000ステップ間の平均学習損失、1000ゲーム後の最終Eloレーティング、合計訓練時間(時間単位)。
  • 時間コスト関数は経験的に導出された(式2)、これにより各パラメータ設定の計算オーバーヘッドを定量的に評価できるようになった。
  • 訓練時間への影響に基づいてパラメータを時間に敏感なタイプまたは時間に余裕のあるタイプに分類し、性能トレンドの統計的分析を実施した。
  • 多目的分析を実施し、損失、実力、効率のバランスが取れたパラメータ設定(Pareto最適解)を特定した。

実験結果

リサーチクエスチョン

  • RQ112のハイパーパラメータの異なる値は、AlphaZeroGeneralにおける学習損失、Eloレーティング、時間コストにどのように影響するか?
  • RQ2どのハイパーパラメータが時間に敏感(訓練時間に顕著な影響を及ぼす)であり、どのパラメータが時間に余裕がある(時間にほとんど影響しない)か?
  • RQ3パラメータ値を増加させることで性能が常に向上するのか、それともある最適値を超えると性能が低下するのか?
  • RQ4多目的分析により、訓練効率、損失低減、対戦力のバランスが取れたパラメータ設定を特定できるか?
  • RQ5学習損失を最小化し、Eloレーティングを最大化し、時間コストを削減するための最も有望なハイパーパラメータ設定は何か?

主な発見

  • MCTS1回あたりのシミュレーション回数を表すパラメータ'mctssimu'は、Eloレーティングに強く正の影響を与える。200回のシミュレーションが最も高い性能を示したが、時間コストも顕著に増加した。
  • 訓練フェーズごとの自己対戦ゲーム数を表す'iteration'パラメータは、性能と非単調な関係にある。デフォルト値の100が損失とEloレーティングのバランスが最良であり、200などの高い値では性能が低下した。
  • ミニバッチサイズを表す'batchsize'パラメータは、時間コストと強い負の相関関係にある。64などの大きなバッチサイズは、32などの小さなサイズと比較して16%の訓練時間を短縮し、時間に非常に敏感である。
  • ニューラルネットワーク方策の更新タイミングを制御する'updateThreshold'パラメータは、0.6でEloレーティングが最大に達し、単調に向上するのではなく、非自明な最適値があることが示された。
  • 'Cpuct'、'learningrate'、'dropout'、'tempThreshold'などのパラメータは、訓練時間への影響が最小限であるため、時間に余裕のあるタイプに分類された。これにより、性能向上のための安全なチューニングが可能である。
  • アーエナコンペア数を表す'arenacompare'パラメータは、Eloレーティングおよび時間コストにほとんど影響を及ぼさないため、性能や効率のトレードオフなしに自由にチューニング可能であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。