Skip to main content
QUICK REVIEW

[論文レビュー] Transformer Based Reinforcement Learning For Games

Uddeshya Upadhyay, Nikunj Shah|arXiv (Cornell University)|Dec 9, 2019
Artificial Intelligence in Games参考文献 16被引用数 10
ひとこと要約

本稿では、動的タスクの制御に適したTransformerベースの強化学習モデル(DTQN)を提案し、再帰的ネットワークの代わりに自己注意機構を用いて順序付きゲーム状態を処理する。自然言語処理(NLP)分野では優れた性能を発揮するが、DTQNはCartPole環境においてLSTMベースのDRQNより性能が劣っており、強化学習タスクにおける時間的依存性を再帰ネットワーク(RNN)がより効果的に捉えられることを示している。

ABSTRACT

Recent times have witnessed sharp improvements in reinforcement learning tasks using deep reinforcement learning techniques like Deep Q Networks, Policy Gradients, Actor Critic methods which are based on deep learning based models and back-propagation of gradients to train such models. An active area of research in reinforcement learning is about training agents to play complex video games, which so far has been something accomplished only by human intelligence. Some state of the art performances in video game playing using deep reinforcement learning are obtained by processing the sequence of frames from video games, passing them through a convolutional network to obtain features and then using recurrent neural networks to figure out the action leading to optimal rewards. The recurrent neural network will learn to extract the meaningful signal out of the sequence of such features. In this work, we propose a method utilizing a transformer network which have recently replaced RNNs in Natural Language Processing (NLP), and perform experiments to compare with existing methods.

研究の動機と目的

  • Transformerアーキテクチャ(元々自然言語処理(NLP)を目的として設計されたもの)が、ビデオゲーム用の深層強化学習に応用可能かどうかを検討すること。
  • 標準DQNが長期依存性を扱えないとされる問題を解消するため、再帰ネットワークを自己注意機構に置き換えること。
  • Transformerに内蔵された自己注意機構が、部分的に観測可能な環境における順序付き状態遷移を効果的にモデル化できるかどうかを評価すること。
  • DQN、DRQN(LSTMベース)、DTQN(Transformerベース)の各エージェントがCartPole制御タスクにおいてどのように性能を発揮するかを比較すること。

提案手法

  • 提案されたDTQNモデルは、Transformerのエンコーダー部のみを用い、CartPoleの状態入力(位置とポールの角度)の系列を処理する。
  • 多頭部自己注意機構を用いて、入力系列の文脈的表現を計算し、異なる時刻の重要度を重みづけ可能にする。
  • Transformerエンコーダーの出力を用いて、標準DQNフレームワークに準拠してQ値を予測する。
  • 経験再生とターゲットネットワークを用いて、DQNおよびDRQNと同様にエンドツーエンドで学習を実行する。
  • 実験は、OpenAI GymのCartPole環境で実施され、入力として生の状態値(位置と角度)のみが使用される。
  • DQN、DRQN、DTQNの各モデル間で公平な比較を実現するため、ハイパーパrameterは同一に保たれた。

実験結果

リサーチクエスチョン

  • RQ1Transformerベースのアーキテクチャが、ゲームプレイエージェントの深層強化学習において再帰ネットワークを効果的に置き換えられるか?
  • RQ2Transformerに内蔵された自己注意機構が、強化学習における順序的依存性のモデル化においてRNNを上回る性能を発揮するか?
  • RQ3部分的に観測可能な制御タスク(例:CartPole)において、Transformerベースのエージェント(DTQN)の性能はDQNおよびDRQNと比べてどうなるか?
  • RQ4Transformerに明示的な再帰構造がないことが、順序付き意思決定タスクにおける長期的時間的依存性の学習を妨げているか?
  • RQ5ランダム初期化が、Transformerベースの強化学習エージェントの学習安定性および最終的性能に顕著な影響を及えるか?

主な発見

  • LSTMを用いて時間的依存性をモデル化するDRQNは、最高で1回の実行で135エピソードに達する最高平均スコアを記録した。
  • DTQNはDQNおよびDRQNの両方と比較して平均的に劣位にあり、Transformerベースの手法がこの順序制御タスクにうまく適応できていないことが示された。
  • DQNおよびDTQNは複数回のランダム初期化において一貫性のない性能を示し、学習過程でスコアがしばしば低下または変動した。
  • DTQNの失敗は、RNNが時刻を跨いで隠れ状態を保持できるのに対し、DTQNが明示的な時間的進行をモデル化できないことに起因するとされる。
  • NLP分野での成功にもかかわらず、本研究の強化学習設定(表形式の状態入力)では、TransformerはRNNを上回らなかった。
  • 順序的ダイナミクスの強いモデル化を要するタスクでは、状態入力が低次元かつ順序的である場合、RNNは自己注意機構よりも依然として有効であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。