Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Frame skip Deep Q Network

Aravind S. Lakshminarayanan, Sahil Sharma|arXiv (Cornell University)|May 17, 2016
Reinforcement Learning in Robotics参考文献 18被引用数 10
ひとこと要約

本論文では、固定されたスキップ値ではなく、現在の状態に応じてフレームスキップレートを動的に学習する、新しい強化学習アーキテクチャ「Dynamic Frame skip Deep Q-Network (DFDQN)」を提案する。フレームスキップを学習可能なポリシーとして扱うことで、Seaquest のような困難なアーケードゲームにおいて、静的フレームスキップ手法と比較して優れたサンプル効率と最終スコアを達成する。

ABSTRACT

Deep Reinforcement Learning methods have achieved state of the art performance in learning control policies for the games in the Atari 2600 domain. One of the important parameters in the Arcade Learning Environment (ALE) is the frame skip rate. It decides the granularity at which agents can control game play. A frame skip value of $k$ allows the agent to repeat a selected action $k$ number of times. The current state of the art architectures like Deep Q-Network (DQN) and Dueling Network Architectures (DuDQN) consist of a framework with a static frame skip rate, where the action output from the network is repeated for a fixed number of frames regardless of the current state. In this paper, we propose a new architecture, Dynamic Frame skip Deep Q-Network (DFDQN) which makes the frame skip rate a dynamic learnable parameter. This allows us to choose the number of times an action is to be repeated based on the current state. We show empirically that such a setting improves the performance on relatively harder games like Seaquest.

研究の動機と目的

  • 固定されたフレームスキップレートによる制限を解消する。これは、文脈にかかわらず行動の繰り返し回数を固定するため、学習の柔軟性を制限する。
  • フレームスキップレートをポリシーの出力として学習させることで、アーケード2600ゲームにおけるサンプル効率と最終的パフォーマンスが向上するかどうかを検証する。
  • フレームスキップレートをニューラルネットワークの連続的かつ状態依存の出力として扱う DQN ベースのアーキテクチャを構築する。これにより、適応的な行動繰り返しが可能になる。

提案手法

  • DFDQN アーキテクチャは、標準的な DQN を拡張し、各状態に対して連続的なスキップ値を出力する学習可能なフレームスキップヘッドを導入する。
  • ネットワークは行動とその繰り返し回数(スキップ数)を同時に予測し、スキップ値は微分可能であり、深層Q学習により訓練される。
  • 指定されたフレーム数にわたり、行動が繰り返し実行され、スキップ期間終了後に新たな状態と報酬が観測される。
  • 推論時には、整数値に制限するための微分可能リラクゼーションまたはハードラウンディングを用いることで、ALE環境との互換性を維持する。
  • 訓練の目的関数は標準的な DQN のまま(経験再生とターゲットネットワークを含む)だが、Q値関数は行動とスキップ時間の両方に依存するようになる。
  • アーキテクチャは、アーケード学習環境(ALE)ベンチマークを用いてアーケード2600環境で評価される。

実験結果

リサーチクエスチョン

  • RQ1現在の状態の関数としてフレームスキップレートを学習させることで、固定スキップレートと比較してアーケード2600ゲームにおけるパフォーマンスが向上するか?
  • RQ2動的フレームスキップは、Seaquest のような複雑な環境において、学習のサンプル効率を向上させるか?
  • RQ3DFDQN のパフォーマンスは、標準DQN や DuDQN と比較して、困難な探索やスパarsely報酬のゲームでどのように異なるか?

主な発見

  • DFDQN は、Seaquest 環境において標準DQN や DuDQN よりも高い最終スコアを達成しており、適応的行動繰り返しによるポリシー学習の向上を示している。
  • 動的フレームスキップ機構により、収束が早く、困難なレベルでのサンプル効率が向上していることが実証された。
  • モデルは、安定的かつ予測可能なゲーム状態では多くのフレームをスキップし、不確実性が高く、重要な瞬間では少ないフレームをスキップするよう学習しており、文脈に応じた行動を示している。
  • 実験結果から、動的スキップレートポリシーは複数のアーケードゲームに一般化でき、困難な探索タスクで一貫した改善が得られている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。