Skip to main content
QUICK REVIEW

[論文レビュー] On Inductive Biases in Deep Reinforcement Learning

Matteo Hessel, Hado van Hasselt|arXiv (Cornell University)|Jul 5, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 21
ひとこと要約

この論文は、深層強化学習におけるドメイン固有のインダクティブバイアスの影響を調査し、報酬クリッピング、固定アクションリピート、報酬スケーリングといった一般的なヒューリスティクスの代わりに、学習可能で適応可能な代替手法が、Atariで競争力のある性能を達成または上回るとともに、追加のチューニングなしに新しい連続制御タスクへの一般化を向上させられることを示している。

ABSTRACT

Many deep reinforcement learning algorithms contain inductive biases that sculpt the agent's objective and its interface to the environment. These inductive biases can take many forms, including domain knowledge and pretuned hyper-parameters. In general, there is a trade-off between generality and performance when algorithms use such biases. Stronger biases can lead to faster learning, but weaker biases can potentially lead to more general algorithms. This trade-off is important because inductive biases are not free; substantial effort may be required to obtain relevant domain knowledge or to tune hyper-parameters effectively. In this paper, we re-examine several domain-specific components that bias the objective and the environmental interface of common deep reinforcement learning agents. We investigated whether the performance deteriorates when these components are replaced with adaptive solutions from the literature. In our experiments, performance sometimes decreased with the adaptive components, as one might expect when comparing to components crafted for the domain, but sometimes the adaptive components performed better. We investigated the main benefit of having fewer domain-specific components, by comparing the learning performance of the two systems on a different set of continuous control problems, without additional tuning of either system. As hypothesized, the system with adaptive components performed better on many of the new tasks.

研究の動機と目的

  • 深層強化学習におけるドメイン固有のヒューリスティクスを、適応的で学習可能なコンponentsに置き換えることで、性能と一般化性能に与える影響を評価すること。
  • 手作業で設計されたインダクティブバイアスへの依存を減らすことで、多様な環境において深層強化学習エージェントの一般性が向上するかどうかを調査すること。
  • 適応的ソリューションが、Atariのようなベンチマークタスクでよくチューニングされたヒューリスティクスと同等またはそれを上回る性能を発揮し、新しいドメインではさらにチューニングを必要としないかどうかを特定すること。
  • 固定アクションリピートや報酬クリッピングといった一般的なインダクティブバイアスが、RLエージェントのスケーラビリティや転送性を妨げているかどうかを評価すること。
  • ドメイン固有の事前知識を除去することで、コアな学習アルゴリズムの欠陥が露呈されるか、それとも全体的なロバストネスと適応性が向上するかを検討すること。

提案手法

  • 報酬クリッピングや固定アクションリピートなどの固定でドメイン特有のヒューリスティクスを、学習可能で訓練中に適応する異なる微分可能コンponentsに置き換える。
  • 長期的な依存関係をモデル化し、インダクティブバイアスのエンドツーエンド学習を可能にするために、再帰的状態表現を備えたアクタ・クリティックフレームワークを用いる。
  • 複数の環境で共有パラメータを使用して、サンプル効率を向上させるために、非同期アドバンテージアクタ・クリティック(A3C)を用いてエージェントを訓練する。
  • PopArt正規化を用いた適応的報酬スケーリングを適用し、訓練の安定性を高め、報酬のスケールに依存する感度を低減する。
  • 標準的なベンチマークゲームを用いて、Atari Learning Environment(ALE)で適応的バージョンとヒューリスティクスベースのバージョンを比較して性能を評価する。
  • 完全に適応的なエージェントを、ハイパーパramータチューニングなしに新しい連続制御タスクのスイート(例:MuJoCo環境)に適用して一般化をテストする。

実験結果

リサーチクエスチョン

  • RQ1固定でドメイン特有のヒューリスティクスを、適応的で学習可能なコンponentsに置き換えると、Atariベンチマークでの性能が低下するか?
  • RQ2完全に適応的なインダクティブバイアスを持つエージェントは、Atari用にチューニングされたヒューリスティクスベースのエージェントよりも、新しい未確認の環境への一般化性能が優れているか?
  • RQ3報酬クリッピングや固定アクションリピートのようなインダクティブバイアスの除去が、学習の安定性と最終的なパフォーマンスに与える影響は何か?
  • RQ4複数の環境において、適応的コンponentsとよくチューニングされたドメイン特有のヒューリスティクスの間で、サンプル効率と最終リターンの観点から性能に差は生じるか?
  • RQ5インダクティブバイアスが、コアな学習アルゴリズムの限界を隠ぺいしている程度はどれほどで、それらを除去することでRLエージェントの透明性と一般化性能が向上するか?

主な発見

  • 適応的コンponentsは、Atari Learning Environmentでドメイン特有のヒューリスティクスと同等またはそれを上回る性能を発揮し、性能が著しく劣ることはめったになかった。
  • 完全に適応的なエージェントは、それらのタスクに特化してよくチューニングされたA3Cエージェントよりも、連続制御タスクのスイートで高い集約パフォーマンスを達成した。
  • ハイパーパramータチューニングなしに新しい環境への一般化が効果的に可能であり、即時の一般化性の向上が示された。
  • 報酬クリッピングは依然として顕著な例外であった。いくつかのAtariゲームではヒューリスティクスが性能優位を保ち、これは有用なインダクティブバイアスを反映している可能性がある。
  • 固定されたハイパーパramータ(例:アクションリピート回数、割引率)の使用は、複雑な相互作用と訓練フェーズにわたる適応性の欠如のため、非効率であることが示された。
  • 結果から、一般的に使用されているヒューリスティクスが競争力のある性能を達成するために不可欠であるとは限らず、むしろ深層強化学習エージェントの一般性を制限している可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。