Skip to main content
QUICK REVIEW

[論文レビュー] Composing Task-Agnostic Policies with Deep Reinforcement Learning

Ahmed H. Qureshi, Jacob J. Johnson|arXiv (Cornell University)|May 25, 2019
Reinforcement Learning in Robotics参考文献 35被引用数 11
ひとこと要約

本論文は、未学習のタスクに適応可能なプリミティブ方策を複合方策に組み合わせるための深層強化学習手法を提案する。双方向RNNエンコーダとアテンションベースのデコーダを用い、行動を順次的および並列的に動的に結合することで、高いデータ効率を達成し、スパース報酬で複雑な制御環境において、標準的および階層的強化学習を上回る性能を発揮する。

ABSTRACT

The composition of elementary behaviors to solve challenging transfer learning problems is one of the key elements in building intelligent machines. To date, there has been plenty of work on learning task-specific policies or skills but almost no focus on composing necessary, task-agnostic skills to find a solution to new problems. In this paper, we propose a novel deep reinforcement learning-based skill transfer and composition method that takes the agent's primitive policies to solve unseen tasks. We evaluate our method in difficult cases where training policy through standard reinforcement learning (RL) or even hierarchical RL is either not feasible or exhibits high sample complexity. We show that our method not only transfers skills to new problem settings but also solves the challenging environments requiring both task planning and motion control with high data efficiency.

研究の動機と目的

  • 多くの手法がタスク固有の方策に焦点を当てている一方で、事前に学習されたタスクに依存しないスキルを再利用または組み合わせる能力に欠ける強化学習分野における一般化可能なスキル構成の欠如に対処する。
  • 再訓練からではなく、既存のプリミティブ方策を組み合わせることで、新しい未学習タスクへの効率的な適応を可能にする。
  • スパース報酬および複雑なモーション制御環境における標準的および階層的RLの高いサンプル複雑性と失敗モードを克服する。
  • 状態、目的、スキル情報をアテンション機構を介して統合する構造的でエンドツーエンドで学習可能なフレームワークを設計し、動的な方策構成を実現する。
  • タスクの要件に応じて、スキルの並列的(AND演算)および順次的(OR演算)な構成が可能であることを示す。

提案手法

  • タスクに依存しないプリミティブ方策の固定集合を、時間的および順序的依存性を捉えるために、双方向再帰ニューラルネットワーク(BRNN)エンコーダを用いて潜在状態に埋め込む。
  • 現在の状態と目的情報を条件として、エンコードされたスキル表現に注目するアテンション機構を備えた全結合デコーダを用い、スキル構成の混合重みを予測する。
  • 予測された混合重みを用いてプリミティブ方策の行動を結合し、文脈依存の動的な行動ブレンドを実現する。
  • 標準的または階層的強化学習を用いて、スキル構成と方策実行の両方を統合的に最適化するため、モデル全体をエンドツーエンドで学習する。
  • 学習されたアテンション重みを通じて、並列的(複数のアクティブな方策)および順次的(段階的な方策活性化)な構成をサポートするようにデコーダを構造化する。
  • プリミティブ方策は事前に学習済みで固定され、新しいタスク用に微調整するのはゲーティング機構(混合重み予測器)のみであるモジュラーなアーキテクチャを採用し、効率的な適応を実現する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習フレームワークは、事前に学習済みのタスクに依存しないプリミティブ方策を効果的に組み合わせ、未学習のタスクを高いデータ効率で解けるか?
  • RQ2潜在状態のエンコーディングやアテンション機構なしに直接混合重みを予測する手法と比較して、アテンションベースのスキル構成はどのように性能を発揮するか?
  • RQ3本手法は、スパース報酬環境において、モーション制御とタスク計画の両方を必要とする複雑なタスクをどの程度処理できるか?
  • RQ4モデルは順次的および並列的スキル構成をサポートするか?その動的挙動はアテンション重みのダイナミクスにどのように反映されるか?
  • RQ5本フレームワークは多様な環境に一般化可能であり、サンプル複雑性と最終的性能において、標準的および階層的RLのベースラインを上回るか?

主な発見

  • 提案手法は、Ant Random Goal、Cross Maze Ant、Pusher環境において、BRNNやアテンションを欠如させたアブレーションモデルと比較して顕著に優れた性能を発揮し、構造的潜在状態エンコーディングとアテンションの必要性を示している。
  • 2次元マルチゴールポイントマス環境では、アテンション重みが複数のプリミティブ方策(例:上、右)を同時に動的に活性化し、階段状の経路を回避する直接的な経路を達成しており、並列的構成の能力を裏付けている。
  • 標準的および階層的RLが失敗するか、極めて高いサンプル複雑性を要する挑戦的な環境でも、本モデルは正常にタスクを解消できており、スパース報酬設定におけるロバストネスを示している。
  • アテンション可視化の結果、ノイズが存在する中でも、目的方向と整合するプリミティブ方策に高い重みが割り当てられていることが確認され、タスクに依存した目的条件付きの構成が実現されていることが裏付けられている。
  • アブレーションスタディの結果、スキル表現のエンコーディングなしに直接混合重みを予測する手法(MCP)は劣った性能を示しており、BRNNによる潜在状態モデリングの利点が明確に示されている。
  • 固定されたプリミティブ方策を再利用し、ゲーティングネットワークのみを微調整することで、本手法は新しいタスクへの効果的な適応を可能にし、優れた一般化性能とデータ効率を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。