Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot Reinforcement Learning with Deep Attention Convolutional Neural Networks

Şahika Genç, Sunil Mallya|arXiv (Cornell University)|Jan 2, 2020
Domain Adaptation and Few-Shot Learning参考文献 32被引用数 7
ひとこと要約

本論文は、注意メカニズムを用いて、認識と制御を統合的に最適化することで、顕著な計算コストの低減と同等の性能を達成するゼロショット強化学習を可能にする深層注意畳み込みニューラルネットワーク(DACNN)を提案する。モデルは事前学習や現実世界での微調整を必要とせず、タスクに関連する視覚的特徴に注目する能力を学習し、自律走行タスクにおけるシミュレーションから現実への一般化を強力に実現する。

ABSTRACT

Simulation-to-simulation and simulation-to-real world transfer of neural network models have been a difficult problem. To close the reality gap, prior methods to simulation-to-real world transfer focused on domain adaptation, decoupling perception and dynamics and solving each problem separately, and randomization of agent parameters and environment conditions to expose the learning agent to a variety of conditions. While these methods provide acceptable performance, the computational complexity required to capture a large variation of parameters for comprehensive scenarios on a given task such as autonomous driving or robotic manipulation is high. Our key contribution is to theoretically prove and empirically demonstrate that a deep attention convolutional neural network (DACNN) with specific visual sensor configuration performs as well as training on a dataset with high domain and parameter variation at lower computational complexity. Specifically, the attention network weights are learned through policy optimization to focus on local dependencies that lead to optimal actions, and does not require tuning in real-world for generalization. Our new architecture adapts perception with respect to the control objective, resulting in zero-shot learning without pre-training a perception network. To measure the impact of our new deep network architecture on domain adaptation, we consider autonomous driving as a use case. We perform an extensive set of experiments in simulation-to-simulation and simulation-to-real scenarios to compare our approach to several baselines including the current state-of-art models.

研究の動機と目的

  • 現実世界での微調整を要しない条件下で、ロボット工学における強化学習におけるシミュレーションから現実へのドメインギャップに取り組む。
  • シミュレーションベースの学習におけるドメインおよびパrameterのランダム化に伴う高い計算コストを克服する。
  • 制御目的に一致する特徴重み付けを学習する注意メカニズムを用いて、認識と制御を統合する。
  • シミュレーテッドデータのみを用いて、自律走行などの視覚ベースの制御タスクにおけるゼロショット一般化を可能にする。
  • 畳み込みニューラルネットワークにおける注意メカニズムが、明示的な動的モデル化なしに安定した制御を実現するためのパassivityに類似したシステム特性を捉えることができるかどうかを示す。

提案手法

  • 入力画像を複数のCNN層を経由して処理し、その後に注意メカニズムを適用する深層注意畳み込みニューラルネットワーク(DACNN)を導入する。
  • 事前学習済みのCNNから抽出したアノテーションベクトルを画像特徴として定義することで、注意ネットワークが関連する視覚的コンポONENTに注目できるようにする。
  • ポリシー最適化を用いて、注意ネットワークが全画像誤差を最小化するような局所的画像特徴を重みづけするように訓練し、認識と制御目的を直接結びつける。
  • 球面カメラの幾何構造と固定方向のアノテーションベクトルを活用することで、動的システムにパassivityに類似した性質を保持させ、安定性を確保する。
  • proximal policy optimization(PPO)を用いて、自律走行シミュレーションにおけるレーン中央への維持と高速走行を促進する報酬関数を用いて、DACNN全体をエンドツーエンドで訓練する。
  • 別個の認識モジュールと制御モジュールを避けるのではなく、制御目標に応じて適応する注意駆動型特徴選択によって、両者を統合的に最適化する。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドの注意ベースのCNNアーキテクチャは、計算コストを大幅に削減しつつ、ドメインランダマイズドベースラインと同等のゼロショット強化学習性能を達成できるか?
  • RQ2CNNベースのポリシー網で注意ベースの特徴重み付けが、現実世界での微調整なしに、照明やテクスチャの変化といったドメインシフトに対しても一般化を向上させられるか?
  • RQ3視覚ベースの制御ポリシーにおける注意メカニズムが、変化する視覚的条件下でもパassivityに類似したシステム特性を保持し、安定した制御を実現できるか?
  • RQ4シミュレーションからシミュレーションおよびシミュレーションから現実の状況において、DACNNアーキテクチャはDARLAのようなマルチステージエージェントと比較して、学習収束性とサンプル効率に優れているか?
  • RQ5注意ユニットの選択とミニバッチサイズの設定が、DACNNフレームワークにおける学習速度と最終的なパフォーマンスに及ぼす影響はどの程度か?

主な発見

  • DACNNは、認識のための事前学習フェーズを必要としないにもかかわらず、最先端のマルチステージエージェントDARLAと同等の学習収束速度を達成した。
  • バッチサイズ64で学習すると32よりも収束が速く、注意ユニットを64から256に増加させることでさらに学習速度と安定性が向上した。
  • DACNNモデルは、現実世界での微調整なしに、シミュレーションからシミュレーションおよびシミュレーションから現実への転送タスクにおいて高いパフォーマンスを維持し、真のゼロショット一般化を実証した。
  • 視覚的比較から、注意メカニズムが不要なオブジェクト(例:レーン外の物体)を効果的に除外し、レーン境界などの関連する視覚的手がかりに注目していることが示された。
  • 基礎となるCNNの不変性および注意ベースの特徴選択のおかげで、テクスチャや照明の変化に対してもモデルのパフォーマンスが安定している。
  • 特に広範なドメイン一般化を要する状況において、サンプル効率および計算コストの点で、ベースライン手法を上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。