Skip to main content
QUICK REVIEW

[論文レビュー] Privileged Information Dropout in Reinforcement Learning

Pierre-Alexandre Kamienny, Kai Arulkumaran|arXiv (Cornell University)|May 19, 2020
Reinforcement Learning in Robotics参考文献 26被引用数 7
ひとこと要約

本稿では、報酬関数に依存しない特権情報(PI)をノイズ制御によってエージェントの入力に組み込むことで強化学習のサンプル効率と性能を向上させる、Privileged Information Dropout(PI-Dropout)を提案する。部分観測環境におけるナビゲーションタスクにおいて、PI-Dropoutは知識蒸留や補助タスクを凌駉し、完全状態や部分目標といった多様なPIタイプに一般化可能であり、ほぼオラクル性能に近い結果を達成する。

ABSTRACT

Using privileged information during training can improve the sample efficiency and performance of machine learning systems. This paradigm has been applied to reinforcement learning (RL), primarily in the form of distillation or auxiliary tasks, and less commonly in the form of augmenting the inputs of agents. In this work, we investigate Privileged Information Dropout (\pid) for achieving the latter which can be applied equally to value-based and policy-based RL algorithms. Within a simple partially-observed environment, we demonstrate that \pid outperforms alternatives for leveraging privileged information, including distillation and auxiliary tasks, and can successfully utilise different types of privileged information. Finally, we analyse its effect on the learned representations.

研究の動機と目的

  • 訓練中に特権情報(PI)を活用することで、強化学習におけるサンプル効率と性能を向上させること。
  • 知識蒸留や補助タスクとは異なり、PIを入力特徴として使用するという新しいパラダイムを検討すること。
  • 情報ボトルネック理論に基づいて導出されたPI-Dropoutが、RLにおける表現学習と一般化性能を向上させるかどうかを評価すること。
  • PI-Dropoutが知識蒸留や補助予測タスクといった既存のPIベースの手法と比較して、どのような差を示すかを検証すること。
  • PI-Dropoutが部分観測環境における学習済み表現とエージェント行動に与える影響を分析すること。

提案手法

  • PI-Dropoutは、ドロップアウトノイズの分散を主な入力 $\mathbf{x}$ ではなく特権情報 $\mathbf{x}^*$ に依存させるノイズ制御機構を用いる。
  • 表現 $\mathbf{z}$ は $\mathbf{z} = h(\mathbf{x};W) \odot \text{Lognormal}(\mathbf{0}, h^*(\mathbf{x}^*;W^*))$ として計算され、$h^*$ はPIからノイズ分散を出力する。
  • この手法は情報ボトルネック理論に基づいており、入力 $\mathbf{x}$ と表現 $\mathbf{z}$ の相互情報量を最小化すると同時に、タスクに必要な情報を保持する。
  • 推論時においてはPIサブネットワークを無効化し、ノイズ分散をゼロに設定することで $\mathbf{x}^*$ を周辺化し、運用時のロバスト性を確保する。
  • 価値ベースおよび方策ベースのRLアルゴリズム(A3C、PPO、DRQNなど)と両立可能である。
  • グリッドワールドナビゲーションタスクにおいて、知識蒸留、補助予測、標準的な情報ドロップアウトといったベースラインと比較してPI-Dropoutを評価する。

実験結果

リサーチクエスチョン

  • RQ1PI-Dropoutは、強化学習における特権情報の活用において、知識蒸留や補助タスクを凌駒することができるか?
  • RQ2PI-Dropoutは、完全状態や部分目標といった異なる種類の特権情報に対しても一般化可能か?
  • RQ3PI-Dropoutによる性能向上は、特権情報の使用によるものであり、単なるドロップアウト正則化の副産物ではないか?
  • RQ4PI-Dropoutは、特に位置の復元可能性という観点から、エージェント内部状態の表現能力にどのように影響を与えるか?
  • RQ5PI-Dropoutは探索を向上させることができ、他の探索強化技術と組み合わせ可能か?

主な発見

  • PI-Dropoutは、知識蒸留、補助タスク、標準的な情報ドロップアウトを上回り、部分観測ナビゲーションタスクにおいてオラクルエージェントに最も近い性能を達成した。
  • 他のベースラインが左端の部屋から失敗するのに対し、PI-Dropoutエージェントは全初期位置からタスクを正常に解決した。
  • 部分目標PIを用いたPI-D[5x5,SG]エージェントは、完全状態PIバージョンと同等の性能を示し、PIタイプにわたる一般化を実証した。
  • 標準的な情報ドロップアウト(I-D[5x5,5x5])とのアブレーションにより、PI-Dropoutの性能向上はドロップアウト正則化そのものではなく、PIの使用に起因することが確認された。
  • GRUの活性化に線形分類器を適用した結果、PI-Dropoutはエージェント位置の線形分離性に顕著な向上を示さなかった(88.8% vs ベースラインDRQNの90.1%)、これはタスクの成功が線形分離可能な表現を必要としないことを示唆する。
  • PI-Dropoutは収束が早く、ランダムシードに依存しない一貫性のある性能を示し、訓練の安定性とサンプル効率の向上が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。