Skip to main content
QUICK REVIEW

[論文レビュー] Learning Invariances for Policy Generalization

Rémi Tachet, Philip Bachman|arXiv (Cornell University)|Sep 7, 2018
Reinforcement Learning in Robotics参考文献 17被引用数 3
ひとこと要約

本論文は、強化学習における方策一般化を向上させる手法を調査し、特に簡単なジャンプタスクにおける平行移動不変性を学習することで、不変性を誘導することを目的としている。データ拡張が不変性を効果的に誘導し、未観測の障害物位置1,265箇所のうち99.8%の一般化を達成した一方、メタラーニングや adversarial training は理論的有望性にもかかわらず、ベースラインを上回ることはできなかった。

ABSTRACT

While recent progress has spawned very powerful machine learning systems, those agents remain extremely specialized and fail to transfer the knowledge they gain to similar yet unseen tasks. In this paper, we study a simple reinforcement learning problem and focus on learning policies that encode the proper invariances for generalization to different settings. We evaluate three potential methods for policy generalization: data augmentation, meta-learning and adversarial training. We find our data augmentation method to be effective, and study the potential of meta-learning and adversarial learning as alternative task-agnostic approaches.

研究の動機と目的

  • 訓練されたタスクが限定的である場合に、エージェントが未観測の変化に一般化できないという強化学習における方策一般化の課題に対処すること。
  • 不変性学習(特に平行移動不変性)が、異なる訓練パラダイムによって誘導可能かどうかを調査すること。
  • データ拡張、メタラーニング、 adversarial training を、タスクに依存しない手法として、ゼロショット一般化を改善するための評価を行うこと。
  • 不変または分離された特徴を学習することが、未観測のタスク変化にわたる転送性を向上させるかどうかを検証すること。
  • どの手法が、タスク固有の特徴の記憶を越えて一般化を促進するかを特定すること。

提案手法

  • データ拡張は、訓練中にゲーム画面の埋め込みをランダムにシフトすることで適用され、エージェントが平行移動不変な表現を学習するように強制される。
  • メタラーニングは、勾配更新後の2つのランダムなタスクの損失の和を最小化する1次近似によって実装され、一般化可能なパラメータ更新を促進する。
  • adversarial training は、隠れ層の活性化からタスクの識別子を分類するディスクラミネータを採用し、エージェントがタスクに依存しない表現を生成するように促進する。
  • エージェントは、提案された不変性誘導技術を用いなくとも、Double-DQN および A2C アルゴリズムで訓練される。
  • 性能評価は、合計1,271のタスクで実施され、うち6つが訓練に、1,265つがゼロショット一般化テストに使用された。
  • t-SNE 視覚化を用いて、adversarial training 有無における隠れ層表現のタスククラスタリングを比較分析した。

実験結果

リサーチクエスチョン

  • RQ1データ拡張は、強化学習方策における平行移動不変性を効果的に誘導できるか。その結果、ゼロショット一般化が向上するか。
  • RQ2メタラーニングによるタスク間の勾配整合化は、標準的な強化学習訓練に比べて、より良い一般化をもたらすか。
  • RQ3adversarial training は、タスク固有の情報を隠れ表現から効果的に除去しつつ、タスク解決能力を維持できるか。
  • RQ4独立または分離された特徴を学習することが、一般化に十分か、それとも不変性の学習がより重要か。
  • RQ5メタラーニングと adversarial training は、理論的優位性があるにもかかわらず、なぜ標準的な強化学習ベースラインを上回る一般化を達成できないのか。

主な発見

  • データ拡張は99.8%の一般化パフォーマンスを達成し、未観測の障害物位置1,265箇所のうち1,263箇所を解消した。これはベースラインを顕著に上回った。
  • データ拡張なしのベースラインエージェントは、テストタスクのたった2.8%(1,265中36)に一般化に成功しており、転送性が著しく低いことが示された。
  • データ拡張で訓練されたエージェントは、訓練中に一度も観測されなかった連続する2つの障害物に対しても一般化に成功しており、強力な不変性学習の証明となった。
  • メタラーニングと adversarial training は、理論的有望性にもかかわらず、標準的な強化学習ベースラインを上回る一般化を達成できなかった。
  • t-SNE 視覚化により、adversarial training が隠れ表現におけるタスク固有のクラスタリングを効果的に除去していることが確認されたが、一般化性能は依然として低かった。
  • 結果から、不変性は明示的に促進されなければならないことが示された。単に分離された特徴を学習するだけでは一般化に十分ではなく、メタラーニングや adversarial training が効果的に一般化できないことが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。