Skip to main content
QUICK REVIEW

[論文レビュー] Disentangling Controllable and Uncontrollable Factors of Variation by Interacting with the World

Yoshihide Sawada|arXiv (Cornell University)|Apr 19, 2018
Fault Detection and Control Systems参考文献 25被引用数 9
ひとこと要約

本稿では、視覚的環境における制御可能要因と制御不能要因の分離を強化学習に基づいて行う手法を提案する。2つの深層ニューラルネットワーク(DNN)を用いる:1つは制御可能なオブジェクトを、もう1つは制御不能な障害物をそれぞれ表現する。制御可能DNNを単純な環境で学習した頑健なモデルを事前学習することで、アノテーションデータを一切必要とせず安定した分離を達成した。シミュレーションにおいて、潜在的要因と制御行動との間に高い相関が確認された。

ABSTRACT

We introduce a method to disentangle controllable and uncontrollable factors of variation by interacting with the world. Disentanglement leads to good representations and is important when applying deep neural networks (DNNs) in fields where explanations are required. This study attempts to improve an existing reinforcement learning (RL) approach to disentangle controllable and uncontrollable factors of variation, because the method lacks a mechanism to represent uncontrollable obstacles. To address this problem, we train two DNNs simultaneously: one that represents the controllable object and another that represents uncontrollable obstacles. For stable training, we applied a pretraining approach using a model robust against uncontrollable obstacles. Simulation experiments demonstrate that the proposed model can disentangle independently controllable and uncontrollable factors without annotated data.

研究の動機と目的

  • 既存の強化学習に基づく分離手法において、制御不能な障害物の表現メカニズムが欠如しているという問題に対処すること。
  • 制御可能および制御不能な要因の分離を可能にすることで、深層ニューラルネットワークにおける表現学習を改善すること。
  • 手動でのアノテーションを必要とせず、安定した訓練を実現すること。
  • 単純な環境での事前学習が、障害物を含む複雑な環境における分離性能を向上させるかどうかを検証すること。
  • 外生的報酬を伴う強化学習設定で手法を評価し、下流タスクにおける実用性を示すこと。

提案手法

  • 制御可能なオブジェクトを表現するDNNと、制御不能な障害物を表現するDNNを別々に訓練する。両者とも強化学習で学習する。
  • Thomasらの手法にインspiredされた自己教師あり戦略を採用し、最も高い隠れ層が個々の制御行動に独立して応答するように制約を課す。
  • 障害物のない単純な環境で学習したモデルを用いて、制御可能なオブジェクトのDNNを事前学習することで、頑健性と安定性を向上させる。
  • 事前学習したパラメータを初期値として使用し、ニューロンが制御行動に敏感であり、障害物の影響を受けにくくなるように保証する。
  • 両方のDNNから得られる潜在的特徴をLSTMおよび全結合層に統合し、深層再帰的Qネットワーク(DRQN)構造におけるQ値予測を実行する。
  • 固定学習率と割引率を用いた確率的勾配降下法を適用し、訓練中にエンコーダーを固定することで、分離の影響を明確に分離する。

実験結果

リサーチクエスチョン

  • RQ1手動でのアノテーションを一切必要とせず、強化学習に基づく手法が制御可能および制御不能な要因の分離を達成できるか?
  • RQ2単純な環境で制御可能DNNを事前学習することで、障害物を含む複雑な環境における分離の安定性が向上するか?
  • RQ3制御可能および制御不能な要因の潜在的表現が、実際の制御行動および障害物の位置とどの程度相関しているか?
  • RQ4分離された表現が、外生的報酬を伴う下流の強化学習タスクをサポートできるか?
  • RQ5頑健な事前学習メカニズムが、分離された特徴の品質にどのような影響を与えるか?

主な発見

  • 提案手法は、注釈データを一切使用せずに、シミュレーション環境において制御可能および制御不能な要因の分離に成功した。
  • 単純な環境で学習したモデルを用いた制御可能DNNの事前学習により、訓練の安定性および分離性能が顕著に向上した。
  • 状況1では、潜在的要因と制御行動との相関がx軸で最大0.904、y軸で0.934に達し、強い分離が確認された。
  • 状況2では、x軸で-0.846、y軸で-0.897の相関が得られ、複雑な障害物配置下でも頑健な分離が実現した。
  • 異なる環境からの事前学習を用いた場合、再構成誤差が増加した。これは、同じ環境での事前学習がより優れた特徴品質をもたらすことを示している。
  • VAEベースラインはぼやけた不自然なサンプルを生成した。これは、提案手法の強化学習に基づく分離法が、複雑な視覚的データに対して優位であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。