Skip to main content
QUICK REVIEW

[論文レビュー] Hallucinative Topological Memory for Zero-Shot Visual Planning

Kara Liu, Thanard Kurutach|arXiv (Cornell University)|Feb 27, 2020
Multimodal Machine Learning Applications参考文献 27被引用数 14
ひとこと要約

本論文は、環境の文脈に条件付けられた幻覚的画像のグラフを用いて、画像空間そのものに直接計画を実行するゼロショット視覚的計画法であるHallucinative Topological Memory(HTM)を提案する。対照的予測符号化による安定した接続性学習と、ドメイン一般化のための条件付きVAEを組み合わせることで、特に幾何的推論を要する複雑で未知の環境において、最先端の手法に比べ優れた成功確率と解釈可能な計画を達成する。

ABSTRACT

In visual planning (VP), an agent learns to plan goal-directed behavior from observations of a dynamical system obtained offline, e.g., images obtained from self-supervised robot interaction. Most previous works on VP approached the problem by planning in a learned latent space, resulting in low-quality visual plans, and difficult training algorithms. Here, instead, we propose a simple VP method that plans directly in image space and displays competitive performance. We build on the semi-parametric topological memory (SPTM) method: image samples are treated as nodes in a graph, the graph connectivity is learned from image sequence data, and planning can be performed using conventional graph search methods. We propose two modifications on SPTM. First, we train an energy-based graph connectivity function using contrastive predictive coding that admits stable training. Second, to allow zero-shot planning in new domains, we learn a conditional VAE model that generates images given a context of the domain, and use these hallucinated samples for building the connectivity graph and planning. We show that this simple approach significantly outperform the state-of-the-art VP methods, in terms of both plan interpretability and success rate when using the plan to guide a trajectory-following controller. Interestingly, our method can pick up non-trivial visual properties of objects, such as their geometry, and account for it in the plans.

研究の動機と目的

  • 実データ収集が非現実的である動的環境におけるゼロショット視覚的計画の課題に対処すること。
  • 学習済み潜在空間ではなく画像空間そのものに計画を実行することで、計画の解釈可能性と頑健性を向上させること。
  • 文脈ベクトルに条件付けられ、関連する画像状態を幻覚的に生成することで、未確認の環境への一般化を可能にすること。
  • ヒューリスティックな分類器を対照的学習に置き換えることで、トポロジカルメモリ手法における訓練の不安定性を克服すること。
  • 視覚的計画における幾何的推論が、明示的な教師なしでデータから自己で出現することを示すこと。

提案手法

  • HTMは、画像サンプルをノードとし、遷移が可能であることを表すエッジを持つトポロジカルメモリグラフを構築する。エッジは、対照的予測符号化に基づくエネルギー関数を用いたエネルギーに基づくモデルで学習される。
  • 条件付きVAEを訓練して、文脈ベクトル(例:障害物の配置)に条件付けられた画像サンプルを生成させ、新しい環境のゼロショット幻覚を可能にする。
  • グラフの接続性は、対照的損失で訓練されたエネルギー関数を用いて学習され、標準的なバイナリ分類器に比べて訓練の安定性と計画品質が向上する。
  • 計画は、逆近接スコアをエッジ重みとして用いる最短経路推論問題として実行され、ハイパーパrameterチューニングが最小限に抑えられる。
  • 既存のオフラインデータとリプレイを活用することで、新しい設定においても再収集なしに実画像上で計画が可能になる。
  • 古典的グラフ探索と深層生成モデリングを組み合わせることで、長時間スケールで解釈可能な視覚的計画を支援する。

実験結果

リサーチクエスチョン

  • RQ1画像空間における計画が、潜在空間における計画に比べ、計画の質と成功確率の面で優れているか?
  • RQ2幻覚データを用いて、再収集なしにトポロジカルメモリシステムが未確認の環境に一般化できるか?
  • RQ3対照的学習は、標準的な分類器に比べ、トポロジカルメモリの接続性学習の安定性と性能を向上させるか?
  • RQ4物体の幾何的性質(例:形状、方向)が、明示的な教師なしでデータから暗黙的に学習され、視覚的計画に利用できるか?
  • RQ5単純で解釈可能な計画手法が、ゼロショット視覚的計画タスクで最先端の性能を達成できるか?

主な発見

  • ブロックウォールドメインでは、HTMは簡単なタスクで100%の成功確率、難しいタスクで70%を達成し、Visual Foresight(それぞれ60%と10%)を上回った。
  • ブロックインサーションドメインでは、HTMは簡単なタスクで100%、難しいタスクで70%の成功確率を達成したが、Visual Foresightは回転計画ができないため、多くの難しいタスクで失敗した。
  • HTMは、狭い開口部を通過させるためにブロックを回転させるような複雑な操作を成功裏に計画し、データから暗黙的に幾何的推論を獲得していることを示した。
  • Sawyerロボットのシミュレーションでは、HTMはリプレイバッファからの実画像のみを用いて、未確認の14のテストタスクのうち12つで実行可能な計画を生成した。
  • アブレーションスタディの結果、対照的エネルギーモデルと逆スコアエッジ重み付けを用いることで、SPTMベースラインに比べて最終的なゴールまでの距離が顕著に減少した。
  • HTMの計画はSPTMよりも解釈可能で滑らかで、最小限のハイパーパrameterチューニングで実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。