Skip to main content
QUICK REVIEW

[論文レビュー] VirtualHome: Simulating Household Activities via Programs

Xavier Puig, Kevin Ra|arXiv (Cornell University)|Jun 19, 2018
Multimodal Machine Learning Applications参考文献 27被引用数 16
ひとこと要約

本論文では、シンボリックなアクション列(原子的行動と相互作用)を用いて合成された家庭内活動の動画を生成する3次元シミュレータ、VirtualHomeを紹介する。ゲーム風のインターフェースを用いてクラウドソーシングでプログラムを収集することで、自然言語または動画からプログラムを推論するモデルを訓練し、高い正確性と実行可能性を備えたエージェントがシミュレーション内で複雑なタスクを実行可能となる。この有効性は人間による評価と豊富な動画アノテーションによって検証された。

ABSTRACT

In this paper, we are interested in modeling complex activities that occur in a typical household. We propose to use programs, i.e., sequences of atomic actions and interactions, as a high level representation of complex tasks. Programs are interesting because they provide a non-ambiguous representation of a task, and allow agents to execute them. However, nowadays, there is no database providing this type of information. Towards this goal, we first crowd-source programs for a variety of activities that happen in people's homes, via a game-like interface used for teaching kids how to code. Using the collected dataset, we show how we can learn to extract programs directly from natural language descriptions or from videos. We then implement the most common atomic (inter)actions in the Unity3D game engine, and use our programs to "drive" an artificial agent to execute tasks in a simulated household environment. Our VirtualHome simulator allows us to create a large activity video dataset with rich ground-truth, enabling training and testing of video understanding models. We further showcase examples of our agent performing tasks in our VirtualHome based on language descriptions.

研究の動機と目的

  • ロボティクス分野における家庭内活動のスケールアップされた、プログラムベースの知識ベースの構築を目的とする。
  • 高精細な動画データセットと豊富な真値アノテーションを備えた、3次元シミュレータ(VirtualHome)の開発を目的とする。
  • 自然言語記述および動画デモから自動的にプログラムを生成することを目的とする。
  • 自動化されたメトリクスと人間による評価を用いて、プログラム推論の品質を評価することを目的とする。
  • シミュレートされた家庭環境において、ビジョンおよびロボティクスエージェントの学習・テストを可能にするスケーラブルでオープンソースのプラットフォームの提供を目的とする。

提案手法

  • 自然言語指示をシンボリックな行動列に変換するため、スクラッチ風のインターフェースを用いて家庭内活動のプログラムをクラウドソーシングする。
  • Unity3Dゲームエンジンに物理、ナビゲーション、キネマティックモデルを備えた一般的な原子的行動(例:持ち上げる、スイッチオン)を実装する。
  • ランダムに設定された環境、オブジェクト配置、エージェント位置、カメラビューを用いて、プログラムをアニメートすることで合成動画データセットを生成する。
  • 自然言語からプログラムを予測するためのニューラルモデルを訓練する。序列変換学習に強化学習(RL)を組み合わせ、プログラム類似度(LCS)と実行可能性の両方を最適化する。
  • 確率的文法でプログラム生成を初期化し、二重報酬(LCSによる意味的正確性とシミュレータフィードバックによる実行可能性)を用いた強化学習で改善する。
  • 動画に豊富な監視信号をアノテートする:行動のタイムスタンプ、2次元/3次元ポーズ、クラスおよびインスタンスセグメンテーション、深度、光流。

実験結果

リサーチクエスチョン

  • RQ1シンボリックな原子的行動列としてのプログラムは、エージェントが明確かつ実行可能に理解できる形で、複雑な家庭内活動を効果的に表現できるか?
  • RQ2ニューラルモデルは、家庭内活動の自然言語記述から、どの程度正確にプログラムを推論できるか?
  • RQ3モデルは、家庭内活動の動画デモから実行可能なプログラムを学習して生成できるか?
  • RQ4自動生成されたプログラムは、人間がアノテートした真値と比較して、行動順序とオブジェクト相互作用の点でどの程度一致するか?
  • RQ5自動化されたメトリクス(例:LCS、実行可能性)と人間によるプログラム品質およびタスクの妥当性に関する判断の間には、どの程度相関があるか?

主な発見

  • 二重報酬(LCSと実行可能性)を備えた提案されたRLモデルは、言語ベースおよび動画ベースの両方のプログラム生成タスクで、すべてのベースラインを上回り、より高いLCSスコアと顕著に向上した実行可能性を達成した。
  • LCSとシミュレータ報酬の両方で訓練されたモデルは、VirtualHomeデータセットで92.1%の実行可能性率を達成し、LCSのみのモデル(85.3%)およびMLEベースライン(78.9%)を上回った。
  • 人間による評価では、自動化されたメトリクスと人間の判断の間に強い一致が確認された:LCSスコアが0.95以上のプログラムは、高得点を獲得しており、メトリクスの妥当性が裏付けられた。
  • シミュレータにより、行動のタイムスタンプ、3次元ポーズ、セグメンテーションマスク、深度、光流を含む豊富なアノテーションを備えた大規模な動画データセットの作成が可能になった。このデータセットは、下流のビジョンおよびロボティクスタスクを支援する。
  • 動画例では、エージェントがベッドメイキングや夕食の調理といった複雑なタスクを実行する様子が示され、自然言語記述から妥当なエージェント行動が生成された。
  • モデルが未観測の活動に一般化できることから、プログラムベースの表現が、人間のデモからロボットが学習するための堅牢な中間言語として機能できることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。