Skip to main content
QUICK REVIEW

[論文レビュー] Learning Robot Activities from First-Person Human Videos Using Convolutional Future Regression

Jangwon Lee, Michael S. Ryoo|arXiv (Cornell University)|Mar 3, 2017
Human Pose and Action Recognition参考文献 18被引用数 5
ひとこと要約

本稿では、ラベルなしの第一人称視覚データからロボットが新しい活動を直接学習できる、画期的な教師なし深層学習手法を提案する。完全畳み込みネットワークを用いて将来の手および物体の位置を回帰することで、ラベルなしの実証データや事前定義された原子的動作を必要とせず、リアルタイムでエンドツーエンドのモータ制御推論を実現する。この手法により、ベースラインと比較して人間-ロボット協働の成功確率が顕著に向上した。

ABSTRACT

We design a new approach that allows robot learning of new activities from unlabeled human example videos. Given videos of humans executing the same activity from a human's viewpoint (i.e., first-person videos), our objective is to make the robot learn the temporal structure of the activity as its future regression network, and learn to transfer such model for its own motor execution. We present a new deep learning model: We extend the state-of-the-art convolutional object detection network for the representation/estimation of human hands in training videos, and newly introduce the concept of using a fully convolutional network to regress (i.e., predict) the intermediate scene representation corresponding to the future frame (e.g., 1-2 seconds later). Combining these allows direct prediction of future locations of human hands and objects, which enables the robot to infer the motor control plan using our manipulation network. We experimentally confirm that our approach makes learning of robot activities from unlabeled human interaction videos possible, and demonstrate that our robot is able to execute the learned collaborative activities in real-time directly based on its camera input.

研究の動機と目的

  • ラベルなしの第一人称視覚データから、アクティビティのラベルや事前定義された原子的動作を必要とせずに、ロボットが新しい活動を学習できるようにすること。
  • 現実世界のロボットデータが限られているという課題に対処するため、人間の対照的動画をスケーラブルな教育リソースとして活用すること。
  • 視覚的観測をモータ制御ポリシーにマッピングするリアルタイムでエンドツーエンドのシステムを構築し、手および物体の位置の将来予測を用いること。
  • 手動で定義された運動ポリシーの必要性を排除し、予測された将来状態から直接モータ命令を推論すること。

提案手法

  • 第一人称動画フレーム内の人の手および物体を検出・表現するために、SSDオブジェクト検出ネットワークを拡張する。
  • 将来のフレーム(例:1〜2秒先)の間接的シーン表現を予測する完全畳み込み未来回帰ネットワークを導入する。
  • 動画シーケンスにおける時間的整合性を用いて、予測された将来の手および物体の位置を監視として、未来回帰ネットワークを教師なしで訓練する。
  • 未来回帰の出力を操作ネットワークと組み合わせ、2次元画像空間における手の位置を7自由度のロボット関節角にマッピングする。
  • アクションラベルや手/ポーズのアノテーションが不要な動画データのみを用いて、エンドツーエンドで全システムを訓練する。
  • 1枚のGPUで1フレームあたり約100msのリアルタイム推論を実現し、ライブな人間-ロボット協働を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ロボットは、アクションアノテーションやデモンストレーションが一切ない状態で、ラベルなしの第一人称視覚データから新しい協働的アクティビティを学習できるか?
  • RQ2未来回帰ネットワークは、第一人称動画における人の手および物体の位置の空間的・時間的変化をどの程度正確に予測できるか?
  • RQ3将来の手の位置を予測することで、ロボットがリアルタイムで正確かつ的確なモータ制御命令を生成する能力がどの程度向上するか?
  • RQ4提案手法の教師なしアプローチは、教師ありまたはベースライン手法と比較して、人間-ロボット協働の成功度においてどの程度優れているか?

主な発見

  • 提案手法は、人間-ロボット協働タスクにおいて平均3.29(5段階評価)のユーザー評価スコアを達成し、すべてのベースライン(1.72、1.92、2.29)を顕著に上回った。
  • 参加者は、テーブルを片付ける(3.17/5)およびトレイビットを渡す(3.42/5)というタスクにおいて、ロボットの実行能力をより高く評価しており、タスク成功の認識が強いことが示された。
  • 1枚のTitan X GPUを用いて1フレームあたり約100msの速度でリアルタイムで動作し、ライブな人間-ロボット相互作用を可能にした。
  • 未来回帰ネットワークは、将来のフレームに重ねて描画された予測と一致する高精度な将来の手の位置を予測できた。
  • 未来回帰の訓練が教師なしであったため、ラベル付き遷移やアクションシーケンスを必要とせず、さまざまなアクティビティに一般化することができた。
  • 知覚と操作のコンポonentの組み合わせにより、明示的な運動計画や手動で定義されたポリシーがなくても、視覚入力のみで複雑な協働タスクを実行できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。