Skip to main content
QUICK REVIEW

[論文レビュー] Robot Learning and Execution of Collaborative Manipulation Plans from YouTube Videos.

Hejia Zhang, Stefanos Nikolaidis|arXiv (Cornell University)|Nov 25, 2019
Multimodal Machine Learning Applications参考文献 44被引用数 8
ひとこと要約

本論文では、言語的で階層的な行動表現を活用することで、非構造的なYouTube調理動画からロボットが共同で操作する計画を学習・実行できるフレームワークを提案する。物体のラベルが付された動画を処理し、実行可能なロボット計画を生成する。100本のキュレート済み動画および3本のフル長尺共同動画で成功を確認し、シミュレーションおよび実ロボットへのデプロイメントをサポートするオープンソースの環境を提供する。

ABSTRACT

People often watch videos on the web to learn how to cook new recipes, assemble furniture or repair a computer. We wish to enable robots with the very same capability. This is challenging; there is a large variation in manipulation actions and some videos even involve multiple persons, who collaborate by sharing and exchanging objects and tools. Furthermore, the learned representations need to be general enough to be transferable to robotic systems. On the other hand, previous work has shown that the space of human manipulation actions has a linguistic, hierarchical structure that relates actions to manipulated objects and tools. Building upon this theory of language for action, we propose a framework for understanding and executing demonstrated action sequences from full-length, unconstrained cooking videos on the web. The framework takes as input a cooking video annotated with object labels and bounding boxes, and outputs a collaborative manipulation action plan for one or more robotic arms. We demonstrate performance of the system in a standardized dataset of 100 YouTube cooking videos, as well as in three full-length Youtube videos that include collaborative actions between two participants. We additionally propose an open-source platform for executing the learned plans in a simulation environment as well as with an actual robotic arm.

研究の動機と目的

  • 人間がオンラインチュートリアルから学ぶのと同様に、非構造的でフル長尺のYouTube動画からロボットが複雑な操作タスクを学習できるようにすること。
  • Web動画における人間の行動のばらつき、多人数での協働、物や道具の共有といった課題に対処すること。
  • ロボット実行にマッピング可能な、一般化可能で転送可能な操作行動の表現を構築すること。
  • 物体レベルのラベルが付与された動画入力から実行可能なマルチロボット操作計画を生成できるシステムを構築すること。
  • シミュレーションおよび実ロボットアームでの学習計画の実行・検証を可能にするオープンソースプラットフォームを提供すること。

提案手法

  • 動画シーケンス内の行動、物体、道具の関係をモデル化するために、言語的で階層的な行動表現を活用する。
  • 物体ラベルとバウンディングボックスが付与された入力動画を処理し、空間的・時間的な行動セグメントを抽出する。
  • 観察された行動を物体操作関係に基づいた意味的行動空間にマッピングすることで、構造的な行動計画を推論する。
  • 推論された行動シーケンスと物体依存関係に基づき、1台以上のロボットアーム向けの共同操作計画を構築する。
  • 動画理解、行動セグメンテーション、計画生成を統合したモジュラーなパイプラインを採用し、ロボット実行に適した処理を実現する。
  • 学習済み計画の実行および検証を可能にする、オープンソースのシミュレーションおよび実ロボットインターフェースを提供する。

実験結果

リサーチクエスチョン

  • RQ1ロボットは、最小限の教師付き情報で、制限のないフル長尺のYouTube調理動画から共同操作計画を学習できるか?
  • RQ2言語的で階層的な行動表現は、多様な操作行動および多人数協働の文脈に一般化して機能するか?
  • RQ3学習済み計画は、実ロボットシステムへの実行にどの程度転送可能か?
  • RQ4このフレームワークは、Web動画における行動実行のばらつき、物体相互作用、道具の使用法の変化に対し、どの程度有効に機能するか?
  • RQ5物体レベルのラベルが付与された生動画入力から、実行可能なマルチロボット操作計画を生成できるか?

主な発見

  • フレームワークは、標準化されたデータセットに含まれる100本のYouTube調理動画に対して、実行可能な操作計画を正常に生成した。
  • 2名の参加者が協働する行動を含む3本のフル長尺動画において、安定した性能を示した。
  • オープンソースプラットフォームを用いて、シミュレーション環境および実ロボットアームでも学習済み計画が正常に実行された。
  • 言語的で階層的な行動表現により、多様な操作行動および物体相互作用への一般化が可能になった。
  • フレームワークは、学習済み計画の実ロボットシステムへの転送をサポートし、実用的応用の有効性を検証した。
  • オープンソースプラットフォームにより、今後のWebベースのロボット学習分野における研究の再現性と拡張性が促進された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。