Skip to main content
QUICK REVIEW

[論文レビュー] Datasets on object manipulation and interaction: a survey

Yongqiang Huang, Yu Sun|arXiv (Cornell University)|Jul 2, 2016
Human Pose and Action Recognition参考文献 20被引用数 7
ひとこと要約

本稿は、2009年から2015年までの20の最近のデータセット(物体操作と相互作用に焦点を当てたもの)について包括的なサーベイを提示し、そのモダリティ、アノテートされた活動、研究用途における適性を評価している。本稿は、モダリティの可用性、物体の識別可能性、時間的セグメンテーションの観点からデータセットを比較し、ロボティクスおよび人間-ロボットインタラクション分野における今後のデータセット設計のための提言を提示している。

ABSTRACT

A dataset is crucial for model learning and evaluation. Choosing the right dataset to use or making a new dataset requires the knowledge of those that are available. In this work, we provide that knowledge, by reviewing twenty datasets that were published in the recent six years and that are directly related to object manipulation. We report on modalities, activities, and annotations for each individual dataset and give our view on its use for object manipulation. We also compare the datasets and summarize them. We conclude with our suggestion on future datasets.

研究の動機と目的

  • 2009年から2015年までの間に発表された、物体操作に直接関連する20のデータセットについて、研究者が活用可能な体系的かつ最新のレビューを提供すること。
  • 各データセットのモダリティ、アノテートされた活動、時間的セグメンテーションに基づいて評価を行い、物体操作分野における研究適性を検証すること。
  • 特に物体の識別可能性とアノテーション構造の観点から、データセット間の共通点と相違点を特定し、データセット選定の支援を行うこと。
  • 特に6次元物体ポーズ追跡や運動学的データの欠落といった、現在のデータセットにおけるギャップを特定し、今後のデータ収集における改善策を提言すること。
  • 行動認識、模倣学習、人間-ロボットインタラクションなどのタスクにおける適切なデータセット選定を支援するため、比較的洞察を提供すること。

提案手法

  • 2009年から2015年までの間に発表された、物体操作および相互作用に関連するデータセットを体系的にサーベイ・分析した。
  • 各データセットは、出版物と整合性があるかを確認するためにダウンロード・検証された。曖昧な点が生じた場合には、著者に連絡を取った。
  • データセットは、調理行動(例:Slice&Dice、CMU-MMAC)と日常的行動(ADL)(例:Gaze、NTU-Action)の2つのグループに分類され、時系列順に並べられた。
  • 各データセットについて、モダリティ(例:RGB動画、深度、IMU、RFID、モーショントラッキング)、アノテートされた活動(動詞-目的語-前置詞構造)、時間的セグメンテーション(例:タイムスタンプ、フレーム番号、字幕)を分析した。
  • 3つの基準(モダリティの可用性、アノテーション内での物体識別可能性、時間的セグメンテーション形式)に基づいて、比較的要約を生成した。
  • 複数のデータセットに共通するアノテートされた活動(例:'phoneを使う'、'ドアを開ける')を特定し、表形式で整理することで、共通認識の強化とマルチデータセット分析の支援を図った。

実験結果

リサーチクエスチョン

  • RQ1過去6年間で、物体操作研究に最も適したデータセットは何か。また、それらはどのようなモダリティを提供しているか。
  • RQ2これらのデータセットのアノテーションは、物体操作行動をどのように表現しているのか。具体的には、どのような形式をとっているか(例:動詞-目的語フレーズ、タイムスタンプ、フレーム番号)。
  • RQ3アノテートされた活動内での物体の識別性はどの程度か。また、センサーベースまたはアノテーションベースの手法によって、その識別性はどのようにサポートされているか。
  • RQ4物体操作研究における現在のデータセットの主な制限要因は何か。特に、3次元物体ポーズ追跡や運動学的データの欠落について説明せよ。
  • RQ5研究者が既存のデータセットをマルチデータセット分析に効果的に活用するにはどうすればよいか。また、新しいデータセット作成のためのガイドラインとなる基準は何か。

主な発見

  • 6次元物体ポーズの推定トラジェクトリを提供するのは、[10]の1つのデータセットにとどまっている。これは、大多数のデータセットにおいて明示的な物体ポーズ追跡が欠落しているという深刻なギャップを示している。
  • 物体に埋め込みセンサ(例:加速度計)を搭載したデータセット(例:[1]、[7]、[14])は、画像のみまたは人間中心のモダリティよりも、操作分析に直接的かつ有用なデータを提供している。
  • GazeおよびGaze+データセットは、高解像度のエゴセントリック動画に加え、視線追跡が可能であり、操作タスク中の注視行動の研究に貴重なデータを提供している。
  • 時間的セグメンテーションは一貫性が欠けている。多くのデータセットが明示的なタイムスタンプやフレーム番号を用いている一方、[13]、[15]、[18]など一部のデータセットでは非明示的セグメンテーションが用いられており、再現性に制限がある。
  • モダリティの多様性は見られるが、力、トルク、関節ポーズデータを含むデータセットはごくわずかである。これらは、模倣学習(LfD)やロボットポリシー学習において不可欠な情報である。
  • 複数のデータセットに共通するアノテートされた活動(例:'phoneを使う'、'ドアを開ける'、'液体を注ぐ')が特定され、共通の操作行動に対する合意形成が示された。これにより、マルチデータセットベンチマークの実現が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。