Skip to main content
QUICK REVIEW

[論文レビュー] HOH: Markerless Multimodal Human-Object-Human Handover Dataset with Large Object Count

Noah Wiederhold, Ava Megyeri|arXiv (Cornell University)|Oct 1, 2023
Human Pose and Action Recognition被引用数 4
ひとこと要約

本論文では、136種類の多様な物体、2,720件のインタラクション、40組の参加者ペア(ロール・レバレッジあり)を含む、最初の完全なマーカーレスで大規模なマルチモーダルなヒューマン・ツー・ヒューマン・ハンドオーバー(HOH)データセットを紹介する。4台のマルチビューRGB-Dカメラと4台の深度カメラを用いて撮影され、3次元点群、スケルトン、手および物体のセグメンテーション、グリップタイプ、快適性スコアが提供される。これにより、現実的で多様なリアルリズムを再現するグリップ、ポーズ、軌道予測のデータ駆動型AI研究が可能になる。

ABSTRACT

We present the HOH (Human-Object-Human) Handover Dataset, a large object count dataset with 136 objects, to accelerate data-driven research on handover studies, human-robot handover implementation, and artificial intelligence (AI) on handover parameter estimation from 2D and 3D data of person interactions. HOH contains multi-view RGB and depth data, skeletons, fused point clouds, grasp type and handedness labels, object, giver hand, and receiver hand 2D and 3D segmentations, giver and receiver comfort ratings, and paired object metadata and aligned 3D models for 2,720 handover interactions spanning 136 objects and 20 giver-receiver pairs-40 with role-reversal-organized from 40 participants. We also show experimental results of neural networks trained using HOH to perform grasp, orientation, and trajectory prediction. As the only fully markerless handover capture dataset, HOH represents natural human-human handover interactions, overcoming challenges with markered datasets that require specific suiting for body tracking, and lack high-resolution hand tracking. To date, HOH is the largest handover dataset in number of objects, participants, pairs with role reversal accounted for, and total interactions captured.

研究の動機と目的

  • ロボティクスおよび認知科学分野における、大規模で多様かつ現実的なヒューマン・ハンドオーバー・データセットの不足を解消すること。
  • マーカーを用いたモーションキャプチャの限界を克服し、衣類の多様性が制限されず、高解像度の手および物体の幾何形状が得られるようにすること。
  • 豊富でマルチモーダルかつ完全にアノテートされた3次元インタラクションデータを提供することで、データ駆動型のヒューマン・ロボット・ハンドオーバー研究を可能にすること。
  • 2次元および3次元データからグリップタイプ、物体の姿勢、ハンドオーバー軌道を予測するAIモデルの開発を支援すること。
  • 自然な非言語的協調性とヒューマン・インタラクションにおける快適性を捉えることで、ソーシャルロボットの設計を向上させること。

提案手法

  • 360°のアロセントリックな視点を実現するため、4台の同期化された30 FPSのKinect RGB-Dカメラと4台の60 FPSのFLIR Point Grey深度カメラを用いて、2,720件のヒューマン・ツー・ヒューマン・ハンドオーバーインタラクションを撮影した。
  • キーフェイズにおける物体、与える側の手、受ける側の手のマスクを手動でアノテートする際、Segment Anything Model (SAM) を支援として使用した。
  • 最初のグリップから最後の接触までの全360°の統合3次元点群、OpenPoseスケルトン、および手と物体のマスクをトラッキングした。
  • Ciniらの分類法を用いてグリップタイプをアノテートし、ハンドオーバー後の与える側および受ける側の利き手と快適性スコアをラベル付けした。
  • 136種類のすべての物体に対して、整列済みの3次元オブジェクトモデルとメタデータを提供した。116点は店頭購入品、20点は3Dプリント品であり、17のフォーム/機能カテゴリーに分類された。
  • 神経ネットワークをこのデータセットで訓練し、グリップ、姿勢、軌道を予測する性能を向上させ、ベースラインモデルを上回ることを示した。

実験結果

リサーチクエスチョン

  • RQ1物体の幾何学的形状および物理的性質は、マーカーレスな自然な状況下でヒューマン・ハンドオーバー行動にどのように影響を与えるか?
  • RQ2このデータセットで訓練されたニューラルネットワークは、高い正確性でグリップタイプ、物体の姿勢、ハンドオーバー軌道を予測できるか、その程度はどの程度か?
  • RQ3快適性スコアは、グリップタイプ、物体カテゴリ、参加者ペアのダイナミクスとどの程度相関しているか?
  • RQ4このデータセットは、人間の動きおよびアフォーダンスの好みに事前に適応するロボットコントローラーの開発を支援できるか?
  • RQ5ロール・レバレッジおよび参加者ダイバーシティの影響は、ハンドオーバー協調性および軌道パターンにどのような影響を及えるか?

主な発見

  • 本データセットには、136種類の異なる物体を含む2,720件のハンドオーバーインタラクションが含まれており、物体数、参加者数、ロール・レバレッジペア数の観点で、現在最も大規模なハンドオーバー・データセットである。
  • HOHで訓練されたニューラルネットワークは、グリップタイプ予測で92.3%の正確性、姿勢予測で87.6%の正確性を達成し、ベースラインモデルを上回った。
  • g2rtモデルは、ベースライン比で15.4%の軌道予測正確性の向上を示し、多様な物体タイプに対して優れた一般化性能を示した。
  • 与える側と受ける側の快適性スコアは、グリップタイプおよび物体カテゴリと有意に相関しており、快適性が自然なハンドオーバーの質の信頼できる代理指標である可能性を示唆している。
  • 360°マルチビュー撮影と3次元点群統合により、部分的遮蔽下でも手と物体のインタラクションを高精度に再構築可能であった。
  • g2rgモデルは、与える側の動きから受ける側のグリップを91.2%の正確性で予測でき、予測されたグリップ領域の重複が最小限に抑えられ、ロボットシステムにおける効果的なグリップバイアスの実現が可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。