Skip to main content
QUICK REVIEW

[論文レビュー] Detailed 2D-3D Joint Representation for Human-Object Interaction

Yong–Lu Li, Xinpeng Liu|arXiv (Cornell University)|Apr 17, 2020
Human Pose and Action Recognition参考文献 61被引用数 17
ひとこと要約

本稿では、1枚のビューからの再構成と透視投影を用いて詳細な3Dボディ形状(顔および手)と推定された3Dオブジェクト位置を活用する、人間-オブジェクトインタラクション(HOI)検出のための新しい2次元-3次元連携表現学習フレームワーク、DJ-RNを提案する。2Dおよび3D特徴をクロスモーダル整合性タスクを通じて統合することで、HICO-DETおよび新しい曖昧なベンチマークAmbiguous-HOIにおいて、それぞれ21.34 mAPおよび10.37 mAPの最先端性能を達成した。

ABSTRACT

Human-Object Interaction (HOI) detection lies at the core of action understanding. Besides 2D information such as human/object appearance and locations, 3D pose is also usually utilized in HOI learning since its view-independence. However, rough 3D body joints just carry sparse body information and are not sufficient to understand complex interactions. Thus, we need detailed 3D body shape to go further. Meanwhile, the interacted object in 3D is also not fully studied in HOI learning. In light of these, we propose a detailed 2D-3D joint representation learning method. First, we utilize the single-view human body capture method to obtain detailed 3D body, face and hand shapes. Next, we estimate the 3D object location and size with reference to the 2D human-object spatial configuration and object category priors. Finally, a joint learning framework and cross-modal consistency tasks are proposed to learn the joint HOI representation. To better evaluate the 2D ambiguity processing capacity of models, we propose a new benchmark named Ambiguous-HOI consisting of hard ambiguous images. Extensive experiments in large-scale HOI benchmark and Ambiguous-HOI show impressive effectiveness of our method. Code and data are available at https://github.com/DirtyHarryLYL/DJ-RN.

研究の動機と目的

  • 2DベースのHOI検出の限界に対処する。これは、2Dポーズおよび外観の情報が疎であるため、視点の曖昧性に苦しむ。
  • 粗い3Dジョイント表現の不十分さを克服するため、より豊かな幾何学的および意味的理解を得るために、顔および手の詳細な3次元人体形状を統合する。
  • 2D空間的配置とカテゴリープライアを用いて、オブジェクトの位置とサイズを推定することで、相互作用するオブジェクトの3次元表現を導入する。
  • クロスモーダル整合性を強制することで、不確かさの低減と耐性を向上させる、2D-3D連携学習フレームワークを開発する。
  • 2Dの視点の曖昧性を解消する能力を厳密に評価できるように、HICO検出における2Dの曖昧性を扱う新しいベンチマーク、Ambiguous-HOIを提案する。

提案手法

  • SMPLify-Xなどの1枚のビューによる人体キャプチャを活用し、顔および手の幾何形状を含む詳細な3次元人体形状を再構成する。
  • 2Dでの人間-オブジェクト空間的関係とオブジェクトカテゴリープライアを用いて、3次元オブジェクトの位置とサイズを推定し、正規化された3次元ボリューム内に空洞の球体として表現する。
  • 3次元人間とオブジェクトの表現を共通の3次元空間に配置することで、3次元HOI空間的配置ボリュームを構築する。
  • RGB画像と3次元ボリュームからモダリティ固有の特徴を抽出する2D-RNおよび3D-RNを備えたデュアルストリームネットワーク(DJ-RN)を設計する。
  • 3つのタスクを通じてクロスモーダル整合性を強制する:3次元空間特徴に従ってガイドされる2D特徴のアライメント、2Dおよび3D特徴間の意味的アライメント、ボディパーツのための共同注目学習。
  • 損失関数を用いたマルチタスク学習を実施する:$γ_{att}$ は注目一致性、$γ_{tri}$ は三重項対照学習、$γ_{sem}$ は意味的整合性を目的とする。

実験結果

リサーチクエスチョン

  • RQ1顔および手の詳細な3次元人体表現は、粗い3次元ジョイントと比較して、HOI検出性能を顕著に向上させるか?
  • RQ22Dの1枚のビューからの2次元のキューとカテゴリープライアを用いた3次元オブジェクト推定は、HOI理解の向上にどの程度効果的か?
  • RQ3クロスモーダル整合性を強制する2D-3D連携表現学習は、視点の曖昧性がある画像における不確かさの解消をどの程度向上させるか?
  • RQ4Ambiguous-HOIのような新しいベンチマークは、2Dの曖昧性に対するモデルの耐性を効果的に評価・区別できるか?
  • RQ5提案された連携学習フレームワークは、単独の2Dまたは3Dモデルと比較して、レアおよび長尾のHOIカテゴリへの一般化能力が優れているか?

主な発見

  • DJ-RNはHICO-DET Default Fullセットで21.34 mAPを達成し、以前の最先端手法を1.94 mAP上回った。
  • 提案されたAmbiguous-HOIベンチマークでは、DJ-RNは次に優れた手法(Juliaら)を0.65 mAP上回った。
  • 3D-RNコンponent単体でもHICO-DETで12.41 mAPを達成し、非レアカテゴリ(22.18 mAP)よりもレアカテゴリ(18.53 mAP)でより高い一般化性能を示した。これは、データ依存性が低いことを示唆している。
  • アブレーションスタディの結果、手および顔の詳細を削除すると、それぞれ0.51および0.32 mAPの性能低下が生じ、手関連の行動においてその重要性が確認された。
  • すべての整合性損失($\mathcal{L}_{att}$, $\mathcal{L}_{tri}$, $\mathcal{L}_{sem}$)を含む連携学習フレームワークは21.34 mAPを達成したが、いずれかの損失を削除すると性能が0.5–0.6 mAP低下した。
  • 可視化結果から、2Dおよび3Dの注目マップがよく一致しており、意味的に関連するボディパーツ(例:『切る』では手、『話す』では顔)に注目していることが確認された。これにより、整合性学習の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。