Skip to main content
QUICK REVIEW

[論文レビュー] Contextual Heterogeneous Graph Network for Human-Object Interaction Detection

Hai Wang, Wei‐Shi Zheng|arXiv (Cornell University)|Oct 20, 2020
Multimodal Machine Learning Applications参考文献 38被引用数 8
ひとこと要約

本稿では、人間と物体を別々のノードタイプとして扱い、ヒューマンオブジェクトインタラクション(HOI)検出におけるクラス内(同種)およびクラス間(異種)のメッセージパッシングを捉えるための文脈的非均質的グラフネットワーク(CHGN)を提案する。文脈的に関連するメッセージの重み付けにグラフアテンション機構を活用することで、V-COCOおよびHICO-DETの両ベンチマークで最先端の性能を達成し、先行手法に比べて最大0.7 mAPおよびHICO-DETでは相対的に34%の向上を達成した。

ABSTRACT

Human-object interaction(HOI) detection is an important task for understanding human activity. Graph structure is appropriate to denote the HOIs in the scene. Since there is an subordination between human and object---human play subjective role and object play objective role in HOI, the relations between homogeneous entities and heterogeneous entities in the scene should also not be equally the same. However, previous graph models regard human and object as the same kind of nodes and do not consider that the messages are not equally the same between different entities. In this work, we address such a problem for HOI task by proposing a heterogeneous graph network that models humans and objects as different kinds of nodes and incorporates intra-class messages between homogeneous nodes and inter-class messages between heterogeneous nodes. In addition, a graph attention mechanism based on the intra-class context and inter-class context is exploited to improve the learning. Extensive experiments on the benchmark datasets V-COCO and HICO-DET demonstrate that the intra-class and inter-class messages are very important in HOI detection and verify the effectiveness of our method.

研究の動機と目的

  • 人間と物体のノードを同一視する従来のグラフベースのHOI手法の限界を解決し、主語(subject)と対象(object)としての異なる役割を無視しないこと。
  • 同種のエンティティ間(例:人間同士、物体同士)のメッセージと異種のエンティティ間(人物-物体ペア)のメッセージが、インタラクション推論において同等に重要ではないことを認識すること。
  • クラス内およびクラス間の文脈を明示的にモデル化する非均質的グラフニューラルネットワークを開発し、インタラクション検出を改善すること。
  • クラス内およびクラス間の文脈に基づいて、隣接ノードからの関連メッセージを動的に重み付けるためのグラフアテンション機構を統合すること。
  • ベンチマークデータセットを用いて、複数のインタラクションが存在する複雑なシーンにおけるメッセージタイプの区別が有効であることを実証すること。

提案手法

  • 人間と物体を非均質的グラフ内の別々のノードタイプとして表現し、異なるメッセージパッシングを可能にする。
  • 同じタイプのノード間(例:人間–人間、物体–物体)にクラス内エッジを定義し、類似性や文脈的関連性をエンコードする。
  • 人間ノードと物体ノード間のエッジを定義し、インタラクションの可能性や空間的関係をモデル化する。
  • クラス内およびクラス間の文脈特徴に基づいて、アテンションスコアを計算するグラフアテンション機構を導入する。
  • 学習されたアテンション重みに基づいてメッセージを集約し、より良いインタラクション予測のためのノード表現を精緻化する。
  • ボクシングボックスの局所化とインタラクションクラス予測を最適化するため、HOI検出のクロスエントロピー損失を用いてエンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1HOI検出においてクラス内とクラス間のメッセージを区別することで、同種グラフモデルに比べて性能向上が達成できるか?
  • RQ2クラス内メッセージ(例:人間同士の類似性、物体同士の類似性)とクラス間メッセージ(例:インタラクションの可能性)が、インタラクション推論にどのように異なる寄与をしているか?
  • RQ3クラス内およびクラス間の両方の文脈を考慮するグラフアテンション機構が、複雑なシーンにおける特徴表現をどの程度向上させるか?
  • RQ4提案された非均質的グラフモデルは、希少で複雑なインタラクションを含む多様なインタラクションタイプに一般化可能か?
  • RQ5V-COCOおよびHICO-DETといった標準的なHOIベンチマークで、既存の最先端手法を上回る性能を発揮できるか?

主な発見

  • 提案されたCHGNモデルは、V-COCOデータセットで52.7% mAPを達成し、以前のSOTA手法(PMFNet)を0.7ポイント上回った。
  • HICO-DETでは、Default設定で17.57% mAPを達成し、GPNNベースラインに比べて相対的に34%の向上を示した。
  • HICO-DETのKnown Object設定では21.08% mAPを達成し、以前のSOTA手法(PMFNet)を0.34ポイント上回った。
  • アブレーションスタディの結果、クラス内およびクラス間のメッセージ学習の両方が不可欠であり、特にクラス間メッセージがインタラクション推論に顕著な寄与をしていることが確認された。
  • 可視化結果から、モデルは複雑なシーンにおいて複数のインタラクションを正しく同定できており、相互作用のあるペアとそうでないペアを明確に区別していることが示された。
  • グラフアテンション機構は関連する近隣ノードに的確に注目できており、複数の人物や物体が存在するシーンでも耐障害性が向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。