Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Granularity Reasoning for Social Relation Recognition from Images

Meng Zhang, Xinchen Liu|arXiv (Cornell University)|Jan 10, 2019
Human Pose and Action Recognition参考文献 28被引用数 4
ひとこと要約

本稿では、画像内の社会的関係認識のためのマルチスケール推論(MGR)フレームワークを提案する。このフレームワークは、グローバルなシーン特徴、中位レベルの人物-物体領域表現、および細粒度のポーズ誘導型グラフを統合することで、視覚的・社会的ドメインのギャップを埋める。ポーズに注意を払った人物-物体および人物-ポーズグラフをグラフ畳み込みネットワーク(GCN)と組み合わせることで、2つの公開データセットにおいて最先端の性能を達成し、多様な関係タイプにわたって優れた正確性と頑健性を示した。

ABSTRACT

Discovering social relations in images can make machines better interpret the behavior of human beings. However, automatically recognizing social relations in images is a challenging task due to the significant gap between the domains of visual content and social relation. Existing studies separately process various features such as faces expressions, body appearance, and contextual objects, thus they cannot comprehensively capture the multi-granularity semantics, such as scenes, regional cues of persons, and interactions among persons and objects. To bridge the domain gap, we propose a Multi-Granularity Reasoning framework for social relation recognition from images. The global knowledge and mid-level details are learned from the whole scene and the regions of persons and objects, respectively. Most importantly, we explore the fine-granularity pose keypoints of persons to discover the interactions among persons and objects. Specifically, the pose-guided Person-Object Graph and Person-Pose Graph are proposed to model the actions from persons to object and the interactions between paired persons, respectively. Based on the graphs, social relation reasoning is performed by graph convolutional networks. Finally, the global features and reasoned knowledge are integrated as a comprehensive representation for social relation recognition. Extensive experiments on two public datasets show the effectiveness of the proposed framework.

研究の動機と目的

  • 画像における視覚的特徴と意味的社會的関係の間の顕著なドメインギャップに対処すること。
  • 外見や共起性のみに依存する単一スケール表現に依存する従来手法の限界を克服すること。
  • グローバルなシーン、領域レベルの人物/物体特徴、および細粒度の相互作用を統合することで、認識の正確性を向上させること。
  • ポーズ誘導型グラフ構造を用いて、人物と物体の行動および人物間相互作用をモデル化し、より豊かな関係的推論を実現すること。
  • 多様な関係タイプ、特に曖昧またはリソースが乏しい関係においても、一貫性があり優れた性能を発揮すること。

提案手法

  • 全画像からグローバルなシーンレベル特徴を抽出するために、深層畳み込みニューラルネットワーク(例:ResNet)を用いる。
  • 物体検出器を用いて人物と物体を局所化し、領域表現のためのCNNにより中位レベルの視覚的特徴を抽出する。
  • 人体のポーズキーポoinを抽出し、2つの新規グラフ(人物-物体グラフ(POG)と人物-ポーズグラフ(PPG))の構築を誘導する。
  • 空間的およびポーズに整合した相互作用の手がかりに基づいて、人物と物体を接続することでPOGを構築し、人物から物体への行動をモデル化する。
  • ペアド人物間のキーポイントに基づく接続を用いて、PPGを構築し、人間関係の相互作用を捉える。
  • メッセージパッシングを用いて、両方のグラフ上でグラフ畳み込みネットワーク(GCN)を用いて関係的推論を実行し、表現を精緻化する。

実験結果

リサーチクエスチョン

  • RQ1グローバル、領域、細粒度のマルチスケール視覚的表現は、単一レベルの特徴を超えて社会的関係認識を向上させるか?
  • RQ2ポーズ誘導型グラフモデリングは、関係的推論に向けた意味的な人物-物体および人物-人物の相互作用をどれほど効果的に捉えられるか?
  • RQ3グローバルシーン、領域の手がかり、および相互作用グラフからの補完的特徴は、多様な関係タイプにわたって認識性能をどの程度向上させるか?
  • RQ4複数のスケールを統合することで、曖昧またはレアな関係においても一貫性があり頑健な性能が得られるか?
  • RQ5GCNを用いたグラフベースの推論は、視覚入力と意味的社會的関係の間のドメインギャップを効果的に埋め合わせられるか?

主な発見

  • MGRフレームワークは、PISAおよびPIPAの両データセットで最先端の性能を達成し、全体の正確性において既存手法を上回った。
  • グローバル特徴、POG、PPG、およびラテナル融合を含む完全なMGRフレームワークが最高の性能を発揮し、マルチスケール特徴の補完的利点を実証した。
  • ポーズ誘導型POGは、ポーズなしPOGを著しく上回り、関係認識におけるアクションに注意を払ったモデリングの重要性を裏付けた。
  • PPGモジュールは、友人、家族、カップルなど、対人関係の認識を向上させ、特にその分野で効果を示した。
  • グローバル特徴は、職業的、商業的関係など、対人関係が薄い関係タイプに対してより効果的であり、シーンレベルの手がかりがこのようなカテゴリにおいてより関連性があることを示した。
  • 本手法は、注意メカニズムに基づくモデルが不要な文脈的対象に惑わされるのとは異なり、すべての関係タイプで一貫した性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。