Skip to main content
QUICK REVIEW

[論文レビュー] An End-to-End Network for Generating Social Relationship Graphs

Arushi Goel, Keng Teck|arXiv (Cornell University)|Mar 23, 2019
Multimodal Machine Learning Applications参考文献 27被引用数 7
ひとこと要約

本論文では、メッセージパッシングを用いてノード(人物)およびエッジ(関係)の状態を反復的に更新することで、画像から構造的で解釈可能な社会的関係グラフを生成する、エンド・トゥ・エンドで学習可能なニューラルネットワークSRG-GNを提案する。このモデルは、社会的関係認識タスクで最先端の性能を達成し、PISCデータセットで71.6%のmAPを記録しており、シーンの文脈、属性、および再帰的メッセージパッシングを統合することの有効性を示している。

ABSTRACT

Socially-intelligent agents are of growing interest in artificial intelligence. To this end, we need systems that can understand social relationships in diverse social contexts. Inferring the social context in a given visual scene not only involves recognizing objects, but also demands a more in-depth understanding of the relationships and attributes of the people involved. To achieve this, one computational approach for representing human relationships and attributes is to use an explicit knowledge graph, which allows for high-level reasoning. We introduce a novel end-to-end-trainable neural network that is capable of generating a Social Relationship Graph - a structured, unified representation of social relationships and attributes - from a given input image. Our Social Relationship Graph Generation Network (SRG-GN) is the first to use memory cells like Gated Recurrent Units (GRUs) to iteratively update the social relationship states in a graph using scene and attribute context. The neural network exploits the recurrent connections among the GRUs to implement message passing between nodes and edges in the graph, and results in significant improvement over previous methods for social relationship recognition.

研究の動機と目的

  • 知識グラフを用いて、視覚的シーンにおける社会的関係の構造的かつ解釈可能な表現を開発すること。
  • 物体検出をはるかに超える、潜在的な社会的ヒントを含む、視覚的入力から高レベルの社会的意味(例:家族、友人、同僚)を推論する課題に対処すること。
  • 統一的かつ学習可能なグラフ生成フレームワークを通じて、シーンの文脈、人の属性、行動特徴を統合することで、社会的関係認識を向上させること。
  • 再帰的メッセージパッシングが、視覚分野における社会的理解のためのグラフニューラルネットワークにおいて、どの程度有効であるかを示すこと。

提案手法

  • モデルは、人物の属性とシーンの文脈を含む画像領域からの視覚的特徴を抽出するために、マルチネットワーク畳み込みニューラルネットワーク(MN-CNN)を用いる。
  • 2種類のゲート付き再帰ユニット(GRUs)を採用する:属性特徴を用いてノード(人物)状態をモデル化するPPair GRUs、およびシーンと行動特徴を用いてエッジ(関係)状態をモデル化するRship GRUs。
  • メッセージパッシングは、GRUs間の再帰的接続によって実装され、エッジ状態が隣接するノード状態と隣接するエッジ状態の両方を用いて更新されることで、関係予測の反復的改善が可能になる。
  • グラフ推論ネットワーク(SRG-IN)は、複数のメッセージパッシング反復にわたる時間ステップの平均プーリングを用いて情報の集約を行い、耐性性と正確性を向上させる。
  • 全アーキテクチャはエンド・トゥ・エンドで学習可能であり、社会的関係グラフ生成(SRGGen)と社会的関係認識(SRRec)の両方を同時に最適化する。
  • モデルは、関係の解釈を明確にするために、グローバルなシーンの文脈を重要な入力として組み込んでいる。
Figure 1: For a given scene, our network generates a structured representation – a Social Relationship Graph. Graph representations have shown good results on a variety of high-level vision tasks, e.g. image retrieval and visual Q&A.
Figure 1: For a given scene, our network generates a structured representation – a Social Relationship Graph. Graph representations have shown good results on a variety of high-level vision tasks, e.g. image retrieval and visual Q&A.

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、単一の画像入力から、構造的で人間が解釈可能な社会的関係グラフを直接生成できるか?
  • RQ2シーンの文脈と属性特徴を統合することで、個別のペアワイズ予測と比較して、社会的関係認識の正確性がどの程度向上するか?
  • RQ3ノードとエッジ間の再帰的メッセージパッシングは、グラフ構造的表現における関係予測をどの程度向上させるか?
  • RQ4社会的理解タスクにおけるグラフ推論において、最適なメッセージパッシングの反復回数とプーリング戦略は何か?

主な発見

  • 提案されたSRG-GNモデルは、社会的関係認識タスクにおいて、PISCデータセットで71.6%のmAPという最先端の平均平均精度を達成した。
  • モデルからシーンの文脈を除去すると、性能が著しく低下し、mAPが69.2%に低下した。これは、社会的関係の解釈を明確にするためにグローバルな文脈が極めて重要であることを示している。
  • アブレーションスタディの結果、最大プーリング(52.16%)よりも平均プーリング(53.56%)の方が優れた性能を示し、より効果的な情報集約が可能であることがわかった。
  • メッセージパッシングの時間ステップ数を2つを超えて増加させると、性能が低下する(平均プーリングでは53.56%から52.08%に低下)。これは、過剰な反復がノイズを導入する可能性があることを示している。
  • MN-CNNモジュールのみを搭載したモデルは60.2%のmAPを記録したが、これは完全なSRG-GNモデルに劣り、グラフベースのメッセージパッシングの価値を示している。
  • 定性的な分析により、モデルが隣接するノードやエッジからの文脈的ヒントを活用して誤予測を是正していることが確認された。例えば、個別のペア予測が失敗する状況でも、バンドメンバーを正しく特定している。
Figure 2: SRG-GN: Our proposed end-to-end network for Social Relationship Graph generation. We take the single body images, $I_{1}$ and $I_{2}$ , and the “context image” (smallest image that contains both single-body images), $I_{c}$ as input to the SN1 and SN2 sub-modules of the MN-CNN module and f
Figure 2: SRG-GN: Our proposed end-to-end network for Social Relationship Graph generation. We take the single body images, $I_{1}$ and $I_{2}$ , and the “context image” (smallest image that contains both single-body images), $I_{c}$ as input to the SN1 and SN2 sub-modules of the MN-CNN module and f

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。