Skip to main content
QUICK REVIEW

[論文レビュー] Dual-Glance Model for Deciphering Social Relationships

Junnan Li, Yongkang Wong|arXiv (Cornell University)|Aug 2, 2017
Multimodal Machine Learning Applications参考文献 35被引用数 7
ひとこと要約

本稿では、静止画における社会的関係認識のためのデュアル・グランスモデルを提案する。2段階のアテンション機構を用い、まずターゲットとなる人物ペアに注目して粗い予測を行い、次にアテンショナリーRCNNを用いて文脈的領域を活用して結果を精緻化する。主な貢献は、76,568件のアノテーションを含む22,670枚の画像を含むPISCデータセットの導入であり、アテンションを用いた文脈的推論により、最先端の性能を達成した。

ABSTRACT

Since the beginning of early civilizations, social relationships derived from each individual fundamentally form the basis of social structure in our daily life. In the computer vision literature, much progress has been made in scene understanding, such as object detection and scene parsing. Recent research focuses on the relationship between objects based on its functionality and geometrical relations. In this work, we aim to study the problem of social relationship recognition, in still images. We have proposed a dual-glance model for social relationship recognition, where the first glance fixates at the individual pair of interest and the second glance deploys attention mechanism to explore contextual cues. We have also collected a new large scale People in Social Context (PISC) dataset, which comprises of 22,670 images and 76,568 annotated samples from 9 types of social relationship. We provide benchmark results on the PISC dataset, and qualitatively demonstrate the efficacy of the proposed model.

研究の動機と目的

  • 静止画における社会的関係の認識という、より高レベルの社会的シーン理解への一歩を解決すること。
  • 物理的外見を超えた、洗練された高レベルの社会的ヒントをモデル化することで、既存の視覚的関係認識の限界を克服すること。
  • 人間の視覚的注意にインspiredされたバイオロジカルなビジョンモデルを構築し、2つの明確な注目段階(ターゲットペアへの注目、文脈的領域への注目)を実現すること。
  • 今後の社会的関係分析分野の研究を支援するため、大規模かつ公開可能なベンチマークデータセットを提供すること。
  • 局所的ペア特徴とグローバルな文脈的特徴を統合することで、より正確で解釈可能な社会的シーン理解を実現すること。

提案手法

  • デュアル・グランスアーキテクチャを提案:最初のグランスは、領域提案ネットワーク(RPN)を用いてターゲット人物ペアの特徴を抽出する。2番目のグランスは、結果の精緻化のための文脈的領域に注目する。
  • アテンショナリーRCNNを導入し、ターゲットペアに対する関連性に基づいて、関連する文脈的領域を動的に重みづけるボトムアップおよびトップダウンの両方のアテンションを適用する。
  • 複数の文脈的領域からの特徴を統合するために、ボック・オブ・ビジュアル・ワーズのアプローチを用い、最大値、平均値、LSEプーリング関数を用いる。
  • 重複する領域提案を削減するため、非最大抑制(NMS)を適用し、最適なパフォーマンスを得るためにハイパーパrameter(m=30の提案領域、τu=0.7の重複閾値)を調整する。
  • PISCデータセットを用いて、9つの社会的関係カテゴリと66の職業ラベルを用いた交差エントロピー損失で、モデルをエンド・ツー・エンドで訓練する。
  • 関係的モデル理論を活用して、家族やカップルといった親密な関係、職業的・商業的関係といった非親密な関係、および非関係を含む、階層的な社会的関係の分類体系を定義する。

実験結果

リサーチクエスチョン

  • RQ1局所的ペア特徴と文脈的特徴の両方を活用することで、ビジョンモデルは静止画における社会的関係を効果的に認識できるか?
  • RQ2アテンション機構が、社会的関係認識の向上に寄与する関連する文脈的領域を選択する際の影響は何か?
  • RQ3複数の文脈的領域からの特徴を統合する際、最大値、平均値、LSEといった異なる集約関数は、どのように性能を発揮するか?
  • RQ4デュアル・グランス機構は、単一アテンションまたは非アテンションベースラインに比べて、社会的関係認識でどの程度優れているか?
  • RQ5PISCのような大規模かつ人手でアノテートされたデータセットは、社会的シーン理解における信頼性の高いベンチマークと一般化性能を実現できるか?

主な発見

  • アテンション機構を備えたデュアル・グランスモデルは、PISCデータセットの6関係サブセットで79.7%のmAPを達成し、非アテンションベースラインを顕著に上回った。
  • アテンションを用いたLSEプーリングは最良のパフォーマンス(79.7% mAP)を示し、関連する領域のソフトウェート重み付き集約が推論精度を向上させることを示した。
  • アテンションを用いたモデルは3関係サブセットで76.9% mAPを達成したのに対し、非アテンションでは71.7%にとどまり、文脈的アテンションによる一貫した向上が確認された。
  • 最適なパフォーマンスは30の領域提案と0.7の重複閾値(提案領域とターゲットペア間)で達成され、効果的な領域フィルタリングが実現された。
  • 可視化により、アテンション機構が文脈的に関連するキューを動的に注目していることが示された(例:家族にはテレビ、友人にはゲームパッド、職業的関係にはホワイトボード)。これは解釈可能性を示している。
  • 強力なパフォーマンスを発揮したが、距離や服装の類似性に基づき、友人をカップルと誤認するなど、曖昧なキューによる誤分類が偶発的に発生した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。