Skip to main content
QUICK REVIEW

[論文レビュー] Sketching Image Gist: Human-Mimetic Hierarchical Scene Graph Generation

Wenbin Wang, Ruiping Wang|arXiv (Cornell University)|Jul 17, 2020
Multimodal Machine Learning Applications参考文献 56被引用数 10
ひとこと要約

本稿では、階層的エンティティツリー(HET)とハイブリッドLSTMを用いて人間の認知を模倣する階層的シーングラフ生成フレームワークを提案する。HETは階層的構造を、ハイブリッドLSTMは同胞関係をエンコードする。関係ランク付けモジュール(RRM)は、オブジェクトの視覚的顕著性とサイズを用いて、キーリレーションを優先的に処理し、シーングラフ生成で最先端の性能を達成するとともに、画像固有の、全体像を反映する関係を優れた精度で抽出する。

ABSTRACT

Scene graph aims to faithfully reveal humans' perception of image content. When humans analyze a scene, they usually prefer to describe image gist first, namely major objects and key relations in a scene graph. This humans' inherent perceptive habit implies that there exists a hierarchical structure about humans' preference during the scene parsing procedure. Therefore, we argue that a desirable scene graph should be also hierarchically constructed, and introduce a new scheme for modeling scene graph. Concretely, a scene is represented by a human-mimetic Hierarchical Entity Tree (HET) consisting of a series of image regions. To generate a scene graph based on HET, we parse HET with a Hybrid Long Short-Term Memory (Hybrid-LSTM) which specifically encodes hierarchy and siblings context to capture the structured information embedded in HET. To further prioritize key relations in the scene graph, we devise a Relation Ranking Module (RRM) to dynamically adjust their rankings by learning to capture humans' subjective perceptive habits from objective entity saliency and size. Experiments indicate that our method not only achieves state-of-the-art performances for scene graph generation, but also is expert in mining image-specific relations which play a great role in serving downstream tasks.

研究の動機と目的

  • 既存のシーングラフ生成手法に階層的構造が欠如していること、人間の認知習慣を反映していない点を是正すること。
  • 階層的エンティティ表現を通じて、画像の全体像(主なオブジェクトとキーリレーション)を記述する人間の好みをモデル化すること。
  • 共通の常識的関係や単なる背景関係よりも、画像固有の、知覚的に重要な関係を優先的に処理する関係ランク付けモジュール(RRM)を開発すること。
  • MSCOCOキャプションから抽出したキーリレーションをアノテートした新しいベンチマークデータセット、VG-KRを構築し、関係の重要度を評価すること。
  • 画像キャプションなどの下流タスクを改善するため、画像のコアな視覚的コンテンツをよりよく反映するシーングラフを生成すること。

提案手法

  • 画像を、各ノードがオブジェクトであり、より細分化されたサブオブジェクトに分解可能な階層的エンティティツリー(HET)として表現する。これは人間の知覚的階層を模倣する。
  • HETにおける階層的構造と同胞関係を、ハイブリッドLSTMを用いてエンコードし、知覚的レベルを越えた構造的関係を捉える。
  • オブジェクトの視覚的顕著性と正規化されたサイズに基づいて関係をランク付けする関係ランク付けモジュール(RRM)を設計する。これにより、人間の主観的重要度を反映する。
  • 関係の重要度を示す新しい指標を導入する:Φ′ = S^sub + S^obj + A(o^sub)/A(o_I) + A(o^obj)/A(o_I)。顕著性と相対的サイズを組み合わせることで、小さな部品の過大評価を是正する。
  • Visual Genomeを拡張し、MSCOCOキャプションから抽出したキーリレーションをアノテートしたVG-KRというデータセットを構築し、RRMの学習と評価に用いる。
  • RRMによる関係のランク付けを通じてシーングラフを生成し、上位の関係が画像の全体像を形成するようにし、キャプション生成や下流タスクに活用する。

実験結果

リサーチクエスチョン

  • RQ1どのようにすれば、主な出来事やキーリレーションを優先する人間の認知階層を反映したシーングラフ生成が実現できるか?
  • RQ2オブジェクトの顕著性とサイズは、画像記述における人間の関係選好をどの程度正確に予測できるか?
  • RQ3階層的シーングラフ表現は、平坦で非階層的なアプローチに比べ、生成されるシーングラフの質と関連性を向上させられるか?
  • RQ4提案されたRRMは、共通の常識的関係や背景関係よりも、画像固有の非自明な関係をどれほど効果的に特定できるか?
  • RQ5人間を模倣する階層的構造を組み込むことで、画像キャプションなどの下流タスクにおける性能が向上するか?

主な発見

  • 提案されたHetH-RRMモデルは、標準的なシーングラフ生成ベンチマークで最先端の性能を達成し、検出およびランク付け指標の両面で先行手法を上回った。
  • 関係ランク付けモジュール(RRM)は、画像固有の関係の抽出を顕著に改善し、HetH-RRMにおける上位関係は、ベースラインモデルと比較して画像の全体像により近いものとなった。
  • アブレーションスタディの結果、RRMの指標(Φ′)に顕著性と正規化されたサイズを組み合わせたことで、IDCとCSの間に強い相関が得られ、設計の妥当性が裏付けられた。
  • 定性的な結果から、HetH-RRMの上位関係に基づくキャプションは、女性が傘を持っているといった画像の核となる内容をよりよくカバーしていることが示された。
  • VG-KRデータセットの分析から、既存の手法はしばしば「女性が頭を持っている」など、単なる常識的関係を上位関係として予測しており、画像の実際の全体像とは異なる場合があることが判明した。
  • 低-IDC・高-CSおよび高-IDC・低-CSの関係トリプレットの分析から、小さなが顕著な部品は、しばしば誤って高い顕著性を得るが、知覚的重要な関係としては低くなることが明らかになった。これは、サイズを考慮したランク付けの必要性を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。