Skip to main content
QUICK REVIEW

[論文レビュー] An Interpretable Model for Scene Graph Generation

Ji Zhang, Kevin J. Shih|arXiv (Cornell University)|Nov 21, 2018
Multimodal Machine Learning Applications参考文献 23被引用数 8
ひとこと要約

本論文は、視覚的、空間的、意味的特徴を3つの別々のブランチで明示的にモデル化し、後期統合によってそれらを統合する、解釈可能で新規なシーングラフ生成モデルを提案する。このアプローチにより、各特徴の寄与度が明確に分析可能となり、最先端の性能を達成した。本モデルは、OpenImages Visual Relationship Detection Challengeで1位を獲得し、2位と比較して相対的に20%の向上を達成した。

ABSTRACT

We propose an efficient and interpretable scene graph generator. We consider three types of features: visual, spatial and semantic, and we use a late fusion strategy such that each feature's contribution can be explicitly investigated. We study the key factors about these features that have the most impact on the performance, and also visualize the learned visual features for relationships and investigate the efficacy of our model. We won the champion of the OpenImages Visual Relationship Detection Challenge on Kaggle, where we outperform the 2nd place by 5\% (20\% relatively). We believe an accurate scene graph generator is a fundamental stepping stone for higher-level vision-language tasks such as image captioning and visual QA, since it provides a semantic, structured comprehension of an image that is beyond pixels and objects.

研究の動機と目的

  • 視覚的、空間的、意味的特徴からの明示的かつ解釈可能な寄与を提供するシーングラフ生成モデルの開発。
  • 特徴学習の分離と各モodalの影響分析を可能にすることで、視覚的関係検出の性能を向上させること。
  • OpenImages、Visual Genome、VRDなどのベンチマークデータセットにおける優れた性能を示すこと。
  • 関係予測における学習済み表現の解釈可能性と分析を向上させること。
  • 画像キャプション生成や視覚的質問応答などの高レベルなビジョン・言語タスクの基盤となること。

提案手法

  • モデルは2段階のパイプラインを採用する。まず、既存の物体検出器が物体ラベル、バウンディングボックス、視覚的特徴を抽出する。
  • 視覚的、空間的、意味的特徴を別々に処理する3つのブランチを設け、それらの信頼度スコアを加算およびソフトマックス正規化によって後期統合する。
  • 意味的モジュールは、学習データから得た頻度ベースのベースライン $ p(P|S,O) $ を用い、その上に残差学習を適用する。
  • 空間的モジュールは、ボックスのデルタと正規化された座標を用いて、相対的な物体位置を符号化する。
  • 視覚的モジュールは、関係固有の表現を学習するための専用バックボーンを用いて物体特徴を処理する。
  • 最終的な予測は、ブランチスコアの和をとり、ソフトマックスを適用して予測される述語の確率分布を生成する。

実験結果

リサーチクエスチョン

  • RQ1視覚的、空間的、意味的特徴が、シーングラフ生成性能にそれぞれどのように寄与しているか?
  • RQ2明示的かつ別々のブランチを有する後期統合戦略は、視覚的関係検出における解釈可能性と性能向上に寄与するか?
  • RQ3主語・目的語ペairの頻度ベースの事前知識は、関係予測の正確性をどの程度向上させるか?
  • RQ4空間的特徴と視覚的特徴は、関係固有のパターンを捉える能力において、どのように比較されるか?
  • RQ5モジュラーかつ解釈可能な設計は、エンドツーエンド統合手法を上回る性能を発揮できるか?

主な発見

  • 本モデルは、プライベートリーダーボードにおいて2位と比較して相対的に20%の向上を達成し、OpenImages Visual Relationship Detection Challengeで1位を獲得した。
  • OpenImagesデータセットでは、シーングラフ検出のリCALL@100が28.59%に達し、先行手法を著しく上回った。
  • Visual Genomeデータセットでは、シーングラフ検出設定でリCALL@50が26.12%、リCALL@100が31.28%を達成し、最先端手法を上回った。
  • VRDデータセットでは、COCO事前学習を用いた場合、mAP_relが33.29%、mAP_phrが41.25%を達成し、先行の最先端モデルを上回った。
  • 学習済み特徴の可視化により、述語固有のバックボーンが、例えばマイクを持つ手のような判別可能な領域を効果的に捉えていることが示された。
  • アブレーションスタディの結果、3つのブランチと空間的特徴を含む完全なモデルが最良の性能を示し、各コンponentの寄与が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。