Skip to main content
QUICK REVIEW

[論文レビュー] Iterative Scene Graph Generation

Siddhesh Khandelwal, Leonid Sigal|arXiv (Cornell University)|Jul 27, 2022
Multimodal Machine Learning Applications被引用数 11
ひとこと要約

本稿では、マークフ・ランダムフィールドにおけるメッセージパッシングを通じて、反復的にシーングラフを精錬するフレームワークを提案する。このフレームワークは、エンド・トゥ・エンドで学習可能なトランスフォーマー・アーキテクチャを用いて、主語、目的語、述語の統合的推論を可能にする。本手法は、Visual Genome および Action Genome ベンチマークで、物体と述語の予測を統合的に最適化することで、先行手法に比べて最大 R@50 で 2.3、hR@50 で 1.6 の向上を達成し、最先端の性能を実現した。

ABSTRACT

The task of scene graph generation entails identifying object entities and their corresponding interaction predicates in a given image (or video). Due to the combinatorially large solution space, existing approaches to scene graph generation assume certain factorization of the joint distribution to make the estimation feasible (e.g., assuming that objects are conditionally independent of predicate predictions). However, this fixed factorization is not ideal under all scenarios (e.g., for images where an object entailed in interaction is small and not discernible on its own). In this work, we propose a novel framework for scene graph generation that addresses this limitation, as well as introduces dynamic conditioning on the image, using message passing in a Markov Random Field. This is implemented as an iterative refinement procedure wherein each modification is conditioned on the graph generated in the previous iteration. This conditioning across refinement steps allows joint reasoning over entities and relations. This framework is realized via a novel and end-to-end trainable transformer-based architecture. In addition, the proposed framework can improve existing approach performance. Through extensive experiments on Visual Genome and Action Genome benchmark datasets we show improved performance on the scene graph generation.

研究の動機と目的

  • 既存のシーングラフ生成手法における固定因子分解の制限を解消すること。特に、物体と述語の間の条件付き独立性を仮定する点に起因する制限。
  • 各精錬ステップを以前のグラフ推定に動的に条件づけることで、主語、目的語、述語の統合的推論を可能にすること。
  • 物体検出器からの誤差伝搬を克服し、まれなまたは検出が難しい述語の性能を向上させること。
  • すべての物体ペairの組み合わせを一度に評価するのではなく、反復的精錬によって二次的ペairリング複雑性を回避するエンド・トゥ・エンドで学習可能なアーキテクチャを設計すること。
  • 新しい損失重み付け方式とデータサンプリング戦略の統合を通じて、ヘッド、ボディ、テイル述語クラスにおける再検出率の向上を実証すること。

提案手法

  • 各ステップが直前のグラフ推定に条件づけられる反復的精錬プロセスを採用。マークフ・ランダムフィールドにおけるメッセージパッシングをアンラールすることで、統合的推論を可能にする。
  • 主語、目的語、述語の3つの同期されたマルチレイヤー・デコーダを備えた新規トランスフォーマー・アーキテクチャを採用。デコーダ間で共有されたアテンション機構を用いることで、コンponent間の推論を可能にする。
  • 反復間での一貫性と精錬を促進するための明示的な統合損失関数を設計。ヘッド、ボディ、テイルクラスのパフォーマンスをバランスさせるために動的重み付けを実装。
  • 標準的な2段階検出ベースのグラフ推定で初期化し、反復的メッセージパッシングを用いて複数ステップにわたり精錬を実行。
  • 特に長尾述語のパフォーマンス向上を図るため、バイパーティット・グラフネットワーク(BGNN)を用いたファインチューニングをサポート。
  • すべての可能な主語-目的語ペアを一度に評価するのではなく、段階的精錬によって二次的ペアリング複雑性を回避する。

実験結果

リサーチクエスチョン

  • RQ1動的条件づけを伴う反復的精錬は、シーングラフ生成における主語、目的語、述語の統合的推論を向上させるか?
  • RQ2固定因子分解をマークフ・ランダムフィールドにおける反復的メッセージパッシングに置き換えることで、長尾や検出が難しい述語のパフォーマンスが向上するか?
  • RQ3統一されたトランスフォーマー・アーキテクチャは、効率性とスケーラビリティを維持しながら、主語、目的語、述語の予測を同時に最適化できるか?
  • RQ4提案された損失重み付け方式は、標準的なサンプリング戦略と比較して、ヘッド、ボディ、テイル述語クラスにおける再検出率にどのような影響を与えるか?
  • RQ5反復的フレームワークは、トップ-k予測のような既存のデータサンプリング技術と組み合わせて、さらなるパフォーマンス向上を実現できるか?

主な発見

  • 提案手法は、Visual Genome データセットで 20.2@50 および 24.1@100 の平均再検出率を達成し、ベースラインの SGTR + BGNN に比べて mR@50 で 1.3、hR@50 で 1.6 の向上を示した。
  • 1つの主語-目的語ペアに対してトップ3の述語を予測する設定では、再検出率が 30.8@50 および 35.6@100 に達し、ベースラインの SGTR をそれぞれ 6.2 および 9.6 ポイント上回った。
  • ベースラインと比較して、ヘッドクラスで 1.6 ポイント、テイルクラスで 1.6 ポイントの調和再検出率の向上を達成。クラス頻度にわたる一般化性能の向上を示した。
  • BGNN ファインチューニングの統合により、mR@50 が 1.3 ポイント向上。損失重み付け方式が長尾パフォーマンスの向上に有効であることを示した。
  • 定性的な結果では、精錬ステップの進行に伴いグラフ品質が一貫して向上しており、後続の反復で誤った予測が修正されていることが観察された。
  • 本手法は、Visual Genome および Action Genome ベンチマークの両方で最先端のパフォーマンスを達成し、多様なシーン理解タスクにわたる頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。