Skip to main content
QUICK REVIEW

[論文レビュー] Bipartite Graph Network with Adaptive Message Passing for Unbiased Scene Graph Generation

Rongjie Li, Songyang Zhang|arXiv (Cornell University)|Apr 1, 2021
Multimodal Machine Learning Applications参考文献 59被引用数 14
ひとこと要約

本稿では、不偏のシーングラフ生成を改善するために、適応的メッセージ渡しを備えた信頼度対応型二部グラフニューラルネットワーク(BGNN)を提案する。長尾分布とノイズの多いコンテキストモデリングの問題に対処する。バイレベルのデータリサンプリング戦略と関係の信頼度に基づく動的エッジ重み付けを統合することで、Visual Genome、Open Images V4、V6の各データセットで最先端の性能を達成し、尾カテゴリのリcallを顕著に向上させつつ、高い全体的な精度を維持する。

ABSTRACT

Scene graph generation is an important visual understanding task with a broad range of vision applications. Despite recent tremendous progress, it remains challenging due to the intrinsic long-tailed class distribution and large intra-class variation. To address these issues, we introduce a novel confidence-aware bipartite graph neural network with adaptive message propagation mechanism for unbiased scene graph generation. In addition, we propose an efficient bi-level data resampling strategy to alleviate the imbalanced data distribution problem in training our graph network. Our approach achieves superior or competitive performance over previous methods on several challenging datasets, including Visual Genome, Open Images V4/V6, demonstrating its effectiveness and generality.

研究の動機と目的

  • 視覚的関係における長尾分布と高いクラス内変動が、シーングラフモデルをヘッドカテゴリにバイアスするのを是正すること。
  • グラフベースのメッセージ渡しにおいて、ノイズの多い主語・目的語関連をフィルタリングすることで、コンテキストモデリングにおける誤差伝搬を低減すること。
  • 新たなトレーニング戦略により、リソースが少ない(尾カテゴリの)動詞および目的語カテゴリのパフォーマンスを向上させること。
  • 完全結合型またはスパースグラフよりも、エンティティ・動詞関係をより効果的にモデリングできる構造的で信頼度対応型のグラフネットワークを開発すること。
  • エンドツーエンドのシーングラフ生成において、ヘッドカテゴリとテイルカテゴリのパフォーマンスのトレードオフをより良くすること。

提案手法

  • 本手法は、エンティティと動詞の提案間の情報伝達を別々にモデル化するため、有向エッジを備えた二部グラフニューラルネットワーク(BGNN)を用いる。
  • 予測された関係の信頼度に基づいてメッセージ伝達の重みを動的に調整する適応的メッセージ渡しメカニズムを導入し、低信頼度の関係に起因するノイズを低減する。
  • 段階的なトレーニングプロセスにより、エンティティノードと動詞ノード間を繰り返しメッセージ渡しを行うことで、表現を段階的に精錬する。
  • バイレベルのデータリサンプリング戦略は、画像レベルのオーバーサンプリングとインスタンスレベルのアンダーサンプリングを組み合わせ、トレーニング中にヘッドカテゴリとテイルカテゴリのバランスを取る。
  • エンティティおよび動詞の表現は、メッセージ渡しにより精錬され、その後線形分類器を用いて分類される。
  • メッセージ渡しの重み付けのための信頼度推定は、トレーニング中にエンドツーエンドで学習され、動的ノイズ抑制を可能にする。
Figure 1 : The illustration of biased scene graph generation and empirical study on Visual Genome. As shown in (D), the baseline (MSDN [ 23 ] ) performance is dominated by the head categories due to the imbalanced data. We estimate an upper-bound performance by ignoring negative predicate-entity con
Figure 1 : The illustration of biased scene graph generation and empirical study on Visual Genome. As shown in (D), the baseline (MSDN [ 23 ] ) performance is dominated by the head categories due to the imbalanced data. We estimate an upper-bound performance by ignoring negative predicate-entity con

実験結果

リサーチクエスチョン

  • RQ1関係の信頼度に基づく適応的メッセージ渡しが、シーングラフ生成における誤差伝搬を低減できるか?
  • RQ2バイレベルのデータリサンプリング戦略は、低頻度(テイル)動詞および目的語の一般化性能を向上させることができるか?
  • RQ3長尾分布を伴う視覚的関係をモデリングする際、二部グラフ構造が完全結合型またはスパースグラフを上回る性能を示せるか?
  • RQ4ベンチマークデータセットにおける平均リcallと重み付きAPの観点から、本手法は最先端モデルと比較してどのように差をつけるか?
  • RQ5ノイズの多い主語・目的語関連を除去することで、ベースラインパフォーマンスがどの程度向上するか、実証的に観察できるか?

主な発見

  • Open Images V6において、提案されたBGNNは平均リコール@50(mR@50)40.45を達成し、GPS-Net(38.93)やRelDN(37.20)といった先行手法を上回った。
  • Open Images V6では、重み付き指標スコア42.06を達成し、以前のSOTA手法であるGPS-Net*(41.60)を上回った。
  • Visual Genomeでは、3段階および3反復を用いた場合、mR@100が12.6、テイルカテゴリリコールが6.0に達し、低頻度関係においても優れたパフォーマンスを示した。
  • アブレーションスタディにより、3反復および3段階が最適なパフォーマンスをもたらすことが確認され、それ以上に増加させても性能は飽和した。
  • 実証的スタディでは、ノイズの多い主語・目的語関連を除去することで、ベースラインパフォーマンスが向上することが示され、信頼度対応型メッセージ渡しの必要性が裏付けられた。
  • バイレベルリサンプリング戦略により、ヘッドカテゴリとテイルカテゴリのパフォーマンスのトレードオフがより良く取られ、希少な動詞のパフォーマンスが向上した一方で、ヘッドカテゴリの精度は劣化しなかった。
Figure 2 : Illustration of overall pipeline of our BGNN model. RCE denotes the relationship confidence estimation module. CMP denotes the confidence-aware message propagation model. SG Predictor is the scene graph predictor for the final prediction.
Figure 2 : Illustration of overall pipeline of our BGNN model. RCE denotes the relationship confidence estimation module. CMP denotes the confidence-aware message propagation model. SG Predictor is the scene graph predictor for the final prediction.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。