Skip to main content
QUICK REVIEW

[論文レビュー] Probabilistic Modeling of Semantic Ambiguity for Scene Graph Generation

Gengcong Yang, Jingyi Zhang|arXiv (Cornell University)|Mar 9, 2021
Multimodal Machine Learning Applications参考文献 44被引用数 5
ひとこと要約

本稿では、視覚的関係をガウス分布として表現することで、意味的曖昧さ(類義語、下位関係、マルチビュー曖昧さ)をモデル化する、プラグアンドプレイ型の確率的不確実性モデリング(PUM)モジュールを提案する。これにより、多様で妥当な予測が可能となり、不確実性に配慮した特徴表現による確率的定式化により、ResCAGCNと組み合わせた際、最先端の性能を達成する。

ABSTRACT

To generate "accurate" scene graphs, almost all existing methods predict pairwise relationships in a deterministic manner. However, we argue that visual relationships are often semantically ambiguous. Specifically, inspired by linguistic knowledge, we classify the ambiguity into three types: Synonymy Ambiguity, Hyponymy Ambiguity, and Multi-view Ambiguity. The ambiguity naturally leads to the issue of \emph{implicit multi-label}, motivating the need for diverse predictions. In this work, we propose a novel plug-and-play Probabilistic Uncertainty Modeling (PUM) module. It models each union region as a Gaussian distribution, whose variance measures the uncertainty of the corresponding visual content. Compared to the conventional deterministic methods, such uncertainty modeling brings stochasticity of feature representation, which naturally enables diverse predictions. As a byproduct, PUM also manages to cover more fine-grained relationships and thus alleviates the issue of bias towards frequent relationships. Extensive experiments on the large-scale Visual Genome benchmark show that combining PUM with newly proposed ResCAGCN can achieve state-of-the-art performances, especially under the mean recall metric. Furthermore, we prove the universal effectiveness of PUM by plugging it into some existing models and provide insightful analysis of its ability to generate diverse yet plausible visual relationships.

研究の動機と目的

  • 既存の決定的手法が無視する、意味的曖昧さに起因する暗黙のマルチラベル問題に対処する。
  • 言語学的知識にインspiredされ、3種類の意味的曖昧さ(類義語、下位関係、マルチビュー曖昧さ)をモデル化する。
  • 特徴表現への不確実性の導入により、多様かつ妥当な視覚的関係の予測を可能にする。
  • 頻度の高い動詞に偏るバイアスを軽減するため、レアで細分化された関係のカバレッジを向上させる。
  • 既存のSGGモデルに統合可能で、アーキテクチャの変更なしに普遍的に性能を向上できる、プラグアンドプレイ型モジュール(PUM)を開発する。

提案手法

  • 各ユニオン領域を、学習可能な平均と分散を持つガウス分布として表現し、視覚的コンテンツの不確実性を分散が符号化する。
  • 各特徴量をガウス分布から抽出された確率変数として扱い、多様な予測を可能にするための確率的定式化を導入する。
  • 視覚的関係を単一の点ではなく、意味空間内のソフト領域へ写像する確率的表現を用いる。
  • アーキテクチャの変更なしに、ResCAGCNのような既存のSGGモデルにPUMをプラグアンドプレイで統合する。
  • 不確実性モデリングを活用し、類義語、下位関係、視点依存的記述を含む複数の妥当な動詞を自然にカバーする。
  • 多様性を評価するため、M個の連続的な予測のうちどれかが正例と一致すればヒットとカウントする、オракルリCALLメトリック(oR)を用いる。

実験結果

リサーチクエスチョン

  • RQ1視覚的関係における意味的曖昧さのモデリングは、シーングラフ予測の多様性と妥当性を向上させ得るか?
  • RQ2不確実性に配慮した特徴表現は、シーングラフ生成において頻度の高い関係に偏るバイアスをどの程度軽減するか?
  • RQ3提案されたPUMモジュールは、異なるSGGモデルに対して、プラグアンドプレイ形式でどの程度効果的に性能を向上させ得るか?
  • RQ4確率的定式化は、決定的アプローチに比べて、類義語、下位関係、マルチビュー曖昧さをよりよく捉え得るか?
  • RQ5同じ視覚的関係に対して、モデルは人間のアノテータの多様性を反映した複数の妥当な動詞を生成できるか?

主な発見

  • PUMは、ResCAGCNと組み合わせた際、Visual Genomeベンチマークで最先端の性能を達成する。特に、平均リCALLメトリックにおいて顕著な向上を示す。
  • ResCAGCN + PUMのオラクルリCALL(oR)は、連続予測数(M)が増えるにつれて安定して上昇し、多様性の有効性が裏付けられる。
  • M = 1の場合でも、PUMは決定的ResCAGCNを上回るリCALLを達成しており、単一予測のカバレッジが向上していることが示唆される。
  • 定性的な分析から、PUMは意味的に類似した動詞(例:carrying と holding、on と laying on)を生成し、視点の違い(例:using と in front of)を捉えている。
  • PUMは細分化された関係を効果的にカバーしており、従来のモデルで見られる頻度の高い動詞へのバイアスを軽減している。
  • PUMのプラグアンドプレイ性は、複数の既存のSGGモデルにおいて一貫した性能向上によって裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。