Skip to main content
QUICK REVIEW

[論文レビュー] Unbiased Scene Graph Generation via Rich and Fair Semantic Extraction

Bin Wen, Jie Luo|arXiv (Cornell University)|Feb 1, 2020
Multimodal Machine Learning Applications参考文献 26被引用数 8
ひとこと要約

この論文は、関係の意味的性質(例:対称性)に関する暗黙の仮定と、トレーニングアノテーションにおけるクラスの不均衡という2つの主要なバイアスを軽減する、RiFaと呼ばれる新しいシーングラフ生成モデルを提案する。疑似シアンズネットワークを用いて主語と対象を別々に埋め込み、文脈に配慮したアノテーションに依存しないスコアリング機構を採用することで、RiFaはVisual Genomeで最先端の性能を達成し、特にレアな関係や非対称性・対称性といった意味的性質の捉え込みに優れている。

ABSTRACT

Extracting graph representation of visual scenes in image is a challenging task in computer vision. Although there has been encouraging progress of scene graph generation in the past decade, we surprisingly find that the performance of existing approaches is largely limited by the strong biases, which mainly stem from (1) unconsciously assuming relations with certain semantic properties such as symmetric and (2) imbalanced annotations over different relations. To alleviate the negative effects of these biases, we proposed a new and simple architecture named Rich and Fair semantic extraction network (RiFa for short), to not only capture rich semantic properties of the relations, but also fairly predict relations with different scale of annotations. Using pseudo-siamese networks, RiFa embeds the subject and object respectively to distinguish their semantic differences and meanwhile preserve their underlying semantic properties. Then, it further predicts subject-object relations based on both the visual and semantic features of entities under certain contextual area, and fairly ranks the relation predictions for those with a few annotations. Experiments on the popular Visual Genome dataset show that RiFa achieves state-of-the-art performance under several challenging settings of scene graph task. Especially, it performs significantly better on capturing different semantic properties of relations, and obtains the best overall per relation performance.

研究の動機と目的

  • 関係に固定された意味的性質(例:対称性)を仮定する既存のシーングラフモデルのバイアスを是正すること。
  • Visual Genomeのようなデータセットにおける不均衡なアノテーション分布によって生じる低リソース関係における性能低下を緩和すること。
  • アノテーション頻度にかかわらず、関係予測の順位付けを公平に行う手法を開発すること。
  • 事前仮定なしに、関係の洗練された意味的性質(例:非対称性、推移性)を捉えること。
  • バイアスが排除された状態で、シンプルなCNNベースのアーキテクチャが、複雑なGNNベースのモデルを上回ることを実証すること。

提案手法

  • 主語と対象のための明確で非対称な埋め込みを学習するために、疑似シアンズネットワークを採用し、意味的差を保持する。
  • 各主語・対象ペアをカバーする最小のバウンディングボックスから視覚的特徴を抽出し、局所的文脈を捉える。
  • 両エンティティの視覚的特徴と意味的特徴を統合し、共同埋め込み空間で関係を予測する。
  • アノテーション頻度に依存しないスコアリング機構を導入し、予測の順位付けを公平にする。
  • 対照学習に類似した目的関数を用い、低リソース関係に対しても正しい関係予測を促進する。
  • 関係固有のクラスウェイトに依存せず、予測スコアの交差エントロピー損失を用いて、エンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1関係の対称性や他の意味的性質に関する暗黙の仮定が、シーングラフ生成の性能をどの程度劣化させるのか?
  • RQ2アノテーションの不均衡が、シーングラフモデルのレアな関係への一般化性能にどのように影響するのか?
  • RQ3バイアスが排除された状態で、シンプルなCNNベースのアーキテクチャが、複雑なGNNベースのモデルを上回るのか?
  • RQ4統一されたスコアリング機構は、アノテーション頻度に関係なく関係を公平に順位付けできるのか?
  • RQ5事前インダクティブバイアスなしに、非対称性・対称性・可逆性といった複雑な意味的性質をどの程度モデルが捉えることができるのか?

主な発見

  • RiFaは、Visual Genomeの50番目に頻度の高い関係において、mean per-relation R@100が48.86%を達成し、Pixel2Graph(41.61%)やMotifNet(37.79%)を顕著に上回った。
  • 全アノテーションの0.5%未満の頻度の関係において、RiFaは上位15関係の40%を正しく予測し、稀な関係への公平性と一般化性能に優れていることが示された。
  • 「wearing」では96.78% R@100、「riding」では92.75% R@100を達成し、強い意味的非対称性を持つ関係を強く捉えている。
  • モデルは「near」のような対称的関係を両方向(例:(A, near, B) と (B, near, A))で正しく特定し、(has, part of) のような逆対のペアも認識しており、意味的認識能力を示している。
  • Pixel2Graphが固有の対称性バイアスを持つにもかかわらず、RiFaは非対称性や逆対関係の捉え込みでPixel2Graphを上回った。
  • 限定的なアノテーションでもモデルの性能は維持され、質的例では「walking on」や「carrying」のようなレアな関係が正しく予測されていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。