Skip to main content
QUICK REVIEW

[論文レビュー] Compositional Feature Augmentation for Unbiased Scene Graph Generation

Lin Li, Guikun Chen|arXiv (Cornell University)|Aug 13, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、関係トリプルの内在的および外在的特徴を拡張することで、尾部述語の特徴多様性を向上させることにより、シーングラフ生成(SGG)におけるバイアスを軽減する、モデルに依存しない新しい手法であるコンポジショナル・フェイチャーオーギュメンテーション(CFA)を提案する。CFAはトリプル特徴を内在的(オブジェクトレベル)および外在的(文脈的)成分に分解し、特徴置換とミックスアップを適用することで、不足している尾部カテゴリの特徴を豊かにし、VGおよびGQAで最先端の性能を達成した。これは、さまざまな指標における平均リCALLの顕著な向上を伴う。

ABSTRACT

Scene Graph Generation (SGG) aims to detect all the visual relation triplets $<$ exttt{sub}, exttt{pred}, exttt{obj}$>$ in a given image. With the emergence of various advanced techniques for better utilizing both the intrinsic and extrinsic information in each relation triplet, SGG has achieved great progress over the recent years. However, due to the ubiquitous long-tailed predicate distributions, today's SGG models are still easily biased to the head predicates. Currently, the most prevalent debiasing solutions for SGG are re-balancing methods, \eg, changing the distributions of original training samples. In this paper, we argue that all existing re-balancing strategies fail to increase the diversity of the relation triplet features of each predicate, which is critical for robust SGG. To this end, we propose a novel Compositional Feature Augmentation ( extbf{CFA}) strategy, which is the first unbiased SGG work to mitigate the bias issue from the perspective of increasing the diversity of triplet features. Specifically, we first decompose each relation triplet feature into two components: intrinsic feature and extrinsic feature, which correspond to the intrinsic characteristics and extrinsic contexts of a relation triplet, respectively. Then, we design two different feature augmentation modules to enrich the feature diversity of original relation triplets by replacing or mixing up either their intrinsic or extrinsic features from other samples. Due to its model-agnostic nature, CFA can be seamlessly incorporated into various SGG frameworks. Extensive ablations have shown that CFA achieves a new state-of-the-art performance on the trade-off between different metrics.

研究の動機と目的

  • 長尾述語分布に起因するSGGモデルにおけるヘッド述語への偏りを是正すること。
  • サンプル頻度や損失重みの調整にかかわらず、尾部述語の特徴多様性を向上させない既存の再バランス手法の限界を克服すること。
  • 未表皮的述語の特徴空間の多様性を高めることを目的とした、モデルに依存しない拡張戦略の開発。
  • トリプル特徴の分布を豊かにすることで、長尾SGGにおける意思決定境界の学習を改善すること。
  • ヘッド、ボディ、テイル述語の各カテゴリにおいて、mR@KとR@Kの間のトレードオフを改善すること。

提案手法

  • CFAは、各関係トリプル特徴を内在的(オブジェクト固有)および外在的(文脈的)成分に分解する。
  • 内在的特徴拡張では、パターン、文脈、意味的類似性に基づくクラスタリングを用いて、他のサンプルからの意味的および文脈的に類似したエンティティの特徴で、尾部述語トリプルのエンティティ特徴を置換する。
  • 外在的特徴拡張では、学習可能なパrameter θ を用いて、フォアグラウンドおよびバックグラウンドのトリプル特徴間でミックスアップを適用する。
  • この手法はモデルに依存せず、Motifsなどの既存のSGGフレームワークにスムーズに統合可能である。
  • 置換または混合のための特徴選択は、類似度メトリクスに従い、意味的および文脈的に妥当なことを保証する。
  • 訓練データの頻度や損失重みを変更せずに、バイアスの根本的原因である希少で多様性のない特徴分布に直接対処する。

実験結果

リサーチクエスチョン

  • RQ1サンプル頻度や損失重みの調整に代えて、関係トリプル特徴の多様性を高めることで、SGGにおける一般化性能が向上するか?
  • RQ2内在的および外在的特徴を分離することで、尾部述語のためのより効果的で意味的に意味のあるデータ拡張が可能になるか?
  • RQ3異なるサンプルからの特徴を混合または置換するモデルに依存しない拡張戦略が、ヘッド、ボディ、テイル述語の各カテゴリで性能向上をもたらすか?
  • RQ4パターン、文脈、意味的類似度といった異なる類似度メトリクスが、拡張特徴の品質および多様性にどのように影響するか?
  • RQ5ハイパーパrameter設定(例:クラスタ数K、ミックスアップ比θ)をどのように選べば、バイアスのないSGGにおけるmR@KとR@Kの最良のトレードオフが得られるか?

主な発見

  • CFAは、PredCls設定下でVGデータセットにおいて、平均リCALLが46.2に達する新たな最先端性能を達成し、ベースラインのMotifsモデルを上回った。
  • アブレーションスタディの結果、内在的置換、フォアグラウンドミックスアップ、バックグラウンドミックスアップのすべてのCFAコンponentsを組み合わせた場合に、最高の平均リCALL(46.2)が得られ、相乗効果が確認された。
  • 内在的特徴置換のみを用いる場合、mR@Kが2.8%〜3.4%向上するが、R@Kはわずかに低下するため、特徴多様性が不十分なため、限られた影響にとどまる。
  • 外在的特徴ミックスアップ(フォアグラウンドおよびバックグラウンド両方)は、mR@Kを顕著に向上(例:mR@100で17.8%から30.3%に)させつつ、R@Kを強く維持するため、文脈特徴の豊かさ向上に有効であることが示された。
  • 内在的CFAにおける最適なクラスタ数K=15は、特徴多様性と選択範囲のバランスが最良であり、K=40やK=150よりも優れた性能を示した。
  • 最適なミックスアップパラメータθ=0.5は、クエリ特徴と文脈特徴の影響をバランスよく保証し、両極端(θ=0.0またはθ=1.0)では性能が低下することがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。