Skip to main content
QUICK REVIEW

[論文レビュー] Tackling the Unannotated: Scene Graph Generation with Bias-Reduced Models

Tzu-Jui Julius Wang, Selen Pehlivan|arXiv (Cornell University)|Aug 18, 2020
Multimodal Machine Learning Applications参考文献 39被引用数 20
ひとこと要約

本論文は、Visual Genomeにおける不完全でスパースなアノテーションに起因するアノテーションバイアスを軽減するために自己学習知識を活用する二教師知識蒸留アプローチを用いたバイアス低減型シーングラフ生成フレームワークを提案する。異なるインダクティブバイアスを持つ二つの関係分類器を用いて訓練する(一方が他方に対してバイアスの少ない監視を提供する)ことで、平均リCALL(mR@100)が最大+20.4%向上し、全体のリCALL(R@100)の低下は最小限に抑えられ、Motifs や VCTree などの最先端モデルをすべての標準的SGGベンチマークで上回る性能を達成する。

ABSTRACT

Predicting a scene graph that captures visual entities and their interactions in an image has been considered a crucial step towards full scene comprehension. Recent scene graph generation (SGG) models have shown their capability of capturing the most frequent relations among visual entities. However, the state-of-the-art results are still far from satisfactory, e.g. models can obtain 31% in overall recall R@100, whereas the likewise important mean class-wise recall mR@100 is only around 8% on Visual Genome (VG). The discrepancy between R and mR results urges to shift the focus from pursuing a high R to a high mR with a still competitive R. We suspect that the observed discrepancy stems from both the annotation bias and sparse annotations in VG, in which many visual entity pairs are either not annotated at all or only with a single relation when multiple ones could be valid. To address this particular issue, we propose a novel SGG training scheme that capitalizes on self-learned knowledge. It involves two relation classifiers, one offering a less biased setting for the other to base on. The proposed scheme can be applied to most of the existing SGG models and is straightforward to implement. We observe significant relative improvements in mR (between +6.6% and +20.4%) and competitive or better R (between -2.4% and 0.3%) across all standard SGG tasks.

研究の動機と目的

  • Visual Genome(VG)データセットにおける不均衡で不完全かつスパースなアノテーションによって引き起こされるシーングラフ生成(SGG)モデルのバイアスを解消すること。
  • 頻出関係(例:'on', 'has')への過剰な依存を軽減し、アノテーションの誤った否定(aFN)および部分的に真の陽性(aPTP)の影響を低減すること。
  • 頻出関係の性能を損なわず、まれな関係およびマイノリティ関係への一般化を向上させること。
  • 既存のSGGモデルに最小限のアーキテクチャ変更で統合可能な訓練スキームの開発

提案手法

  • 一つの関係分類器(教師)が、もう一つのモデル(生徒)をガイドするバイアスの少ない予測を提供する二教師知識蒸留フレームワークを導入し、頻出関係への過剰適合を低減する。
  • 関係分類の正則化に超球面埋め込み空間を用い、長テール分布における一般化性能を向上させる。
  • 主モデル(F)をすべてのクラスで関係を予測するように訓練する(未アノテートペアは「関係なし」と扱う)一方、第二のモデル(G)は自己アノテート済みでバイアスの少ない予測から学習する。
  • 蒸留損失における温度スケーリングを適用し、生徒モデルの予測の柔らかさを制御することで、多様性と精度のバランスを取る。
  • 両モデルが未アノテートおよび曖昧なペアからの自己教師的知識を用いて予測を共同で改善する、コトレーニングに類似した設定を採用する。
  • 既存のSGGモデル(例:Motifs, VCTree)に、グラフ制約の有無に関わらず適用可能であり、プラグアンドプレイ統合が可能である。

実験結果

リサーチクエスチョン

  • RQ1バイアスの少ない教師モデルからの知識蒸留は、シーングラフ生成におけるまれな関係への一般化を向上させることができるか?
  • RQ2未アノテートおよび部分的にアノテートされたペアからの自己学習知識は、SGGモデルにおけるバイアス低減にどの程度寄与するか?
  • RQ3超球面空間上で学習させることで、SGGにおける長テール関係分布の性能向上が達成できるか?
  • RQ4提案手法は、全体のリCALL(R@100)と平均クラスワイドリCALL(mR@100)のトレードオフにどのように影響を与えるか?
  • RQ5本フレームワークは、アーキテクチャの変更なしに既存のSGGモデルに効果的に適用可能か?

主な発見

  • 提案された L2+cKD フレームワークは、VCTreeベースラインに対して mR@100 で最大 +20.4% の相対的向上を達成し、R@100 は平均で -0.79% の低下にとどまる。
  • PrdCls タスクでは、VCTree L2+cKD は制約なしで mR@100 を 13.02% 向上(制約ありでは 11.64%)、R@100 は最大 -1.21% の低下にとどまる。
  • SGCls では、Motifs ベースラインに対して mR@100 で 19.89% の相対的向上を達成し、R@100 は無視できる -1.3% の損失にとどまる。
  • アブレーションスタディの結果、蒸留損失における温度 T を増加させると mR@K は向上するが、T が大きすぎると R@K が低下する傾向にあり、多様性と精度のトレードオフが明確に示された。
  • モデルはメジャリティクラスよりもマイノリティクラス(例:'on back of', 'lying on')でより顕著な向上を示し、頻出関係へのバイアス低減が確認された。
  • フレームワークは制約なし設定で最も顕著な性能向上を示しており、グラフ構造による制約がない状況で関係の関連性をより効果的に検出できる能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。