[論文レビュー] Weakly-supervised learning of visual relations
本稿では、画像レベルのラベルのみを用いて、物体ペア間の視覚的関係を弱教師付きで学習する手法を提案する。新規のマルチモーダル特徴表現を活用し、外観と空間的配置の両方を符号化する。本手法は視覚的関係検出で最先端の性能を達成し、未学習の関係へのゼロショット一般化において、完全教師付きベースラインを著しく上回り、珍しい三つ組み検出の厳密な評価を可能にするUnRelデータセットを導入する。
This paper introduces a novel approach for modeling visual relations between pairs of objects. We call relation a triplet of the form (subject, predicate, object) where the predicate is typically a preposition (eg. 'under', 'in front of') or a verb ('hold', 'ride') that links a pair of objects (subject, object). Learning such relations is challenging as the objects have different spatial configurations and appearances depending on the relation in which they occur. Another major challenge comes from the difficulty to get annotations, especially at box-level, for all possible triplets, which makes both learning and evaluation difficult. The contributions of this paper are threefold. First, we design strong yet flexible visual features that encode the appearance and spatial configuration for pairs of objects. Second, we propose a weakly-supervised discriminative clustering model to learn relations from image-level labels only. Third we introduce a new challenging dataset of unusual relations (UnRel) together with an exhaustive annotation, that enables accurate evaluation of visual relation retrieval. We show experimentally that our model results in state-of-the-art results on the visual relationship dataset significantly improving performance on previously unseen relations (zero-shot learning), and confirm this observation on our newly introduced UnRel dataset.
研究の動機と目的
- ボックスレベルのアノテーションが不足している、あるいは利用できない状況において、物体ペア間の視覚的関係を学習する課題に対処すること。
- 類似する関係間で知識を共有することで、未学習の視覚的関係三つ組み(主語-述語-目的語)へのゼロショット一般化を可能にすること。
- インスタンスレベルのアノテーションにかかるコストを回避するため、画像レベルの自然言語ラベルのみを用いて関係分類器を学習する弱教師付き学習フレームワークを開発すること。
- 珍しい視覚的関係を網羅的にアノテートした新しいベンチマークデータセットUnRelを提供し、検出と一般化の正確な評価を可能にすること。
提案手法
- 本手法は、個々の物体からの外観特徴と、物体ペア間の空間的配置特徴を組み合わせた視覚的特徴表現を用いる。空間的配置は、学習された空間的トランスフォーマーモジュールで符号化される。
- 関係分類を弱教師付き学習問題として定式化し、ボックスレベルのアノテーションを必要とせず、画像レベルのラベル(例:「人が自転車に乗っている」)に基づいて線形分類器を学習する。
- 判別的クラスタリングモデルを用いて、画像レベルの監視に基づき、候補となる物体ペアに疑似ラベルを割り当て、エンドツーエンドの学習を可能にする。
- 検索中にポジティブペアとネガティブペアの区別を高めるために、学習された「関係なし」クラスをモデルに組み込む。
- 事前学習済みの物体検出器(例:Faster R-CNN)から特徴を抽出し、関係特徴は、空間的文脈を考慮して、主語と目的語の特徴を連結またはアテンション処理することで構成する。
- 視覚的および言語的三つ組みが一致する共同埋め込み空間を用い、損失関数は対照的学習または画像レベルラベルに基づく交差エントロピーで最適化される。
実験結果
リサーチクエスチョン
- RQ1ボックスレベルのアノテーションを一切使用せず、画像レベルのラベルでのみ学習した場合、視覚的関係認識は未学習の三つ組み(ゼロショット学習)に効果的に一般化できるか?
- RQ2画像レベルのアノテーションのみが利用可能な状況で、弱教師付きモデルは完全教師付きベースラインと比べてどの程度の性能を示すか?
- RQ3提案されたマルチモーダル視覚的特徴表現は、多様な空間的・外観的構成において、関係検出の性能をどの程度向上させるか?
- RQ4珍しい関係に網羅的なアノテーションが付与された新しい評価データセット(UnRel)は、視覚的関係検出におけるゼロショット一般化の信頼性あるベンチマークを可能にするか?
主な発見
- 提案された弱教師付きモデルは、画像レベルの監視のみでUnRelデータセットで58.5%のmAPを達成し、完全教師付きのDenseCapベースライン(6.2%)と再現した[31]ベースライン(完全監視下で50.6% mAP)を著しく上回った。
- Visual Relationship Detectionデータセットでは、真の主語・目的語ボックスが与えられた状況で62.6%のmAPを達成し、強い監視下でも優れた性能を示した。
- ゼロショット一般化性能が向上し、未学習の関係における主語/目的語検索タスクで12.1%のmAPを達成。完全教師付きベースラインの10.0%を上回った。
- アブレーションスタディの結果、『関係なし』クラスを削除するとmAPが3.5%低下し、これはそのクラスが判別的ペア分類に重要であることを確認した。
- 図6の定性的な結果では、トレーニング中にこのような三つ組みを一度も見ないにもかかわらず、「人がベッドの上にいる」や「コーンが人の上にのっている」のような珍しい関係についても、正しく物体ペアを検出できた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。