Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Relation Reasoning for Shot-Stable Few-Shot Object Detection

Chenchen Zhu, Fang-Yi Chen|ArXiv.org|Mar 2, 2021
Domain Adaptation and Few-Shot Learning参考文献 47被引用数 22
ひとこと要約

本稿では、学習済み単語埋め込みと動的関係グラフを用いて、ベースクラスと新規クラス間の意味的関係を明示的にモデル化することで、データ不足に対する耐性を高める、少サンプル物体検出フレームワークSRR-FSDを提案する。視覚的特徴を意味的空間に投影し、注意に基づく関係推論によって精緻化することで、特に明示的および暗黙的ショットの両方が少ない状況下でも、顕著に向上した安定した性能を達成する。

ABSTRACT

Few-shot object detection is an imperative and long-lasting problem due to the inherent long-tail distribution of real-world data. Its performance is largely affected by the data scarcity of novel classes. But the semantic relation between the novel classes and the base classes is constant regardless of the data availability. In this work, we investigate utilizing this semantic relation together with the visual information and introduce explicit relation reasoning into the learning of novel object detection. Specifically, we represent each class concept by a semantic embedding learned from a large corpus of text. The detector is trained to project the image representations of objects into this embedding space. We also identify the problems of trivially using the raw embeddings with a heuristic knowledge graph and propose to augment the embeddings with a dynamic relation graph. As a result, our few-shot detector, termed SRR-FSD, is robust and stable to the variation of shots of novel objects. Experiments show that SRR-FSD can achieve competitive results at higher shots, and more importantly, a significantly better performance given both lower explicit and implicit shots. The benchmark protocol with implicit shots removed from the pretrained classification dataset can serve as a more realistic setting for future research.

研究の動機と目的

  • データ不足下での少サンプル物体検出器の不安定性を解消すること、特に明示的および暗黙的ショットの両方が制限される状況において。
  • ベースクラスと新規クラス間の定常的意味的関係を、一般化を向上させる安定した誘導的バイアスとして活用すること。
  • 視覚的特徴に依存する既存手法の限界を克服し、ショットの変動に敏感でない方法を提供すること。
  • 視覚的検出とテキスト的意味的知識を、エンドツーエンドで学習可能な形で統合する手法を開発すること。
  • 静的またはヒューリスティックな知識グラフに代わる、より優れたクラス間関係をモデル化できる動的関係グラフを提案すること。

提案手法

  • 大規模なテキストコーパスからの事前学習済み単語埋め込みを用いて各クラスを表現し、ゼロショット一般化のための意味的空間を構築する。
  • 検出器を訓練して画像特徴をこの意味的空間に投影し、視覚的表現を対応するクラス埋め込みと整合させる。
  • 自己注意を用いてクラス埋め込み間のクラス間関係を学習する動的関係グラフモジュールを導入し、固定されたヒューリスティック知識グラフに置き換える。
  • 関係推論を微分可能演算として定式化する:$\mathbf{W}_{e}^{\prime} = \delta(\mathbf{W}_{e}\mathbf{T}_{f}\mathbf{T}_{g}^{T}\mathbf{W}_{e}^{T})\mathbf{W}_{e}\mathbf{T}_{h}\mathbf{T}_{l} + \mathbf{W}_{e}$、ここで$\mathbf{W}_{e}$は初期の単語埋め込み行列である。
  • 拡張された埋め込み$\mathbf{W}_{e}^{\prime}$を検出ヘッドでの分類重みとして使用し、関係に配慮した分類を可能にする。
  • バックボーンを固定したまま、関係推論モジュールと投影行列のみを微調整することで、少サンプル環境下での過学習を回避する。

実験結果

リサーチクエスチョン

  • RQ1ベースクラスと新規クラス間の意味的関係は、データ不足下での少サンプル物体検出を向上させる安定した誘導的バイアスとして機能するか?
  • RQ2学習済み意味的埋め込みと動的関係推論を組み込むことで、明示的および暗黙的ショットの変動に対する検出器の耐性がどのように向上するか?
  • RQ3ヒューリスティック知識グラフを、データ駆動型で学習可能な関係グラフに置き換えることで、固定グラフに比べてより優れた少サンプル一般化が達成されるか?
  • RQ4視覚的・意味的整合性と関係推論をエンドツーエンドで学習することで、視覚的特徴に依存する手法に比べて優れた性能が得られるか?
  • RQ5ImageNetの事前学習データセットから新規クラスのサンプルを削除した場合(すなわち暗黙的ショットを排除した場合)、検出器の性能にどのような影響が生じるか?また、提案手法はこの影響を緩和できるか?

主な発見

  • SRR-FSDは1ショットのVOCベンチマークでmAP50が46.1%を達成し、低ショット条件下でFSRW(31.5%)およびMeta R-CNN(35.8%)を顕著に上回る。
  • 2ショットではSRR-FSDが55.6%のAP50を達成し、極めて少ないラベル付き例でも強力な一般化性能を示す。
  • ImageNetから新規クラスのサンプルを削除したrm-nov設定下でも、SRR-FSDは1ショットで41.5%のmAP50を維持するのに対し、ベースラインは著しく低下する。これは、ショットの安定性を示す。
  • 5ショットでは65.4%のAP50、10ショットでは67.4%のAP50を達成し、すべてのショットレベルで競争力のある性能を示す。
  • アブレーションスタディの結果、より多くのパラメータを微調整しても性能向上が見られない一方で、動的関係グラフは耐性を確保するために不可欠であることが確認され、静的またはヒューリスティックなグラフを上回る。
  • 自己注意を用いて実装された動的関係グラフは、クラス埋め込み間での効果的な知識伝達を可能にし、データが少ない環境下での分類精度を向上させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。