Skip to main content
QUICK REVIEW

[論文レビュー] Breaking Immutable: Information-Coupled Prototype Elaboration for Few-Shot Object Detection

Xiaonan Lu, Wenhui Diao|arXiv (Cornell University)|Nov 27, 2022
Advanced Neural Network Applications被引用数 5
ひとこと要約

本稿では、条件付き情報結合モジュールを介してクエリに依存する情報をサポート特徴に統合し、階層的および画像間の注意メカニズムを用いて顕著な特徴を動的に集約することで、プロトタイプ品質を向上させる、情報結合型プロトタイプ拡張(ICPE)という、新しい few-shot 物体検出手法を提案する。ICPE は、Pascal VOC および MS COCO で最先端の性能を達成し、COCO における 10-shot および 30-shot 設定で AP を 10% 以上向上させる。

ABSTRACT

Few-shot object detection, expecting detectors to detect novel classes with a few instances, has made conspicuous progress. However, the prototypes extracted by existing meta-learning based methods still suffer from insufficient representative information and lack awareness of query images, which cannot be adaptively tailored to different query images. Firstly, only the support images are involved for extracting prototypes, resulting in scarce perceptual information of query images. Secondly, all pixels of all support images are treated equally when aggregating features into prototype vectors, thus the salient objects are overwhelmed by the cluttered background. In this paper, we propose an Information-Coupled Prototype Elaboration (ICPE) method to generate specific and representative prototypes for each query image. Concretely, a conditional information coupling module is introduced to couple information from the query branch to the support branch, strengthening the query-perceptual information in support features. Besides, we design a prototype dynamic aggregation module that dynamically adjusts intra-image and inter-image aggregation weights to highlight the salient information useful for detecting query images. Experimental results on both Pascal VOC and MS COCO demonstrate that our method achieves state-of-the-art performance in almost all settings.

研究の動機と目的

  • few-shot 物体検出における不変的かつクエリに依存しないプロトタイプの限界を解消すること。
  • クエリ画像からの知覚的情報をサポート特徴学習に組み込むことで、プロトタイプの代表性を向上させること。
  • プロトタイプ集約における均一な平均化が原因で生じる判別的物体特徴のぼやけを軽減すること。
  • サポート画像内における顕著な領域およびクエリに最も類似する重要なサポート画像を動的に強調すること。
  • 多様なクエリ画像の文脈に適応する、クエリ固有の高品質なプロトタイプを生成すること。

提案手法

  • 条件付き情報結合モジュールがクエリ特徴をサポート特徴に統合し、サポート表現にクエリに依存する文脈を注入する。
  • プロトタイプ動的集約モジュールには、各サポート画像内での局所的からグローバルな依存関係を構築するインラインアテンション機構が含まれ、重要な領域を強調する。
  • 画像間動的集約機構は、クエリとの類似度を学習し、より関連性の高いサポート画像に高い重みを割り当てる。
  • インラインおよび画像間モジュールの両方で学習可能なアテンション重みを使用し、クエリ文脈に応じて特徴集約を動的に調整する。
  • 結合された特徴はプロトタイプ生成ヘッドを通過し、検出用にクエリに適応したプロトタイプを生成する。
  • フレームワークは、サポートセットとクエリセットを用いたエピソード学習によるメタラーニング設定で、エンドツーエンドに訓練される。

実験結果

リサーチクエスチョン

  • RQ1few-shot 物体検出におけるプロトタイプは、各クエリ画像の特定の文脈にどのようにより適応可能にすることができるか?
  • RQ2クエリに依存する情報は、サポートベースのプロトタイプの代表性をどの程度向上させることができるか?
  • RQ3均一な平均化に比べて、動的特徴集約は、プロトタイプ構築時に判別的物体特徴を保持する上で優れていると期待できるか?
  • RQ4インラインおよび画像間アテンションメカニズムは、どのようにして few-shot 検出におけるプロトタイプ品質を共同で向上させるか?
  • RQ5提案手法は、MS COCO のような複雑で現実世界のデータセットに対しても効果的に一般化できるか?

主な発見

  • ICPE は、10-shot 条件下で MS COCO で 19.3% の AP を達成し、30-shot 条件下では 23.1% を達成し、Meta R-CNN よりも 10% 以上優れている。
  • 条件付き情報結合モジュール単体でも、Pascal VOC における全ショット設定で mAP を 5.2% 向上させた。
  • プロトタイプ動的集約モジュールは、独立して使用した場合に mAP を 3.7% 向上させ、結合モジュールと組み合わせた場合には 7.8% 向上させた。
  • Intra-DAM は、ベースラインのプーリング手法と比較して mAP を 2.7% 向上させ、Inter-DAM は平均でさらに 3.7% の性能向上をもたらした。
  • アブレーションスタディにより、クエリキー特徴マップ $f(Q,K)$ で 1024 チャネルが最適なパフォーマンスをもたらし、過学習や不足学習を回避することが確認された。
  • 計算コストの増加は最小限に抑えられており、Meta R-CNN と比較してパrameter数および FLOPs がわずかに増加するにとどまり、効率性が保証されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。