Skip to main content
QUICK REVIEW

[論文レビュー] Weakly-supervised Object Localization for Few-shot Learning and Fine-grained Few-shot Learning

Xiaojian He, Jinfu Lin|arXiv (Cornell University)|Mar 2, 2020
Domain Adaptation and Few-Shot Learning参考文献 28被引用数 6
ひとこと要約

本論文は、自己注意ベースの補完モジュール(SAC)を用いて特徴的な領域を局所化し、意味的アライメントモジュール(SAM)を用いて最近傍アライメントによるロバストな類似度距離を計算することで、弱教師ありのオブジェクト局所化手法を、少数ショットおよび細分化された少数ショット学習に提案する。この手法は、特に細分化ベンチマークにおいて最先端の性能を達成し、データセット間での局所化精度と一般化性能に顕著な向上を示す。

ABSTRACT

Few-shot learning (FSL) aims to learn novel visual categories from very few samples, which is a challenging problem in real-world applications. Many methods of few-shot classification work well on general images to learn global representation. However, they can not deal with fine-grained categories well at the same time due to a lack of subtle and local information. We argue that localization is an efficient approach because it directly provides the discriminative regions, which is critical for both general classification and fine-grained classification in a low data regime. In this paper, we propose a Self-Attention Based Complementary Module (SAC Module) to fulfill the weakly-supervised object localization, and more importantly produce the activated masks for selecting discriminative deep descriptors for few-shot classification. Based on each selected deep descriptor, Semantic Alignment Module (SAM) calculates the semantic alignment distance between the query and support images to boost classification performance. Extensive experiments show our method outperforms the state-of-the-art methods on benchmark datasets under various settings, especially on the fine-grained few-shot tasks. Besides, our method achieves superior performance over previous methods when training the model on miniImageNet and evaluating it on the different datasets, demonstrating its superior generalization capacity. Extra visualization shows the proposed method can localize the key objects more interval.

研究の動機と目的

  • グローバル表現が微細な詳細を捉えきれない低データレジームにおける少数ショット学習の課題に対処すること。
  • ボクシングボックスアノテーションを必要とせずに、識別的なオブジェクト領域を局所化することで、少数ショット分類を向上させること。
  • プロトタイプ平均化の代わりに最近傍ベースの意味的アライメントを用いることで、特徴表現の安定性を向上させること。
  • 多様な少数ショットおよび細分化少数ショットデータセットに一般化可能な軽量でエンドツーエンド微調整可能なモジュールを開発すること。

提案手法

  • 自己注意ベースの補完モジュール(SAC)は、チャネルベースの注目モジュール(CBAM)を用いて特徴マップから重要度マスクと補完的削除マスクを生成する。
  • 分類器は元の特徴とマスク処理済み特徴の両方に対して二重分類を実行し、二つのクラスアクティベーションマップ(CAM)を生成する。これらを統合することで、より完全で整合性のあるオブジェクト局所化が得られる。
  • 統合されたCAMに基づく補間を用いて、最も活性化された領域から深層記述子を抽出し、識別的な局所特徴に焦点を当てる。
  • 意味的アライメントモジュール(SAM)は、各クエリ記述子をサポート記述子のうち最近傍にマッチングさせることで、ノイズに対してロバストな意味的アライメント距離を計算する。
  • フレームワークはエンドツーエンド微調整可能であり、VGG-16 や ResNet などのさまざまなバックボーンと互換性がある。
  • 追加のデータオーグメンテーションやアノテーション付きハロシネーションネットワークへの依存を避ける。代わりに、注目駆動型局所化と相対的類似度学習に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1識別的な局所領域に注目することで、弱教師ありオブジェクト局所化が少数ショット分類性能を向上させることができるか?
  • RQ2注目ベースの補完的特徴学習は、標準的なCAM手法と比較して、局所化精度をどのように向上させるか?
  • RQ3低データレジーム下で、最近傍ベースの意味的アライメントは、プロトタイプ平均化を上回る性能を示すか?
  • RQ4提案手法は、さまざまな少数ショットおよび細分化少数ショットデータセットにどの程度一般化可能か?
  • RQ5SACおよびSAMモジュールを効果的に組み合わせることで、局所化および分類性能の両方を向上させることができるか?

主な発見

  • 提案手法は、1ショットでStanford Carsで82.24%、5ショットで95.43%の精度を達成し、細分化少数ショットタスクにおいて顕著に先行手法を上回った。
  • CUB-200-2011では5ショットで83.72%の精度に達し、細分化分類において強力な性能を示した。
  • アブレーションスタディでは、5ショット設定でSAMを用いることで、ResNetバックボーンで25.11%の向上が確認された。
  • SACモジュール単体でも、SACなしのベースラインと比較して1ショットで4.47%、5ショットで4.19%の性能向上を達成した。
  • 可視化結果から、SACモジュールは標準的なCAMと比較して、特に細分化データセットにおいてより完全で整合性のあるオブジェクト領域を局所化していることが確認された。
  • miniImageNetで学習したモデルは、未学習のデータセットにも良好に一般化され、Stanford Carsでは1ショットで58.11%、5ショットで77.83%の精度を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。