Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Representation based Query-Specific Prototypical Network for Few-Shot Image Classification

Yaohui Li, Huaxiong Li|arXiv (Cornell University)|Mar 21, 2021
Domain Adaptation and Few-Shot Learning参考文献 40被引用数 4
ひとこと要約

本稿では、階層的特徴表現と注目ベースの領域選択を用いて、クエリ固有の領域レベルのプロトタイプを生成することで、少数ショット画像分類を向上させる Query-Specific Prototypical Network (QPN) を提案する。位置的およびスケール的側面での意味的整合性を達成することで、細分化されたデータセットも含む5つのベンチマークで最先端の性能を発揮し、5-way 1-shot設定下での miniImageNet では 54.92% の精度を達成した。

ABSTRACT

Few-shot image classification aims at recognizing unseen categories with a small number of labeled training data. Recent metric-based frameworks tend to represent a support class by a fixed prototype (e.g., the mean of the support category) and make classification according to the similarities between query instances and support prototypes. However, discriminative dominant regions may locate uncertain areas of images and have various scales, which leads to the misaligned metric. Besides, a fixed prototype for one support category cannot fit for all query instances to accurately reflect their distances with this category, which lowers the efficiency of metric. Therefore, query-specific dominant regions in support samples should be extracted for a high-quality metric. To address these problems, we propose a Hierarchical Representation based Query-Specific Prototypical Network (QPN) to tackle the limitations by generating a region-level prototype for each query sample, which achieves both positional and dimensional semantic alignment simultaneously. Extensive experiments conducted on five benchmark datasets (including three fine-grained datasets) show that our proposed method outperforms the current state-of-the-art methods.

研究の動機と目的

  • メトリックベースの少数ショット学習における固定プロトタイプの制限を解決し、クエリ固有の判別的領域を捉えること。
  • 画像間で物体のスケールや位置が異なることによる特徴空間内の不整合を克服すること。
  • 不要な背景領域をフィルタリングし、意味的に関連のある判別的領域に注目することで、メトリックの効率を向上させること。
  • 転移可能なクエリ適応型表現を学習することで、ドメイン間での頑健な一般化を実現すること。
  • 複雑なマルチスケールモジュールを、パラメータ数を大幅に減らしても性能を維持できる軽量な階層的プーリング戦略に置き換えること。

提案手法

  • 支持画像およびクエリ特徴における判別的キーエリアを特定するために、畳み込みブロック注目モジュール (CBAM) を採用する。
  • クエリ領域とサポート領域間の局所的類似度を計算し、プロトタイプ生成に適したサポート領域を選択する。
  • クエリとの類似度に基づいて重み付けを再計算することで、クエリ固有のプロトタイプを構築する。
  • マルチスケールのマックスプーリングを用いた階層的表現により、スケール不変特徴を取得し、パrameterの追加を最小限に抑える。
  • 最終的表現における異なる特徴スケールの影響をバランスさせるために、学習可能な生成係数 (ξ) を使用する。
  • クエリ特徴とクエリ固有プロトタイプ間の距離を計算するためのメトリック関数として、コサイン類似度を採用する。

実験結果

リサーチクエスチョン

  • RQ1クエリ固有のプロトタイプは、各クエリが持つ固有の空間的および意味的特性に適応することで、少数ショット分類を向上させることができるか?
  • RQ2階層的マルチスケール表現は、判別的領域のスケール変動に対してどのように頑健性を向上させるか?
  • RQ3注目と局所的類似度による不要領域のフィルタリングは、メトリック精度をどの程度向上させるか?
  • RQ4提案手法は、既存の少数ショット学習ベースラインと比較して、ドメイン間でより優れた一般化性能を示すか?
  • RQ5パラメータ数を減らすことで、複雑なマルチスケールモジュール(例:Inception Operator)を凌駆する軽量な階層的プーリング機構を実現できるか?

主な発見

  • 5-way 1-shot設定下での miniImageNet において、QPNは 54.92% の精度を達成し、ガウス類似度を用いた従来のSOTA(54.08%)を上回った。
  • 5-way 5-shot設定では、73.18% の精度を達成し、より強力なバックボーンを搭載した他の手法をすべて上回った。
  • クロスドメイン評価(miniImageNet → CUB-200-2011)において、QPNは 66.19% の精度を達成し、ベースライン手法を 0.62 パcentageポイント上回った。
  • QPNはトレーニング可能なパラメータをたった 0.150M 個で実現しており、GCR(1.755M)よりもはるかにパラメータ効率が良く、ProtoNet などの単純なモデルと同等の水準であった。
  • アブレーションスタディの結果、生成係数 ξ は性能にやや影響を与えることが確認され、最適値は約 5–7 の範囲にあった。
  • コサイン類似度はガウス類似度よりも優れた性能を示し、1-shot設定で 0.84%、5-shot設定で 0.55% の向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。