[論文レビュー] CAD: Co-Adapting Discriminative Features for Improved Few-Shot Classification
本稿では、共通の自己注意モジュールを介してサポート特徴量とクエリ特徴量を同時に適応させることで、少サンプル分類を向上させる、エンド・ツー・エンドのメタラーニングフレームワークであるCAD(Co-Adapting Discriminative Features)を提案する。クエリ特徴量とサポート特徴量の間で相互注意スコアを計算し、それらを特徴量の再重み付けに用いることで、プロトタイプ学習を改善し、転移学習を必要とせずに、標準ベンチマークで最先端の性能を達成する。この手法は、先行手法よりも3%〜5%の絶対的向上を達成している。
Few-shot classification is a challenging problem that aims to learn a model that can adapt to unseen classes given a few labeled samples. Recent approaches pre-train a feature extractor, and then fine-tune for episodic meta-learning. Other methods leverage spatial features to learn pixel-level correspondence while jointly training a classifier. However, results using such approaches show marginal improvements. In this paper, inspired by the transformer style self-attention mechanism, we propose a strategy to cross-attend and re-weight discriminative features for few-shot classification. Given a base representation of support and query images after global pooling, we introduce a single shared module that projects features and cross-attends in two aspects: (i) query to support, and (ii) support to query. The module computes attention scores between features to produce an attention pooled representation of features in the same class that is later added to the original representation followed by a projection head. This effectively re-weights features in both aspects (i & ii) to produce features that better facilitate improved metric-based meta-learning. Extensive experiments on public benchmarks show our approach outperforms state-of-the-art methods by 3%~5%.
研究の動機と目的
- 従来の少サンプル学習手法が静的プロトタイプや限定的な特徴適応に依存するという限界を是正すること。
- 相互関係的注意を用いて動的に特徴量を再重み付けすることで、メトリックベースのメタラーニングを改善すること。
- ベースクラスでの事前学習に依存しないエンド・ツー・エンドの学習を可能にすることで、事前学習の必要性を排除すること。
- 注意ベースのプロトタイプ精錬により、低ショット設定における特徴量の凝縮性とクラス分離性を向上させること。
提案手法
- グローバル平均プーリング後に、サポート特徴量とクエリ特徴量の間で相互注意を計算するための、1つの共有マルチヘッド自己注意モジュールを導入する。
- モジュールは基本特徴量を投影し、クエリからサポートへの方向およびサポートからクエリへの方向の両方でスケーリングドット積注意スコアを計算する。
- 注意重みを元の特徴量に適用することで、注意プールド特徴量を計算し、精錬された表現を生成する。
- 精錬された特徴量を元の投影特徴量に加算した後、最終埋め込みを生成するためにプロジェクションヘッドを通過させる。
- 注意プールドプロトタイプを初期特徴量に統合することで、明示的な空間的対応学習を伴わずに、識別力の高い特徴量を強化する。
- フレームワーク全体を事前学習なしでスクラッチからエンド・ツー・エンドに学習可能である。
![Figure 1 : Visual intuition of the proposed framework compared to other approaches using attention. (a) Standard ProtoNet [ 41 ] architecture with nearest neighbour classifier (NN). (b) Adaptation of support embeddings only without using relations in the query sets, with backbone pre-training [ 52 ]](https://ar5iv.labs.arxiv.org/html/2203.13465/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1相互注意を介したサポート特徴量とクエリ特徴量の共適応が、静的プロトタイプ学習を上回る少サンプル分類性能を達成できるか?
- RQ2事前学習なしでエンド・ツー・エンドに学習させても、少サンプル学習で最先端の性能を達成できるか?
- RQ3クエリ特徴量とサポート特徴量の間の相互注意が、特徴量の凝縮性とクラス分離性にどのように影響するか?
- RQ4クエリからサポートへの注意とサポートからクエリへの注意の両方が、特徴量再重み付けにおいて果たす寄与度は何か?
- RQ5明示的なピクセル単位の対応関係を学習しない状況でも、注意ベースの特徴量再重み付けが、空間的注意メカニズムを上回る性能を発揮できるか?
主な発見
- CADは、mini-ImageNetを含む標準的な少サンプルベンチマークで、最先端の手法よりも3%〜5%の絶対的向上を達成した。
- アブレーションスタディの結果、クエリからサポートへの注意のみ(MAB^S_h)を用いる場合、特に1ショット設定で顕著な性能低下が見られた。
- クエリ特徴量の単独適応(MAB^Q_h)は、5ショット設定においてもCADの完全な手法に比べて一貫してやや低い性能であった。
- 相互適応なしの自己注意のみ(MAB^*_h)では、特に極めて低ショットな環境下で、ProtoNetなどのベースラインモデルを上回ることができなかった。
- t-SNE可視化により、CADは適応後、より凝縮され、明確に分離された特徴量クラスタを生成していることが確認され、一般化性能の向上が示された。
- 定性的分析から、注意スコアが背景の変動や関係のない物体といった干渉要因を効果的に抑制し、意味的に関連する特徴量に焦点を当てる能力があることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。