[論文レビュー] BaseTransformers: Attention over base data-points for One Shot Learning
本稿では、ベースデータセットの特徴空間における意味的に類似した、よく表現された領域に注目することで、より頑健なプロトタイプを新規クラスのために構築することにより、ワンショット分類を向上させる、新規の少样本学習手法BaseTransformersを提案する。クロスアテンションを用いてベースデータポイントの特徴に注目し、事前学習済みでノイズの少ない特徴を活用することで、インダクティブワンショット設定において、mini-ImageNet(70.88%)、tiered-ImageNet(72.46%)、CUB(82.27%)で最先端の性能を達成する。
Few shot classification aims to learn to recognize novel categories using only limited samples per category. Most current few shot methods use a base dataset rich in labeled examples to train an encoder that is used for obtaining representations of support instances for novel classes. Since the test instances are from a distribution different to the base distribution, their feature representations are of poor quality, degrading performance. In this paper we propose to make use of the well-trained feature representations of the base dataset that are closest to each support instance to improve its representation during meta-test time. To this end, we propose BaseTransformers, that attends to the most relevant regions of the base dataset feature space and improves support instance representations. Experiments on three benchmark data sets show that our method works well for several backbones and achieves state-of-the-art results in the inductive one shot setting. Code is available at github.com/mayug/BaseTransformers
研究の動機と目的
- 新規クラスの単一でノイズの多いサンプル表現に起因する、ワンショット学習におけるプロトタイプ推定の悪さを解消すること。
- 大規模なベースデータセットからのよく訓練された、ノイズの少ない特徴表現を活用して、少样本分類を向上させること。
- サポートインスタンスと意味的に類似したベースインスタンスの間で局所的で意味的な対応関係を学習することで、プロトタイプの部分ベースの構成を可能にすること。
- ガウス分布の仮定や特徴のグローバルな転送可能性に依存するのではなく、局所的で空間的に意味のある特徴の整合性に焦点を当てる。
提案手法
- BaseTransformersはクロスアテンション機構を用い、サポートインスタンスの特徴マップをクエリとして用い、意味的に類似したベースインスタンスの特徴をキーおよび値として用いる。
- 事前学習済みエンコーダーの潜在空間で特徴空間の適応を実行し、ピクセル空間の操作を避けることで、より良い意味的転送を実現する。
- クラスラベル情報による意味的類似度を用いて、最も近いベースクラスを特定し、関連するベース特徴への的確なクエリを可能にする。
- メタラーニングを用いてエンドツーエンドに訓練し、エンコーダーとBaseTransformerを同時に最適化することで、新規クラスのプロトタイプを精緻化する。
- 事前学習には対照的損失(例:SimCLRとInfoNCE)を用い、監視の崩壊を防ぎ、頑健なベース特徴を生成する。
- アテンションマップの可視化により、モデルがベース画像内の意味的に意味のある部分レベルの領域に注目していることが確認された。
実験結果
リサーチクエスチョン
- RQ1単一でノイズの多いサポートサンプルに依存するのではなく、ベースデータセットからのよく表現された特徴を活用することで、ワンショット学習におけるプロトタイプ推定を改善できるか?
- RQ2新規サポートインスタンスと意味的に類似したベースインスタンスの間で局所的で部分ベースの対応関係を学習することで、より頑健なプロトタイプ表現が得られるか?
- RQ3クロスアテンション機構は、ベース特徴空間から関連する領域を的確に注目し、新規クラスのためのより良いプロトタイプを組み立てるのに効果的か?
- RQ4クエリ関数の選択(視覚的、意味的、オラクル)が、提案手法の性能にどのように影響するか?
- RQ5本手法は、異なるバックボーンや少样本ベンチマークにどの程度一般化可能か?
主な発見
- BaseTransformersは、1ショット精度70.88%を達成し、mini-ImageNetで既存手法を上回る最先端の性能を示した。
- tiered-ImageNetでは1ショット設定で72.46%の精度に達し、多様な少样本ベンチマークにわたる強力な一般化能力を示した。
- CUBデータセットでは1ショット精度82.27%を達成し、細分化分類タスクにおける有効性を強調した。
- アブレーションスタディの結果、SimCLR事前学習と意味的クエリの組み合わせにより、ベースラインのプロトタイプネットワーク比で性能が約2%向上した。
- モデルの性能はクエリ関数に制限を受けており、オラクルクエリ(真のクラスプロトタイプを使用)を用いることでtiered-ImageNetで76.55%まで精度が向上したため、クエリ戦略の改善の余地があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。