Skip to main content
QUICK REVIEW

[論文レビュー] SEGA: Semantic Guided Attention on Visual Prototype for Few-Shot Learning

Fengyuan Yang, Ruiping Wang|arXiv (Cornell University)|Nov 8, 2021
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

SEGAは、少数のショット学習における視覚的特徴の注目を、クラスレベルの意味的埋め込みによってガイドする意味的誘導型アテンションメカニズムを提案する。このアプローチにより、判別性の高いプロトタイプ表現が向上する。意味的事前知識からカテゴリ固有のアテンションベクトルを学習することで、SEGAはminiImageNet、tieredImageNet、CUB、CIFAR-FSの主要ベンチマークで最先端性能を達成し、特に1ショット設定において、先行手法を最大4.5%の精度向上で上回る。

ABSTRACT

Teaching machines to recognize a new category based on few training samples especially only one remains challenging owing to the incomprehensive understanding of the novel category caused by the lack of data. However, human can learn new classes quickly even given few samples since human can tell what discriminative features should be focused on about each category based on both the visual and semantic prior knowledge. To better utilize those prior knowledge, we propose the SEmantic Guided Attention (SEGA) mechanism where the semantic knowledge is used to guide the visual perception in a top-down manner about what visual features should be paid attention to when distinguishing a category from the others. As a result, the embedding of the novel class even with few samples can be more discriminative. Concretely, a feature extractor is trained to embed few images of each novel class into a visual prototype with the help of transferring visual prior knowledge from base classes. Then we learn a network that maps semantic knowledge to category-specific attention vectors which will be used to perform feature selection to enhance the visual prototypes. Extensive experiments on miniImageNet, tieredImageNet, CIFAR-FS, and CUB indicate that our semantic guided attention realizes anticipated function and outperforms state-of-the-art results.

研究の動機と目的

  • 少数の視覚的データという挑戦に、意味的事前知識を活用して特徴表現を改善すること。
  • 新しいクラスのためのキービジュアル特徴を選択するために、意味的埋め込みからトップダウン型の注目を誘導すること。
  • 意味的埋め込みからカテゴリ固有のアテンションベクトルへの微分可能なマッピングを学習すること。
  • 1つまたは数個のサンプルしか利用できない状況でも、視覚的プロトタイプの一般化性能と判別性を向上させること。
  • 意味的知識が人間と同様の注目ベースの方法で視覚的認識を効果的にガイドできるかどうかを検証すること。

提案手法

  • ベースクラスで訓練された特徴抽出器により、少数のショット画像が視覚的プロトタイプに埋め込まれる。
  • 学習可能なネットワークが、クラスの意味的埋め込み(例:テキスト記述やクラス名)をカテゴリ固有のアテンションベクトルにマッピングする。
  • 推論時、新しいクラス名からアテンションベクトルが生成され、要素ごとの乗算によって視覚的プロトタイプに適用され、判別性の高い特徴が強調される。
  • アテンションメカニズムは、重要な視覚次元に注目することで特徴選択を実行し、プロトタイプの判別性を向上させる。
  • フレームワークは、ベースクラスにおけるクロスエントロピー損失を用いてエンドツーエンドで訓練され、対照学習またはメトリック学習によるアテンションの監視が行われる。
  • この手法は一般化性能に優れており、ベースクラスで学習した意味的・視覚的整合性が、新しいクラスへも効果的に転送される。

実験結果

リサーチクエスチョン

  • RQ1意味的知識を、少数のショット学習における視覚的特徴の注目をガイドするために効果的に利用できるか?
  • RQ2意味的によって誘導された注目が、少数のサンプルでの視覚的プロトタイプの判別性を向上させるか?
  • RQ3視覚的特徴やプロトタイプ再構成に依存するベースライン手法と比較して、意味的誘導型アテンションはどのように異なるか?
  • RQ4意味的空間と視覚的空間の整合性が、ベースクラスから新しいクラスへ一般化される程度はどの程度か?
  • RQ5ショット数が増加するにつれて、意味的誘導の利点が減少するか?

主な発見

  • miniImageNetの5-way 1ショット設定において、SEGAはトップ1正解率69.04%を達成し、以前の最先端手法AM3を3.74%上回った。
  • tieredImageNetでは、5-way 1ショットで79.03%の正解率を記録し、次善の手法を0.91%上回った。
  • CUBでは、5-way 1ショットで84.57%の正解率を達成し、以前の最先端手法FEAT(68.87%)およびDeepEMD(75.65%)を大きく上回った。
  • CIFAR-FSでは、5-way 1ショットで78.45%の正解率を達成し、MetaOptNet(72.0%)およびRFS(73.9%)を上回った。
  • Grad-CAMの可視化結果から、SEGAは動物の体部など意味的に関連する領域に注目しているのに対し、ベースライン手法はしばしば背景ノイズに注目していることが確認された。
  • 意味的誘導による性能向上は、1ショットの状況で最も顕著であり、ショット数が増えるにつれて低下する傾向にあり、意味的アテンションが視覚的プロトタイプの不安定性を補完していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。