Skip to main content
QUICK REVIEW

[論文レビュー] Zero and Few Shot Learning with Semantic Feature Synthesis and Competitive Learning

Zhiwu Lu, Jiechao Guan|arXiv (Cornell University)|Oct 19, 2018
Domain Adaptation and Few-Shot Learning参考文献 59被引用数 5
ひとこと要約

本論文は、プロトタイプに基づく摂動と競争的双方向射影学習(BPL)を用いた意味的特徴合成により、ゼロショットおよびフェイントショット学習の統合フレームワークを提案する。クラスプロトタイプから未学習クラスの特徴を合成し、各サンプルに対して最も可能性の高い2つのクラスを考慮するロバストで競争的な射影モデルを訓練することで、大規模および小規模なベンチマークの両方で最先端の性能を達成し、ゼロショットおよびフェイントショット認識タスクにおいて先行手法を上回る。

ABSTRACT

Zero-shot learning (ZSL) is made possible by learning a projection function between a feature space and a semantic space (e.g.,~an attribute space). Key to ZSL is thus to learn a projection that is robust against the often large domain gap between the seen and unseen class domains. In this work, this is achieved by unseen class data synthesis and robust projection function learning. Specifically, a novel semantic data synthesis strategy is proposed, by which semantic class prototypes (e.g., attribute vectors) are used to simply perturb seen class data for generating unseen class ones. As in any data synthesis/hallucination approach, there are ambiguities and uncertainties on how well the synthesised data can capture the targeted unseen class data distribution. To cope with this, the second contribution of this work is a novel projection learning model termed competitive bidirectional projection learning (BPL) designed to best utilise the ambiguous synthesised data. Specifically, we assume that each synthesised data point can belong to any unseen class; and the most likely two class candidates are exploited to learn a robust projection function in a competitive fashion. As a third contribution, we show that the proposed ZSL model can be easily extended to few-shot learning (FSL) by again exploiting semantic (class prototype guided) feature synthesis and competitive BPL. Extensive experiments show that our model achieves the state-of-the-art results on both problems.

研究の動機と目的

  • ゼロショット学習(ZSL)における既知クラスと未知クラスの間のドメインギャップを解消すること。これは、実際の未知クラスのサンプルが存在しない状況で正確な認識を妨げる要因である。
  • 既知クラスの特徴に対する単純な摂動を用いて、意味的プロトタイプ(例:属性ベクトル)を用いて未知クラスのデータを合成することで、ZSLにおけるロバスト性を向上させること。
  • 各サンプルに対して最も可能性の高い2つの未知クラス候補を考慮することで、合成データの不確実性に対処する競争的学習ベースの射影モデルを開発すること。
  • 同じ意味的合成と競争的射影メカニズムを用いて、提案されたZSLフレームワークをフェイントショット学習(FSL)に拡張すること。
  • 特に低ショット状態下において、大規模および小規模な設定下でZSLおよびFSLの両方において最先端の性能を達成すること。

提案手法

  • 生成モデルを必要とせず、未知クラスのプロトタイプ(例:属性ベクトル)を用いて既知クラスの特徴を摂動させることで、合成された未知クラス特徴を生成する新しい意味的特徴合成戦略。
  • 競争的双方向射影学習(BPL)モデルを導入し、各合成サンプルが競争的な方法で最も可能性の高い2つの未知クラスに射影されることで、ロバスト性を向上させる。
  • BPLモデルは、最小-最小/最大-最小の定式化を採用し、競争的制約下で視覚的特徴から意味的特徴、および意味的特徴から視覚的特徴への射影を同時に学習する。
  • 最適化には勾配降下と勾配上昇を組み合わせた反復的アルゴリズムを用い、理論的収束保証を有する。
  • フェイントショット学習への拡張は、同じ意味的合成と競争的BPLをフェイントショットのサポートセットに適用することで実現する。
  • 視覚的特徴は事前学習済みのCNN(例:Simple, WRN)を用いて抽出され、ImageNetおよびmini-ImageNetにおける標準的なZSLおよびFSLプロトコルに従って評価が行われる。

実験結果

リサーチクエスチョン

  • RQ1意味的プロトタイプに基づく摂動は、ゼロショット学習における現実的で未学習クラスの特徴を効果的に合成できるか?
  • RQ2競争的双方向射影学習は、合成データのドメインシフトおよび不確実性に対するロバスト性を向上させることができるか?
  • RQ3提案されたフレームワークは、限られたサポートサンプルを持つフェイントショット学習に効果的に一般化できるか?
  • RQ4大規模および小規模なベンチマークにおいて、最先端の手法と比較してモデルの性能はどの程度か?
  • RQ5競争的学習メカニズムは、ZSLおよびFSLにおける標準的な最近傍法や単一クラス射影と比較して優れているか?

主な発見

  • 大規模なImageNet ZSLベンチマークでは、本手法がゼロショットおよびフェイントショット両設定で、先行する最先端手法を上回る最先端の性能を達成した。
  • mini-ImageNet FSLベンチマークでは、Wide ResNet(WRN)を特徴抽出器として用い、5-way 5-shotの精度が75.62%に達し、以前の最先端の73.74%を上回った。
  • WRNを用いたmini-ImageNetでは、5-way 1-shotの精度が58.53%に達し、同じバックボーンを用いたPAAの59.60%という以前の最高値を上回った。
  • 競争的BPLモデルは、ベースラインの最近傍法や標準的な射影手法と比較して、特に低ショット状態下で顕著な性能向上を示した。
  • より強力な視覚的特徴抽出器(例:WRN)を用いることで顕著な性能向上が得られ、本フレームワークにおける高品質な特徴の重要性を裏付けた。
  • アブレーション実験では、競争的学習メカニズムが不可欠であることが示された。この機構を除去すると性能が低下し、合成データの不確実性に対処する役割を果たしていることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。