Skip to main content
QUICK REVIEW

[論文レビュー] Classifier and Exemplar Synthesis for Zero-Shot Learning

Soravit Changpinyo, Wei‐Lun Chao|arXiv (Cornell University)|Dec 16, 2018
Domain Adaptation and Few-Shot Learning参考文献 83被引用数 5
ひとこと要約

本論文は、意味的埋め込みを用いて未学習クラスの分類器と視覚的例示を合成する2つのゼロショット学習フレームワークを提案する。グラフベースの多様体学習を用いてクラス間の関係をモデル化し、視覚的例示を意味的ベクトルから回帰することで、5つのベンチマークで最先端の性能を達成し、従来のZSLおよび一般化ZSLの両設定において優れた汎化性能を示す。

ABSTRACT

Zero-shot learning (ZSL) enables solving a task without the need to see its examples. In this paper, we propose two ZSL frameworks that learn to synthesize parameters for novel unseen classes. First, we propose to cast the problem of ZSL as learning manifold embeddings from graphs composed of object classes, leading to a flexible approach that synthesizes "classifiers" for the unseen classes. Then, we define an auxiliary task of synthesizing "exemplars" for the unseen classes to be used as an automatic denoising mechanism for any existing ZSL approaches or as an effective ZSL model by itself. On five visual recognition benchmark datasets, we demonstrate the superior performances of our proposed frameworks in various scenarios of both conventional and generalized ZSL. Finally, we provide valuable insights through a series of empirical analyses, among which are a comparison of semantic representations on the full ImageNet benchmark as well as a comparison of metrics used in generalized ZSL. Our code and data are publicly available at https://github.com/pujols/Zero-shot-learning-journal

研究の動機と目的

  • ラベル付きトレーニング例なしで未学習のオブジェクトクラスを認識する課題に対処すること。
  • 従来のZSLの制限を克服し、新規クラスの代表的パラメータ(分類器および視覚的例示)を合成すること。
  • 意味表現から視覚的特徴および分類器パラメータへのマッピングを学習することで、ゼロショット一般化を向上させること。
  • 既存のZSL手法を強化できる統合的で柔軟なフレームワークを提供するか、単体で動作するモデルとして機能させること。
  • 意味的表現の品質および例示予測の影響が、多様なデータセットにおけるZSL性能に与える影響を調査すること。

提案手法

  • オブジェクトクラスが意味的空間内で重み付きグラフを形成するゼロショット学習の問題として定式化し、エッジの重みを意味的類似度から導出する。
  • 視覚的分類器(モデル空間座標として)を意味的グラフにマップする多様体埋め込みを学習し、未学習クラスの分類器合成を可能にする。
  • 視覚的例示を、学習済みクラスの平均特徴の次元削減版として定義し、意味的表現からこれらの例示を予測する回帰器を訓練する。
  • サポートベクターレグレッサー(SVR)またはマルチレイヤーパーセプトロン(MLP)を用いて意味的ベクトルから視覚的例示特徴へマッピングし、過学習を防ぐためにL2正則化を適用する。
  • t-SNE可視化を用いて予測された例示の品質を評価し、未学習クラスの実際の画像クラスタに近いかどうかを測定する。
  • PCAを用いて特徴の次元削減を実施し、PCA次元(10〜1024)の多様な設定においても性能が安定していることを示す。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトクラスの意味的グラフ上で多様体学習を用いて分類器を合成することで、ゼロショット一般化を向上させられるか?
  • RQ2意味的埋め込みから視覚的例示を合成することは、ゼロショット認識性能の向上にどの程度効果的か?
  • RQ3回帰モデルの選択(SVR対MLP)が、例示予測の精度およびZSLにおける一般化性能に与える影響はいかほどか?
  • RQ4PCA次元の選択が、例示予測および推論の性能と効率に与える影響は?
  • RQ5意味的表現の質および学習済みクラスの数が、合成された例示および分類器の品質に与える影響はどの程度か?

主な発見

  • SynCフレームワークは、AwA、CUB、ImageNetを含む5つのベンチマークデータセットにおいて、従来のZSLおよび一般化ZSLの両設定で最先端の性能を達成した。
  • AwAでは、PCAを使用しないSVRベースの例示予測で77.8%の精度を達成し、わずか40クラスの学習データしかないにもかかわらず優れた一般化性能を示した。
  • SVRを用いたEXEM(1NN)はMLPベースの例示予測を上回り、AwAでPCA(d=1024)を使用した場合に76.2%の精度を記録した。これはSVRが小規模な学習データセットに対しても頑健であることを示している。
  • 本手法はPCA次元に対して非常に頑健であり、d=10でもAwAでは75%以上、SUNでは68%以上の精度を維持しており、スケーラビリティと効率性を兼ね備えている。
  • t-SNE可視化により、予測された例示が実画像クラスタとよく一致していることが確認され、特にAwAおよびSUNにおいて合成特徴の品質が妥当であることが裏付けられた。
  • 細分化されたCUBではクラスの混合が生じやすく例示予測が困難であるが、本手法はPCA(d=1024)を使用した場合に59.4%の精度を達成し、ベースラインのMLPを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。