Skip to main content
QUICK REVIEW

[論文レビュー] Zero-shot Learning via Shared-Reconstruction-Graph Pursuit

Bo Zhao, Xinwei Sun|arXiv (Cornell University)|Nov 20, 2017
Domain Adaptation and Few-Shot Learning参考文献 18被引用数 9
ひとこと要約

本論文は、画像空間と意味的埋め込み空間の間の分布シフトが知識の転送を妨げるゼロショット学習(ZSL)における空間シフト問題に対処するため、新しいグラフベースの手法、共有再構成グラフ・プロシュート(SRG)を提案する。画像空間と意味的空間の両方で共有再構成係数を学習することで、未学習クラスのプロトタイプを再構成し、分類に用いることが可能となり、3つのベンチマークデータセットで最先端の性能を達成した。特にImageNetではトップ5正解率が18.26%に達した。

ABSTRACT

Zero-shot learning (ZSL) aims to recognize objects from novel unseen classes without any training data. Recently, structure-transfer based methods are proposed to implement ZSL by transferring structural knowledge from the semantic embedding space to image feature space to classify testing images. However, we observe that such a knowledge transfer framework may suffer from the problem of the geometric inconsistency between the data in the training and testing spaces. We call this problem as the space shift problem. In this paper, we propose a novel graph based method to alleviate this space shift problem. Specifically, a Shared Reconstruction Graph (SRG) is pursued to capture the common structure of data in the two spaces. With the learned SRG, each unseen class prototype (cluster center) in the image feature space can be synthesized by the linear combination of other class prototypes, so that testing instances can be classified based on the distance to these synthesized prototypes. The SRG bridges the image feature space and semantic embedding space. By applying spectral clustering on the learned SRG, many meaningful clusters can be discovered, which interprets ZSL performance on the datasets. Our method can be easily extended to the generalized zero-shot learning setting. Experiments on three popular datasets show that our method outperforms other methods on all datasets. Even with a small number of training samples, our method can achieve the state-of-the-art performance.

研究の動機と目的

  • トレーニングデータとテストデータが幾何的に整合性のない画像空間と意味的埋め込み空間に存在するゼロショット学習における空間シフト問題に対処すること。
  • 直接的なマッピング関数に依存せずに、意味的空間から画像特徴空間への構造的知識の転送を可能にすること。
  • 共有再構成係数を用いて未学習クラスのプロトタイプを合成することで、未学習クラスの正確な分類を可能にすること。
  • SRG上でスペクトルクラスタリングを適用することで意味のある潜在クラスタを発見し、一般化ゼロショット学習(GZSL)における一般化性能を向上させること。
  • 特に限られたトレーニングサンプルでの性能向上を図るため、スパースかつ局所的構造を持つ再構成を強化することで耐性を高めること。

提案手法

  • 各クラスのプロトタイプが、画像空間および意味的埋め込み空間内の他のプロトタイプの線形結合にマッピングされるように、共有再構成係数を学習することで、共有再構成グラフ(SRG)を構築する。
  • 関連性があり情報量の多いプロトタイプを選択するため、スパarsityと局所性正則化を導入した最適化問題としてSRGの学習を定式化する。
  • 学習済みSRGに対してスペクトルクラスタリングを適用し、埋め込み空間内に意味的で解釈可能なクラスタを発見することで、知識転送を支援する。
  • 意味的空間から導出された共有再構成係数を用いて、画像空間における未学習クラスのプロトタイプを合成し、最近傍距離に基づく分類を可能にする。
  • 見出しと未学習クラスの両方の性能を評価する一般化ZSLに本手法を拡張し、${u\rightarrow u}$、${s\rightarrow s}$、${s\rightarrow\tau}$などの指標を用いる。
  • 属性と単語ベクトルの両方を意味的埋め込みとして用い、正則化による統合により、より高い耐性と性能を実現する。

実験結果

リサーチクエスチョン

  • RQ1幾何的不整合が生じる画像空間と意味的埋め込み空間間で、構造的知識をどのように効果的に転送できるか?
  • RQ2提案された共有再構成グラフ(SRG)は、ZSLにおける空間シフト問題をどの程度軽減できるか?
  • RQ3スパースかつ局所的構造を持つ再構成は、特に少ないトレーニングサンプル下でも、プロトタイプの合成と分類精度を向上させられるか?
  • RQ4SRGフレームワークは、効果的な知識転送を支援する意味的に明確な潜在クラスタを発見できるか?
  • RQ5より現実的である一般化ゼロショット学習(GZSL)設定において、最先端の手法と比較して本手法はどの程度の性能を示すか?

主な発見

  • 提案されたSRG手法は、3つのベンチマークデータセットで最先端の性能を達成した。特にImageNetでは18.26%のトップ5正解率を記録し、DeViSEおよびConSEを上回った。
  • ImageNetでは、スパarsityと局所性正則化を適用した場合、トップ1正解率が8.14%に達し、前回の最高記録(7.72%)を0.42%上回った。
  • AwAでは、GZSL設定において、すべての指標で最高の正解率を記録した。${u\rightarrow u}$は100%、${s\rightarrow s}$は85.7%であった。
  • スパarsity正則化の導入により、属性を意味的埋め込みとして使用した場合、AwAで最大16.29%の性能向上が見られた。
  • SRG上でのスペクトルクラスタリングにより、AwAで11の意味的に明確で分離可能なクラスタが発見された。未学習クラスは、意味的に類似した既知のクラスとグループ化されており、本手法の解釈可能性を裏付けた。
  • 本手法は、少数のトレーニングサンプルでも高い性能を維持しており、耐性と一般化能力の高さを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。