Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot Learning via Category-Specific Visual-Semantic Mapping

Li Niu, Jianfei Cai|arXiv (Cornell University)|Nov 16, 2017
Domain Adaptation and Few-Shot Learning参考文献 38被引用数 4
ひとこと要約

本論文では、ゼロショット学習におけるプロジェクションドメインシフトを解消するために、カテゴリ固有の視覚的・意味的マッピングを学習することで、Adaptive Embedding ZSL (AEZSL) と Deep AEZSL (DAEZSL) を提案する。未学習カテゴリと学習済みカテゴリ間の意味的類似度を用いてマッピング関数の重みを付与することで、一般化性能が向上し、CUB、SUN、Dog、ImageNetなどの小規模および大規模ベンチマークで最先端性能を達成した。ImageNetでは最大20,345の未学習カテゴリを対象としている。

ABSTRACT

Zero-Shot Learning (ZSL) aims to classify a test instance from an unseen category based on the training instances from seen categories, in which the gap between seen categories and unseen categories is generally bridged via visual-semantic mapping between the low-level visual feature space and the intermediate semantic space. However, the visual-semantic mapping learnt based on seen categories may not generalize well to unseen categories because the data distributions between seen categories and unseen categories are considerably different, which is known as the projection domain shift problem in ZSL. To address this domain shift issue, we propose a method named Adaptive Embedding ZSL (AEZSL) to learn an adaptive visual-semantic mapping for each unseen category based on the similarities between each unseen category and all the seen categories. Then, we further make two extensions based on our AEZSL method. Firstly, in order to utilize the unlabeled test instances from unseen categories, we extend our AEZSL to a semi-supervised approach named AEZSL with Label Refinement (AEZSL_LR), in which a progressive approach is developed to update the visual classifiers and refine the predicted test labels alternatively based on the similarities among test instances and among unseen categories. Secondly, to avoid learning visual-semantic mapping for each unseen category in the large-scale classification task, we extend our AEZSL to a deep adaptive embedding model named Deep AEZSL (DAEZSL) sharing the similar idea (i.e., visual-semantic mapping should be category-specific and related to the semantic space) with AEZSL, which only needs to be trained once, but can be applied to arbitrary number of unseen categories. Extensive experiments demonstrate that our proposed methods achieve the state-of-the-art results for image classification on four benchmark datasets.

研究の動機と目的

  • 学習済みカテゴリで訓練された視覚的・意味的マッピングが未学習カテゴリにうまく一般化されない、ゼロショット学習におけるプロジェクションドメインシフトを解消すること。
  • ラベル付きテストデータを必要とせず、未学習カテゴリのためのカテゴリ固有の視覚的・意味的マッピングを学習する手法を開発すること。
  • 一度の学習フェーズで学習済みカテゴリにのみ依存するが、任意の未学習カテゴリをサポートできるスケーラブルなディープモデル(DAEZSL)を設計すること。
  • 学習済みカテゴリと未学習カテゴリ間の意味的類似度に基づいてマッピング関数に重みを付けることで、ゼロショット分類性能を向上させること。

提案手法

  • 未学習カテゴリとすべての学習済みカテゴリ間の意味的類似度を計算することで、各未学習カテゴリに対してカテゴリ固有の視覚的・意味的マッピングを学習する。
  • 未学習カテゴリと意味的に近い学習済みカテゴリのマッピング関数に高い重みを付与し、それらの意味的表現ベクトルに基づく。
  • マルチレイヤーパーセプトロン(MLP)を用いて特徴マスクを学習し、シグモイド出力により、各未学習カテゴリの視覚特徴と意味的埋め込みを適応的に組み合わせる。
  • 段階的なラベル精錬を統合し、カテゴリ固有のマッピングを反復的に改善する。
  • ディープバージョンのDAEZSLは、すべての未学習カテゴリで同一のトレーニング済みネットワークを共有し、再トレーニングなしに効率的な推論を可能にする。
  • モデルはGoogleNetバックボーンを用い、1,024次元の特徴出力を有し、ドロップアウトを含む1層の隠れ層を持つMLPと、AdaGrad最適化を使用する。

実験結果

リサーチクエスチョン

  • RQ1カテゴリ固有の視覚的・意味的マッピングは、プロジェクションドメインシフトを低減することでゼロショット一般化を向上させ得るか?
  • RQ2学習済みカテゴリと未学習カテゴリ間の意味的類似度は、視覚的・意味的マッピングの性能にどのように影響するか?
  • RQ3一度の学習で、適応的かつカテゴリ固有の特徴マスクを用いて、任意の未学習カテゴリをサポートできる単一のディープモデルを構築可能か?
  • RQ4段階的なラベル精錬は、カテゴリ固有のマッピングを用いたゼロショット学習における予測精度を向上させるか?
  • RQ5大規模ベンチマーク(例:ImageNet)において、提案手法は既存のSOTA手法と比較して優れているか?

主な発見

  • DAEZSLはImageNet 2011 21Kデータセットで最先端性能を達成し、DeVISE、ConSE、EXEM、[28]などのベースライン手法と比較して27のテスト設定のうち25で上回った。
  • 2ホップテストセット(10,000の未学習カテゴリ)では、Flat hit@1が38.7%に達し、次善の手法を4ポイント以上上回った。
  • 3ホップテストセット(100,000の未学習カテゴリ)では、Flat hit@1が32.1%に達し、強力なスケーラビリティを示した。
  • 全「all」テストセット(20,345の未学習カテゴリ)では、Flat hit@1が31.5%を維持し、多様なカテゴリ階層にわたる頑健性を示した。
  • アブレーションスタディにより、DAEZSLにおけるカテゴリ固有の特徴マスクが、共有マッピングを用いるベースラインESZSLよりも顕著に性能向上をもたらすことが確認された。
  • 階層的精度@Kを含むすべての評価指標で一貫した向上を示し、意味的階層とカテゴリの重複を効果的に処理できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。