Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Knowledge Fusion for New Feature Generation in Generalized Zero-Shot Learning

Hongxin Xiang, Cheng Xie|arXiv (Cornell University)|Feb 23, 2021
Domain Adaptation and Few-Shot Learning参考文献 67被引用数 4
ひとこと要約

本稿では、多層知識(例:系統、属、種)を統合し、遺伝的戦略を用いた適応的ニューフィーチャジェネレータ(NFG)を備えた、生成的ゼロショット学習の新規手法であるマルチ・ノリッジ・フュージョン・ネットワーク(MKFNet)を提案する。この手法は、意味的不十分性とドメインシフト問題を軽減することで、一般化ゼロショット学習およびリtrievalベンチマークで、最先端の手法を上回る性能を発揮する。

ABSTRACT

Suffering from the semantic insufficiency and domain-shift problems, most of existing state-of-the-art methods fail to achieve satisfactory results for Zero-Shot Learning (ZSL). In order to alleviate these problems, we propose a novel generative ZSL method to learn more generalized features from multi-knowledge with continuously generated new semantics in semantic-to-visual embedding. In our approach, the proposed Multi-Knowledge Fusion Network (MKFNet) takes different semantic features from multi-knowledge as input, which enables more relevant semantic features to be trained for semantic-to-visual embedding, and finally generates more generalized visual features by adaptively fusing visual features from different knowledge domain. The proposed New Feature Generator (NFG) with adaptive genetic strategy is used to enrich semantic information on the one hand, and on the other hand it greatly improves the intersection of visual feature generated by MKFNet and unseen visual faetures. Empirically, we show that our approach can achieve significantly better performance compared to existing state-of-the-art methods on a large number of benchmarks for several ZSL tasks, including traditional ZSL, generalized ZSL and zero-shot retrieval.

研究の動機と目的

  • 既存の手法が意味的表現が限定的または不完全であるため、識別的な意味的特徴を捉えられないという意味的不十分性問題に対処する。
  • 学習済みクラスと未学習クラスの意味的および視覚的分布が著しく乖離するドメインシフト課題を克服する。
  • 系統、属、種などの多層知識を統合することで、より代表的かつ一般化された視覚的特徴を生成し、特徴の一般化を向上させる。
  • 適応的特徴生成メカニズムにより、合成視覚的特徴と実際の未学習視覚的特徴の間の整合性を向上させる。
  • 意味的および視覚的特徴空間を豊かにすることで、一般化ゼロショット学習およびゼロショット画像リtrievalで優れた性能を達成する。

提案手法

  • 学習可能な統合モジュールを用いて、系統、属、種といった複数の意味的知識レベルからの視覚的特徴を適応的に統合するマルチ・ノリッジ・フュージョン・ネットワーク(MKFNet)を提案。これにより特徴の一般化が向上する。
  • 既存の属性を再重み付けおよび再結合することで、より識別的な意味的特徴を生成する、適応的遺伝的戦略を備えたニューフィーチャジェネレータ(NFG)を導入。これにより意味的表現力が向上する。
  • マルチロス訓練目的を採用:NFGにおける$L_{ER}$で意味的特徴の品質を向上させ、適応的遺伝的戦略における$L_{NR}$および$L_{KR}$で合成された特徴と実際の未学習視覚的特徴との共通部分を増加させる。
  • 意味的特徴が異なる知識レベルから視覚空間に深層ニューラルネットワークを介してマッピングされる共有の意味的・視覚的埋め込み空間を用い、エンドツーエンドの学習を可能にする。
  • リtrieval性能を評価するために、生成された視覚的特徴と実際の未学習特徴との間のコサイン類似度を用い、上位5件の検索結果を定量的分析に使用する。
  • アテンションメカニズムと知識グラフにインspiredされた集約手法を用いて、データセットに埋め込まれた属性に依存せずに意味的表現を豊かにする。

実験結果

リサーチクエスチョン

  • RQ1系統、属、種といった多層知識の統合は、ゼロショット学習における視覚的特徴の一般化を向上させるか?
  • RQ2遺伝的戦略による適応的ニューフィーチャ生成は、合成視覚的特徴の識別力向上に寄与するか?
  • RQ3提案手法は、学習済みクラスと未学習クラス間のドメインシフト問題をどの程度軽減するか?
  • RQ4多様な意味的知識の統合は、合成特徴と実際の未学習視覚的特徴の間の整合性をどのように向上させるか?
  • RQ5提案手法は、CUB、AwA1、AwA2、FLOなど複数のZSLベンチマークで、一般化ZSLおよびゼロショットリtrievalの分野で最先端の性能を達成できるか?

主な発見

  • 提案手法であるMKFNet-NFGは、CUB、AwA1、AwA2、FLOの複数のベンチマークで、従来の最先端手法を上回る顕著な性能を発揮し、従来のZSL、一般化ZSL、ゼロショットリtrievalの各タスクで優れた結果を示した。
  • MKFNetの適応的統合モジュールは、すべてのデータセットで系統、属、種の各知識レベルに非ゼロの重要度重みを割り当てており、各知識分野が特徴生成に有意義に寄与していることを確認した。
  • AwA1およびAwA2データセットでは、NFGを備えないMKFNetに比べ、ほぼすべての未学習カテゴリを正しく分類することができ、ニューフィーチャジェネレータの有効性を示した。
  • CUBデータセットにおける定性的なリtrieval結果では、GazeSと比較して、正しい画像(緑枠)をより多く検索し、誤った画像(赤枠)をより少なく検索しており、特徴の整合性が向上していることが示された。
  • 生成された視覚的特徴の中心と真の未学習特徴との間のコサイン類似度が高く、モデルが実際の未学習視覚的特徴に近い特徴を生成できることを裏付けた。
  • アブレーションスタディの結果、多層知識統合と適応的特徴生成の両コンponentが性能向上に不可欠であり、それぞれが意味的不十分性とドメインシフトの問題を軽減していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。