Skip to main content
QUICK REVIEW

[論文レビュー] Semantics Disentangling for Generalized Zero-Shot Learning

Zhi Chen, Yadan Luo|arXiv (Cornell University)|Jan 20, 2021
Domain Adaptation and Few-Shot Learning参考文献 34被引用数 10
ひとこと要約

本稿では、関係モジュールと全相関ペナルティを備えた条件付きVAEを用いて、視覚的特徴を意味的に整合する成分と意味的に関係のない成分に分離する、意味的分離フレームワークSDGZSLを提案する。特徴の分離によりアノテートされた属性と整合させることで、一般化ゼロショット学習における汎化性能が向上し、4つのベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

Generalized zero-shot learning (GZSL) aims to classify samples under the assumption that some classes are not observable during training. To bridge the gap between the seen and unseen classes, most GZSL methods attempt to associate the visual features of seen classes with attributes or to generate unseen samples directly. Nevertheless, the visual features used in the prior approaches do not necessarily encode semantically related information that the shared attributes refer to, which degrades the model generalization to unseen classes. To address this issue, in this paper, we propose a novel semantics disentangling framework for the generalized zero-shot learning task (SDGZSL), where the visual features of unseen classes are firstly estimated by a conditional VAE and then factorized into semantic-consistent and semantic-unrelated latent vectors. In particular, a total correlation penalty is applied to guarantee the independence between the two factorized representations, and the semantic consistency of which is measured by the derived relation network. Extensive experiments conducted on four GZSL benchmark datasets have evidenced that the semantic-consistent features disentangled by the proposed SDGZSL are more generalizable in tasks of canonical and generalized zero-shot learning. Our source code is available at https://github.com/uqzhichen/SDGZSL.

研究の動機と目的

  • アノテートされた属性と意味的に整合しない視覚的特徴が原因で、ゼロショット学習モデルの汎化性能が低いという問題に対処すること。
  • 視覚的特徴を意味的に整合する成分と意味的に関係のない成分に分離することで、属性との整合性を高め、未学習クラスへの転移性を向上させること。
  • 事前学習済み畳み込みニューラルネットワーク(CNN)から得られる混同された特徴と比較して、より優れた性能を達成できるように、分離された表現を活用するフレームワークを開発すること。

提案手法

  • 条件付き変分オートエンコーダ(cVAE)を用い、意味的に整合する特徴($\bm{h}_s$)と意味的に関係のない特徴($\bm{h}_n$)の2つの分離された潜在ベクトルから視覚的特徴を再構成する。
  • 関係モジュールが $\bm{h}_s$ と意味的埋め込みの間の適合スコアを計算し、$\bm{h}_s$ が意味的整合性に向かって学習するのをガイドする。
  • 全相関ペナルティを適用して $\bm{h}_s$ と $\bm{h}_n$ の間の統計的独立性を強制し、分離を確保する。
  • 再構成損失により、$\bm{h}_s$ と $\bm{h}_n$ の結合が元の視覚的情報をすべて保持することを保証する。
  • 再構成損失、関係損失、分離損失を統合した共同目的関数を用いて、エンドツーエンドでモデルを訓練する。
  • 分離された $\bm{h}_s$ 特徴を一般化ゼロショット学習(GZSL)における分類に使用し、既知クラスから未知クラスへの転移性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1視覚的特徴を意味的に整合する成分と意味的に関係のない成分に分離することで、GZSLにおけるゼロショット一般化性能が向上するか?
  • RQ2意味的属性に $\bm{h}_s$ を整合させるために関係モジュールを用いることで、特徴の品質とモデル性能が向上するか?
  • RQ3全相関ペナルティは、意味的に整合する成分と意味的に関係のない成分の間の独立性を効果的に強制するか?
  • RQ4事前学習済みCNNから得られる混同された特徴と比較して、分離された $\bm{h}_s$ 特徴はGZSLにおいてより優れた一般化性能を示すか?
  • RQ5関係モジュール、全相関、再構成損失といった個々の構成要素が、全体の性能に与える影響は何か?

主な発見

  • 提案されたSDGZSLフレームワークは、CUB、AWA1、AWA2、FLOWERSの4つのGZSLベンチマークデータセットで最先端の性能を達成した。
  • 意味的に整合する特徴($\bm{h}_s$)は、元の混同された特徴($\bm{h}$)および意味的に関係のない特徴($\bm{h}_n$)と比較して、GZSL精度で顕著に優れた性能を示した。
  • アブレーションスタディの結果、関係モジュールと全相関ペナルティの両方が最適な性能を達成するために不可欠であることが確認され、両方を併用した場合に最も良い結果が得られた。
  • t-SNE可視化の結果、$\bm{h}_s$ 特徴は $\bm{h}_n$ 特徴よりもより判別可能でクラスごとに明確に分離されていることが示された。$\bm{h}_n$ 特徴は、主に意味的属性とは関係のないパターンを保持している。
  • ハイパーパramータの変動に対してモデルは頑健であり、潜在次元数、関係重み、全相関重み、識別器重みのさまざまな設定において安定した性能を示した。
  • 最近傍検索の結果、$\bm{h}_s$ 特徴は正しいクラスの例をより効果的に検索できており、誤検出は主に視覚的に似ているが意味的に異なるクラスから生じた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。