Skip to main content
QUICK REVIEW

[論文レビュー] CANZSL: Cycle-Consistent Adversarial Networks for Zero-Shot Learning from Natural Language

Zhi Chen, Jingjing Li|arXiv (Cornell University)|Sep 21, 2019
Domain Adaptation and Few-Shot Learning参考文献 38被引用数 15
ひとこと要約

本稿では、自然言語からのゼロショット学習を目的としたサイクル整合性のある生成的敵対ネットワーク、CANZSLを提案する。この手法は、ノイズのあるテキストから視覚的特徴を合成する前方GANと、合成された視覚からテキストを再構成する逆方向GANを同時に学習し、サイクル整合性と分類損失を強制することで、意味的正確性を向上させる。本手法は、ゼロショット認識および一般化ゼロショット学習のベンチマークで、先行手法を大きく上回る最先端の性能を達成した。

ABSTRACT

Existing methods using generative adversarial approaches for Zero-Shot Learning (ZSL) aim to generate realistic visual features from class semantics by a single generative network, which is highly under-constrained. As a result, the previous methods cannot guarantee that the generated visual features can truthfully reflect the corresponding semantics. To address this issue, we propose a novel method named Cycle-consistent Adversarial Networks for Zero-Shot Learning (CANZSL). It encourages a visual feature generator to synthesize realistic visual features from semantics, and then inversely translate back synthesized the visual feature to corresponding semantic space by a semantic feature generator. Furthermore, in this paper a more challenging and practical ZSL problem is considered where the original semantics are from natural language with irrelevant words instead of clean semantics that are widely used in previous work. Specifically, a multi-modal consistent bidirectional generative adversarial network is trained to handle unseen instances by leveraging noise in the natural language. A forward one-to-many mapping from one text description to multiple visual features is coupled with an inverse many-to-one mapping from the visual space to the semantic space. Thus, a multi-modal cycle-consistency loss between the synthesized semantic representations and the ground truth can be learned and leveraged to enforce the generated semantic features to approximate to the real distribution in semantic space. Extensive experiments are conducted to demonstrate that our method consistently outperforms state-of-the-art approaches on natural language-based zero-shot learning tasks.

研究の動機と目的

  • クリーンな意味的プロトタイプから視覚的特徴を生成する既存のGANベースのゼロショット学習手法に、意味的正確性の欠如があることに対処すること。
  • 手動で整備された属性ではなく、ノイズを含む現実世界の自然言語記述からも、頑健なゼロショット学習を可能にすること。
  • 視覚的特徴空間とテキスト特徴空間の間でサイクル整合性を強制することで、一般化ゼロショット学習における「学習済み-未学習」精度バイアスを軽減すること。
  • 分類の監視付き敵対学習により、合成された視覚的特徴の一般化性能と識別性能を向上させること。

提案手法

  • ノイズ除去全結合層と勾配クリッピングを用いたワッサースタインGANを活用し、ノイズを含む自然言語記述から視覚的特徴を生成する前方GANを設計する。
  • 生成された視覚的特徴が識別可能でクラスに正確であるよう、ディスクラミネーター上で分類ヘッドを学習する。
  • 逆方向GANを用いて、合成された視覚的特徴を元のテキスト表現へ再構成し、前方GANと組み合わせてサイクルを形成する。
  • 再構成されたテキストと元の入力テキストとの間にサイクル整合性損失を適用し、生成過程での意味的保存を強制する。
  • 逆方向ディスクラミネーターに対しても分類損失を適用し、再構成過程でノイズを抑圧し、意味情報を保持する。
  • 敵対的損失、サイクル整合性損失、分類損失を統合し、エンドツーエンドでモデルを学習することで、現実性、正確性、識別可能性を同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1サイクル整合性のあるGANは、自然言語からのゼロショット学習における合成視覚的特徴の意味的正確性を向上させることができるか?
  • RQ2再構成のために逆方向GANを組み込むことで、生成された視覚的特徴の品質と識別性能はどのように向上するか?
  • RQ3本手法は、現実的でノイズを含むテキスト入力下でも、既存のSOTA手法を上回る性能を示せるか?
  • RQ4サイクル整合性損失は、視覚的特徴合成過程で意味的意味を保存するように生成器を正則化するのに効果的か?

主な発見

  • CUBデータセットでは、一般化ゼロショット学習のSCSスプリットで40.2%、SCEスプリットで12.5%の精度を達成し、2番目に高い成績を収めたGAZSLをそれぞれ4.8ポイントおよび3.8ポイント上回った。
  • NABデータセットでは、SCSスプリットで25.6%、SCEスプリットで6.8%の精度を達成し、GAZSLの20.4%および5.8%を大きく上回った。
  • 属性からのゼロショット学習では、CUBデータセットで56.5%の精度を達成し、以前のSOTAであるGAZSL(55.8%)とESZSL(53.9%)を上回った。
  • t-SNE可視化により、視覚的類似性があるにもかかわらず、異なる鳥種のクラスレベルの構造と分布が保持されていることが確認された。
  • アブレーションスタディの結果、敵対的損失、サイクル整合性損失、分類損失が相乗的に性能向上に寄与しており、特にサイクル整合性損失が意味的正確性の向上に不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。