Skip to main content
QUICK REVIEW

[論文レビュー] Visual Data Synthesis via GAN for Zero-Shot Video Classification

Chenrui Zhang, Yuxin Peng|arXiv (Cornell University)|Apr 26, 2018
Domain Adaptation and Few-Shot Learning参考文献 15被引用数 11
ひとこと要約

本稿では、マルチレベルの意味的推論とマッチングに配慮した相互情報量相関を活用して高品質な合成動画特徴を生成する、ゼロショット動画分類を目的としたGANベースの視覚的データ合成フレームワークを提案する。共同視覚的・意味的分布をモデル化し、異種性ギャップを軽減することで、4つの動画データセットにおいて最先端の性能を達成し、従来のプロジェクションベース手法を顕著に上回る。

ABSTRACT

Zero-Shot Learning (ZSL) in video classification is a promising research direction, which aims to tackle the challenge from explosive growth of video categories. Most existing methods exploit seen-to-unseen correlation via learning a projection between visual and semantic spaces. However, such projection-based paradigms cannot fully utilize the discriminative information implied in data distribution, and commonly suffer from the information degradation issue caused by "heterogeneity gap". In this paper, we propose a visual data synthesis framework via GAN to address these problems. Specifically, both semantic knowledge and visual distribution are leveraged to synthesize video feature of unseen categories, and ZSL can be turned into typical supervised problem with the synthetic features. First, we propose multi-level semantic inference to boost video feature synthesis, which captures the discriminative information implied in joint visual-semantic distribution via feature-level and label-level semantic inference. Second, we propose Matching-aware Mutual Information Correlation to overcome information degradation issue, which captures seen-to-unseen correlation in matched and mismatched visual-semantic pairs by mutual information, providing the zero-shot synthesis procedure with robust guidance signals. Experimental results on four video datasets demonstrate that our approach can improve the zero-shot video classification performance significantly.

研究の動機と目的

  • 情報劣化と異種性ギャップに苦しむプロジェクションベースのゼロショット動画分類手法の限界を解消すること。
  • 未学習カテゴリにおける頑健な動画特徴合成のため、視覚的データ分布と意味的知識の両方を活用すること。
  • 合成特徴を用いてタスクを教師あり学習問題に変換することで、ゼロショット動画分類の性能を向上させること。
  • 敵対的訓練による特徴の判別性向上により、ゼロショット学習で一般的に見られるハブネス問題を軽減すること。

提案手法

  • 特徴レベルおよびラベルレベルで双方向の合成(意味的→視覚的および視覚的→意味的)を実行するマルチレベル意味的推論を提案し、判別的属性を捉える。
  • 一致ペアと不一致ペアからの相互情報量を用いて、既知から未知への関係をモデル化するマッチングに配慮した相互情報量相関(MMICC)を導入。
  • 生成器が意味的埋め込みを条件として動画特徴を合成する条件付きGANフレームワークを採用し、敵対的訓練でガイドする。
  • 一致ペア間の相互情報量を最大化し、不一致ペア間を最小化することで、頑健な指標信号を提供。
  • 生成器が特徴空間内で意味的に整合的かつ判別的に分離された合成特徴を生成するように訓練。
  • t-SNE可視化とアブレーションスタディを用いて、各コンポonentがハブネスを低減し一般化性能を向上させる有効性を検証。

実験結果

リサーチクエスチョン

  • RQ1GANによる生成モデリングは、ゼロショット動画分類における未学習カテゴリの判別的動画特徴を効果的に合成できるか?
  • RQ2視覚的データ分布と意味的知識をどのように統合することで、特徴合成の頑健性を向上させられるか?
  • RQ3マッチングに配慮した相互情報量相関は、ゼロショット動画学習における異種性ギャップと情報劣化をどの程度軽減できるか?
  • RQ4提案フレームワークは、ベースラインのGANおよびプロジェクションベース手法と比較してハブネス問題を軽減するか?
  • RQ5合成特徴は、異なる視覚的特徴タイプ(例:FVおよび深層特徴)およびデータセット間で一般化可能か?

主な発見

  • UCF101およびCCVデータセットにおいて、本手法は深層特徴を用いたSVMでそれぞれ27.3%および22.3%のトップ1精度を達成し、cGANベースライン(13.9%および13.9%)および実際の特徴ベースライン(11.9%および11.6%)を顕著に上回った。
  • アブレーションスタディの結果、意味的推論とMMICCを組み合わせた場合が最高の性能(FVを用いたUCF101では28.8% mAP)を示し、両コンポーネントの相乗効果を実証した。
  • t-SNE可視化により、本手法の合成特徴はベースライン手法と比較してクラスタリングが強く、重複が少ないことが確認され、ハブネスの低減が示された。
  • 本手法は、伝統的なFVおよび深層動画特徴の両方でゼロショット性能を向上させ、特徴タイプにわたる頑健性を示した。
  • MMICCは情報劣化を軽減する上で最も効果的なコンポーネントであり、単一コンポーネントのアブレーションと比較して顕著な性能向上を示した。
  • 本フレームワークは4つの動画データセットで最先端の結果を達成し、ゼロショット動画分類における一般化能力と有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。