Skip to main content
QUICK REVIEW

[論文レビュー] S3VAE: Self-Supervised Sequential VAE for Representation Disentanglement and Data Generation

Yizhe Zhu, Martin Renqiang Min|arXiv (Cornell University)|May 23, 2020
Generative Adversarial Networks and Image Synthesis参考文献 56被引用数 8
ひとこと要約

本稿では、光流や音声の音量といった内在的教師信号を用いて、時間に依存しない(静的)および時間に依存する(動的)要因に分離する自己教師付き逐次変分オートエンコーダー、S3VAEを提案する。このモデルは、完全教師あり手法と同等の分離性能を達成し、動画および音声生成タスクにおいて、最先端の非教師ありモデルを上回る性能を示す。

ABSTRACT

We propose a sequential variational autoencoder to learn disentangled representations of sequential data (e.g., videos and audios) under self-supervision. Specifically, we exploit the benefits of some readily accessible supervisory signals from input data itself or some off-the-shelf functional models and accordingly design auxiliary tasks for our model to utilize these signals. With the supervision of the signals, our model can easily disentangle the representation of an input sequence into static factors and dynamic factors (i.e., time-invariant and time-varying parts). Comprehensive experiments across videos and audios verify the effectiveness of our model on representation disentanglement and generation of sequential data, and demonstrate that, our model with self-supervision performs comparable to, if not better than, the fully-supervised model with ground truth labels, and outperforms state-of-the-art unsupervised models by a large margin.

研究の動機と目的

  • 動画や音声などの逐次データにおいて、アイデンティティと運動、またはトーンと言語的内容といった要因を分離する必要があるという課題に対処すること。
  • 非教師あり手法の限界を克服すること。非教師あり手法は、誘導的バイアスの欠如とランダムな初期化への依存により、現実のデータに一般化しにくいことがある。
  • 人為的アノテーションにかかるコストを減らすために、データ自体や市販のモデル(例:光流推定器、音声エネルギー)から容易に入手可能な教師信号を活用すること。
  • 自己教師信号に基づく補助タスクと正則化を導入することで、逐次VAEにおける分離性と生成品質を向上させること。
  • 自己教師信号が、人為的アノテーションに依存する完全教師あり手法と同等またはそれ以上の性能を達成できることを示すこと。

提案手法

  • 時間に依存しない要因 $\bm{z}_f$(静的)と時間に依存する要因 $\bm{z}_t$(動的)に分離する潜在空間を持つ再帰的VAEアーキテクチャを提案する。
  • 時間的シャッフルによって入力シーケンスが変化しても $\bm{z}_f$ が不変であることを保証する静的整合性制約 $\mathcal{L}_{SSC}$ を導入する。
  • 動的要因予測ヘッド $\mathcal{L}_{DFP}$ を設計し、動画データでは光流から運動の位置を予測し、音声セグメントでは音量を予測する。
  • $\bm{z}_f$ と $\bm{z}_t$ の間の相互情報量を最小化する $\mathcal{L}_{MI}$ を適用し、情報漏れを抑えることで分離性を促進する。
  • 再構成損失、補助教師信号、正則化を組み合わせて、エンドツーエンドで訓練し、分離性と生成性能を同時に最適化する。
  • 追加の訓練やアノテーションを必要とせず、市販のモデル(例:光流推定器)を用いて教師信号を抽出する。

実験結果

リサーチクエスチョン

  • RQ1内在的データ信号(例:光流、音声エネルギー)からの自己教師信号は、非教師あり手法と比較して、逐次表現の分離性を顕著に向上させることができるか?
  • RQ2自己教師付き補助タスクは、高価な人為的アノテーションに依存する完全教師ありモデルの性能に、どの程度まで達するか、あるいはそれを上回るか?
  • RQ3個々の構成要素(例:静的整合性、動的要因予測、相互情報量正則化)は、潜在空間における分離性にどのように寄与しているか?
  • RQ4モデルは、動画や音声といった異なるモodal間で一般化可能であり、強力な分離性と生成品質を維持できるか?
  • RQ5静的要因と動的要因の間の相互情報量を最小化することで、潜在空間における意味的要因のクリアな分離が達成されるか?

主な発見

  • MUGデータセットでは、S3VAEは完全教師ありのコンponentsを備えた状態で70.51%の分離精度を達成し、アブレーションバリアントやベースラインを顕著に上回った。
  • アブレーションスタディの結果、相互情報量正則化 $\mathcal{L}_{MI}$ を削除すると精度が66.07%に低下し、動的コード内での外見情報の抑制にこの正則化が重要な役割を果たしていることが示された。
  • 静的整合性損失 $\mathcal{L}_{SSC}$ は不可欠である。この損失を削除すると精度は61.45%に低下し、時間的シャッフルが静的要因の分離に寄与することが確認された。
  • 動的要因予測損失 $\mathcal{L}_{DFP}$ は運動モデリングに不可欠である。この損失を削除すると精度は58.32%に低下し、運動情報がこれなしでは適切に符号化されないことが示された。
  • TIMITデータセットでは、$\bm{z}_f$ を用いた発話者識別で等誤り率(EER)が4.80%を記録し、FHVAE や DSVAE を上回った。また、$\bm{z}_{1:T}$ ではEERが40.12%に低下し、動的コードからトーンが効果的に除去されたことが示された。
  • 定性的な結果から、$\mathcal{L}_{MI}$ が欠落すると、ひげなどの顔の特徴が動的コードに残り、$\mathcal{L}_{SSC}$ が欠落すると、静的および動的要因が依然として混在していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。