Skip to main content
QUICK REVIEW

[論文レビュー] A Deep Generative Model for Disentangled Representations of Sequential Data.

Yingzhen Li, Stephan Mandt|arXiv (Cornell University)|Mar 8, 2018
Generative Adversarial Networks and Image Synthesis参考文献 23被引用数 19
ひとこと要約

本稿では、音声や動画などの順序付きデータを静的コンテンツと時間に依存する動的特徴に分離する深層変分オートエンコーダ(VAE)を提案する。このモデルにより、いずれかの成分に条件付けすることで制御された生成が可能となる。実験では、音声分野における男性から女性への声質変換や、動画分野における形状と運動の独立的制御が成功した。また、長期間の順序データをモデル化する際、確率的RNNがより高い効率を示した。

ABSTRACT

We present a VAE architecture for encoding and generating high dimensional sequential data, such as video or audio. Our deep generative model learns a latent representation of the data which is split into a static and dynamic part, allowing us to approximately disentangle latent time-dependent features (dynamics) from features which are preserved over time (content). This architecture gives us partial control over generating content and dynamics by conditioning on either one of these sets of features. In our experiments on artificially generated cartoon video clips and voice recordings, we show that we can convert the content of a given sequence into another one by such content swapping. For audio, this allows us to convert a male speaker into a female speaker and vice versa, while for video we can separately manipulate shapes and dynamics. Furthermore, we give empirical evidence for the hypothesis that stochastic RNNs as latent state models are more efficient at compressing and generating long sequences than deterministic ones, which may be relevant for applications in video compression.

研究の動機と目的

  • 動画や音声などの順序付きデータの分離表現を学習する深層生成モデルの開発。
  • 潜在変数を静的コンテンツと時間経過に伴い変化するダイナミクスに分離し、独立した制御を可能にする。
  • 推論時にコンテンツまたはダイナミクスの潜在変数に条件付けすることで、条件付き生成を実現する。
  • 長期間の順序付きデータをモデル化する際、確率的RNNと決定的RNNの効率を評価する。

提案手法

  • モデルは、時間的ダイナミクスを捉えるために確率的RNNを潜在状態遷移モデルとして用いるVAEフレームワークを採用する。
  • 潜在空間を、静的コンテンツを表す部分と、時間経過に伴い変化するダイナミクスを表す部分に分割する。
  • 変分推論を用いてエビデンス下界(ELBO)を最大化する形で、エンドツーエンドに学習する。
  • 推論時にコンテンツまたはダイナミクスの潜在変数に条件付けすることで、条件付き生成を実現する。
  • 異なるシーケンスからのコンテンツやダイナミクスを交換することで、分離された操作を実現するアーキテクチャをサポートする。
  • 潜在遷移をモデル化するために確率的RNNを用いることで、長期間のシーケンスの圧縮と生成が向上する。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、順序付きデータにおける静的コンテンツと動的特徴を効果的に分離できるか?
  • RQ2コンテンツまたはダイナミクスにのみ条件付けすることで、意味的かつ制御可能な新しいシーケンスの生成が可能か?
  • RQ3長期間の順序付きシーケンスの圧縮と生成において、確率的RNNは決定的RNNに比べて優れているか?
  • RQ4本モデルは、音声や動画におけるコンテンツ交換(例:音声変換や形状・運動の分離)を実現できるか?

主な発見

  • モデルはコンテンツとダイナミクスを成功裏に分離し、静的特徴と時間経過に伴う変化成分を独立して操作可能となった。
  • 音声分野におけるコンテンツ交換により、プロソディを保持したまま男性から女性、または逆に女性から男性への声質変換が効果的に実現された。
  • 動画生成においては、形状(コンテンツ)と運動(ダイナミクス)を別々に操作可能となった。
  • 長期間の順序付きシーケンスの圧縮と生成において、確率的RNNが決定的RNNを上回り、モデル化の効率性向上の仮説を支持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。