Skip to main content
QUICK REVIEW

[論文レビュー] Style Equalization: Unsupervised Learning of Controllable Generative Sequence Models

Jen-Hao Rick Chang, Ashish Shrivastava|arXiv (Cornell University)|Oct 6, 2021
Music and Audio Processing被引用数 8
ひとこと要約

本稿では、非教師付き制御可能生成系列モデルにおける学習時と推論時の不一致を解消するためのスタイル等化(Style Equalization)を提案する。この手法は、関係のないスタイル入力にターゲットのスタイル情報を転送するスタイル変換モジュールを適用する。対応のないコンテンツとスタイルのサンプルを用いて学習することで、モデルは高品質なスタイル再現を達成し、ユーザー研究でも実データと同等の性能を示す。一方で、時間に依存しないスタイルボトルネックによりコンテンツ漏れを防止する。

ABSTRACT

Controllable generative sequence models with the capability to extract and replicate the style of specific examples enable many applications, including narrating audiobooks in different voices, auto-completing and auto-correcting written handwriting, and generating missing training samples for downstream recognition tasks. However, under an unsupervised-style setting, typical training algorithms for controllable sequence generative models suffer from the training-inference mismatch, where the same sample is used as content and style input during training but unpaired samples are given during inference. In this paper, we tackle the training-inference mismatch encountered during unsupervised learning of controllable generative sequence models. The proposed method is simple yet effective, where we use a style transformation module to transfer target style information into an unrelated style input. This method enables training using unpaired content and style samples and thereby mitigate the training-inference mismatch. We apply style equalization to text-to-speech and text-to-handwriting synthesis on three datasets. We conduct thorough evaluation, including both quantitative and qualitative user studies. Our results show that by mitigating the training-inference mismatch with the proposed style equalization, we achieve style replication scores comparable to real data in our user studies.

研究の動機と目的

  • 非教師付き制御可能系列生成における学習時と推論時の不一致に対処すること。具体的には、モデルがペアのコンテンツとスタイルで学習されるが、実行時には非ペアの入力を想定する。
  • スピーカーラベルや手動アノテーションに依存せず、単に生の入力系列のみを用いて、効果的なスタイル転送を可能にすること。
  • モデルがスタイル入力からコンテンツをコピーしてしまうコンテンツ漏れを防ぐため、スタイル表現が時間に依存しないようにすること。
  • 定量的および定性的な評価において、実データと同等の高精細なスタイル再現を達成すること。
  • テキストから音声やテキストから筆跡再現の両分野において、未学習のスピーカーやスタイルへの一般化を示すこと。

提案手法

  • コンテンツ入力のスタイルに一致するように、リファレンスのスタイル入力を変換するスタイル変換モジュールを導入し、非ペアのコンテンツとスタイルのサンプルを用いた学習を可能にする。
  • 訓練中にスタイル入力のサブセットをランダムに変換済みバージョンに置き換えることでスタイル等化を実装し、モデルがさまざまなスタイルに一般化できるようにする。
  • スタイルエンコーダーに時間に依存しないボトルネックを導入し、時間的依存性を持つコンテンツ情報の抑制により、コンテンツ漏れのリスクを低減する。
  • コンテンツおよびスタイル表現の両方に注目するアテンションベースの自己回帰的生成モデルを用い、系列出力を生成する。
  • スタイル潜在変数の学習済み事前分布を用いた変分オートエンコーダー(VAE)の目的関数を用いて、モデルをエンドツーエンドで訓練する。
  • ローパスフィルタリングを適用し、ダウンサンプリング時にパディングを避けることで、アリasingを低減し、時間に依存しないスタイル表現の整合性を保つ。

実験結果

リサーチクエスチョン

  • RQ1非教師付きで学習された生成系列モデルは、ペアのコンテンツとスタイルデータにアクセスできない状況でも、高品質なスタイル転送を達成できるか?
  • RQ2推論時に非ペアのコンテンツとスタイル入力が想定される状況において、モデルの学習時と推論時の分布シフトをどのように軽減できるか?
  • RQ3スタイル等化は、自己回帰的系列生成モデルにおけるコンテンツ漏れをどの程度低減できるか?
  • RQ4時間に依存しないスタイル表現は、プロソディーや筆跡のストロークパターンなど、複雑な時間的変動を持つスタイルダイナミクスを効果的に捉えることができるか?
  • RQ5提案手法は、ベースラインと比較して、スタイル再現の忠実度および未学習のスピーカーやスタイルへの一般化性能において優れているか?

主な発見

  • ユーザー研究において、提案手法は実データと同等のスタイル再現スコアを達成し、高品質な知覚的性能を示した。
  • 訓練バッチの50%にスタイル等化を適用した場合、すべての比較モデルの中で基準スタイルとのコサイン類似度が最も高く、効果的なスタイル表現学習が実現された。
  • スタイル等化を適用したモデルは、非並列なテキスト生成設定において文字誤り率(CER)が低く抑えられており、コンテンツ漏れが顕著に低減していることが裏付けられた。
  • アブレーションスタディーにより、スタイル等化がコンテンツ漏れ防止に不可欠であることが確認された。特に、過学習に陥りやすいモデルにおいて顕著であった。
  • スピーカーとスタイルの両方において、未学習の対象へも一般化がうまくいった。音声と筆跡再現の両分野で、学習済みスタイル事前分布からの補間およびランダムサンプリングが成功した。
  • リファレンスのスタイルに異なるコンテンツが含まれても、モデルは依然として高い性能を維持しており、非並列推論設定に対するロバストネスを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。