Skip to main content
QUICK REVIEW

[論文レビュー] Autoencoder Based Architecture For Fast & Real Time Audio Style Transfer.

D. Roja Ramani, Samarjit Karmakar|arXiv (Cornell University)|Dec 18, 2018
Speech and Audio Processing参考文献 5被引用数 6
ひとこと要約

本論文は、1回の順方向伝搬でスタイライズド音声を生成する高速でリアルタイムな音声スタイル転送のための、新しい自己符号化器ベースのアーキテクチャを提案する。事前学習された損失ネットワークから得られるコンテンツ損失とスタイル損失を用いてスペクトログラム上で変換ネットワークを訓練することで、計算コストが低く、高品質な音声合成を実現した。反復的最適化手法に比べて速度と効率性に優れ、言語的コンテンツを保持する。

ABSTRACT

Recently, there has been great interest in the field of audio style transfer, where a stylized audio is generated by imposing the style of a reference audio on the content of a target audio. We improve on the current approaches which use neural networks to extract the content and the style of the audio signal and propose a new autoencoder based architecture for the task. This network generates a stylized audio for a content audio in a single forward pass. The proposed network architecture proves to be advantageous over the quality of audio produced and the time taken to train the network. The network is experimented on speech signals to confirm the validity of our proposal.

研究の動機と目的

  • 音声スタイル転送における遅い反復的最適化手法の限界を解消すること。
  • 1回の順方向伝搬でスタイライズド音声を生成するフォワードパスネットワークを設計することで、リアルタイム音声スタイル転送を可能にすること。
  • 従来のディープラーニングベースの手法に比べ、訓練効率を向上させ、計算コストを低減すること。
  • 発話者固有のスタイル特徴(発音、ピッチ、イントネーションなど)を転送する一方で、言語的コンテンツを保持すること。

提案手法

  • 本手法は、音声信号のスペクトログラムからコンテンツとスタイル表現を学習するための単一の畳み込み自己符号化器を用いる。
  • コンテンツ特徴とスタイル特徴は、事前学習された損失ネットワークを用いて抽出され、コンテンツ損失は高レベルの活性化に基づき、スタイル損失は低レベル特徴のグラム行列に基づく。
  • 変換ネットワークは、コンテンツスペクトログラムをスタイライズド出力にマッピングするように訓練され、組み合わせ損失関数(α × MSE(コンテンツ) + β × MSE(スタイル))を最小化する。
  • 変換ネットワークの学習中は損失ネットワークの重みを固定することで、安定した特徴抽出を保証する。
  • スペクトログラムはSTFTとログマグニチュードスケーリングを用いて生成され、原始音声はGriffin-Limアルゴリズムで再構築される。
  • 両方のネットワークの学習にAdam最適化手法を用い、特定のハイパーパrameter(例:初期学習率1e-3、β1=0.999、β2=0.99)を設定する。

実験結果

リサーチクエスチョン

  • RQ11回の順方向伝搬でリアルタイム音声スタイル転送を実現できる単一のフォワードパスニューラルネットワークは、高品質な聴覚的品質を達成できるか?
  • RQ2損失ネットワークを変換ネットワークから分離することで、学習の安定性と性能にどのような影響を与えるか?
  • RQ3ピッチや発音といった発話者固有のスタイル特徴を転送する際、言語的コンテンツはどの程度保持できるか?
  • RQ4損失関数のハイパーパrameter(例:損失関数内のαとβ)の設定は、コンテンツとスタイルの忠実度の最適なトレードオフをどのようにもたらすか?

主な発見

  • 提案されたアーキテクチャは1回の順方向伝搬でスタイライズド音声を生成し、反復的最適化手法に比べて推論時間を顕著に短縮した。
  • モデルは入力音声の言語的コンテンツを効果的に保持しながら、ピッチ、発音、イントネーションといった重要な発話者固有のスタイル属性を転送した。
  • 重みを固定した事前学習損失ネットワークの使用により、学習の安定性と特徴表現の質が向上した。
  • スペクトログラムの可視化により、コンテンツ構造が保持され、スタイルテクスチャが適切に転送されていることが示された。
  • α = 100およびβ = 10^4の設定で、複数のテスト発話において最適な聴覚的結果が得られた。
  • モデルはVCTKコーパスを用いて1台のGTX 1070 Ti GPUで訓練・評価された。これは標準的なハードウェアでも実現可能であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。