Skip to main content
QUICK REVIEW

[論文レビュー] Modulated Variational auto-Encoders for many-to-many musical timbre transfer

Adrien Bitton, Philippe Esling|arXiv (Cornell University)|Sep 29, 2018
Music and Audio Processing参考文献 21被引用数 16
ひとこと要約

本稿では、特徴量別線形変調(FiLM)を用いた条件付き生成と最大平均差分(MMD)を用いた安定な学習により、敵対的学習を不要とし、軽量な、多くの楽器間での音色転送を実現する、モodulated Variational Auto-Encoders(MoVE)を提案する。MoVEは3次元の潜在空間を用いた1つの共有エンコーダ・デコーダアーキテクチャにより、複数の楽器に対して制御可能で高速かつ効果的な音色転送を可能にし、小規模なデータセットでも高品質な音声再構成と合成を達成する。

ABSTRACT

Generative models have been successfully applied to image style transfer and domain translation. However, there is still a wide gap in the quality of results when learning such tasks on musical audio. Furthermore, most translation models only enable one-to-one or one-to-many transfer by relying on separate encoders or decoders and complex, computationally-heavy models. In this paper, we introduce the Modulated Variational auto-Encoders (MoVE) to perform musical timbre transfer. We define timbre transfer as applying parts of the auditory properties of a musical instrument onto another. First, we show that we can achieve this task by conditioning existing domain translation techniques with Feature-wise Linear Modulation (FiLM). Then, we alleviate the need for additional adversarial networks by replacing the usual translation criterion by a Maximum Mean Discrepancy (MMD) objective. This allows a faster and more stable training along with a controllable latent space encoder. By further conditioning our system on several different instruments, we can generalize to many-to-many transfer within a single variational architecture able to perform multi-domain transfers. Our models map inputs to 3-dimensional representations, successfully translating timbre from one instrument to another and supporting sound synthesis from a reduced set of control parameters. We evaluate our method in reconstruction and generation tasks while analyzing the auditory descriptor distributions across transferred domains. We show that this architecture allows for generative controls in multi-domain transfer, yet remaining light, fast to train and effective on small datasets.

研究の動機と目的

  • 既存のモデルが直面する音色転送の限界、特に敵対的学習依存、高い計算コスト、複数楽器への一般化不能性を解消すること。
  • 個々のドメインごとのエンコーダ・デコーダを別々に用いずに、多数対多数の音色転送が可能な統合的で軽量なアーキテクチャの開発。
  • 楽器、音高、オクターブの条件に基づいた3次元潜在空間による、高水準かつ明示的な音声生成制御の実現。
  • 音声記述子と知覚的指標を用いて、再構成、転送、生成的合成のパフォーマンスを評価すること。
  • 安定性と制御可能性を維持したまま、小規模データセットでも効果的な性能を示すモデルの有効性の実証。

提案手法

  • MoVEは、楽器、音高、オクターブに基づいて音色的特性を制御するため、特徴量別線形変調(FiLM)によって条件付けられた、共有エンコーダ・デコーダを備えた変分オートエノードバーラ(VAE)を用いる。
  • 訓練目的関数は敵対的損失を最大平均差分(MMD)に置き換え、学習の安定性と速度を向上させるとともに、モード崩壊を回避する。
  • 潜在空間は3次元であり、ユーザーによる直接的な操作と滑らかな補間を可能にし、音色の混合や音声合成に適している。
  • ドメイン情報が埋め込まれ、ネットワークの内部層を変調することで、1つのモデル内で複数ドメインの転送が可能になる。
  • 音声記述子(スペクトル重心、平坦度、ロールオフ、ラウドネス)を用いて、転送された音色の知覚的正確性を分析・検証する。
  • モデルは中規模の単音録音データセット上でエンドツーエンドに学習され、再トレーニングなしに複数楽器間での転送が可能になる。

実験結果

リサーチクエスチョン

  • RQ1敵対的学習やドメイン別デコーダを必要としない1つのVAEベースアーキテクチャが、多数対多数の音色転送を実現できるか?
  • RQ2MMD損失は、音声生成タスクにおける安定的かつ高速な収束を実現するための敵対的学習の代替として、どの程度有効か?
  • RQ33次元潜在空間は、制御可能で知覚的に意味のある音色の混合や合成をどの程度可能にするか?
  • RQ4音色の多様な分布(例:スペクトル重心)がドメイン間転送中にどの程度保持されるか?
  • RQ5窓状に分割されたシーケンスを処理することで、モデルはフルメロディックな転送に一般化できるか?

主な発見

  • 敵対的損失をMMDに置き換えることで、MoVEは学習が安定し、収束が速くなり、モード崩壊を回避する。
  • 音声再構成の精度は非常に高く、RMSE(例:バイオリンで0.3271)とLSD(例:バイオリンで773.65)が低く抑えられている。
  • アルトサックス、フラute、バイオリン、フランスホルンなど多様な楽器間で優れた転送性能を示し、MMD値が3.5e-3未満、k-NNスコアが60k未満であり、正確なドメイン転送が確認された。
  • 転送サンプルにおける音声記述子(例:スペクトル重心)の分布が、ターゲットドメインと非常に近いことから、知覚的音色特性の正確な転送が確認された。
  • 3次元潜在空間により、滑らかで連続的な音色の混合と直接的なユーザー制御が可能となり、高水準パrameterによるリアルタイム音声合成が可能になった。
  • 窓状に分割されたセグメントを処理することで、フルメロディックな楽器演奏の転送に成功し、実世界の音楽的シーケンスへの応用可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。