Skip to main content
QUICK REVIEW

[論文レビュー] Learning Disentangled Representations for Timber and Pitch in Music Audio

Yun-Ning Hung, Yi‐An Chen|arXiv (Cornell University)|Nov 8, 2018
Music and Audio Processing参考文献 25被引用数 13
ひとこと要約

本稿では、フレームレベルの楽器およびピッチラベルを用いて、生音声から音色とピッチの分離表現を学習する2つの深層畳み込み自己符号化モデル—DuoAEおよびUnetAE—を提案する。MIDIピアノロールを正確に同期させた時間的監督と adversarial 学習を活用することで、音声ドメインにおける音色クロスオーバーによる音楽編集が可能となり、UnetAEは音色移行時のピッチ構造の保持において優れた性能を示した。

ABSTRACT

Timbre and pitch are the two main perceptual properties of musical sounds. Depending on the target applications, we sometimes prefer to focus on one of them, while reducing the effect of the other. Researchers have managed to hand-craft such timbre-invariant or pitch-invariant features using domain knowledge and signal processing techniques, but it remains difficult to disentangle them in the resulting feature representations. Drawing upon state-of-the-art techniques in representation learning, we propose in this paper two deep convolutional neural network models for learning disentangled representation of musical timbre and pitch. Both models use encoders/decoders and adversarial training to learn music representations, but the second model additionally uses skip connections to deal with the pitch information. As music is an art of time, the two models are supervised by frame-level instrument and pitch labels using a new dataset collected from MuseScore. We compare the result of the two disentangling models with a new evaluation protocol called "timbre crossover", which leads to interesting applications in audio-domain music editing. Via various objective evaluations, we show that the second model can better change the instrumentation of a multi-instrument music piece without much affecting the pitch structure. By disentangling timbre and pitch, we envision that the model can contribute to generating more realistic music audio as well.

研究の動機と目的

  • 生音声における音色とピッチの分離表現を学習する深層学習モデルの開発。
  • 手作業で設計された特徴量に依存し、直接の分離評価が難しい伝統的な信号処理手法の限界を克服すること。
  • フレームレベルのMIDIアノテーションからの時間的監督を用いて、データ駆動型でエンドツーエンドの分離表現を学習すること。
  • ピッチ構造を保持したまま音色を操作することで、音声ドメインにおける音楽編集の可能性を実証すること。
  • 表現学習における分離品質を定量的に評価するための新規評価プロトコル「音色クロスオーバー」を導入すること。

提案手法

  • モデルは、音色とピッチの両方の成分に対して分離された潜在表現を生成するため、重みを共有するエンコーダ-デコーダアーキテクチャを採用する。
  • 分離を強制するために adversarial 学習を採用し、音色およびピッチ成分の両方の埋め込みが平均ゼロになるようにモデルを学習させる。
  • 時間的監督は、時間に同期されたMIDIファイルから導出されたフレームレベルの楽器およびピッチラベルを用いて実施し、ノートレベルでの高精度な監督を可能にする。
  • UnetAEモデルは対称的なスキップ接続を組み込んでおり、エンコーダからデコーダへのピッチ情報の直接的な伝達を可能にし、ピッチ再構成を改善する。
  • モデルは生音声の再構成ではなく、各楽器およびピッチごとのノートオン/オフを表す記号的ピアノロール表現を再構成することを目的としており、より良い分離を実現する。
  • 新規評価プロトコル「音色クロスオーバー」を導入し、クリップ間で音色表現を入れ替えることで、分離品質の定量的評価を可能にする。

実験結果

リサーチクエスチョン

  • RQ1adversarial 学習と時間的監督を用いた深層自己符号化モデルは、音声音楽における音色とピッチの分離表現を学習できるか?
  • RQ2標準的な指標と比較して、提案された「音色クロスオーバー」評価プロトコルは、分離品質の測定にどの程度有効か?
  • RQ3UnetAEアーキテクチャにおけるスキップ接続は、音色移行時のピッチ保持にどの程度寄与するか?
  • RQ4学習された表現は、再録音なしで現実的な音声ドメインにおける音楽編集を可能にするか?
  • RQ5出力ターゲットとしてピアノロールとCQTのどちらを選ぶかが、分離表現学習のパフォーマンスにどのように影響するか?

主な発見

  • UnetAEは音色クロスオーバーにおいて69.1%のピッチ正確度を達成し、DuoAE(42.8%)および adversarial 学習なしのアブレーションモデルを著しく上回った。
  • ピアノロールをターゲット出力として使用したことで、楽器認識正確度が9.6%向上し、ピッチ正確度も5.3%向上した。これは時間的監督の有効性を裏付けた。
  • UnetAEからスキップ接続を削除すると、トランスクリプション正確度は0.407に低下し、音色クロスオーバーにおけるピッチ正確度も0.068にまで低下した。これはスキップ接続がピッチ保持において極めて重要な役割を果たしていることを示した。
  • ピアノからバイオリンへの音色クロスオーバー後の生成音声のスペクトログラムは、長時間の持続と強い高調波といった重要な音響的特徴を的確に捉えていた。
  • アブレーションスタディの結果、adversarial 学習や適切な監督がなければ、モデルの音色とピッチの分離能力が著しく低下することが確認された。
  • 有望な結果が得られたが、音声品質はまだ最適でないため、WaveNet やマルチバンドアーキテクチャなどの高度なデコーダーの導入によりさらなる改善が期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。