Skip to main content
QUICK REVIEW

[論文レビュー] Musical Composition Style Transfer via Disentangled Timbre Representations

Yun-Ning Hung, I-Tung Chiang|arXiv (Cornell University)|May 30, 2019
Music and Audio Processing参考文献 23被引用数 5
ひとこと要約

本稿では、敵対的訓練を用いて多音性音声内のトーンとピッチ表現を分離することで、音楽的作曲スタイル転送のためのディープラーニングフレームワークを提案する。モデルは楽器活動検出において最先端の性能を達成し、ピッチコンテンツを保持したままトーンを操作することで高品質な音楽再編成を可能にし、弦楽器、ピアノ、バンドなどのジャンルをまたがる有効なスタイル転送を示している。

ABSTRACT

Music creation involves not only composing the different parts (e.g., melody, chords) of a musical work but also arranging/selecting the instruments to play the different parts. While the former has received increasing attention, the latter has not been much investigated. This paper presents, to the best of our knowledge, the first deep learning models for rearranging music of arbitrary genres. Specifically, we build encoders and decoders that take a piece of polyphonic musical audio as input and predict as output its musical score. We investigate disentanglement techniques such as adversarial training to separate latent factors that are related to the musical content (pitch) of different parts of the piece, and that are related to the instrumentation (timbre) of the parts per short-time segment. By disentangling pitch and timbre, our models have an idea of how each piece was composed and arranged. Moreover, the models can realize "composition style transfer" by rearranging a musical piece without much affecting its pitch content. We validate the effectiveness of the models by experiments on instrument activity detection and composition style transfer. To facilitate follow-up research, we open source our code at https://github.com/biboamy/instrument-disentangle.

研究の動機と目的

  • ピッチコンテンツを保持しながら楽器編成を変更できる、普遍的なニューラルネットワークモデルを自動音楽再編成のために開発すること。
  • 潜在空間におけるトーンとピッチ要因の分離により、音楽スタイル転送のための汎用的でないモデルの欠如に対処すること。
  • 各ターゲットスタイルのペairedデータを必要とせず、音声とMIDIペアのみを用いて、作曲スタイル転送を可能にすること。
  • 敵対的訓練とピッチに配慮したモデリングを通じて分離表現を学習することで、音楽再編成の品質を向上させること。
  • コードのオープンソース化とデモ結果の提供により、今後の研究を促進すること。

提案手法

  • モデルは、多音性音声をMIDIスコアに変換するためのU-Netベースのエンコーダーデコーダー構造を用い、各音符のピッチと楽器を予測する。
  • 分離は敵対的訓練により達成され、識別器が潜在空間におけるトーン関連要因とピッチ関連要因を区別できるように学習される。
  • MIDIアノテーションを用いてピッチと楽器の予測を監視することで、ピッチとトーン表現の共同学習が可能になる。
  • 潜在コード上で別個の楽器分類器を訓練することで、トーンの分離をさらに強化し、敵対的損失を通じて分離を促進する。
  • スタイル転送のため、ピッチ関連潜在要因は固定されたまま、トーン関連要因を変更して新しい楽器編成を生成する。
  • モデルのエンドツーエンド最適化には、再構成損失、ピッチ分類損失、敵対的損失の組み合わせが用いられる。

実験結果

リサーチクエスチョン

  • RQ1音声とMIDIペアから効果的に分離されたトーン表現を学習できるか、それが音楽再編成を可能にするか?
  • RQ2敵対的訓練は、ニューラル音声トランスcriptionにおけるトーンとピッチ要因の分離を向上させるか?
  • RQ3ピッチコンテンツを変更せずに、どの程度モデルが音楽的作曲スタイルを転送できるか?
  • RQ4先行研究と比較して、モデルの楽器活動検出性能はどの程度か?
  • RQ5弦楽器、ピアノ、アコースティック、バンドの作品など、多様な音楽ジャンルに一般化できるか?

主な発見

  • 提案されたUnetEDモデルは、M&Mデータセットにおいて楽器活動検出で最先端の性能を達成し、先行手法を上回っている。
  • 敵対的訓練は分離を顕著に向上させ、楽器活動検出および音楽再編成の両方で優れた性能をもたらした。
  • 人間評価により、UnetEDはアブレーションバージョンと比較して、12のソース・ターゲットスタイルペアにおいてよりリズミカルで調和の取れた再編成を生成した。
  • 音楽専門家と非専門家の両方の被験者から、Hadadら(2018)のベースライン手法よりもUnetEDが高く評価された。後者はピッチ情報を保持できず、多くの空トラックを生成していた。
  • モデルは、低音にはベース、メロディにはバイオリンやクラリネットを適切に割り当てており、再編成中の楽器選択が有効であることを示している。
  • 音楽専門家と非専門家の間で評価に有意差は認められず、モデルの出力が広範な聴衆にとって知覚的に妥当であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。