Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Learning of Harmonic Priors for Pitch Detection in Polyphonic Music

Pablo A. Alvarado, Dan Stowell|arXiv (Cornell University)|May 19, 2017
Music and Audio Processing参考文献 20被引用数 6
ひとこと要約

本稿では、物理的に妥当な調波事前分布を学習することで、複数楽器が重なった音楽におけるピッチ検出を向上させるために、新しいマテルンスペクトルミックス(MSM)カーネルを備えたベイジアンガウス過程モデルを提案する。シグモイドまたはソフトマックス非線形変換を用いて、アタック/ディレイエナベロープとピッチ活性化を同時にモデル化し、変分ベイズを用いたスケーラブルな推論を実現することで、アクティブな音符の数に関する事前知識が不要な状態で、複雑な調波構造を捉えることに成功し、最先端の性能を達成した。

ABSTRACT

Automatic music transcription (AMT) aims to infer a latent symbolic representation of a piece of music (piano-roll), given a corresponding observed audio recording. Transcribing polyphonic music (when multiple notes are played simultaneously) is a challenging problem, due to highly structured overlapping between harmonics. We study whether the introduction of physically inspired Gaussian process (GP) priors into audio content analysis models improves the extraction of patterns required for AMT. Audio signals are described as a linear combination of sources. Each source is decomposed into the product of an amplitude-envelope, and a quasi-periodic component process. We introduce the Matérn spectral mixture (MSM) kernel for describing frequency content of singles notes. We consider two different regression approaches. In the sigmoid model every pitch-activation is independently non-linear transformed. In the softmax model several activation GPs are jointly non-linearly transformed. This introduce cross-correlation between activations. We use variational Bayes for approximate inference. We empirically evaluate how these models work in practice transcribing polyphonic music. We demonstrate that rather than encourage dependency between activations, what is relevant for improving pitch detection is to learnt priors that fit the frequency content of the sound events to detect.

研究の動機と目的

  • 物理的に妥当な事前分布を確率的モデルに組み込むことで、複数楽器が重なった音楽における自動音楽記録(AMT)の性能を向上させること。
  • ガウス過程を用いて、アタック/ディレイエナベロープやスペクトル内容を含む、楽器の音の複雑な調波構造をモデル化すること。
  • 変分ベイズ近似を用いることで、長時間の音声信号に対してもスケーラブルな推論を可能にすること。
  • 事前指定が不要な状態で、データから直接アクティブな音符の数を学習できること。
  • ピッチ活性化の間の相互相関(ソフトマックスを介して)と正確な調波事前分布(MSMカーネルを介して)のどちらが性能向上に寄与しているかを調査すること。

提案手法

  • 音声を、各々がアタック/ディレイエナベロープと準周期的成分から成る複数の音源の線形結合としてモデル化する。
  • マテルンスペクトルミックス(MSM)カーネルを導入し、ローレンツ型基底関数を用いて周波数領域で長期的な依存関係と調波成分を捉える。
  • ピッチ活性化のガウス過程にシグモイドおよびソフトマックス非線形変換を適用し、非負性とスパarsityを強制し、後者は相互相関を導入する。
  • 変分ベイズを用いて近似推論を実施し、4次元数値積分を1次元積分の組み合わせに置き換えることで計算コストを低減する。
  • マテルン-1/2カーネルのフーリエ変換に基づくローレンツ関数の混合から導かれるスペクトル密度モデルを採用する。
  • 周波数領域でモデルハイパーパrameterを学習することで、楽器固有の調波構造をよりよく反映する。

実験結果

リサーチクエスチョン

  • RQ1物理的にインspiredされたガウス過程事前分布を導入することで、複数楽器が重なった音楽におけるピッチ検出性能が向上するか?
  • RQ2ソフトマックスを介したピッチ活性化の相互相関と、MSMカーネルを介した正確な調波事前分布のどちらが性能向上に寄与しているか?
  • RQ3モデルは、事前指定がなくても音声データから直接アクティブな音符の数を学習できるか?
  • RQ4マテルンスペクトルミックスカーネルは、標準的なカーネルと比較して、調波成分をどのようによりよくモデル化できるか?
  • RQ5変分ベイズは、長時間の音声信号に対して、どのようにスケーラブルな推論を可能にするか?

主な発見

  • ピッチ検出性能の向上の鍵となる要因は、マテルンスペクトルミックスカーネルによる正確な調波事前分布の学習であり、活性化同士の相互相関の強制ではない。
  • MSMカーネルは、複数楽器音声信号における複雑な調波成分と長期的依存関係を効果的にモデル化でき、標準カーネルを上回る性能を示した。
  • ソフトマックスモデルによる相互相関は、性能向上に顕著な寄与を示さなかったため、活性化の相関よりも調波事前分布の学習がより重要であると考えられる。
  • 変分ベイズにより、4次元数値積分を1次元積分の組み合わせに置き換えることで、数秒にわたる音声信号に対しても効率的な推論が可能になった。
  • 事前に固定された音声イベント数を指定する必要がなく、ピッチ検出分野で最先端の性能を達成した。
  • データ駆動型の調波構造の学習により、楽器や複数楽器のテクスチャにわたる一般化性能が優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。