Skip to main content
QUICK REVIEW

[論文レビュー] Multiple F0 Estimation in Vocal Ensembles using Convolutional Neural Networks

Helena Cuesta, Brian McFee|arXiv (Cornell University)|Sep 9, 2020
Music and Audio Processing参考文献 37被引用数 7
ひとこと要約

本論文は、倍音定常Q変換(HCQT)特徴量(振幅と位相情報を含む)を用いて、コーラス形式の声楽アンサンブルにおける複数の基本周波数(F0)推定のための畳み込みニューラルネットワーク(CNN)ベースの手法を提案する。このモデルは、特に20セントの高周波数分解能において、最先端の手法を上回り、リバーブやユニゾン歌唱に対しても頑健であることが示された。

ABSTRACT

This paper addresses the extraction of multiple F0 values from polyphonic and a cappella vocal performances using convolutional neural networks (CNNs). We address the major challenges of ensemble singing, i.e., all melodic sources are vocals and singers sing in harmony. We build upon an existing architecture to produce a pitch salience function of the input signal, where the harmonic constant-Q transform (HCQT) and its associated phase differentials are used as an input representation. The pitch salience function is subsequently thresholded to obtain a multiple F0 estimation output. For training, we build a dataset that comprises several multi-track datasets of vocal quartets with F0 annotations. This work proposes and evaluates a set of CNNs for this task in diverse scenarios and data configurations, including recordings with additional reverb. Our models outperform a state-of-the-art method intended for the same music genre when evaluated with an increased F0 resolution, as well as a general-purpose method for multi-F0 estimation. We conclude with a discussion on future research directions.

研究の動機と目的

  • 同じトーンと倍音構造を有する声のみからなる多声およびコーラス形式の声楽アンサンブルにおける複数F0推定の課題に対処すること。
  • 個別の声の録音や楽譜同期に依存する従来手法の限界を克服し、実世界の録音において実用的でない点を改善すること。
  • リバーブやユニゾン歌唱を含む多様な録音条件に一般化可能なディーブラーニングモデルの開発。
  • 入力表現に振幅に加えて位相差を組み込むことで、推定精度の向上を図ること。
  • トレーニングと評価を支援するための、F0アノテーション付きの大規模かつ高品質な声楽四重唱データセットの構築。

提案手法

  • 倍音定常Q変換(HCQT)とその位相差を用いて、倍音構造と時間的ダイナミクスを捉える入力特徴量を採用する。
  • HCQT表現を処理し、有望なF0候補を強調する周波数感受性関数を出力するCNNアーキテクチャを設計する。
  • 感受性マップに対してしきい値処理とピーク検出を適用し、出力から離散的なF0値を抽出する。
  • ピッチシフトとリバーブを適用したマルチトラック録音から抽出した声楽四重唱のカスタムデータセットを用いてモデルを訓練する。
  • F0推定精度の向上を目的として、振幅と位相情報を統合するための異なる統合戦略を実験する。
  • バリデーションセットを用いて最適なピーク検出しきい値を特定し、多様な条件下でも頑健な性能を確保する。

実験結果

リサーチクエスチョン

  • RQ1混合音声のみを入力として用いる深層学習モデルは、個別の声の録音が得られない状況においても、コーラス形式の声楽アンサンブルにおける複数F0推定を効果的に行えるか?
  • RQ2入力表現に位相情報が含まれることで、特に高分解能(20セント)条件下でのF0推定精度にどのような影響を与えるか?
  • RQ3リバーブを含む信号で学習させることで、高リバーブ環境にさらされた実世界の録音条件への一般化性能がどの程度向上するか?
  • RQ4さまざまな周波数許容誤差(ピッチ許容誤差)において、提案手法は最先端手法と比較してどの程度のF0推定性能を示すか?
  • RQ5ユニゾン歌唱や高リバーブ環境といった、コーアル音楽で一般的な未学習の録音条件に対しても、モデルは一般化可能か?

主な発見

  • 提案手法は、同じ音楽ジャンル(バリバーショップ四重唱)における最先端手法と比較して、100セントおよび20セントのピッチ許容誤差の両方で優れた性能を示し、20セントでの性能低下が著しく小さい(-2% F-Score 対 他のベースラインの -17% および -26%)。
  • 入力表現に位相差を組み込むことで、F0推定の精度が向上し、特に高分解能(20セント)での性能が振幅のみのベースラインより優れていることが実証された。
  • ドライ信号とリバーブ信号の両方で学習したモデルは、ドライ信号でのみ学習したモデルと比較して、リバーブが強いテストサンプルで平均10%のF-Score向上を達成した。
  • 高リバーブと複数の歌手が1パートに存在する困難なコーラスデータセットに対して評価したところ、モデルは平均F-Score 0.704を達成し、ベースライン手法の0.653を上回った。
  • ユニゾン歌唱に対してもモデルは頑健であることが示され、複数の声が同じ周波数を歌っても高い性能を維持した。
  • F0曲線の後処理により時間的連続性が向上したため、今後の研究では高品質な出力を得るためのこの種の精練ステップの統合が推奨される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。