Skip to main content
QUICK REVIEW

[論文レビュー] Score-informed syllable segmentation for a cappella singing voice with convolutional neural networks

Jordi Pons, Rong Gong|arXiv (Cornell University)|Jul 12, 2017
Music and Audio Processing参考文献 16被引用数 3
ひとこと要約

本稿では、音楽的スコアの長さに関する事前知識を統合した新しい畳み込みニューラルネットワーク(CNN)アーキテクチャを用いて、アカペラの Jingju 歌唱における音節開始検出関数(ODF)推定を向上させるスコア情報に基づく音節分割手法を提案する。その後、スコアの長さ事前分布を活用して境界検出を精緻化するスコア情報に基づくバイテルビアルゴリズムを適用する。本手法は、マルチスケールの時間周波数特徴を効果的に捉え、スコアからの事前知識を統合することで、分割誤りを低減し、最先端の手法を上回る性能を達成する。

ABSTRACT

This paper introduces a new score-informed method for the segmentation of jingju a cappella singing phrase into syllables. The proposed method estimates the most likely sequence of syllable boundaries given the estimated syllable onset detection function (ODF) and its score. Throughout the paper, we first examine the jingju syllables structure and propose a definition of the term "syllable onset". Then, we identify which are the challenges that jingju a cappella singing poses. Further, we investigate how to improve the syllable ODF estimation with convolutional neural networks (CNNs). We propose a novel CNN architecture that allows to efficiently capture different time-frequency scales for estimating syllable onsets. In addition, we propose using a score-informed Viterbi algorithm -instead of thresholding the onset function-, because the available musical knowledge we have (the score) can be used to inform the Viterbi algorithm in order to overcome the identified challenges. The proposed method outperforms the state-of-the-art in syllable segmentation for jingju a cappella singing. We further provide an analysis of the segmentation errors which points possible research directions.

研究の動機と目的

  • 教育的評価において正確な発音とインテンションが不可欠であるため、Jingju アカペラ歌唱における自動音節分割の課題に対処すること。
  • Jingju音楽の独自の音声構造(頭、腹、尾)と演奏実態を考慮し、音節および音節開始の定義を明確にすること。
  • 多フィルタCNNアーキテクチャを設計することで、多様な時間周波数スケールを捉え、音節開始検出を向上させること。
  • 特に音節の長さに関する事前知識(スコアの長さ事前分布)をバイテルビデコーディングプロセスに統合し、分割のロバスト性を向上させること。
  • 分割誤りを分析し、スコアと演奏の不一致や曖昧な音節遷移といった主な失敗モードを特定し、今後の改善に役立てる。

提案手法

  • 複数の異なるフィルタ形状を最初の畳み込み層に用いるマルチスケールCNNを提案し、音節開始検出に適した時間的・トーン的表現を補完的に学習する。
  • 時間的ダイナミクスに最適化されたモデルとスペクトル的トーンに最適化されたモデルの2つの専用CNNモデルの予測結果を後段で統合することで、全体のODF推定性能が向上する。
  • スコア情報に基づくバイテルビアルゴリズムを設計し、状態遷移確率をスコアから導出された長さ事前分布を用いてモデル化する。
  • 推定されたODFとスコアに基づく長さ事前分布を用いて、最も可能性の高い音節境界の系列をデコードし、単純なしきい値処理やピーク検出に代わる。
  • 音節長に関する事前知識と演奏のずれに関する知識を統合することで、アテネーション変動や演奏のばらつきに対してロバストな性能を実現する。
  • デコーディングプロセスでは、スコアに一致する固定数の音節を仮定しており、構造的な推論を可能にするが、スコアに存在しない挿入や削除の処理には限界がある。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングベースのアプローチは、従来の手作業特徴抽出手法と比較して、Jingju アカペラ歌唱における音節開始検出をどの程度改善できるか?
  • RQ2演奏のばらつきが存在する中で、特に音節長さに関するスコア情報(事前分布)が、音節境界検出の精度をどの程度向上させるか?
  • RQ3Jingju歌唱における分割誤りの主な原因は何か。また、それらはどのように体系的に分析され、是正されるべきか?
  • RQ4時間周波数スケールに特化した複数のCNNのリードファージョン統合は、単一アーキテクチャのモデルに比べ、ODF推定をどのように改善するか?
  • RQ5しきい値処理やピーク検出と比較して、バイテルビデコーディングによる事前知識の統合は、分割のロバスト性においてどの程度優れているか?

主な発見

  • 複数のフィルタ形状とリードファージョン統合を備えた提案されたCNNアーキテクチャは、スコアの長さ事前分布を用いたバイテルビアルゴリズムと組み合わせることで、Schlüterらの最先端のCNNベースODF推定器を上回る性能を発揮し、特にアテネーション変動の処理において優れた性能を示す。
  • スコア情報に基づくバイテルビアルゴリズムは、スコアからの長さ事前知識を統合することで、ノイズの多いODFピークに起因する誤検出(偽陽性)を著しく低減し、分割精度を顕著に向上させる。
  • 71.42%の分割誤りは、スコアに反映されていない音節の挿入・削除・長さのずれを含むスコアと演奏の不一致に起因している。
  • 15.61%の誤りは、母音-母音や母音-半母音の遷移といった曖昧な音節遷移に起因しており、これらの遷移には明確なスペクトル的開始がなく、標準的な開始関数では検出が困難である。
  • 既存の最先端手法と比較して、Jingju アカペラ歌唱データセット上での性能が優れており、演奏のばらつきや徐々に変化する遷移の処理には依然課題が残っている。
  • 誤り分析から、今後の改善はパディング文字のモデル化、最後の音節の延長処理、および離散的な時刻点ではなく開始領域を検出するアプローチに焦点を当てるべきであると示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。