Skip to main content
QUICK REVIEW

[論文レビュー] Acoustic Modeling for Automatic Lyrics-to-Audio Alignment

Chitralekha Gupta, Emre Yılmaz|arXiv (Cornell University)|Jun 25, 2019
Music and Audio Processing参考文献 36被引用数 5
ひとこと要約

本稿では、ポリフォニック音楽における自動的リリック-オーディオ同期の向上のための二段階的アプローチを提案する:(1) 背景音楽に対する耐性を高めるために、従来のMFCCに加えて、話声および音楽にインスパイアされた特徴を統合する手法、(2) 小さなドメイン内ポリフォニックデータを用いて大規模なソロ・シンギング音声モデルを適応させることでドメイン不一致を低減する手法。本手法は、Mauch-polyデータセット上で平均同期誤差1.93秒を達成し、データ集約型のエンドツーエンドモデルを除くすべての先行システムを上回る性能を示した。

ABSTRACT

Automatic lyrics to polyphonic audio alignment is a challenging task not only because the vocals are corrupted by background music, but also there is a lack of annotated polyphonic corpus for effective acoustic modeling. In this work, we propose (1) using additional speech and music-informed features and (2) adapting the acoustic models trained on a large amount of solo singing vocals towards polyphonic music using a small amount of in-domain data. Incorporating additional information such as voicing and auditory features together with conventional acoustic features aims to bring robustness against the increased spectro-temporal variations in singing vocals. By adapting the acoustic model using a small amount of polyphonic audio data, we reduce the domain mismatch between training and testing data. We perform several alignment experiments and present an in-depth alignment error analysis on acoustic features, and model adaptation techniques. The results demonstrate that the proposed strategy provides a significant error reduction of word boundary alignment over comparable existing systems, especially on more challenging polyphonic data with long-duration musical interludes.

研究の動機と目的

  • 背景音楽がボーカルを劣化させるポリフォニック音楽における自動的リリック-オーディオ同期の課題に対処すること。
  • 話声および音楽にインスパイアされた特徴を統合することで、スペクトロテンポラル変動および背景干渉に対して耐性が高まるかどうかを調査すること。
  • 小規模なポリフォニックデータを用いて事前学習済みのソロ・シンギング音声モデルを適応させることでドメインギャップを埋めることの有効性を評価すること。
  • 大規模なポリフォニックデータセットに依存しない低リソースなソリューションを提供することを目的とし、知識駆動の特徴とデータ駆動の適応を組み合わせることで、実世界の音楽への一般化を向上させること。

提案手法

  • 本手法は、従来のMFCCに加えて、ボイシング、聴覚的、ピッチ関連の特徴など、話声および音楽にインスパイアされた追加特徴を統合することで、ポリフォニック劣化下でもボーカル特徴をよりよく捉える。
  • 最大事後確率(MAP)または最尤線形回帰(MLLR)を用いたモデル適応により、小規模なドメイン内ポリフォニックデータ上で事前学習済みのDNN-HMM音声モデルを微調整する。
  • 適応プロセスにより、ソロ・シンギングの学習データとポリフォニックテストデータとの間のドメイン不一致が低減され、実世界の音楽への一般化性能が向上する。
  • 前処理の影響とドメインシフトの影響を分離するために、Hansen-polyおよびMauch-polyの2つのベンチマークデータセットを、ボーカル抽出あり・なしの両状態で評価する。
  • 音声モデルは、語彙および言語モデルを用いた強制同期により学習および評価され、語の境界誤差を分析することで同期精度を評価する。
  • エンドツーエンドモデルを含む既存システムと比較することで、低リソース環境下での性能向上を示す。

実験結果

リサーチクエスチョン

  • RQ1標準的なMFCCのみを用いる場合と比較して、話声および音楽にインスパイアされた特徴を統合することで、ポリフォニック音楽における同期の耐性が向上するか?
  • RQ2小規模なポリフォニックデータを用いてソロ・シンギング音声モデルを適応させることで、ポリフォニックテストセットにおける同期誤差が顕著に低減するか?
  • RQ3長時間の音楽的インターリュードを含むデータセット(例:Mauch-poly)において、コンテンツにインスパイアされた特徴とモデル適応はどのように性能を発揮するか?
  • RQ4分離されたボーカルではなく、直接ポリフォニックデータにドメイン適応を適用するほうが、より効果的か?
  • RQ5語の境界同期誤差低減に寄与する主な要因は、特徴工学的アプローチか、モデル適応か、それとも両者の組み合わせか?

主な発見

  • 提案手法は、Mauch-polyデータセット上で平均同期誤差1.93秒を達成し、MIREXコンテストで報告されたすべてのシステムの中で、データ集約型エンドツーエンドモデルを除き最高の結果であった。
  • 話声および音楽にインスパイアされた特徴の統合により、MFCCのみを用いた場合と比較して平均同期誤差が大幅に低減され、背景音楽に対する耐性の高さが実証された。
  • 小規模なポリフォニックデータを用いたモデル適応により、未適応のソロ・シンギングモデルに比べて性能が顕著に向上し、特に長時間のインターリュードを含む挑戦的なデータセットで顕著であった。
  • 最良のシステム(C6)は、長時間の音楽的インターリュード付近で境界誤差が著しく低減されており、静的またはボーカルなしセグメントの処理が改善されたことが示された。
  • すべての境界における中央値同期誤差は、最良のシステムで180 ms未満であり、同期タスクの大部分において高い精度を示している。
  • 特徴工学的アプローチによる性能向上が、モデル適応単体のものよりも顕著であり、両者の組み合わせが特にMauch-polyデータセットで最良の結果をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。