Skip to main content
QUICK REVIEW

[論文レビュー] Joint Robust Voicing Detection and Pitch Estimation Based on Residual Harmonics

Thomas Drugman, Abeer Alwan|arXiv (Cornell University)|Dec 28, 2019
Speech and Audio Processing被引用数 10
ひとこと要約

本稿では、逆フィルタリングにより得られた残差信号における残留高調波の和(SRH)を用いた、一括されたロバストな音声有声検出と基本周波数推定手法を提案する。残差スペクトル内の高調波ピークを活用し、偶数高調波における偽の最大値を抑える新たな基準を適用することで、加法的ノイズに対して顕著なロバスト性を達成し、0 dB SNRにおける女性声の状況では、6つの最先端の基本周波数トラッカーを上回る性能を示す。

ABSTRACT

This paper focuses on the problem of pitch tracking in noisy conditions. A method using harmonic information in the residual signal is presented. The proposed criterion is used both for pitch estimation, as well as for determining the voicing segments of speech. In the experiments, the method is compared to six state-of-the-art pitch trackers on the Keele and CSTR databases. The proposed technique is shown to be particularly robust to additive noise, leading to a significant improvement in adverse conditions.

研究の動機と目的

  • ノイズの多い音声環境における正確な基本周波数トラッキングの課題に対処すること。
  • 元の音声信号ではなく、残差信号内の高調波構造を活用することで、有声判定の精度を向上させること。
  • 単一の基準を用いて同時に基本周波数推定と有声/無声セグメント検出を行う統合フレームワークの構築。
  • 逆フィルタリングにより声道共振やスペクトル歪みの影響を最小限に抑えることで、加法的ノイズに対する耐性を高めること。
  • クリーンおよびノイズ混在状態の下で、標準化されたデータベースを用いて最先端の基本周波数トラッカーと性能を比較すること。

提案手法

  • 本手法は、音声信号のスペクトルエンVELOPを自己回帰モデルで推定し、逆フィルタリングにより残差信号を抽出することで、スペクトルを平坦化し、声道共振やノイズの影響を低減する。
  • 各ハニング窓を適用したフレームに対して、残差信号の振幅スペクトル E(f) を計算する。このスペクトルは、有声区間では基本周波数 F₀ の倍数に高調波ピークを示す。
  • 残留高調波の和(SRH)は、SRH(f) = E(f) + Σₖ₌₂^N_harm [E(k·f) − E((k−½)·f)] として定義され、偶数高調波における偽のピークを抑えるとともに、真の F₀ ピークを強調する。
  • 推定された基本周波数 F₀* は、[F₀,min, F₀,max] の範囲内で SRH(f) を最大にする周波数として得られ、2段階の精製処理を経る:まず全範囲で平均 F₀ を推定し、その後 [0.5·F₀,mean, 2·F₀,mean] の範囲で精製することで、曖昧さを制限する。
  • 有声判定は、フレーム単位のエネルギー正規化後に SRH(F₀*) をしきい値 θ で比較することで行う。SRH(F₀*) > θ を満たすフレームは有声と分類される。
  • 本手法は、Keele および CSTR データベースを用い、0 dB SNR での複数のノイズタイプに対して、6つの最先端の基本周波数トラッカーと比較して評価された。

実験結果

リサーチクエスチョン

  • RQ1残差信号に高調波に基づく基準を適用することで、ノイズ環境下での基本周波数推定のロバスト性が向上するか?
  • RQ2提案された SRH 基準は、偶数高調波における偽のピークを効果的に抑えるとともに、真の F₀ ピークを強調するか?
  • RQ3同じ SRH 指標が、別々の処理を要せず、基本周波数推定と有声検出の両方を信頼性高く行えるか?
  • RQ4ノイズ環境下でのフレーム誤り率(FPE)、有声判定誤り率(VDE)、基本周波数誤差(GPE)の観点から、本手法は最先端の基本周波数トラッカーと比較してどのように性能を発揮するか?
  • RQ52段階の基本周波数推定プロセス(初期平均 F₀ 推定 followed による精製)は、精度の向上と曖昧さの低減に寄与するか?

主な発見

  • クリーン状態では、SRH は競争力のある性能を示す:女性話者の FPE では2位、女性声の GPE では1位を記録し、最先端手法と同等の結果を達成する。
  • ノイズ混在状態(0 dB SNR)では、女性話者の場合、SRH は比較された6つの手法すべてを上回り、FPE を最低8.5%、VDE を10%以上低減する。
  • 男性話者のノイズ混在状態では、SRH は次に優れた手法と比較して FPE を5.7%、VDE を5.3%低減し、一貫したロバストネスの向上を示す。
  • SRH が性能を発揮しない唯一のケースは、男性話者に対するバブルノイズの場合であり、低周波数帯のスペクトル劣化が最初の5つの高調波に影響を与えている可能性がある。
  • ノイズ下における女性声では、SRH は非常に低い VDE(平均2.7%)と GPE(平均4.0%)を達成し、SRH の VAD を使用する YIN 即ち、それらをも凌駕する。
  • 本手法のロバストネスの背景には、逆フィルタリングによるノイズおよび声道効果の低減があり、残差高調波がより信頼性の高い基本周波数の手がかりとなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。