Skip to main content
QUICK REVIEW

[論文レビュー] Glottal Closure Instants Detection From Pathological Acoustic Speech Signal Using Deep Learning

M Gurunath Reddy, Tanumay Mandal|arXiv (Cornell University)|Nov 25, 2018
Voice and Speech Disorders参考文献 15被引用数 14
ひとこと要約

本論文は、生の音声信号と線形予測残差(LPR)特徴量を用い、マルチカラムCNNアーキテクチャを用いて統合する深層学習ベースの手法を提案し、病理的発話における声門閉鎖瞬間(GCI)を検出する。本手法は、手動でGCIアノテーションが付与された新規の病理的発話データセット上で、89.30%の識別率と0.54msのタイミング精度を達成し、最先端手法を著しく上回った。

ABSTRACT

In this paper, we propose a classification based glottal closure instants (GCI) detection from pathological acoustic speech signal, which finds many applications in vocal disorder analysis. Till date, GCI for pathological disorder is extracted from laryngeal (glottal source) signal recorded from Electroglottograph, a dedicated device designed to measure the vocal folds vibration around the larynx. We have created a pathological dataset which consists of simultaneous recordings of glottal source and acoustic speech signal of six different disorders from vocal disordered patients. The GCI locations are manually annotated for disorder analysis and supervised learning. We have proposed convolutional neural network based GCI detection method by fusing deep acoustic speech and linear prediction residual features for robust GCI detection. The experimental results showed that the proposed method is significantly better than the state-of-the-art GCI detection methods.

研究の動機と目的

  • 病理的発話におけるGCI検出のための堅牢な手法が不足していること、特に侵襲的なEGG信号に依存する傾向があることに対処する。
  • 手動によるパrameterチューニングや手作業によるヒューリスティクスを回避する、データ駆動型でエンドツーエンドの深層学習アプローチを開発する。
  • スマートフォンや低コストデバイスで記録された標準的な音声信号から直接GCI検出を可能にする。
  • 研究の妥当性検証を可能にするために、同時にEGGと音声記録が得られた新しい病理的発話データセットを構築する。
  • 声帯疾患に起因する弱いまたはぼやけた声門駆動の影響下でも、検出の精度と耐障害性を向上させる。

提案手法

  • マルチカラム3D-CNNアーキテクチャを用い、各カラムが異なる入力表現(ローパスフィルタ処理済み音声:LPF_S、ローパスフィルタ処理済みLPR:LPF_LPR、および両者の正のクリッピング版)を処理する。
  • 各CNNブロックはバッチ正規化を伴う5層の畳み込み層から構成され、GCI領域における微細な時間的変動を保持するために最大プーリングを省略する。
  • 最終層ではシグモイド活性化関数を用い、各フレームごとのGCI分類の事後確率を出力する。
  • 音声(LPF_S)と残差(PC_LPF_LPR)のブランチからの特徴量を、予測確率の最尤結合によるラテラル統合により統合する統合モデルを構築する。
  • 最終的なGCIは、GCIと分類されたフレーム(確率 ≥ 0.1)内での最大の負のピーク位置として特定される。
  • モデルは30エポックにわたり、ADAM最適化法とヘ正規化重み初期化を用いたバイナリクロスエントロピー損失関数で訓練される。

実験結果

リサーチクエスチョン

  • RQ1生の音声信号とLPR特徴量を学習した深層学習モデルは、従来の信号処理ベースの手法よりも、病理的発話におけるGCI検出をより正確に実現できるか?
  • RQ2音声と残差特徴量の統合は、多様な声帯疾患にわたるGCI検出の耐障害性を向上させるか?
  • RQ3識別率、見逃し率、タイミング精度の観点から、本手法は最先端のGCI検出技術(SEDREAMS、DYPSA、ZFF)と比較してどのように差をつけるか?
  • RQ41つの深層学習モデルが、疾患特異的チューニングを必要とせずに、複数の声帯疾患タイプに一般化できるか?
  • RQ5音声およびLPR信号の正のクリッピングとローパスフィルタ処理が、病理的状態におけるGCI検出性能の向上にどの程度寄与するか?

主な発見

  • 本手法は識別率(IDR)89.30%を達成し、SEDREAMS(84.98%)、DYPSA(79.33%)、ZFF(80.88%)を著しく上回った。
  • 見逃し率(MR)は5.97%であり、SEDREAMS(9.06%)、DYPSA(13.42%)、ZFF(10.64%)よりも低く、GCIイベントの見逃しは少ないことを示した。
  • 誤検出率(FAR)は4.70%であり、SEDREAMS(6.01%)、DYPSA(7.25%)、ZFF(8.48%)よりも低く、特異性が向上したことを示した。
  • 識別精度(IDA)は0.54msであり、すべての手法の中で最低であり、GCI局所化における高い時間的精度を示した。
  • モデル1(LPF_S)は個別に最高のF1スコア(86.82%)を達成したが、モデル4(PC_LPF_LPR)は二次的駆動を抑制することで誤検出を最小限に抑えた。
  • LPF_SとPC_LPF_LPR特徴量のラテラル統合が最尤結合により実施され、音声と残差表現の相補的利点が確認され、最良の全体的性能が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。