Skip to main content
QUICK REVIEW

[論文レビュー] Robustness against the channel effect in pathological voice detection

Yi‐Te Hsu, Zining Zhu|arXiv (Cornell University)|Nov 26, 2018
Speech and Audio Processing参考文献 8被引用数 5
ひとこと要約

本稿では、多様な録音デバイスに起因するチャネル効果を軽減するため、ドメイン adversarial training (DAT) を用いた双方向LSTMを用いた頑健な病理的発声検出システムを提案する。教師なしドメイン適応を活用することで、ラベルなしスマートフォンデータ上でPR-AUCが0.9455に達し、適応なしの0.8448と比べ顕著に向上する。これは、このタスクにおける最初の教師なしドメイン適応アプローチである。

ABSTRACT

Many people are suffering from voice disorders, which can adversely affect the quality of their lives. In response, some researchers have proposed algorithms for automatic assessment of these disorders, based on voice signals. However, these signals can be sensitive to the recording devices. Indeed, the channel effect is a pervasive problem in machine learning for healthcare. In this study, we propose a detection system for pathological voice, which is robust against the channel effect. This system is based on a bidirectional LSTM network. To increase the performance robustness against channel mismatch, we integrate domain adversarial training (DAT) to eliminate the differences between the devices. When we train on data recorded on a high-quality microphone and evaluate on smartphone data without labels, our robust detection system increases the PR-AUC from 0.8448 to 0.9455 (and 0.9522 with target sample labels). To the best of our knowledge, this is the first study applying unsupervised domain adaptation to pathological voice detection. Notably, our system does not need target device sample labels, which allows for generalization to many new devices.

研究の動機と目的

  • 異なる録音デバイスに起因するチャネル不一致の課題に対処すること。
  • ターゲットデバイスのラベル付きデータを必要とせずに、さまざまなデバイスに一般化する頑健なモデルを開発すること。
  • スマートフォンなどの低リソースでラベルなしのターゲットデバイスにおける性能を、教師なしドメイン適応を用いて向上させること。
  • 異なる前処理およびネットワークアーキテクチャ下でのMFCCとフィルターバンクの性能を評価すること。
  • 高精度な発声病理検出を、一般消費者向けのモバイルデバイスに展開可能であることを実証すること。

提案手法

  • 入力特徴として26次元のMFCCと40次元のフィルターバンクを用い、境界効果を軽減するため32msのウィンドウ長と半分のウィンドウフレームシフトを採用する。
  • 双方向LSTM(BLSTM)ネットワークが入力特徴を潜在表現に符号化し、その後に全結合層を介して病理的発声分類を実行する。
  • ドメイン adversarial training (DAT) は勾配逆転層(GRL)を介して適用され、ドメイン分類器の性能を最小化することでドメイン不変特徴を分離する。
  • モデルは高品質マイクロフォンデータ(ソースドメイン)で学習され、ラベルなしスマートフォンデータ(ターゲットドメイン)でテストされ、教師なし適応を可能にする。
  • 損失関数は分類用の交差エントロピーとドメイン整合用の adversarial 損失を組み合わせ、エンドツーエンドで最適化される。
  • 特徴正規化はハイパーパramとして評価され、最終設定では非正規化フィルターバンクが優れた性能を示した。

実験結果

リサーチクエスチョン

  • RQ1教師なしドメイン適応は、低リソースでラベルなしのスマートフォンデータにおける病理的発声検出性能を向上させることができるか?
  • RQ2フロントエンド特徴(MFCC対フィルターバンク)および正規化の選択がモデルの頑健性に与える影響は何か?
  • RQ3マルチレイヤーパーセプトロン(MLP)と比較して、双方向LSTMは発声パターンの順序性をモデル化する上で優れているか?
  • RQ4ドメイン adversarial training は、高品質録音とスマートフォン録音の間のチャネル不一致の影響をどの程度軽減できるか?
  • RQ5そのデバイスのラベル付きサンプルが一切不要な状態で、モデルは新しいデバイスに一般化できるか?

主な発見

  • 提案された教師なしドメイン適応システムは、ラベルなしスマートフォンデータ上でPR-AUCが0.9455に達し、適応なしの0.8448と比べ顕著に向上した。
  • ターゲットデバイスのラベルが利用可能であれば、PR-AUCは0.9522に達し、ドメイン adversarial training の有効性を示した。
  • 双方向LSTMはMLPを上回り、正規化MFCCを用いた場合のPR-AUCは0.9415であったのに対し、MLPでは0.9154にとどまった。
  • 非正規化フィルターバンクは正規化されたものより優れた性能を示し、PR-AUCは0.9478であった。一方、正規化MFCCは0.9415を達成した。
  • 高品質マイクロフォンデータで学習したモデルは、ターゲットサンプルのラベルを一切必要とせず、スマートフォン録音に効果的に一般化でき、チャネル効果に対する頑健性を実証した。
  • 本手法は、病理的発声検出に教師なしドメイン適応を適用した最初のものであり、多様なモバイルデバイスへの展開を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。