Skip to main content
QUICK REVIEW

[論文レビュー] Deep Neural Network for Automatic Assessment of Dysphonia

Mário Garcia, Ana Lorena Rosset|arXiv (Cornell University)|Feb 25, 2022
Speech and Audio Processing被引用数 6
ひとこと要約

本研究では、パワー・セプストラム入力を用いて音声記録からGRBAS全体の機能低下重症度(G)を予測する深層ニューラルネットワークを提案する。アーキテクチャは、振幅/周波数の摂動およびノイズを検出するように設計されており、人間の被検者内信頼性に近い性能を達成し、被検者間信頼性を上回っている。これは、自動的で標準化された音声評価の強力な可能性を示している。

ABSTRACT

The purpose of this work is to contribute to the understanding and improvement of deep neural networks in the field of vocal quality. A neural network that predicts the perceptual assessment of overall severity of dysphonia in GRBAS scale is obtained. The design focuses on amplitude perturbations, frequency perturbations, and noise. Results are compared with performance of human raters on the same data. Both the precision and the mean absolute error of the neural network are close to human intra-rater performance, exceeding inter-rater performance.

研究の動機と目的

  • GRBASスケールにおける全体の機能低下重症度(G)の自動予測を目的とした深層ニューラルネットワークの開発。
  • 人間の聴覚的・主観的評価を置き換えたり補完することで、臨床的音声評価における主観性とばらつきを低減すること。
  • 音声品質の主要な音響的相関要因(振幅・周波数の摂動、ノイズ)を捉えることができるニューラルネットワークアーキテクチャの設計。
  • モデルの性能を、被検者内・被検者間信頼性という基準として用いた人間のレーティングとの比較を通じて評価すること。
  • 堅牢で汎用性の高いアーキテクチャと評価を用いて、将来の臨床的AIベースの音声品質分類器の展開を基盤づけること。

提案手法

  • モデルは、2本のブランチ構造を持つ深層ニューラルネットワークを採用。1本のパスは振幅および周波数の摂動を処理し、もう1本のパスはノイズに焦点を当て、畳み込み層を用いる。
  • 入力特徴量は、音声信号のパワー・セプストラムから得られ、音声品質に関連するスペクトルエンVELOープおよび周期性の情報をエンコードする。
  • 複数の畳み込み層を用い、異なるカーネルサイズで複数のスムージングスケールを捉えることで、画像認識におけるスカラー空間理論にインspiredされたパターンを抽出する。
  • 最終分類のための全結合層を含み、出力は予測されたGRBAS Gスコア(0~3)である。
  • 性能は、モデルの予測を人間レーティングの評価と比較することで評価され、被検者内信頼性および被検者間信頼性を基準として用いる。
  • モデルは、平均絶対誤差および分類精度を指標として用い、人間がレーティングしたGRBASスコアを備えた音声記録データセットで学習される。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、人間のレーティングと同等の性能で、GRBASスケールにおける全体の機能低下重症度(G)の自動評価を達成できるか?
  • RQ2提案されたニューラルネットワークの性能は、人間専門家の被検者内および被検者間のばらつきと比較してどうなるか?
  • RQ3摂動とノイズに特化した2本のブランチ構造は、GRBAS Gの予測精度をどの程度向上させるか?
  • RQ4複数のスムージングスケール(異なるカーネルサイズ)は、モデルが音声品質特徴を検出する能力をどのように向上させるか?
  • RQ5本モデルをより広範な臨床的対象者および環境に一般化する際の主な制限要因は何か?

主な発見

  • 深層ニューラルネットワークは、人間の被検者内信頼性とほぼ同等の平均絶対誤差(MAE)を達成し、個々の人間レーティングと高い一貫性を示した。
  • モデルの性能は被検者間信頼性を上回っており、音声評価における人間のばらつきを上回る能力を示した。
  • 2本のブランチ構造は、振幅/周波数の摂動およびノイズに関連する明確な音響的パターンを効果的に捉えており、Gスコアの予測精度向上に寄与した。
  • 異なるカーネルサイズ(異なるスムージングスケール)の使用により、特徴抽出が向上し、パターン認識におけるスカラー空間理論の原則と整合した。
  • 性能にかかわらず、トレーニングデータのサイズおよび多様性の制限により、特に人口統計的および録音条件の多様性にかんがみて、一般化能力に限界がある。
  • 本研究は、モデルが強力な出発点であるものの、臨床的展開にはより大規模で多様なデータセットとさらなるアーキテクチャの最適化が必要であると結論づける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。