[論文レビュー] Non-intrusive speech quality assessment using neural networks
本稿では、現実世界の歪みを含むクラウドラベル付きデータセットを用いて訓練されたディープニューラルネットワークを用いた、侵襲的でない音声品質評価手法を提案する。メル周波数特徴量を用いた全結合DNNに加え、ELMを用いた後処理を実装し、ピアソン相関係数0.87および平均二乗誤差0.15を達成し、PESQ、P.563、SRMRの両指標において優れた性能を示した。
Estimating the perceived quality of an audio signal is critical for many multimedia and audio processing systems. Providers strive to offer optimal and reliable services in order to increase the user quality of experience (QoE). In this work, we present an investigation of the applicability of neural networks for non-intrusive audio quality assessment. We propose three neural network-based approaches for mean opinion score (MOS) estimation. We compare our results to three instrumental measures: the perceptual evaluation of speech quality (PESQ), the ITU-T Recommendation P.563, and the speech-to-reverberation energy ratio. Our evaluation uses a speech dataset contaminated with convolutive and additive noise, labeled using a crowd-based QoE evaluation, evaluated with Pearson correlation with MOS labels, and mean-squared-error of the estimated MOS. Our proposed approaches outperform the aforementioned instrumental measures, with a fully connected deep neural network using Mel-frequency features providing the best correlation (0.87) and the lowest mean squared error (0.15)
研究の動機と目的
- クリアなリファレンス信号に依存しない、リアルタイムな侵襲的でない音声品質評価手法の開発を目的とする。
- PESQ や P.563 といった既存のインストルメンタル指標が、ノイズ やリバーブなどの非圧縮歪みに対して性能を発揮しないという限界を是正することを目的とする。
- 日常的な音響障害(ノイズ、リバーブ、ルーム効果など)を反映した、現実的でクラウドラベル付きのデータセットを用いてニューラルネットワークを訓練することを目的とする。
- 従来のニューラルネットワークモデルが、主観的なMOSではなく代理ラベル(例:PESQスコア)に依存しているのを改善することを目的とする。
- 多様な音響特徴量を用いた複数のニューラルネットワークアーキテクチャを評価・比較し、MOS予測性能を検証することを目的とする。
提案手法
- 120のルームインパulse応答を用いて音声信号を畳み込み処理し、45 dB SPLのノイズを追加することで、10,000件の音声サンプルから成るデータセットを生成した。これは現実世界の状況を模擬したものである。
- 3つのニューラルネットワークアーキテクチャを評価した:定常Qスペクトル特徴量を用いたCNN、全変動空間からのiベクトルを用いたDNN、メル周波数 cepstral コefficients (MFCCs) を用いたDNN。
- 最も優れた性能を示したモデルは、4層の全結合DNNにメル周波数特徴量を入力とし、その後に時間的統計を統合するための極端学習機械(ELM)を適用した。
- モデル学習にはAdam最適化法を用い、学習率を0.0001および0.0004に設定し、過学習を防ぐためにドロップアウト(0.2~0.5)を適用した。
- 特徴量ベクトルは正規化され、可変長の音声入力に対応するため、統計的プーリング(平均またはモード)を用いて処理され、ニューラルネットワークへの固定長入力を実現した。
- 性能評価は、クラウドラベルによる主観的MOSスコアとの間でピアソン相関係数および平均二乗誤差(MSE)を用いて行った。
実験結果
リサーチクエスチョン
- RQ1現実世界のクラウドラベル付き音声品質データで訓練されたディープニューラルネットワークが、PESQ や P.563 といった標準的なインストルメンタル指標を上回る性能を示せるか?
- RQ2定常Qスペクトル、iベクトル、メル周波数特徴量といった異なる音響特徴表現が、ニューラルネットワークベースのMOS推定性能にどのように影響を与えるか?
- RQ3時間的特徴統合のためのELMをニューラルネットワークと組み合わせることで、単体のDNNと比較してMOS予測精度が向上するか?
- RQ4ニューラルネットワークモデルが、コーディング歪みに偏った従来の指標よりも、人間の音声品質認識をどれほどよく捉えられるか?
- RQ5主観的MOSスコアで訓練された侵襲的でないニューラルネットワークモデルが、PESQスコアで訓練されたモデルと比較して、ノイズおよびリバーブ歪みに対して優れた性能を示せるか?
主な発見
- メル周波数特徴量を入力とし、ELMを用いた後処理を施したDNNが、最高のピアソン相関係数0.87および最小の平均二乗誤差0.15を達成し、すべてのベンチマークインストルメンタル手法を顕著に上回った。
- iベクトルを用いたDNNは、相関係数0.78およびMSE 0.22を達成し、低次元の話者埋め込み特徴量を用いても強力な性能を示した。
- 定常Qスペクトル特徴量を用いたCNNは、相関係数0.72およびMSE 0.30を達成し、心理的音響にインspiredされた特徴量は有効であるが、メル周波数特徴量に比べてやや精度が低いことが示された。
- 提案されたすべてのニューラルネットワークモデルが、ベンチマークインストルメンタル指標(PESQ:ρ=0.70、MSE=0.25;P.563:ρ=0.55、MSE=0.36;SRMR:ρ=0.60、MSE=0.31)を上回った。
- 結果から、主観的MOSデータで訓練されたニューラルネットワークは、コーディング歪みに偏った従来の指標よりも、人間の知覚的品質をよりよく捉えられることを示した。
- PESQスコアの分布が、主観的MOSよりもSNRに近い傾向にあることが判明し、PESQが現実世界の状況において顕著な限界を有することを示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。