Skip to main content
QUICK REVIEW

[論文レビュー] On Psychoacoustically Weighted Cost Functions Towards Resource-Efficient Deep Neural Networks for Speech Denoising

Kai Zhen, Aswin Sivaraman|arXiv (Cornell University)|Jan 29, 2018
Speech and Audio Processing参考文献 17被引用数 3
ひとこと要約

本論文では、PAM-1モデルのマスキング閾値を用いて人間の聴覚に最も敏感な周波数バンドに注目することで、深層ニューラルネットワーク(DNN)ベースの音声ノイズ除去における知覚的品質を向上させる心理物理学的重み付きコスト関数を提案する。この手法により、複雑さを軽減したリソース効率の良いDNNを構築可能となり、標準のMSEで訓練されたモデルに比べて知覚的指標で優れる。

ABSTRACT

We present a psychoacoustically enhanced cost function to balance network complexity and perceptual performance of deep neural networks for speech denoising. While training the network, we utilize perceptual weights added to the ordinary mean-squared error to emphasize contribution from frequency bins which are most audible while ignoring error from inaudible bins. To generate the weights, we employ psychoacoustic models to compute the global masking threshold from the clean speech spectra. We then evaluate the speech denoising performance of our perceptually guided neural network by using both objective and perceptual sound quality metrics, testing on various network structures ranging from shallow and narrow ones to deep and wide ones. The experimental results showcase our method as a valid approach for infusing perceptual significance to deep neural network operations. In particular, the more perceptually sensible enhancement in performance seen by simple neural network topologies proves that the proposed method can lead to resource-efficient speech denoising implementations in small devices without degrading the perceived signal fidelity.

研究の動機と目的

  • モバイルや組み込みシステムなどのリソース制約のあるデバイスへの複雑なDNNを用いた音声ノイズ除去の導入課題に対処すること。
  • 人間の聴覚特性を活用することで、ネットワークの複雑さを増さずに音声の知覚的品質を向上させること。
  • 知覚的に重要な周波数成分に優先順位を付けるコスト関数を構築し、聴こえない領域での誤差を最小限に抑えること。
  • 知覚に配慮した学習が、より単純なネットワークアーキテクチャで、深い・大きなモデルと同等の知覚的性能を達成できるかどうかを評価すること。
  • 知覚的重み付けが、知覚的な音声忠実度を損なわずに、より効率的なDNNを実現できることを示すこと。

提案手法

  • 清音声スペクトログラムからPAM-1心理音響モデルを用いて、グローバルなマスキング閾値を計算し、知覚的に無関係な周波数バンドを同定する。
  • マスキング閾値から導出された知覚的重みを、平均二乗誤差(MSE)損失関数に適用し、聴覚的に重要な周波数領域での誤差に重点を置く。
  • 各周波数バンドの寄与度をその知覚的有意性に応じてスケーリングする心理的重み付きMSEとして、重み付きコスト関数を定義する。
  • TensorFlowで5,000エポックにわたりAdam最適化アルゴリズムを用いて学習を実施し、12種類のネットワークアーキテクチャで重み付きおよび非重み付き損失関数を比較する。
  • 客観的評価にはBSS-Eval指標(SDR、SIR、SAR)を、知覚的評価にはPEASSおよびSTOIを用いて知覚的品質を評価する。
  • モデルの複雑さを浅い(例:256×2)から深い(例:1024×3)まで変化させ、異なるトポロジー間での性能比較を可能にする。

実験結果

リサーチクエスチョン

  • RQ1知覚的重み付きコスト関数は、モデルの複雑さを軽減しつつ、DNNベースの音声ノイズ除去における知覚的品質を向上させることができるか?
  • RQ2知覚的重み付けは、さまざまなネットワークアーキテクチャにおいて、SDR、SIR、SARといった客観的指標にどのように影響を与えるか?
  • RQ3提案手法は、浅く狭いネットワークにおいて、深い・広いモデルと比較してどれほど高い知覚的品質を維持できるか?
  • RQ4損失関数に心理音響的マスキング閾値を組み込むことで、知覚的劣化を伴わずにパラメータ使用の効率性が向上するか?
  • RQ5知覚的重み付けは、リアルタイムで動作する組み込み音声強調アプリケーションにおいて、大規模で計算コストの高いDNNの必要性を低減できるか?

主な発見

  • 知覚的重み付きDNNは、顕著に少ないパラメータ数であっても、非重み付きモデルと同等またはそれ以上の知覚的品質(OPS)を達成した。
  • SIRがわずかに低下(約0.5 dB)したものの、重み付きモデルは知覚的に不快なアーティファクトをより少なく生成し、APSスコアが高かった。
  • STOIスコアは重み付きモデルでわずかに高かったため、話し声の理解性が安定的または向上していた。
  • 浅く狭いネットワークに知覚的コスト関数を適用した場合、複雑さが制限された状況でも、より深いモデルを上回る知覚的指標を達成した。
  • 知覚的品質の損なわれないまま、大規模で複雑なDNNの必要性を減らすことで、リソース効率の良い実装が可能になった。
  • 提案手法は、学習目的に心理音響モデルを統合することで、より効率的かつ知覚的に頑健な音声ノイズ除去システムが実現可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。