Skip to main content
QUICK REVIEW

[論文レビュー] N-HANS: Introducing the Augsburg Neuro-Holistic Audio-eNhancement System

Shuo Liu, Gil Keren|arXiv (Cornell University)|Nov 16, 2019
Speech and Audio Processing参考文献 16被引用数 4
ひとこと要約

N-HANS は、野生の音声を対象とした音声強調のためのTensorFlowベースのPythonツールキットであり、正の参照録音と負の参照録音に条件づけられた二重ブランチ ±補助ネットワークを用いて、ノイズ除去、音源分離、選択的ノイズ抑制を可能にしている。SOTA性能を達成しており、LibriSpeechおよびAudioSetベンチマークにおいて、SDRが最大11.86 dB、PESQが0.92に達し、多様な現実世界の条件下でも頑健であることが示された。

ABSTRACT

N-HANS is a Python toolkit for in-the-wild audio enhancement, including speech, music, and general audio denoising, separation, and selective noise or source suppression. The functionalities are realised based on two neural network models sharing the same architecture, but trained separately. The models are comprised of stacks of residual blocks, each conditioned on additional speech or environmental noise recordings for adapting to different unseen speakers or environments in real life. In addition to a Python API, a command line interface is provided to researchers and developers, both of which are documented at https://github.com/N-HANS/N-HANS. Experimental results indicate that N-HANS achieves outstanding performance, and ensure its reliable usage in real-life audio and speech-related tasks, reaching very high audio and speech quality.

研究の動機と目的

  • 未知のノイズや干渉音によって汚染された現実世界の音声を強調する課題に対処すること。特に低SNRおよび複雑な音響環境下での有効性を確保すること。
  • 共通のコンponentsを有する単一のアーキテクチャで、ノイズ除去、音源分離、選択的ノイズ抑制を統合的に実行できるシステムの開発。
  • 望ましい信号(例:会話や環境警報)を保存しつつ、音声品質と聞き取りやすさを向上させること。
  • 参照ベースの条件づけを通じて、トレーニングデータを超えた未観測の話者や環境に適応可能にすることで、一般化性能を向上させること。

提案手法

  • システムは、正の参照と負の参照に条件づけられる二つの同一の残差畳み込みニューラルネットワークアーキテクチャを用い、±補助ネットワークを形成する。
  • ノイズ混在音声、正の参照、負の参照音声のログマグニチュードSTFTが、それぞれ独立したブランチに供給され、正と負の成分の埋め込みベクトルが生成される。
  • 強調ネットワークは、ノイズ混在音声入力に加え、正および負の埋め込みベクトルを組み合わせて、洗練された出力信号を生成する。
  • 音声の自然さを保持し、歪みを最小限に抑えるために、知覚的および目的的損失関数の組み合わせを用いて、エンド・ツー・エンドでモデルを訓練する。
  • スクリプトや音声・音声処理パイプラインへの統合を可能にするため、コマンドラインインターフェースとPython APIを提供する。
  • 音声特徴抽出のため、openXBOWおよびauDeepとのプラグイン統合をサポートする。

実験結果

リサーチクエスチョン

  • RQ1同一のニューラルネットワークアーキテクチャが、参照条件づけを用いて、ノイズ除去、分離、選択的抑制という複数の音声強調タスクを効果的に処理できるか。
  • RQ2参照録音のみを用いて、未観測の話者および環境ノイズ条件に一般化できるか。
  • RQ3固定モデルベースラインと比較して、参照ベースの条件づけが低SNRおよび複雑な音響状況下でどれほど性能を向上させるか。
  • RQ4システムは、特定のノイズや干渉のみを抑制しつつ、アラームなどの有用な非会話信号を保存できるか。
  • RQ5S/N比の変動が、強調音声の知覚的および目的的品質に与える影響は何か。

主な発見

  • LibriSpeechおよびAudioSetのテストセットにおいて、N-HANSは10 dBの入力SNRで11.86 dBの信号対歪み比(SDR)を達成し、強力なノイズ抑制能力を示した。
  • 8 dBの正と負のノイズを伴う選択的ノイズ除去において、PESQスコアが0.90、SDRが12.12 dBに達し、高い話者の品質と頑健性を示した。
  • VoxCelebにおける音源分離において、N-HANSは全混合音声でSDRが4.79 dBを達成し、Deep Clustering(0.84 dB)およびDeep Attractor(1.81 dB)を上回った。
  • 高SNR条件下でも、STOIスコアが0.90に達し、話者の明瞭さが保持されていることが示された。
  • 10 dB SNRでメルケプストラム歪み(MCD)が5.98にまで低下し、スペクトル歪みが最小限に抑えられ、信号忠実度が高かった。
  • 多様なノイズタイプおよび話者コンビネーションにおいて一貫した性能を示し、未観測の環境への一般化が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。