Skip to main content
QUICK REVIEW

[論文レビュー] Multichannel Speech Enhancement by Raw Waveform-mapping using Fully Convolutional Networks

Changle Liu, Szu‐Wei Fu|arXiv (Cornell University)|Sep 26, 2019
Speech and Audio Processing参考文献 64被引用数 4
ひとこと要約

本稿では、時間領域で直接に多チャンネル音声強調を実行するための、Sincおよび拡張畳み込みを組み込んだ完全畳み込みネットワーク、SDFCNおよびrSDFCNを提案する。スペクトル推定を回避することで、内耳マイクおよび分散マイク設定の両方で優れたノイズ除去性能を達成し、残差接続を組み込むことでさらに性能向上が達成された。

ABSTRACT

In recent years, waveform-mapping-based speech enhancement (SE) methods have garnered significant attention. These methods generally use a deep learning model to directly process and reconstruct speech waveforms. Because both the input and output are in waveform format, the waveform-mapping-based SE methods can overcome the distortion caused by imperfect phase estimation, which may be encountered in spectral-mapping-based SE systems. So far, most waveform-mapping-based SE methods have focused on single-channel tasks. In this paper, we propose a novel fully convolutional network (FCN) with Sinc and dilated convolutional layers (termed SDFCN) for multichannel SE that operates in the time domain. We also propose an extended version of SDFCN, called the residual SDFCN (termed rSDFCN). The proposed methods are evaluated on two multichannel SE tasks, namely the dual-channel inner-ear microphones SE task and the distributed microphones SE task. The experimental results confirm the outstanding denoising capability of the proposed SE systems on both tasks and the benefits of using the residual architecture on the overall SE performance.

研究の動機と目的

  • スペクトルマッピングに基づく音声強調の限界、特に位相推定誤差を解消するため、時間領域における生波形マッピング手法を開発すること。
  • 単一チャンネルから多チャンネルへの波形マッピング技術の拡張を図り、複雑な音響環境下でも強力な音声強調を実現すること。
  • 効率的かつ効果的な多チャンネル音声強調を実現するため、Sincおよび拡張畳み込みを組み込んだ完全畳み込みネットワークアーキテクチャを設計すること。
  • 本手法を、内耳マイクおよび分散マイクの2つの異なる多チャンネル音声強調タスクにおいて評価すること。
  • 残差接続が波形マッピングモデルの性能および安定性に与える影響を調査すること。

提案手法

  • 提案されたSDFCNは、生波形から直接最適なフィルタバンクを学習可能なSinc畳み込み層を採用し、パラメータ効率の高いスペクトルモデリングを実現する。
  • パラメータ数を増加させずに受容 field を拡大するため、拡張畳み込みが導入され、長距離の時間的依存性を捉える能力が向上する。
  • 残差SDFCN(rSDFCN)は、勾配の流れを改善し、訓練の安定性を高めるためのスキップ接続を統合し、深層構造における特徴学習を強化する。
  • モデルは時間領域で直接多チャンネル入力波形を処理し、スペクトル領域手法に内在する位相推定誤差を回避する。
  • マルチヘッドアテンション機構は使用されていない。代わりに、拡張およびSinc畳み込みによる階層的特徴学習に依存することで、強力な強調性能を実現する。
  • ネットワークは、強調波形とクリアな波形の間の平均二乗誤差損失を用いて、エンドツーエンドで訓練される。

実験結果

リサーチクエスチョン

  • RQ1Sincおよび拡張畳み込みを組み込んだ完全畳み込みネットワークは、時間領域における多チャンネル音声強調を効果的に実行できるか?
  • RQ2提案されたSDFCNアーキテクチャは、既存の波形マッピングモデルと比較して、多チャンネルデータにおけるノイズ除去性能で優れているか?
  • RQ3残差接続は、多チャンネル設定における波形マッピングモデルの性能および収束性にどのような影響を与えるか?
  • RQ4本手法は、二重チャンネルの内耳マイクおよび分散マイクタスクにおいて、従来のスペクトルマッピングベースのシステムと比較して、音声品質および聞き取りやすさの面で優れているか?
  • RQ5Sincおよび拡張畳み込みの設計により、パラメータ数を削減しながらも、強調精度を維持または向上できるか?

主な発見

  • 提案されたSDFCNは、二重チャンネルの内耳マイクおよび分散マイクタスクの両方で、音声品質およびノイズ低減性能に顕著な向上を達成した。
  • rSDFCNバージョンはベースラインのSDFCNを上回り、残差接続がモデルの安定性および性能を向上させることを示した。
  • 特に音声の聞き取りやすさを保ちつつアーチファクトを低減する点で、最先端のスペクトルマッピングシステムと比較しても競争力のある結果を得た。
  • Sinc畳み込みの使用により、ネットワークが生波形から直接最適なフィルタ応答を学習可能となり、モデリング効率が向上した。
  • 拡張畳み込み層は、モデルの複雑さを増加させることなく、長距離の時間的依存性を効果的に捉えた。
  • 生波形に対するエンドツーエンド訓練により、位相再構成の必要がなくなり、強調出力の歪みが低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。