Skip to main content
QUICK REVIEW

[論文レビュー] MFFCN: Multi-layer Feature Fusion Convolution Network for Audio-visual Speech Enhancement.

Xinmeng Xu, Dongxiang Xu|arXiv (Cornell University)|Jan 2, 2021
Speech and Audio Processing参考文献 38被引用数 5
ひとこと要約

本稿では、騒音環境下での音声強調性能を向上させるために、音声と視覚的音声特徴を段階的に融合するマルチレイヤー特徴融合畳み込みネットワーク(MFFCN)を提案する。単純な連結を超えたモodal同調を学習することで、相対的改善が最大24%に達し、SNR -15 dBでPESQが1.21から2.06に向上する。

ABSTRACT

The purpose of speech enhancement is to extract target speech signal from a mixture of sounds generated from several sources. Speech enhancement can potentially benefit from the visual information from the target speaker, such as lip move-ment and facial expressions, because the visual aspect of speech isessentially unaffected by acoustic environment. In order to fuse audio and visual information, an audio-visual fusion strategy is proposed, which goes beyond simple feature concatenation and learns to automatically align the two modalities, leading to more powerful representation which increase intelligibility in noisy conditions. The proposed model fuses audio-visual featureslayer by layer, and feed these audio-visual features to each corresponding decoding layer. Experiment results show relative improvement from 6% to 24% on test sets over the audio modalityalone, depending on audio noise level. Moreover, there is a significant increase of PESQ from 1.21 to 2.06 in our -15 dB SNR experiment.

研究の動機と目的

  • 音声のみの手法が困難な騒音環境下での音声品質の低下に取り組む。
  • くちびるの動きや顔の表情といった視覚的音声の手がかりを活用し、背景ノイズに対する耐性を高める。
  • 複数のネットワークレイヤーで音声と視覚特徴の同調と融合を学習するディープラーニングフレームワークを開発する。
  • 特に低SNR条件下で、音声のみのベースラインを上回る音声強調性能を向上させる。
  • エンドツーエンドの音声・視覚特徴融合により、音声の明瞭性と知覚的品質を向上させる。

提案手法

  • エンコーダーおよびデコーダーの各レイヤーで音声と視覚特徴を融合するマルチレイヤー特徴融合(MFF)戦略を提案する。
  • 音声および視覚ストリームのためのモダリティ固有の畳み込みブロックを備えた共有エンコーダ-デコーダー構造を用いる。
  • 各レイヤーで可学習な融合モジュールを適用し、音声と視覚表現の動的同調と結合を実現する。
  • モダリティ固有の特徴を復元パスに統合し、強化された音声信号を再構築する。
  • 音声品質と明瞭性を最適化する損失関数を用いて、モデルをエンドツーエンドで訓練する。
  • 微細な時間的特徴を各レイヤー間で保持するために、残差接続とスイープ接続を採用する。

実験結果

リサーチクエスチョン

  • RQ1音声と視覚特徴のマルチレイヤー融合は、音声のみの手法と比較して音声強調性能を向上させるか?
  • RQ2融合モジュールによるモダリティ同調の学習は、低SNR条件下での音声品質にどのように影響するか?
  • RQ3視覚的情報は、騒音環境下でどれほど明瞭性と知覚的品質を向上させるか?
  • RQ4レイヤー単位の融合は、PESQおよびその他の客観的音声品質指標にどのような影響を与えるか?
  • RQ5特に-15 dBのような挑戦的なSNR条件下で、モデルの性能はどのように変動するか?

主な発見

  • MFFCNモデルは、ノイズレベルに応じて、音声のみのモデルと比較してテストセットで6%から24%の相対的改善を達成する。
  • -15 dB SNR条件下で、PESQスコアは音声のみの状態の1.21から2.06に上昇し、顕著な知覚的品質の向上を示す。
  • 提案されたマルチレイヤー融合戦略は、モダリティ間の動的同調を学習することで、単純な特徴連結を上回る性能を発揮する。
  • モデルは多様なノイズ条件においても頑健な性能を示し、音声の明瞭性に一貫した向上効果を示す。
  • 視覚特徴の統合により、特に高ノイズ状況下でより安定的かつ正確な音声再構築が可能になる。
  • エンドツーエンドの訓練フレームワークにより、補完的な音声・視覚的手がかりを効果的に活用する強化された音声出力を学習できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。