Skip to main content
QUICK REVIEW

[論文レビュー] VSEGAN: Visual Speech Enhancement Generative Adversarial Network

Xinmeng Xu, Yan Wang|arXiv (Cornell University)|Feb 4, 2021
Speech and Audio Processing被引用数 4
ひとこと要約

本論文では、唇の動きからの視覚的情報を用いてノイズの多い音声を強化する生成的対抗ネットワーク、VSEGANを提案する。マルチレイヤー畳み込みエンコーダ・デコーダアーキテクチャを用いて音声と視覚特徴を統合し、最小二乗GAN損失で訓練することで、VSEGANはGRIDデータセットにおいて、音声品質および話者の理解性の面で最先端の性能を達成した。0 dB SNRでPESQ 3.10、STOI 89.8%を記録し、音声のみのモデルやベースラインの音声・視覚モデルを上回った。

ABSTRACT

Speech enhancement is an essential task of improving speech quality in noise scenario. Several state-of-the-art approaches have introduced visual information for speech enhancement,since the visual aspect of speech is essentially unaffected by acoustic environment. This paper proposes a novel frameworkthat involves visual information for speech enhancement, by in-corporating a Generative Adversarial Network (GAN). In par-ticular, the proposed visual speech enhancement GAN consistof two networks trained in adversarial manner, i) a generator that adopts multi-layer feature fusion convolution network to enhance input noisy speech, and ii) a discriminator that attemptsto minimize the discrepancy between the distributions of the clean speech signal and enhanced speech signal. Experiment re-sults demonstrated superior performance of the proposed modelagainst several state-of-the-art

研究の動機と目的

  • ノイズの多い環境における音声強調を、唇の動きからの視覚的情報を活用することで向上させること。
  • 低SNR条件下で話者の理解性および音声品質を保持できない音声のみの音声強調モデルの限界を解消すること。
  • 深層生成モデリングを用いた、ロバストでエンドツーエンドの音声・視覚音声強調フレームワークを構築すること。
  • 視覚的キューを用いた対抗的訓練が、強調された音声の知覚的品質および理解性を向上させるかどうかを調査すること。
  • マルチレイヤー特徴統合とGANベースの訓練が、視覚的音声強調のロバスト性および性能を向上させるかどうかを実証すること。

提案手法

  • 生成器は、ノイズの多い音声と視覚的な動画フレームを入力として受け取り、強調された音声を出力する条件付きGANフレームワークを採用する。
  • 生成器は、音声(Conv-A)と視覚(Conv-V)の別々のエンコーダを備えたマルチレイヤー特徴統合畳み込みネットワークを採用し、その後に音声・視覚統合(Conv-AV)と逆畳み込みを用いたデコーダが続く。
  • 識別器は、実際のクリアな音声と生成器が生成した強調音声を区別するように訓練され、消失勾配を軽減するために最小二乗GAN損失が用いられる。
  • 訓練目的関数は、知覚的損失(L1)とGAN損失を組み合わせており、両者のバランスをとるためにハイパーパrameter λ = 100 が使用される。
  • 音声特徴は、log-Melスペクトログ램(80バンド、40msウィンドウ、10msホップ)として表現され、動画フレームは空間的および時間的畳み込みを施した5フレームのクリップとして処理される。
  • ADAM最適化アルゴリズムを用いて70エポック分、固定学習率1e-4、バッチサイズ8で訓練が行われる。
Fig. 1 : Network architecture of generator. Conv-A, Conv-V, Conv-AV, BN, and Deconv denote convolution of audio encoder, convolution of video encoder, convolution of audio-visual fusion, batch normalization, and transposed convolution.
Fig. 1 : Network architecture of generator. Conv-A, Conv-V, Conv-AV, BN, and Deconv denote convolution of audio encoder, convolution of video encoder, convolution of audio-visual fusion, batch normalization, and transposed convolution.

実験結果

リサーチクエスチョン

  • RQ1唇の動きからの視覚的情報は、ノイズの多い環境下での音声強調性能を顕著に向上させることができるか?
  • RQ2対抗的訓練を伴うGANベースのフレームワークを組み込むことで、音声・視覚音声強調における知覚的品質および理解性が向上するか?
  • RQ3音声ストリームと視覚ストリーム間のマルチレイヤー特徴統合が、強調モデルの性能および訓練安定性に与える影響は何か?
  • RQ4PESQおよびSTOI指標の観点から、VSEGANは最先端の音声・視覚音声強調モデルと比較してどのように差をつけるか?
  • RQ5特に低SNR条件下において、提案されたモデルはさまざまなSNR条件に耐えうるロバスト性を有しているか?

主な発見

  • 0 dB SNR条件下で、VSEGANはPESQスコア3.10、STOIスコア89.8%を達成し、SEGAN(PESQ: 2.21、STOI: 77.3%)およびベースラインモデル(PESQ: 2.94、STOI: 87.9%)を上回った。
  • -5 dB SNR条件下でも、VSEGANはPESQ 2.88、STOI 86.8%を達成し、重度のノイズ環境下でも優れた性能を示した。
  • GRIDデータセットにおいて、VSEGANはOVA(PESQ: 2.69、STOI: 89.75%)およびAV(SE)2(PESQ: 2.98、STOI: 89.44%)といった最近の最先端モデルを、PESQおよびSTOI両方の指標で上回った。
  • 視覚特徴統合とGAN訓練は、強調品質を顕著に向上させたことが、SEGAN(音声のみ)とVSEGAN(音声・視覚GAN)の性能差から明らかになった。
  • スペクトログラムの可視化結果から、VSEGANはベースラインモデルや生成器のみのモデルと比較して、より多くの微細なスペクトルディテールを保持し、ノイズをより効果的に低減していることが確認された。
  • モデルの性能向上は、視覚的キューの統合と対抗的訓練の両方の効果に起因しており、信号ベースの損失のみでは達成できない知覚的品質の向上が実現された。
Fig. 2 : Network architecture of discriminator, and GAN training procedure.
Fig. 2 : Network architecture of discriminator, and GAN training procedure.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。