Skip to main content
QUICK REVIEW

[論文レビュー] Improved Lite Audio-Visual Speech Enhancement

Shang-Yi Chuang, Hsin‐Min Wang|arXiv (Cornell University)|Aug 30, 2020
Speech and Audio Processing参考文献 91被引用数 6
ひとこと要約

本稿では、音声・映像特徴の圧縮と頑健な訓練戦略を用いた、コンパクトでプライバシーを守る音声・映像音声強調システムである、改良型ライト音声・映像音声強調(iLAVSE)を提案する。畳み込み再帰ニューラルネットワーク(CRNN)を採用し、高コストな視覚処理、音声・映像の非同期、低品質な視覚データといった課題を効果的に解決し、実世界の制約下(最大100%の視覚データ損失や深刻な非同期を含む)でもベースラインのAVSEおよび音声専用システムを上回る優れた性能を達成する。

ABSTRACT

Numerous studies have investigated the effectiveness of audio-visual multimodal learning for speech enhancement (AVSE) tasks, seeking a solution that uses visual data as auxiliary and complementary input to reduce the noise of noisy speech signals. Recently, we proposed a lite audio-visual speech enhancement (LAVSE) algorithm for a car-driving scenario. Compared to conventional AVSE systems, LAVSE requires less online computation and to some extent solves the user privacy problem on facial data. In this study, we extend LAVSE to improve its ability to address three practical issues often encountered in implementing AVSE systems, namely, the additional cost of processing visual data, audio-visual asynchronization, and low-quality visual data. The proposed system is termed improved LAVSE (iLAVSE), which uses a convolutional recurrent neural network architecture as the core AVSE model. We evaluate iLAVSE on the Taiwan Mandarin speech with video dataset. Experimental results confirm that compared to conventional AVSE systems, iLAVSE can effectively overcome the aforementioned three practical issues and can improve enhancement performance. The results also confirm that iLAVSE is suitable for real-world scenarios, where high-quality audio-visual sensors may not always be available.

研究の動機と目的

  • 音声・映像音声強調(AVSE)システムを実装する際の実用的課題、すなわち視覚処理の高コスト、音声・映像の非同期、低品質な視覚入力に対処すること。
  • プライバシーの損なわれないか、計算コストが増大しないように、ライトAVSE(LAVSE)フレームワークを拡張して耐性を高めること。
  • 視覚センサーが信頼性が低いかリソースが制限される実世界の条件下でも、高い強調性能を維持できるシステムを開発すること。
  • データ拡張およびゼロアウト訓練が、音声・映像の不一致や視覚データの劣化に対処するために有効であることを検証すること。

提案手法

  • iLAVSEシステムは、音声・映像シーケンスの時間的依存性をモデル化するためのLSTM層を備えたマルチモーダルCRNNアーキテクチャを採用している。
  • 視覚データは、潜在的特徴の量子化ユニットを備えた自己符号化器(AE)によって圧縮され、データサイズの削減と、画像再構成が不可能になることでプライバシーの強化が図られる。
  • CRQ(コンパクト表現量子化)モジュールが、計算オーバーヘッドを最小限に抑えるために、AVSEモデルで使用するコンパクトな視覚特徴を抽出する。
  • 音声・映像の非同期は、データ拡張によって軽減される:訓練時にランダムにオフセットされた音声・映像ペアを用いることで、実世界の不一致を模擬する。
  • 低品質な視覚データは、ゼロアウト訓練アプローチでシミュレートされる。訓練中にフレームがランダムにゼロでマスクされ、マスク率は0~100%の範囲で変化する。
  • システムは、PESQおよびSTOI指標を用いて評価される台湾国語動画データセット上で、エンドツーエンドに訓練される。

実験結果

リサーチクエスチョン

  • RQ1視覚データが音声に対して遅延または不一致している場合でも、軽量なAVSEシステムが高い性能を維持できるか?
  • RQ2視覚入力が劣化または部分的に欠落している場合、システムの性能はどの程度か?
  • RQ3拡張された非同期データを用いた訓練が、音声・映像の非同期に強い耐性を高める程度はどの程度か?
  • RQ4合成された低品質な視覚データに対してゼロアウト訓練を実施することで、実際の視覚データ損失下での一般化性能が向上するか?

主な発見

  • iLAVSE(OFR5)は、[-3, 3]の範囲のすべてのテストオフセットでNoisyおよびAOSE(DP)を上回り、やや強い非同期に対しても耐性があることが確認された。
  • 100%の視覚データ損失の条件下でテストした場合、LPR ≥ 30で訓練されたiLAVSEモデルは、PESQおよびSTOIスコアがAOSE(DP)と同等となり、極端な視覚損失下でも劣化が最小限に抑えられていることが示された。
  • LPR ≥ 30で訓練されたiLAVSE(LPR0)は、10%の視覚データ損失でも性能が急激に低下するため、低品質データの訓練が不可欠であることが確認された。
  • LPR ≥ 30で訓練されたモデルは、0~100%の全範囲の視覚データ損失レベルで安定した性能を維持しており、視覚品質の劣化に対して強い耐性を示している。
  • 従来のAVSEおよび音声専用システムよりも優れた強調性能を発揮しており、特に視覚条件が劣悪な場合に顕著で、実世界への適用可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。