Skip to main content
QUICK REVIEW

[論文レビュー] VoiceFilter-Lite: Streaming Targeted Voice Separation for On-Device Speech Recognition

Quan Wang, Ignacio López Moreno|arXiv (Cornell University)|Sep 9, 2020
Speech and Audio Processing参考文献 25被引用数 10
ひとこと要約

VoiceFilter-Lite は、スフィア埋め込みを用いて非ターゲット音声を選択的に抑制することで、ASR の性能を向上させるコンact でリアルタイムのデバイス内音声分離モデルであり、クリーンな状態や非音声ノイズ下でも正確性を維持する。これは非対称損失関数と適応的抑制強度を用いることで達成され、2.2 MB、8ビット整数モデルとして実装され、クリーンまたは非音声ノイズ下では WER の低下がなく、音声重なり状況下では相対的に 27.7% の WER 改善が得られる。

ABSTRACT

We introduce VoiceFilter-Lite, a single-channel source separation model that runs on the device to preserve only the speech signals from a target user, as part of a streaming speech recognition system. Delivering such a model presents numerous challenges: It should improve the performance when the input signal consists of overlapped speech, and must not hurt the speech recognition performance under all other acoustic conditions. Besides, this model must be tiny, fast, and perform inference in a streaming fashion, in order to have minimal impact on CPU, memory, battery and latency. We propose novel techniques to meet these multi-faceted requirements, including using a new asymmetric loss, and adopting adaptive runtime suppression strength. We also show that such a model can be quantized as a 8-bit integer model and run in realtime.

研究の動機と目的

  • クリーンまたは非音声ノイズ下での性能低下を伴わずに、マルチトークャー環境下での ASR 性能を向上させる軽量でデバイス内音声分離モデルの開発。
  • CPU、メモリ、バッテリー消費を最小限に抑えたリソース制限のあるデバイス上でリアルタイムでストリーミング推論を実現すること。
  • 音声再構成を経由せずに ASR 入力特徴(例:フィルターバンクエネルギー)上で直接処理できるように設計し、計算コストを低減すること。
  • 常に安全であるよう設計し、ASR 性能を損なわないようにしつつ、音声重なり状況下での顕著な向上を実現すること。
  • 低遅延かつ高効率に動作する 8 ビット整数形式への量子化が可能なモデルのデプロイを可能にすること。

提案手法

  • 音声特徴(例:スタックドログメルフィルターバンクエネルギー)を入力とし、音声再構成を経由せずに強化された特徴を出力するフレーム単位のフロントエンドプロセッサとして動作する。
  • 参照音声クリップから得られるスフィア判別型 d-vector を用いて分離を条件づけ、ターゲット音声のフィルタリングを実現する。
  • 訓練時に過剰抑制を防ぐために非対称 L2 損失関数を導入し、非音声またはクリーンな状況下での性能低下を回避する。
  • 推論時に移動平均係数(β=0.8)を用いて適応的抑制強度を適用し、入力信号の特性に応じて抑制を動的に調整する。
  • モデルを 8 ビット整数形式に量子化し、メモリおよび計算コストを最小限に抑えたデバイス内での効率的推論を可能にする。
  • 低遅延ストリーミング推論をサポートするため、双方向 RNN や時空間畳み込みを回避するアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ1クリーンまたは非音声ノイズ下での性能低下を伴わずに、重なり音声状況下での ASR 性能を向上させる軽量でデバイス内音声分離モデルは可能か?
  • RQ2どのような訓練手法により、多様な音響環境下でも過剰抑制を避けて安全に保てるか?
  • RQ3ノイズ下での性能向上とクリーンまたは非音声環境下での耐性の間で、最適なトレードオフは何か?
  • RQ4音声再構成を経由せずに ASR 入力特徴上で直接処理できるモデルは設計可能か?計算コストの低減が可能か?
  • RQ5どのような量子化およびアーキテクチャ的選択が、リソース消費を最小限に抑えながらリアルタイムで低遅延推論を実現できるか?

主な発見

  • VoiceFilter-Lite モデルは、現実的でリアルな音声クエリデータセットにおける追加音声ノイズ下で、相対的に 27.7%(相対的に 49.0%)の WER 改善を達成し、クリーンまたは非音声ノイズ下では WER の低下がなかった。
  • 非対称 L2 損失関数を用いることで、標準 L2 損失と比較して非音声ノイズ下での WER の低下が 80% 減少し、音声重なり状況下でも高い性能向上を維持した。
  • β=0.8 で設定した適応的抑制強度により、非音声ノイズ下での WER の低下がほぼゼロに抑えられ、同時に音声重なり状況下でも顕著な性能向上を達成した。
  • モデルは 2.2 MB に圧縮され、8 ビット整数形式に量子化可能であり、CPU、メモリ、バッテリー消費を最小限に抑えながらリアルタイムのデバイス内推論が可能となった。
  • スタックドフィルターバンク入出力構成により、フレームのサブサンプリングが可能となり、CPU コストが削減された一方で、文脈情報を保持し、効率性が向上した。
  • 異なる入力特徴タイプ(FFT 振幅、フィルターバンク、スタックドフィルターバンク)において一貫した性能を維持したが、スタックドフィルターバンクが、より高い効率性と文脈保持性の観点から好ましいとされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。