Skip to main content
QUICK REVIEW

[論文レビュー] Frequency Domain Multi-channel Acoustic Modeling for Distant Speech Recognition

Minhua Wu, Kenichi Kumatani|arXiv (Cornell University)|Mar 13, 2019
Speech and Audio Processing参考文献 33被引用数 5
ひとこと要約

本論文は、音声認識(ASR)基準を用いて空間フィルタリング、特徴抽出、LSTM分類を同時に最適化する完全に学習可能なマルチチャネル(MC)音響モデルフレームワークを提案する。ビームフォーマー係数による初期化と周波数ドメインでのMC入力を採用することで、単一チャネルのLFBEシステムに対して16.5%の相対的WER削減、および従来の7マイクフォーマーに対して9.5%の相対的WER向上を達成した。

ABSTRACT

Conventional far-field automatic speech recognition (ASR) systems typically employ microphone array techniques for speech enhancement in order to improve robustness against noise or reverberation. However, such speech enhancement techniques do not always yield ASR accuracy improvement because the optimization criterion for speech enhancement is not directly relevant to the ASR objective. In this work, we develop new acoustic modeling techniques that optimize spatial filtering and long short-term memory (LSTM) layers from multi-channel (MC) input based on an ASR criterion directly. In contrast to conventional methods, we incorporate array processing knowledge into the acoustic model. Moreover, we initialize the network with beamformers' coefficients. We investigate effects of such MC neural networks through ASR experiments on the real-world far-field data where users are interacting with an ASR system in uncontrolled acoustic environments. We show that our MC acoustic model can reduce a word error rate (WER) by~16.5\% compared to a single channel ASR system with the traditional log-mel filter bank energy (LFBE) feature on average. Our result also shows that our network with the spatial filtering layer on two-channel input achieves a relative WER reduction of~9.5\% compared to conventional beamforming with seven microphones.

研究の動機と目的

  • 従来のASRシステムが音声強調と音響モデリングを別々に最適化するため、性能が最適でないという制限を克服すること。
  • ASR目的関数を用いて空間フィルタリング、特徴抽出、分類を統合的に最適化する、エンド・トゥ・エンドで学習可能なマルチチャネル音響モデルを構築すること。
  • アレイ信号処理の知識を深層ニューラルネットワークアーキテクチャに組み込むことで、現実世界の混响やノイズが強い遠方環境における耐障害性が向上するかを検証すること。
  • ビームフォーマー係数およびメルフィルターバンクパラメータによるネットワーク初期化が認識精度に与える影響を評価すること。

提案手法

  • 計算効率を向上させるとともに周波数ごとの処理を可能にするために、周波数ドメインでのマルチチャネル入力(127個のDFT係数)を採用した。
  • 3種類のMCネットワークアーキテクチャを提案した:複素アフィン変換(CAT)、マックスプーリングを用いた決定的空間フィルタリング(DSF)、周波数に依存しない重みで空間フィルタを線形結合するエラスティック空間フィルタリング(ESF)。
  • 空間フィルタリング層は、既知の音源方向から導出されたビームフォーマー係数で初期化され、ネットワークにアレイ処理の知識が埋め込まれた。
  • 特徴抽出および分類部は、768ユニットの5層LSTMに続き、音響ユニット分類用のソフトマックス層で実装された。
  • すべてのネットワークは、Adam最適化法を用いた交差エントロピー損失でエンド・トゥ・エンドで学習され、最初の層はランダム重みまたはビームフォーマー係数で初期化された。
  • SNRが変動する実環境の遠方データを用いて評価され、主な指標として相対的WER削減が用いられた。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワーク内で空間フィルタリング、特徴抽出、音響分類を同時に最適化することで、従来のパイプラインシステムに比べてASR性能が向上するか?
  • RQ2空間フィルタリング層をビームフォーマー係数で初期化することで、マルチチャネルASRにおける収束性および認識精度が向上するか?
  • RQ3MCネットワークアーキテクチャの選択(CAT, DSF, ESF)が、実環境の遠方条件下での認識性能に与える影響は何か?
  • RQ4学習可能なフィルターバンクは、ビームフォームド入力と組み合わせた場合、認識精度にどのような影響を与えるか?
  • RQ5入力マイク数の増加が認識性能に与える影響は何か?性能は特定のセンサ数で飽和するか?

主な発見

  • 提案されたエラスティック空間フィルタリング(ESF)ネットワークが最も優れた性能を示し、周波数に依存しない柔軟な空間フィルタの組み合わせにより、CATおよびDSFアーキテクチャを上回った。
  • 完全に学習可能なMC音響モデルは、実環境の遠方データにおいて単一チャネルのLFBEシステムに対して16.5%の相対的WER削減を達成した。
  • 2マイク入力のモデルは、従来の7マイクビームフォーマーに比べて9.5%の相対的WER削減を示し、優れた耐障害性を示した。
  • 最初の層をビームフォーマー係数で初期化した場合、ランダム初期化よりも顕著に高い認識精度が得られ、信号処理の事前知識の価値を裏付けた。
  • 認識性能は約4マイクで飽和し、2チャネルを超えてはほとんど向上が得られず、追加のセンサによる利得が小さくなる傾向を示した。
  • ビームフォームドデータ上で学習された可学習フィルターバンクは、さらに性能向上に寄与した。これは、特徴抽出段階でさえもエンド・トゥ・エンド最適化の恩恵を受ける可能性があることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。