Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Geometry Spatial Acoustic Modeling for Distant Speech Recognition

Kenichi Kumatani, Minhua Wu|arXiv (Cornell University)|Mar 13, 2019
Speech and Audio Processing参考文献 30被引用数 4
ひとこと要約

本稿では、遠方音声認識のための、ビームフォーミングとLSTMベースの音響モデルを統合するマルチジオメトリ空間音響モデリングフレームワークを提案する。複数のアレイジオメトリに適したビームフォーマー重みで空間フィルターレイヤーを初期化し、LSTMと共同最適化することで、マイク配置の不一致に対しても頑健な性能を達成し、単一チャネルシステムと比較して、一致条件では13.4%、不一致条件では12.7%のWER低減を実現。7マイクの従来型ビームフォーミングでさえも上回る性能を発揮する。

ABSTRACT

The use of spatial information with multiple microphones can improve far-field automatic speech recognition (ASR) accuracy. However, conventional microphone array techniques degrade speech enhancement performance when there is an array geometry mismatch between design and test conditions. Moreover, such speech enhancement techniques do not always yield ASR accuracy improvement due to the difference between speech enhancement and ASR optimization objectives. In this work, we propose to unify an acoustic model framework by optimizing spatial filtering and long short-term memory (LSTM) layers from multi-channel (MC) input. Our acoustic model subsumes beamformers with multiple types of array geometry. In contrast to deep clustering methods that treat a neural network as a black box tool, the network encoding the spatial filters can process streaming audio data in real time without the accumulation of target signal statistics. We demonstrate the effectiveness of such MC neural networks through ASR experiments on the real-world far-field data. We show that our two-channel acoustic model can on average reduce word error rates (WERs) by~13.4 and~12.7% compared to a single channel ASR system with the log-mel filter bank energy (LFBE) feature under the matched and mismatched microphone placement conditions, respectively. Our result also shows that our two-channel network achieves a relative WER reduction of over~7.0% compared to conventional beamforming with seven microphones overall.

研究の動機と目的

  • 訓練時とテスト時のマイクアレイジオメトリの不一致によって引き起こされる遠方ASR性能の低下を解消すること。
  • 空間フィルタリングと音響モデリングを統合したエンドツーエンドで学習可能なフレームワークとして統合し、アレイ構成の変動に対する耐性を高めること。
  • DNNマスクベースのビームフォーミングのようなバッチ処理手法とは異なり、信号統計の蓄積を必要としないリアルタイム推論を可能にすること。
  • 複数のマイクを備えたDNNが、複数のビームフォーマー構成を内蔵し、マイク数が少ない場合でも従来型ビームフォーミングを上回ることを実証すること。
  • 複数のマイク配置を同時に学習することで、多様な実世界のアレイジオメトリにおいて優れたASR精度を達成すること。

提案手法

  • 完全結合による空間フィルター出力の統合を用いる2チャネル(MC)ニューラルネットワークアーキテクチャと、周波数に跨る重みの縛りを用いる最大エネルギー選択方式の2種類を提案。
  • 複数のアレイジオメトリと視線方向に最適化されたビームフォーマー重みで空間フィルタリング(SF)レイヤーを初期化し、ネットワークがさまざまなビームフォーマー型を内蔵可能にする。
  • 計算効率を高めるために周波数ドメインで全処理を実行し、波の伝播と指向性をモデル化するための複素数演算を用いる。
  • ASR評価基準を用いて段階的にエンドツーエンドで最適化し、空間フィルターとLSTMレイヤーを同時に学習する。
  • 単一チャネルおよびマルチチャネル入力の両方に対応する共通の特徴抽出および分類パスを採用し、MCモデルは事前学習済みのLFBEベースラインから初期化する。
  • WTSFアーキテクチャでは周波数チャンネル間で重みを共有することでパラメータ数を削減し、アレイ構成にわたる一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1正確なキャリブレーションを要せず、複数のマイクアレイジオメトリを統合的にモデル化できる統一された深層ニューラルネットワークアーキテクチャは有効か?
  • RQ2空間フィルタリングと音響モデリングを共同最適化することで、アレイジオメトリの不一致下でもASRの耐性が向上するか?
  • RQ3少ないマイク数であっても、学習可能な空間フィルタリングレイヤーが従来型ビームフォーミングを上回るWER性能を達成できるか?
  • RQ4テスト時のアレイ構成がトレーニング時の構成と異なる場合、マルチジオメトリ学習が性能に与える影響は何か?
  • RQ5提案手法は、信号統計の蓄積を必要とせず、ストリーミング音声をリアルタイムで処理できるか?

主な発見

  • 2マイクのマルチジオメトリモデルは、マッチドマイクジオメトリ条件下で単一チャネルのLFBEベースラインと比較して13.4%のWER低減を達成した。
  • マイク配置の不一致条件下でも、同じモデルは12.7%の相対的WER低減を達成し、アレイジオメトリの変動に対して高い頑健性を示した。
  • 7マイクの従来型ビームフォーミングでさえも、2マイクの本手法が7.0%以上の相対的WER低減を達成し、優れた性能を発揮した。
  • 重みの縛りとマックスプールを用いるWTSFアーキテクチャは、完全結合によるESFと比較して、特に不一致条件下でわずかに優れた性能を示した。
  • マルチジオメトリモデルは多様なアレイ構成で一貫した性能を維持するが、単一ジオメトリモデルはテスト時の構成がトレーニング時から逸脱するにつれて著しく性能が低下した。
  • 本手法は、DNNマスクベースのビームフォーミングとは異なり、双方向処理や信号統計の蓄積を必要とせず、リアルタイム推論を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。