Skip to main content
QUICK REVIEW

[论文解读] Multi-Geometry Spatial Acoustic Modeling for Distant Speech Recognition

Kenichi Kumatani, Minhua Wu|arXiv (Cornell University)|Mar 13, 2019
Speech and Audio Processing参考文献 30被引用 4
一句话总结

该论文提出了一种多几何结构空间声学建模框架,将波束成形与基于LSTM的声学建模统一起来,用于远场语音识别。通过使用多种阵列几何结构的波束成形权重初始化空间滤波层,并与LSTM联合优化,该模型在麦克风位置不匹配的情况下表现出鲁棒性能,相比单通道系统,词错误率(WER)分别降低了13.4%(匹配情况)和12.7%(不匹配情况),甚至优于7麦克风的传统波束成形系统。

ABSTRACT

The use of spatial information with multiple microphones can improve far-field automatic speech recognition (ASR) accuracy. However, conventional microphone array techniques degrade speech enhancement performance when there is an array geometry mismatch between design and test conditions. Moreover, such speech enhancement techniques do not always yield ASR accuracy improvement due to the difference between speech enhancement and ASR optimization objectives. In this work, we propose to unify an acoustic model framework by optimizing spatial filtering and long short-term memory (LSTM) layers from multi-channel (MC) input. Our acoustic model subsumes beamformers with multiple types of array geometry. In contrast to deep clustering methods that treat a neural network as a black box tool, the network encoding the spatial filters can process streaming audio data in real time without the accumulation of target signal statistics. We demonstrate the effectiveness of such MC neural networks through ASR experiments on the real-world far-field data. We show that our two-channel acoustic model can on average reduce word error rates (WERs) by~13.4 and~12.7% compared to a single channel ASR system with the log-mel filter bank energy (LFBE) feature under the matched and mismatched microphone placement conditions, respectively. Our result also shows that our two-channel network achieves a relative WER reduction of over~7.0% compared to conventional beamforming with seven microphones overall.

研究动机与目标

  • 解决训练与测试条件下麦克风阵列几何结构不匹配导致的远场自动语音识别(ASR)性能下降问题。
  • 将空间滤波与声学建模统一为一个端到端可训练的框架,以提升对阵列配置变化的鲁棒性。
  • 实现实时推理,无需累积信号统计量,与DNN掩蔽波束成形等批处理方法不同。
  • 证明多通道DNN能够涵盖多种波束成形配置,并在麦克风数量更少的情况下仍优于传统波束成形。
  • 通过同时在多种麦克风配置上进行训练,实现在多样化真实世界阵列几何结构下的卓越ASR准确率。

提出的方法

  • 提出两种多通道(MC)神经网络架构:一种采用空间滤波输出的全连接融合,另一种采用频率绑定权重并结合最大能量选择机制。
  • 使用为多种阵列几何结构和波束成形方向设计的波束成形权重初始化空间滤波(SF)层,使网络能够涵盖多种波束成形类型。
  • 所有处理均在频域进行以提高计算效率,使用复数运算来建模波传播与方向性。
  • 采用分阶段方式,使用ASR损失函数对整个模型进行端到端优化,联合训练空间滤波层与LSTM层。
  • 为单通道和多通道输入共享特征提取与分类路径,MC模型从预训练的LFBE基线模型初始化。
  • 在WTSF架构中,对频率子带实施权重共享,以减少参数量并提升在不同阵列配置下的泛化能力。

实验结果

研究问题

  • RQ1统一的深度神经网络架构是否能在无需精确校准的情况下有效建模多种麦克风阵列几何结构?
  • RQ2空间滤波与声学建模的联合优化是否能提升在阵列几何结构不匹配条件下的ASR鲁棒性?
  • RQ3可学习的空间滤波层是否能在麦克风数量更少的情况下,优于传统波束成形,降低词错误率?
  • RQ4当测试阵列配置与训练配置不同时,多几何结构训练对性能有何影响?
  • RQ5所提出的模型是否能在不累积信号统计量的情况下实现实时流式音频处理?

主要发现

  • 在麦克风几何结构匹配条件下,两通道多几何结构模型相比单通道LFBE基线,词错误率(WER)降低了13.4%。
  • 在麦克风位置不匹配条件下,相同模型实现了12.7%的相对WER降低,表明对阵列几何结构变化具有强鲁棒性。
  • 即使仅使用两麦克风,该模型在相对WER降低方面仍优于7麦克风的传统波束成形系统,降幅超过7.0%。
  • 采用权重共享与最大池化机制的WTSF架构,相比全连接融合的ESF架构,性能略优,尤其在不匹配条件下表现更佳。
  • 多几何结构模型在多种阵列配置下保持一致的性能表现,而单几何结构模型在测试几何结构偏离训练配置时性能显著下降。
  • 该模型实现了无需双向处理或信号统计量累积的实时推理,优于基于DNN掩蔽的波束成形方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。