[论文解读] Frequency Domain Multi-channel Acoustic Modeling for Distant Speech Recognition
本文提出了一种完全可学习的多通道(MC)声学建模框架,通过自动语音识别(ASR)准则联合优化波束成形、特征提取和LSTM分类。通过使用波束成形系数进行网络初始化,并采用频域多通道输入,该模型在真实远场数据上相比单通道LFBE系统实现了16.5%的相对WER降低,相比传统7麦克风波束成形系统实现了9.5%的相对WER提升。
Conventional far-field automatic speech recognition (ASR) systems typically employ microphone array techniques for speech enhancement in order to improve robustness against noise or reverberation. However, such speech enhancement techniques do not always yield ASR accuracy improvement because the optimization criterion for speech enhancement is not directly relevant to the ASR objective. In this work, we develop new acoustic modeling techniques that optimize spatial filtering and long short-term memory (LSTM) layers from multi-channel (MC) input based on an ASR criterion directly. In contrast to conventional methods, we incorporate array processing knowledge into the acoustic model. Moreover, we initialize the network with beamformers' coefficients. We investigate effects of such MC neural networks through ASR experiments on the real-world far-field data where users are interacting with an ASR system in uncontrolled acoustic environments. We show that our MC acoustic model can reduce a word error rate (WER) by~16.5\% compared to a single channel ASR system with the traditional log-mel filter bank energy (LFBE) feature on average. Our result also shows that our network with the spatial filtering layer on two-channel input achieves a relative WER reduction of~9.5\% compared to conventional beamforming with seven microphones.
研究动机与目标
- 为克服传统ASR系统中语音增强与声学建模分别优化所导致的次优性能问题。
- 开发一种统一的、端到端可训练的多通道声学模型,通过ASR目标函数联合优化空间波束成形、特征提取和分类。
- 探究将阵列信号处理知识融入深度神经网络架构是否能提升真实世界中混响和噪声环境下的鲁棒性。
- 评估使用波束成形系数和梅尔滤波器组参数进行网络初始化对识别准确率的影响。
提出的方法
- 采用频域多通道输入(127个DFT系数)以提升计算效率,并支持按频率处理。
- 提出三种MC网络架构:复数仿射变换(CAT)、带最大池化的确定性空间波束成形(DSF),以及通过频率无关权重线性组合空间波束成形的弹性空间波束成形(ESF)。
- 空间波束成形层使用已知声源方向推导出的波束成形系数进行初始化,将阵列处理知识嵌入网络。
- 特征提取与分类组件采用5层LSTM(每层768个单元),后接一个Softmax层用于声学单元分类。
- 所有网络均使用Adam优化器和交叉熵损失进行端到端训练,第一层可选择随机初始化或波束成形系数初始化。
- 系统在具有不同信噪比(SNR)的真实远场数据上进行评估,以相对WER降低为主要指标。
实验结果
研究问题
- RQ1在深度神经网络中联合优化空间波束成形、特征提取和声学分类是否能提升ASR性能,优于传统流水线系统?
- RQ2使用波束成形系数初始化空间波束成形层是否能带来更好的收敛速度和识别准确率?
- RQ3多通道网络架构选择(CAT、DSF、ESF)在真实远场条件下如何影响识别性能?
- RQ4当与波束成形输入结合时,可学习滤波器组对识别准确率有何影响?
- RQ5麦克风数量如何影响识别性能?性能是否在某一传感器数量后趋于饱和?
主要发现
- 所提出的弹性空间波束成形(ESF)网络表现最佳,由于其灵活的、频率无关的空间波束成形组合方式,优于CAT和DSF架构。
- 完全可学习的MC声学模型在真实远场数据上相比单通道LFBE系统实现了16.5%的相对WER降低。
- 两麦克风输入的模型相比传统7麦克风波束成形系统实现了9.5%的相对WER降低,展现出更强的鲁棒性。
- 使用波束成形系数初始化第一层相比随机初始化显著提升了识别准确率,证实了先验信号处理知识的价值。
- 识别性能在约四个麦克风时趋于饱和,超过两通道后增益微乎其微,表明增加传感器带来的收益递减。
- 在波束成形数据上进行训练的可学习滤波器组进一步提升了性能,表明即使特征提取阶段也受益于端到端优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。