[论文解读] Denoising convolutional autoencoder based B-mode ultrasound tongue image feature extraction
本文提出一种去噪卷积自编码器(DCAE),用于从B型超声舌像中无监督地提取特征,利用卷积架构增强对斑点噪声和图像失真的鲁棒性。DCAE在2010年无声语音接口挑战赛中实现了6.17%的词错误率(WER),优于最先进基于DCT的方法(6.45%)及其他自编码器变体。
B-mode ultrasound tongue imaging is widely used in the speech production field. However, efficient interpretation is in a great need for the tongue image sequences. Inspired by the recent success of unsupervised deep learning approach, we explore unsupervised convolutional network architecture for the feature extraction in the ultrasound tongue image, which can be helpful for the clinical linguist and phonetics. By quantitative comparison between different unsupervised feature extraction approaches, the denoising convolutional autoencoder (DCAE)-based method outperforms the other feature extraction methods on the reconstruction task and the 2010 silent speech interface challenge. A Word Error Rate of 6.17% is obtained with DCAE, compared to the state-of-the-art value of 6.45% using Discrete cosine transform as the feature extractor. Our codes are available at https://github.com/DeePBluE666/Source-code1.
研究动机与目标
- 为解决从噪声大、信噪比低的B型超声舌像中提取鲁棒且与语音相关特征的挑战。
- 探索无监督深度学习方法在基于超声的无声语音接口(SSI)中进行降维与特征学习的应用。
- 通过利用卷积架构的不变性特性,提升重建保真度与识别性能。
- 在重建与语音识别任务中,将DCAE模型与DCT、PCA及标准自编码器等成熟方法进行对比评估。
提出的方法
- 采用去噪卷积自编码器(DCAE)以无监督方式学习超声舌像的紧凑、抗噪表征。
- 通过在输入图像中引入噪声并优化原始图像的重建,训练DCAE,从而增强对斑点噪声与伪影的鲁棒性。
- 采用对称的编码器-解码器架构,结合步幅卷积与转置卷积,以学习分层空间特征。
- 从DCAE的瓶颈层提取特征,作为DNN-HMM声学模型的输入,用于语音识别。
- 使用均方误差(MSE)与加权对比度结构相似性(CW-SSIM)指标,对比DCAE与DCT、深度自编码器(DAE)、去噪自编码器(DAE)及标准卷积自编码器(CAE)的性能。
- 在Kaldi工具框架下,将特征提取流程应用于2010年无声语音接口挑战赛数据集,实现识别系统构建。
实验结果
研究问题
- RQ1去噪卷积自编码器是否能在重建超声舌像方面优于传统特征提取方法(如DCT与PCA)?
- RQ2在重建精度与抗噪鲁棒性方面,DCAE模型相较于标准自编码器与卷积自编码器表现如何?
- RQ3基于DCAE的特征表示是否能带来相较于最先进方法更低的词错误率(WER)?
- RQ4DCAE架构所具备的空间不变性与抗噪能力,在多大程度上保留了超声序列中与语音相关的发音动态?
主要发现
- DCAE模型在2010年无声语音接口挑战赛中实现了最低的词错误率(WER)6.17%,优于最先进基于DCT的方法(6.45%)。
- 在重建任务中,DCAE在测试集上取得71.28的MSE与0.6577的CW-SSIM,使用60维特征向量,优于DCT、DAE与CAE模型。
- 在相同设置下,DCAE模型表现出更优的抗噪鲁棒性,相比标准CAE,MSE降低1.5%,CW-SSIM提升0.012。
- 基于DCAE的特征在30维特征下实现6.24%的WER,表明即使在降维情况下仍具备优异性能。
- 视觉对比显示,与其它模型相比,DCAE在保留舌部形状与减少斑点伪影方面表现更优。
- DCAE在性能上持续优于非卷积自编码器,表明卷积归纳偏置有助于提升超声成像中特征的质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。