[论文解读] LipReading with 3D-2D-CNN BLSTM-HMM and word-CTC models
本文提出一种3D-2D-CNN-BLSTM架构用于端到端唇读,比较字符级CTC(ch-CTC)与词级CTC(w-CTC)训练。w-CTC方法在Grid数据集已见说话人测试集上达到1.3%的WER,在未见说话人测试集上达到8.6%——分别较LCANet和LipNet提升55%和24.5%——展示了最先进的性能,通过上下文词级建模更好地处理同音词歧义。
In recent years, deep learning based machine lipreading has gained prominence. To this end, several architectures such as LipNet, LCANet and others have been proposed which perform extremely well compared to traditional lipreading DNN-HMM hybrid systems trained on DCT features. In this work, we propose a simpler architecture of 3D-2D-CNN-BLSTM network with a bottleneck layer. We also present analysis of two different approaches for lipreading on this architecture. In the first approach, 3D-2D-CNN-BLSTM network is trained with CTC loss on characters (ch-CTC). Then BLSTM-HMM model is trained on bottleneck lip features (extracted from 3D-2D-CNN-BLSTM ch-CTC network) in a traditional ASR training pipeline. In the second approach, same 3D-2D-CNN-BLSTM network is trained with CTC loss on word labels (w-CTC). The first approach shows that bottleneck features perform better compared to DCT features. Using the second approach on Grid corpus' seen speaker test set, we report $1.3\%$ WER - a $55\%$ improvement relative to LCANet. On unseen speaker test set we report $8.6\%$ WER which is $24.5\%$ improvement relative to LipNet. We also verify the method on a second dataset of $81$ speakers which we collected. Finally, we also discuss the effect of feature duplication on BLSTM-HMM model performance.
研究动机与目标
- 通过使用3D-2D-CNN-BLSTM架构提取的深度神经网络瓶颈特征替代传统DCT特征,提升唇读性能。
- 探究使用词级CTC损失(w-CTC)训练是否能通过利用上下文信息缓解同音词歧义,从而在性能上优于字符级CTC(ch-CTC)
- 评估在纯视觉唇读任务中,BLSTM-HMM模型中特征复制的有效性,将先前音频-视觉融合研究的发现拓展至纯视觉场景。
- 在标准(Grid)和更具挑战性的非约束性(印度英语)数据集上,展示所提架构的鲁棒性与可扩展性。
提出的方法
- 使用课程学习策略,对3D-2D-CNN-BLSTM网络进行字符级标签CTC损失训练(ch-CTC),随后提取瓶颈特征用于下游BLSTM-HMM训练。
- 使用相同的3D-2D-CNN-BLSTM网络,通过词级标签CTC损失进行端到端训练(w-CTC),实现直接词预测,并提升对视觉相似词的歧义消解能力。
- 将ch-CTC模型提取的瓶颈特征用于训练BLSTM-HMM混合系统,以便与传统的基于DCT的BLSTM-HMM基线模型进行比较。
- 通过特征复制使视觉帧率与HMM状态转移时间对齐,从而在纯唇读场景下提升BLSTM-HMM性能。
- 数据增强包括随机帧重复/删除以及水平镜像,以提升对可变帧率和数据变异的鲁棒性。
- 使用编辑距离进行拼写校正后计算词错误率(WER),并在Grid和印度英语数据集上评估模型性能。
实验结果
研究问题
- RQ1使用3D-2D-CNN-BLSTM ch-CTC模型提取的瓶颈特征,是否能显著提升BLSTM-HMM模型性能,超过传统DCT特征?
- RQ2在3D-2D-CNN-BLSTM网络中使用词级CTC损失(w-CTC)训练,是否能显著降低WER,相比字符级CTC和现有最先进模型?
- RQ3特征复制对纯视觉唇读中BLSTM-HMM模型性能有何影响?该效应是否可推广至音频-视觉融合之外的场景?
- RQ4所提架构在约束性(Grid)和非约束性(印度英语)数据集上的表现如何,是否体现出对说话人差异和环境噪声的鲁棒性?
主要发现
- 3D-2D-CNN-BLSTM w-CTC模型在Grid已见说话人测试集上达到1.3% WER,相较LCANet实现55.1%的相对提升。
- 在未见说话人测试集上,w-CTC模型实现8.6% WER,相较LipNet提升24.5%。
- 3D-2D-CNN-BLSTM ch-CTC模型在已见集上将WER降低至3.2%,在未见集上降低至5.2%,相较DCT BLSTM-HMM基线(分别为8.9%和16.5% WER)有显著改进。
- 特征复制使BLSTM-HMM在Grid数据集上性能提升53%,在印度英语数据集上提升44%,证明其在纯视觉场景中的有效性。
- 在印度英语数据集上,3D-2D-CNN-BLSTM w-CTC模型相较ch-CTC模型性能提升25.0%,证实其对真实世界多样性的鲁棒性。
- 尽管性能优越,w-CTC模型在大规模词汇表场景下可扩展性较差;作者建议未来研究采用子词级CTC损失以解决此局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。