[论文解读] Comparing phonemes and visemes with DNN-based lipreading
本论文在TCD-TIMIT语料库上比较了基于DNN的唇读系统中使用音素(38个单元)与音位(13个单元)的性能,采用DCT和Eigenlips作为视觉特征表示方法,在混合DNN-HMM框架中结合WFST解码。基于音素的系统在词级别准确率上显著更高(48.74%),尽管其单元级别准确率较低,表明音素在减少发音词典中的同音词歧义方面更有效,从而提升了词级别识别性能。
There is debate if phoneme or viseme units are the most effective for a lipreading system. Some studies use phoneme units even though phonemes describe unique short sounds; other studies tried to improve lipreading accuracy by focusing on visemes with varying results. We compare the performance of a lipreading system by modeling visual speech using either 13 viseme or 38 phoneme units. We report the accuracy of our system at both word and unit levels. The evaluation task is large vocabulary continuous speech using the TCD-TIMIT corpus. We complete our visual speech modeling via hybrid DNN-HMMs and our visual speech decoder is a Weighted Finite-State Transducer (WFST). We use DCT and Eigenlips as a representation of mouth ROI image. The phoneme lipreading system word accuracy outperforms the viseme based system word accuracy. However, the phoneme system achieved lower accuracy at the unit level which shows the importance of the dictionary for decoding classification outputs into words.
研究动机与目标
- 评估音素与音位作为DNN基唇读系统单位的有效性。
- 评估视觉特征表示方法(DCT与Eigenlips)对唇读性能的影响。
- 研究DNN-HMM混合建模与WFST解码在提升词级别识别准确率中的作用。
- 确定音素类别数量增加是否导致分类性能下降,尽管词级别结果更优。
- 考察DNN与GMM在共音化建模方面对识别准确率的影响。
提出的方法
- 唇读系统采用混合DNN-HMM架构,用DNN替代GMM进行视觉语音建模。
- 通过从嘴部感兴趣区域(ROI)图像中提取离散余弦变换(DCT)和Eigenlips特征作为视觉特征。
- 系统采用加权有限状态转换器(WFST)进行解码,将声学模型与语言模型相结合。
- DNN被训练以从视觉特征预测音素或音位单位,音素与音位单位均来自TCD-TIMIT语料库。
- 采用两种训练配置:说话人相关(SD)与说话人无关(SI),以评估鲁棒性。
- 在单元级别与词级别分别计算混淆矩阵与准确率指标,以比较各模型的性能。
实验结果
研究问题
- RQ1基于DNN的唇读系统在以音素或音位作为分析单位时,性能是否更优?
- RQ2在唇读识别准确率方面,DCT与Eigenlips视觉特征表现如何比较?
- RQ3为何DNN在单元分类性能提升有限的情况下,能显著提升词级别准确率?
- RQ4发音词典中同音词数量的减少在多大程度上影响了音位基系统的词级别性能?
- RQ5DNN对共音化的建模能力是否可解释其在唇读中相对于GMM的优越性能?
主要发现
- 基于音素的唇读系统在使用Eigenlips特征时,词准确率达到48.74%,显著优于基于音位的系统。
- 基于音位的系统在单元级别准确率更高(31.10%),高于基于音素的系统(28.08%),这是由于类别更少,但该优势未转化为更好的词级别性能。
- 与使用Eigenlips特征的GMM基线相比,DNN将词准确率提升了14.87个百分点(从33.87%提升至48.74%)。
- 在所有配置中,Eigenlips特征均优于DCT特征,DNN使用Eigenlips时词准确率达到48.74%,而使用DCT时仅为37.40%。
- DNN在词准确率上的提升幅度大于单元准确率,表明其对共音化效应的建模更优。
- DNN基系统在SD与SI配置间的性能差距更小,表明其具备更强的说话人无关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。