[论文解读] Visual gesture variability between talkers in continuous visual speech
本研究通过利用音素混淆数据构建说话人特定的音素到视觉音素(P2V)映射,探究了连续唇读中说话人特有的视觉语音可变性。基于RMAV数据集和基于HMM的分类方法,研究发现说话人特定的P2V映射在词识别准确率上显著优于说话人无关或多人共用的映射,且连续语音相比孤立词汇能进一步缩小性能差距,表明上下文信息与共发音效应可增强说话人特定映射的有效性。
Recent adoption of deep learning methods to the field of machine lipreading research gives us two options to pursue to improve system performance. Either, we develop end-to-end systems holistically or, we experiment to further our understanding of the visual speech signal. The latter option is more difficult but this knowledge would enable researchers to both improve systems and apply the new knowledge to other domains such as speech therapy. One challenge in lipreading systems is the correct labeling of the classifiers. These labels map an estimated function between visemes on the lips and the phonemes uttered. Here we ask if such maps are speaker-dependent? Prior work investigated isolated word recognition from speaker-dependent (SD) visemes, we extend this to continuous speech. Benchmarked against SD results, and the isolated words performance, we test with RMAV dataset speakers and observe that with continuous speech, the trajectory between visemes has a greater negative effect on the speaker differentiation.
研究动机与目标
- 确定在连续语音中,唇读的音素到视觉音素(P2V)映射是否本质上具有说话人特异性。
- 评估说话人特定(SD)、说话人无关(SI)和多说话人(MS)P2V映射在连续视觉语音识别中的性能表现。
- 评估连续语音是否相比孤立词汇识别,能缩小说话人特定与说话人无关唇读系统之间的性能差距。
- 识别是否存在某些情况下非目标说话人的P2V映射优于目标说话人的映射,从而揭示跨说话人适应的潜力。
- 提出一种用于比较视觉音素映射相似性的度量方法,以支持在数据量有限情况下的高效跨说话人适应。
提出的方法
- 构建了25个P2V映射:一个使用所有说话人混淆数据的多说话人映射,每个说话人各一个说话人无关映射(使用其他说话人的数据),以及每个说话人各一个说话人特定映射。
- 使用HTK工具包训练HMM分类器,采用三状态HMM和每个状态五分量高斯混合模型,通过强制对齐和11次HERest重估计实现参数优化。
- 利用HBuild和HLStats构建词频二元模型网络,并基于公式1定义的词正确率(Cw)评估性能:Cw = (N - D - S)/N。
- 采用10折交叉验证以确保结果稳健性,训练集与测试集数据严格分离。
- 使用BEEP发音词典处理英式英语,并在孤立词汇(AVL2)和连续语音(RMAV)数据集之间进行结果对比。
- 提出一种用于跨说话人比较视觉音素映射相似性的度量方法,旨在实现以最小数据量实现高效适应。
实验结果
研究问题
- RQ1在连续视觉语音中,说话人特定P2V映射的性能与说话人无关及多说话人P2V映射相比如何?
- RQ2相比孤立词汇识别,连续语音在多大程度上缩小了说话人特定与说话人无关唇读系统之间的性能差距?
- RQ3是否存在某些说话人,其非目标说话人的P2V映射优于其自身说话人特定映射,表明存在跨说话人适应的潜力?
- RQ4共发音与语言上下文如何影响说话人特定视觉音素映射的结构与有效性?
- RQ5能否利用视觉音素映射之间的相似性度量,来预测以最少数据量从一个说话人高效适应到另一个说话人?
主要发现
- 说话人特定P2V映射在连续语音中显著优于说话人无关和多说话人映射,RMAV数据集中说话人12的词正确率(Cw)最高提升达8.04%。
- 与孤立词汇相比,连续语音显著缩小了说话人特定与说话人无关系统之间的性能差距,后者在孤立词汇中甚至出现性能低于随机猜测的情况。
- 仅有两名说话人(5号和12号)的P2V映射能提升超过一半其他说话人的分类性能,其中M12对12名测试说话人中的11名产生正向影响,表明说话人特异性映射存在罕见但重要的例外。
- 相比孤立词汇,连续语音使词正确率平均提升5.78%,表明共发音与语言上下文可提升映射准确性。
- 研究发现视觉音素集的可变性以及各视觉音素在集合中的贡献度显著影响分类性能,表明过度泛化多说话人/说话人无关映射可能导致泛化能力下降。
- 有证据表明,说话人无关的唇读是可行的,尤其当说话人之间存在视觉与语言相似性时,部分案例中非目标说话人的映射甚至优于目标说话人映射。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。