Skip to main content
QUICK REVIEW

[论文解读] Speaker-independent machine lip-reading with speaker-dependent viseme classifiers

Helen L. Bear, Stephen Cox|arXiv (Cornell University)|Jan 1, 2015
Speech and Audio Processing被引用 6
一句话总结

本论文提出了一种基于说话人相关视觉单元分类器的说话人无关机器唇读方法,表明尽管存在个体差异,视觉语音单元(visemes)在不同说话人之间仍具有高度一致性。通过从音素混淆矩阵构建说话人特定的视觉单元映射,并在不同说话人之间进行测试,研究发现识别性能下降并非由于错误的视觉单元映射,而是由于在不匹配说话人上进行HMM训练效果不佳——这表明说话人之间存在一个通用的视觉单元集合。

ABSTRACT

In machine lip-reading, which is identification of speech from visual-only information, there is evidence to show that visual speech is highly dependent upon the speaker [1]. Here, we use a phoneme-clustering method to form new phoneme-to-viseme maps for both individual and multiple speakers. We use these maps to examine how similarly speakers talk visually. We conclude that broadly speaking, speakers have the same repertoire of mouth gestures, where they differ is in the use of the gestures.

研究动机与目标

  • 探究在仅视觉的语音识别中,视觉单元映射是否可跨说话人泛化。
  • 确定跨说话人唇读性能下降的原因是否为错误的视觉单元映射,或训练数据不匹配。
  • 评估说话人相关视觉单元分类器在实现说话人无关识别方面的有效性。
  • 利用音素混淆矩阵评估不同说话人之间视觉单元映射的稳定性和相似性。

提出的方法

  • 基于说话人特定的音素识别结果生成的音素混淆矩阵,构建说话人相关的视觉单元映射。
  • 仅当音素相互混淆时才将它们聚类为视觉单元,且辅音与元音保持分离。
  • 使用交叉验证训练和测试三状态HMM模型,每个模型包含五个高斯分量。
  • 系统采用AAM提取的唇部特征,并使用HTK工具包进行HMM的训练、重估计和识别。
  • 在AVLetters2数据集上,通过词正确率评估性能,并比较同说话人、不同说话人及多说话人配置下的表现。
  • 采用加权评分系统评估视觉单元映射相对于同说话人基线的性能,同时考虑统计显著性。

实验结果

研究问题

  • RQ1说话人相关的视觉单元映射能否有效用于说话人无关的唇读?
  • RQ2跨说话人唇读性能下降的原因是否为错误的视觉单元映射,或训练数据不匹配?
  • RQ3在视觉语音识别中,不同说话人之间的视觉单元映射有多相似?
  • RQ4是否存在一个通用的视觉单元集合,可代表所有说话人的视觉语音,还是视觉单元是说话人特定的?

主要发现

  • 当使用某位说话人的视觉单元映射但其HMM模型是基于其他说话人数据训练时,识别性能显著下降;然而,通过重新训练HMM模型,性能可被恢复,表明问题并非出在视觉单元映射本身。
  • 相同的视觉单元映射(如M1234)在不同说话人之间表现一致,表明个体之间存在共享的视觉单元集合。
  • 说话人3在说话人相关识别中表现最佳,其在使用说话人无关映射(M124)时也取得了最佳结果,表明独特的视觉语音模式可能降低跨说话人相似性。
  • 映射中视觉单元的数量与识别性能相关:视觉单元更少、更清晰的映射表现更优,尤其当视觉单元同音现象减少时效果更明显。
  • 在说话人4中引入/ow/和/uw/至/v01/视觉单元,相比说话人1性能显著下降,表明即使微小的映射差异也会显著影响识别效果。
  • 本研究结论认为,视觉语音单元(visemes)在本质上是说话人无关的,其集合是通用的,尽管使用方式存在差异——这与语音中不同口音共享音素的机制类似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。