Skip to main content
QUICK REVIEW

[论文解读] A Cascade Sequence-to-Sequence Model for Chinese Mandarin Lip Reading

Ya Zhao, Rui Xu|arXiv (Cornell University)|Aug 14, 2019
Speech and Audio Processing参考文献 13被引用 4
一句话总结

该论文提出了一种级联序列到序列模型(CSSMCM),用于中文普通话唇读,通过显式建模词汇声调,结合视觉和句法线索,提升了句级识别性能。通过联合预测拼音、声调和字符序列,并采用多模态注意力机制,CSSMCM在新收集的CMLR数据集上实现了最先进性能,证明声调建模显著降低了普通话唇读中的字符错误率。

ABSTRACT

Lip reading aims at decoding texts from the movement of a speaker's mouth. In recent years, lip reading methods have made great progress for English, at both word-level and sentence-level. Unlike English, however, Chinese Mandarin is a tone-based language and relies on pitches to distinguish lexical or grammatical meaning, which significantly increases the ambiguity for the lip reading task. In this paper, we propose a Cascade Sequence-to-Sequence Model for Chinese Mandarin (CSSMCM) lip reading, which explicitly models tones when predicting sentence. Tones are modeled based on visual information and syntactic structure, and are used to predict sentence along with visual information and syntactic structure. In order to evaluate CSSMCM, a dataset called CMLR (Chinese Mandarin Lip Reading) is collected and released, consisting of over 100,000 natural sentences from China Network Television website. When trained on CMLR dataset, the proposed CSSMCM surpasses the performance of state-of-the-art lip reading frameworks, which confirms the effectiveness of explicit modeling of tones for Chinese Mandarin lip reading.

研究动机与目标

  • 为解决普通话唇读中因声调差异而产生的高歧义性问题,该问题在英语中并不存在。
  • 开发一种多模态唇读框架,联合建模视觉线索、拼音和声调,以提升句级识别性能。
  • 收集并发布一个大规模、自然语境下的中文普通话唇读数据集(CMLR),用于研究与评估。
  • 证明显式声调建模可提升普通话唇读中的字符级准确率。
  • 在句级识别任务中超越现有的端到端及两阶段唇读模型。

提出的方法

  • 三阶段级联架构:首先从视频中预测拼音序列,然后结合视频和拼音输入预测声调序列,最后使用全部三路输入预测字符序列。
  • 声调预测子网络中采用双注意力机制,同时关注视频帧和拼音序列。
  • 最终子网络中采用三重注意力机制,整合视觉、拼音和声调表征以生成字符。
  • 对所有三个子网络进行端到端的联合微调,以优化整体性能。
  • 使用音节(而非单个拼音字符)作为拼音单元,以降低解码复杂度并提高建模稳定性。
  • 基于先前语言学研究,利用颈部和头部动作作为视觉线索用于声调预测,这些动作与声调产生时的可见发音特征相关。

实验结果

研究问题

  • RQ1在像普通话这样的声调语言中,显式建模词汇声调是否能提升句级唇读性能?
  • RQ2视觉、拼音和声调信息的融合如何影响字符序列预测的准确率?
  • RQ3使用音节而非单个拼音字符作为输入单元,是否能提升序列到序列唇读模型的鲁棒性与准确率?
  • RQ4级联模型中的注意力机制如何对齐视频帧与预测的拼音、声调和字符?
  • RQ5模型失败案例在多大程度上源于同音词或发音相似但声调不同的字符?

主要发现

  • CSSMCM的字符错误率低于最先进模型,证实了在普通话唇读中显式声调建模的有效性。
  • 该模型成功区分了声调不同但发音相似的同音词,如'实惠'(实惠)与'事会'(机会),而其他模型因声调误判而失败。
  • 注意力可视化显示,模型聚焦于相关视频帧,并利用未来声调信息作为语言模型来优化字符预测。
  • 该模型在涉及相同口型但声调不同的情况中,显著优于WAS和LipCH-Net。
  • 失败案例主要源于同音词或韵母相同的字符,凸显了即使采用先进建模,声调歧义仍是主要挑战。
  • CMLR数据集包含来自新闻广播的超过10万个自然语句,支持可靠评估与未来基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。