Skip to main content
QUICK REVIEW

[论文解读] Improving Ultrasound Tongue Image Reconstruction from Lip Images Using Self-supervised Learning and Attention Mechanism

Haiyang Liu, Jihan Zhang|arXiv (Cornell University)|Jun 20, 2021
Speech and Audio Processing参考文献 39被引用 5
一句话总结

本论文提出了一种自监督的双流CNN-LSTM网络,结合注意力机制,从唇部视频序列重建超声舌像。通过利用光流和时序建模,该方法在基线模型之上实现了更优的重建精度,用户研究中的平均相似度得分为3.01,SSIM(0.728)和MSD(4.953)指标也得到提升。

ABSTRACT

Speech production is a dynamic procedure, which involved multi human organs including the tongue, jaw and lips. Modeling the dynamics of the vocal tract deformation is a fundamental problem to understand the speech, which is the most common way for human daily communication. Researchers employ several sensory streams to describe the process simultaneously, which are incontrovertibly statistically related to other streams. In this paper, we address the following question: given an observable image sequences of lips, can we picture the corresponding tongue motion. We formulated this problem as the self-supervised learning problem, and employ the two-stream convolutional network and long-short memory network for the learning task, with the attention mechanism. We evaluate the performance of the proposed method by leveraging the unlabeled lip videos to predict an upcoming ultrasound tongue image sequence. The results show that our model is able to generate images that close to the real ultrasound tongue images, and results in the matching between two imaging modalities.

研究动机与目标

  • 解决在无需成对超声数据的情况下,从可见唇部运动重建超声舌像的挑战。
  • 通过自监督学习改进唇部图像与超声舌像之间的跨模态映射。
  • 通过时序建模和注意力机制提升重建质量。
  • 使用主观用户研究和客观指标(如SSIM、CW-SSIM、MSD)对方法进行评估。
  • 探究光流和注意力机制在提升重建保真度方面的贡献。

提出的方法

  • 采用双流卷积LSTM(TS-CNN-LSTM)架构,其中一路处理原始唇部图像,另一路处理连续帧之间的光流。
  • 使用自监督学习在未标注的唇部视频序列上训练网络,以预测未来的超声舌像。
  • 在特征融合后引入注意力机制,以强调潜在表征中的相关空间和时序特征。
  • 使用均方误差(MSE)损失进行训练,批量大小为32,并在约50个周期后启用早停。
  • 通过将两路的嵌入特征拼接并输入全连接层,完成推理以生成重建的超声舌像。
  • 与基线ConvLSTM模型进行性能比较,并通过消融实验分析光流和注意力机制的贡献。

实验结果

研究问题

  • RQ1自监督学习是否能有效实现从唇部图像序列重建超声舌像,而无需成对的超声数据?
  • RQ2光流的引入在从唇部视频重建舌部运动方面有何改善作用?
  • RQ3注意力机制在多大程度上提升了重建超声舌像的质量?
  • RQ4所提出的组件(带注意力机制的TS-CNN-LSTM)与基线ConvLSTM模型相比,在定量和定性上表现如何?
  • RQ5输入模态(原始图像 vs. 光流)对重建性能有何影响?

主要发现

  • 所提出的带注意力机制的TS-CNN-LSTM在主观评估中取得了3.01的平均相似度得分,显著优于基线ConvLSTM模型(2.67)。
  • 该模型在结构相似性指数(SSIM)上达到0.728,复 wavelet SSIM(CW-SSIM)为0.765,表明图像重建具有高保真度。
  • 人工提取的舌部轮廓之间的平均距离和(MSD)为4.953,表明与真实超声图像高度对齐。
  • 消融实验表明,光流对性能贡献最大,而注意力机制提供了稳定但较小的改进。
  • 同时包含光流和注意力机制的模型优于所有其他配置,证实了时序与注意力机制之间的协同效应。
  • 结果证实,通过结合注意力机制的自监督学习,唇部与舌部运动之间的跨模态映射是可行且有效的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。