[论文解读] Vid2speech: Speech Reconstruction from Silent Video
本文提出了一种基于端到端CNN的模型,通过直接从完整面部学习视觉特征,绕过手工特征工程,从静默视频帧中重建出可理解的语音。该模型在GRID数据集上实现了最先进的词可懂度,并通过使用LPC和LSP表示的基于回归的音频特征预测,展示了在未登录词(OOV)重建方面的前景。
Speechreading is a notoriously difficult task for humans to perform. In this paper we present an end-to-end model based on a convolutional neural network (CNN) for generating an intelligible acoustic speech signal from silent video frames of a speaking person. The proposed CNN generates sound features for each frame based on its neighboring frames. Waveforms are then synthesized from the learned speech features to produce intelligible speech. We show that by leveraging the automatic feature learning capabilities of a CNN, we can obtain state-of-the-art word intelligibility on the GRID dataset, and show promising results for learning out-of-vocabulary (OOV) words.
研究动机与目标
- 开发一种端到端深度学习模型,从静默视频中重建语音,而无需依赖手工特征工程。
- 通过利用时间上下文和完整面部视觉输入(而非仅口部区域),提升视觉语音处理中的语音可懂度。
- 通过将语音阅读建模为回归问题而非分类任务,实现未登录词(OOV)的重建。
- 证明使用卷积神经网络在原始视频帧上学习鲁棒视觉表征以实现语音重建的可行性。
提出的方法
- 该模型使用三维卷积神经网络(3D-CNN)从连续的静默视频帧中提取时空特征,处理整个面部以捕捉发音动态。
- 音频特征通过8阶线性预测编码(LPC)表示,随后进行线谱对(LSP)分解,每40ms帧生成一个9维向量。
- 将两个连续的LSP向量拼接,形成一个18维的特征向量 $ S_i \in \mathbb{R}^{18} $,用作回归目标。
- 通过使用未激发激励的波形合成,从预测的LSP特征中重建出可理解的语音。
- 模型通过预测LSP特征与真实LSP特征之间的回归损失进行端到端训练,从而从原始音频中获得自然监督。
- 通过使用固定长度的重叠视频片段,保留时间上下文,使网络能够建模音素转换并区分视觉符号。
实验结果
研究问题
- RQ1基于CNN的端到端模型能否在不使用手工设计视觉特征的情况下,从静默视频帧中重建出可理解的语音?
- RQ2与仅使用口部区域相比,使用完整面部是否能显著提升语音重建性能?
- RQ3在视觉数据上训练的基于回归的模型能否重建训练期间未见过的未登录词(OOV)?
- RQ4与先前工作相比,该模型在词可懂度和对未见词汇的鲁棒性方面表现如何?
主要发现
- 在测试说话人S4时,模型在仅音频条件下达到82.6%的词可懂度,在音频-视觉条件下达到79.9%,显著优于先前工作。
- 与仅使用口部区域相比,使用完整面部将测试误差降低了40%,证明了整体面部特征学习的重要性。
- 在完整词汇集的音频-视觉片段上,模型实现了51.9%的可懂度,表明其在重建已知词汇词方面表现强劲。
- 对于OOV词重建,听者正确识别训练集中未出现的数字的概率是随机猜测的5.16倍,显示出良好的泛化潜力。
- 在另一名说话人(S2)上测试时,模型保持了79%的可懂度,证实了其在不同说话人之间的泛化能力。
- 结果表明,通过学习时间与空间上的视觉模式,端到端的CNN学习能够有效实现从发音到声学特征的映射,即使对未见过的词也具备良好表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。