Skip to main content
QUICK REVIEW

[论文解读] Visual Keyword Spotting with Attention

K R Prajwal, Liliane Momeni|arXiv (Cornell University)|Oct 29, 2021
Speech and Audio Processing参考文献 72被引用 6
一句话总结

本文提出 Transpotter,一种基于 Transformer 的模型,通过视觉视频特征与语音关键词嵌入之间的全模态交叉注意力机制,在无声视频中定位口语关键词。该方法在 LRW、LRS2 和 LRS3 数据集上达到最先进性能,在手语视频中孤立口部动作的检测任务中显著优于先前方法,展现出在极端领域偏移下的强大泛化能力。

ABSTRACT

In this paper, we consider the task of spotting spoken keywords in silent video sequences -- also known as visual keyword spotting. To this end, we investigate Transformer-based models that ingest two streams, a visual encoding of the video and a phonetic encoding of the keyword, and output the temporal location of the keyword if present. Our contributions are as follows: (1) We propose a novel architecture, the Transpotter, that uses full cross-modal attention between the visual and phonetic streams; (2) We show through extensive evaluations that our model outperforms the prior state-of-the-art visual keyword spotting and lip reading methods on the challenging LRW, LRS2, LRS3 datasets by a large margin; (3) We demonstrate the ability of our model to spot words under the extreme conditions of isolated mouthings in sign language videos.

研究动机与目标

  • 为解决无声视频中的视觉关键词定位(KWS)挑战,即仅需定位特定关键词而非完整转录。
  • 克服现有视觉语音识别(VSR)方法对语言建模严重依赖的问题,这些方法在遮挡或短语句情况下性能下降。
  • 开发一种利用目标关键词先验知识的模型,以提升关键词定位的鲁棒性与准确性。
  • 在具有挑战性的现实场景(如手语视频中的孤立口部动作)中评估性能,此类场景普遍存在领域偏移与部分发音现象。
  • 通过在包含部分口部动作的新颖、嘈杂且人工标注的手语语料库上进行测试,证明模型在标准唇读数据集之外的泛化能力。

提出的方法

  • Transpotter 模型采用两条独立路径:一条用于使用 3D 卷积神经网络将视频帧编码为视觉特征,另一条用于使用可学习的位置编码将目标关键词编码为语音嵌入。
  • 模型在视觉与语音路径之间采用全连接交叉注意力机制,使模型能够动态关注与关键词语音结构相对应的视觉区域。
  • 模型采用对比学习目标进行训练,当关键词出现时,鼓励视觉与语音表征之间的对齐。
  • 最终的预测头在视频序列上输出时间定位得分,识别关键词的起始与结束时间。
  • 该架构端到端可微分,联合优化特征学习与定位任务。
  • 预处理流程从手语视频中提取人脸裁剪的视频轨迹,以确保推理输入的一致性。

实验结果

研究问题

  • RQ1与先前方法相比,视觉与语音模态之间的交叉注意力机制是否能显著提升视觉关键词定位性能?
  • RQ2该模型在极端领域偏移场景(如手语视频中的孤立口部动作)下的泛化能力如何?
  • RQ3在部分唇部动作、遮挡及非标准发音等挑战性条件下,模型是否仍能保持高性能?
  • RQ4该模型是否能在 LRW、LRS2 和 LRS3 等标准基准数据集上超越最先进 KWS 与 VSR 基线方法?
  • RQ5当关键词仅被部分发音或伴有严重共音现象时,模型性能下降程度如何?

主要发现

  • 在 BSL-Corpus 上,Transpotter 模型在手语视频口部动作检测任务中达到 29.6 的 mAP,显著优于先前最先进方法 KWS-Net(15.6 mAP)。
  • 在 LRS2 数据集上,Transpotter 达到 47.1 的 mAP,大幅超越此前最先进 KWS 方法。
  • 模型对同音词表现出鲁棒性,能正确将目标词及其语音上相似的同音词定位在相同真实标注位置。
  • 即使仅存在部分口部动作,模型仍能成功定位关键词,如 BSL-Corpus 的定性结果所示,尽管存在高度领域偏移与人工标注噪声。
  • 在 BSL-Corpus 上,模型达到 22.5% 的 top-1 准确率与 47.1% 的 top-5 准确率,表明其在低资源、现实世界手语数据上的强大泛化能力。
  • Transpotter 在具有挑战性的 LRW、LRS2 和 LRS3 数据集上,均优于先前视觉 KWS 方法与最先进唇读基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。