Skip to main content
QUICK REVIEW

[论文解读] Crossmodal learning for audio-visual speech event localization

Rahul Sharma, Krishna Somandepalli|arXiv (Cornell University)|Mar 9, 2020
Speech and Audio Processing参考文献 17被引用 11
一句话总结

本文提出一种跨模态神经网络,利用视觉表征来定位音视频语音事件,通过从视频帧中学习时间与空间线索,在音视频语音活动检测和主动说话人定位任务中实现最先进性能。

ABSTRACT

An objective understanding of media depictions, such as about inclusive portrayals of how much someone is heard and seen on screen in film and television, requires the machines to discern automatically who, when, how and where someone is talking. Media content is rich in multiple modalities such as visuals and audio which can be used to learn speaker activity in videos. In this work, we present visual representations that have implicit information about when someone is talking and where. We propose a crossmodal neural network for audio speech event detection using the visual frames. We use the learned representations for two downstream tasks: i) audio-visual voice activity detection ii) active speaker localization in video frames. We present a state-of-the-art audio-visual voice activity detection system and demonstrate that the learned embeddings can effectively localize to active speakers in the visual frames.

研究动机与目标

  • 使机器能够自动检测视频内容中何时、何地以及谁在说话。
  • 解决利用多模态信号识别音视频媒体中主动说话人的挑战。
  • 开发能够隐式编码语音时间与空间位置的视觉表征。
  • 通过跨模态学习提升音视频语音活动检测与主动说话人定位性能。
  • 展示所学习视觉嵌入在定位视频帧中说话事件方面的有效性。

提出的方法

  • 该方法采用一种跨模态神经网络,融合视觉与音频特征以检测语音事件。
  • 对视觉帧进行处理,提取隐式编码说话发生时间与位置的表征。
  • 模型通过联合视觉与音频监督进行训练,以预测音视频语音事件。
  • 所学习的视觉嵌入被微调以应用于两个下游任务:语音活动检测与主动说话人定位。
  • 该架构利用注意力机制对齐视觉与音频模态,以提升检测性能。
  • 采用端到端训练,以优化音视频语音检测与定位的联合表征。

实验结果

研究问题

  • RQ1仅靠视觉表征是否能隐式编码关于语音事件的时间与空间线索?
  • RQ2与单模态基线相比,跨模态学习在音视频语音活动检测中的性能提升效果如何?
  • RQ3所学习的视觉嵌入能否以高精度在视频帧中定位主动说话人?
  • RQ4与先前方法相比,该方法在主动说话人定位任务中的性能增益如何?
  • RQ5在复杂视频场景中,视觉特征在提升语音事件检测鲁棒性方面起到多大作用?

主要发现

  • 所提方法在音视频语音活动检测任务中达到最先进性能。
  • 所学习的视觉嵌入能有效定位到视频帧中的主动说话人。
  • 通过利用音频与视觉模态之间的跨模态交互,模型显著提升了检测准确率。
  • 视觉表征隐含了关于语音时间与空间位置的信息,可支持下游定位任务。
  • 该方法在语音活动检测与主动说话人定位任务中均优于现有方法。
  • 结果证实,当结合跨模态学习时,仅视觉数据即可支持精确的音视频语音事件定位。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。