Skip to main content
QUICK REVIEW

[论文解读] Listen to Look: Action Recognition by Previewing Audio

Ruohan Gao, Tae-Hyun Oh|arXiv (Cornell University)|Dec 10, 2019
Human Pose and Action Recognition参考文献 88被引用 10
一句话总结

本文提出了一种名为 Listen to Look 的新框架,利用音频作为轻量级预览,实现长时未修剪视频中高效的动作识别。通过从图像-音频对中蒸馏片段级特征,并采用基于注意力的 LSTM 进行视频浏览,该方法在不损失性能的前提下,有效减少了短期和长期的时间冗余,实现了最先进的准确率与速度表现。

ABSTRACT

In the face of the video data deluge, today's expensive clip-level classifiers are increasingly impractical. We propose a framework for efficient action recognition in untrimmed video that uses audio as a preview mechanism to eliminate both short-term and long-term visual redundancies. First, we devise an ImgAud2Vid framework that hallucinates clip-level features by distilling from lighter modalities---a single frame and its accompanying audio---reducing short-term temporal redundancy for efficient clip-level recognition. Second, building on ImgAud2Vid, we further propose ImgAud-Skimming, an attention-based long short-term memory network that iteratively selects useful moments in untrimmed videos, reducing long-term temporal redundancy for efficient video-level recognition. Extensive experiments on four action recognition datasets demonstrate that our method achieves the state-of-the-art in terms of both recognition accuracy and speed.

研究动机与目标

  • 解决长时未修剪视频中密集片段级动作识别的计算低效问题。
  • 通过用轻量级图像-音频特征蒸馏替代片段级处理,减少短期冗余。
  • 通过利用音频作为引导,学习从未修剪视频中选择关键时刻,减少长期冗余。
  • 在视频动作识别中实现最先进的准确率与速度权衡。
  • 证明音频可作为视觉内容在动作识别中的有效且高效的预览。

提出的方法

  • ImgAud2Vid 框架使用知识蒸馏,从单张图像及其对应音频生成片段级特征,替代昂贵的 3D CNN。
  • 该方法在图像-音频对上训练轻量级学生网络,以模仿强大教师网络在完整片段上的预测结果。
  • ImgAud-Skimming 网络使用基于注意力的 LSTM,从未修剪视频中迭代选择最具有信息量的图像-音频对。
  • 浏览模块基于从图像-音频对中提取的索引特征运行,通过跳过无信息段落,实现高效的视频级识别。
  • 音频被用作时间动态和上下文线索的代理,使模型能够检测动作的开始或结束。
  • 该框架采用可微分注意力机制进行端到端训练,实现特征提取与时刻选择的联合优化。

实验结果

研究问题

  • RQ1音频能否用作高效预览,以减少视频动作识别中的冗余处理?
  • RQ2蒸馏后的图像-音频特征能否在显著更高效的前提下,实现与完整片段级特征相当的性能?
  • RQ3基于注意力的视频浏览机制,若由音频和图像特征引导,能否优于均匀采样或密集推理?
  • RQ4同时在片段级和视频级处理中利用音频,能否带来更好的准确率-速度权衡?
  • RQ5所提出的方法能否在具有不同视频长度和动作稀疏性的多样化动作识别数据集中实现泛化?

主要发现

  • 在使用 ResNet-152 特征的 ActivityNet 数据集上,该方法实现了 84.2 的 mAP,比之前方法高出 0.4 个百分点,达到最先进水平。
  • 在使用 R(2+1)D-152 特征时,该方法实现了 89.9% 的 mAP,计算速度比密集推理快 10 倍,比均匀采样快 20 倍。
  • 在 ActivityNet 上,该方法将计算成本降低至 1.31 TFLOPs(相比密集推理的 25.9 TFLOPs),同时保持高准确率。
  • 定性结果表明,ImgAud-Skimming 选择的帧在动作指示性方面显著优于均匀采样的帧。
  • 该方法在如射箭、三级跳和啤酒弹瓶等稀疏动作上实现了最高的准确率增益,这些动作的关键时刻短暂且不频繁。
  • 消融实验确认,即使使用轻量级识别特征,ImgAud2Vid 蒸馏步骤对准确率的提升也具有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。