Skip to main content
QUICK REVIEW

[论文解读] An Image Classifier Can Suffice For Video Understanding.

Quanfu Fan, Chun-Fu Chen|arXiv (Cornell University)|Jun 26, 2021
Human Pose and Action Recognition参考文献 47被引用 6
一句话总结

本文提出了一种新颖的视频理解方法,将视频动作识别视为图像分类任务。通过将视频帧组合成一张“超图像”并应用预训练的图像分类器——无需显式的时间建模——该方法在Kinetics400、Something-Want-What(V2)、MiT和Jester数据集上均取得了优异性能,与依赖复杂时空建模的最先进方法相当。

ABSTRACT

We propose a new perspective on video understanding by casting the video recognition problem as an image recognition task. We show that an image classifier alone can suffice for video understanding without temporal modeling. Our approach is simple and universal. It composes input frames into a super image to train an image classifier to fulfill the task of action recognition, in exactly the same way as classifying an image. We prove the viability of such an idea by demonstrating strong and promising performance on four public datasets including Kinetics400, Something-to-something (V2), MiT and Jester, using a recently developed vision transformer. We also experiment with the prevalent ResNet image classifiers in computer vision to further validate our idea. The results on Kinetics400 are comparable to some of the best-performed CNN approaches based on spatio-temporal modeling. our code and models will be made available at this https URL.

研究动机与目标

  • 探究是否仅通过图像分类器即可实现视频理解,而无需显式的时间建模。
  • 评估将视频帧组合为超图像用于动作识别的有效性。
  • 对比图像分类器在视频数据上的性能与现有时空模型的性能。
  • 在包括Kinetics400、Something-Want-What(V2)、MiT和Jester在内的多样化视频数据集上验证该方法的有效性。

提出的方法

  • 将输入视频帧按空间和时间顺序排列,组合成一张复合图像,称为“超图像”。
  • 在超图像表示上微调预训练的视觉Transformer或ResNet图像分类器,用于动作识别。
  • 该方法避免了对时间动态的显式建模,例如3D卷积或循环网络。
  • 该方法具有通用性,可兼容任意图像分类器架构。
  • 训练和推理在超图像上端到端进行,将视频视为单一图像输入。
  • 该方法在多个公开视频数据集上使用标准基准进行评估。

实验结果

研究问题

  • RQ1仅使用图像分类器是否能在不显式建模时间动态的情况下识别视频中的动作?
  • RQ2基于超图像的图像分类器与具备专用时空建模能力的模型在视频动作识别上的性能相比如何?
  • RQ3该方法在动作复杂度和帧率各异的多样化视频数据集上是否具备良好的泛化能力?
  • RQ4选择不同的图像分类器(如视觉Transformer与ResNet)在视频理解任务上的性能影响有多大?

主要发现

  • 超图像方法在Kinetics400上的性能与采用显式时空建模的最先进CNN方法相当。
  • 该方法在多个数据集上表现出强大的泛化能力,包括Kinetics400、Something-Want-What(V2)、MiT和Jester。
  • 使用视觉Transformer作为图像分类器时取得了特别优异的结果,表明其与现代自注意力架构具有良好的兼容性。
  • 与需要3D卷积或循环组件的模型相比,该方法在显著降低架构复杂度的同时实现了具有竞争力的准确率。
  • 结果验证了:当有效利用帧组合与强大图像分类器时,时间建模并非视频理解的必要条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。