Skip to main content
QUICK REVIEW

[论文解读] Can An Image Classifier Suffice For Action Recognition?

Quanfu Fan, Chun-Fu|arXiv (Cornell University)|Jun 26, 2021
Human Pose and Action Recognition被引用 9
一句话总结

本文提出 SIFAR(Super Image for Action Recognition),一种通过将视频帧转换为超图像以实现预训练图像分类器直接应用的新型动作识别方法——无需专用的时空建模。通过将帧重新排列为二维超图像布局,Swin Transformer 和基于 ResNet 的模型在 Kinetics400、SSV2 等基准上实现了最先进或具有竞争力的性能,表明当时间模式被嵌入空间中时,仅使用图像分类器即可实现有效的动作识别。

ABSTRACT

We explore a new perspective on video understanding by casting the video recognition problem as an image recognition task. Our approach rearranges input video frames into super images, which allow for training an image classifier directly to fulfill the task of action recognition, in exactly the same way as image classification. With such a simple idea, we show that transformer-based image classifiers alone can suffice for action recognition. In particular, our approach demonstrates strong and promising performance against SOTA methods on several public datasets including Kinetics400, Moments In Time, Something-Something V2 (SSV2), Jester and Diving48. We also experiment with the prevalent ResNet image classifiers in computer vision to further validate our idea. The results on both Kinetics400 and SSV2 are comparable to some of the best-performed CNN approaches based on spatio-temporal modeling. Our source codes and models are available at https://github.com/IBM/sifar-pytorch.

研究动机与目标

  • 探究是否可以在不使用专用时空模块的情况下,直接复用图像分类器进行视频动作识别。
  • 探索是否可通过将帧在空间上重新排列为超图像,有效建模视频中的时间依赖性。
  • 评估在超图像框架下,视觉Transformer与基于CNN的图像分类器的性能表现。
  • 确定超图像布局、位置嵌入和帧序对模型准确率的影响。
  • 评估在极少架构改动的前提下,复用成熟图像识别技术进行视频理解的可行性。

提出的方法

  • 使用预定义的空间布局将输入视频帧重新排列为二维超图像,以将时空模式编码为空间特征。
  • 直接在超图像上使用标准图像分类损失对预训练图像分类器(如 Swin Transformer 或 ResNet)进行训练,以实现动作识别。
  • 对 Swin Transformer 进行修改,使其在最后一层启用完整的自注意力机制,以增强超图像中的长程时间建模能力。
  • 在超图像中的帧上应用绝对位置嵌入(APE),以改善空间定位,通过消融实验评估其影响。
  • 通过在额外的残差块中用更大卷积核(如 7×7、11×11、21×21)替换 3×3 卷积,扩展 CNN 的感受野,以提升时间建模能力。
  • 使用类激活图(CAM)和消融 CAM 可视化并解释模型在预测动作时的注意力机制。

实验结果

研究问题

  • RQ1当直接应用于由视频帧构成的超图像时,标准图像分类器是否能在动作识别任务上取得优异性能?
  • RQ2超图像中帧的空间布局如何影响模型捕捉时间动态的能力?
  • RQ3引入绝对位置嵌入是否能提升模型性能,且其影响在不同数据集上是否一致?
  • RQ4模型对输入帧的时间顺序是否敏感,尤其是在像 Something-Something V2 这类细粒度动作数据集上?
  • RQ5通过使用更大卷积核尺寸扩展感受野,是否可使基于 CNN 的图像分类器在动作识别任务上具备竞争力?

主要发现

  • 使用 Swin Transformer 的 SIFAR 在 Kinetics400 和 SSV2 上均实现了最先进性能,优于或匹配了使用专用时空建模的现有最先进方法。
  • 基于 ResNet 的 SIFAR 模型在 Kinetics400 上表现具有竞争力,当在附加残差块中使用 21×21 卷积核时,相比原始 ResNet50 提升了 5.0% 的绝对准确率。
  • 在 SSV2 上,当输入帧顺序被反转或随机化时,SIFAR 性能显著下降,表明时间顺序对细粒度动作识别至关重要。
  • 网格布局的超图像表现最佳,而条带布局表现最差,证实帧的空间排列方式会影响时间模式的编码效果。
  • 绝对位置嵌入在 SSV2 上略微提升了准确率,但在 Kinetics400 上反而降低了性能,表明其有效性具有数据集依赖性。
  • 消融 CAM 可视化结果表明,SIFAR 能够学习关注与动作相关的关键对象和运动区域(如呼啦圈或足球),验证了其可解释性与特征学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。