Skip to main content
QUICK REVIEW

[论文解读] ViT-ReT: Vision and Recurrent Transformer Neural Networks for Human Activity Recognition in Videos

James Wensel, Hayat Ullah|arXiv (Cornell University)|Aug 16, 2022
Human Pose and Action Recognition被引用 5
一句话总结

本文提出ViT-ReT,一种新型混合神经网络,结合视觉变换器(ViT)进行空间特征提取和循环变换器(ReT)进行时间序列建模,以提升视频中人类活动识别的性能。该方法在准确率上与CNN-RNN模型相当,但推理速度显著更快,内存占用更低,展示了变换器作为高效、可扩展的替代方案在实时和边缘兼容活动识别系统中的潜力。

ABSTRACT

Human activity recognition is an emerging and important area in computer vision which seeks to determine the activity an individual or group of individuals are performing. The applications of this field ranges from generating highlight videos in sports, to intelligent surveillance and gesture recognition. Most activity recognition systems rely on a combination of convolutional neural networks (CNNs) to perform feature extraction from the data and recurrent neural networks (RNNs) to determine the time dependent nature of the data. This paper proposes and designs two transformer neural networks for human activity recognition: a recurrent transformer (ReT), a specialized neural network used to make predictions on sequences of data, as well as a vision transformer (ViT), a transformer optimized for extracting salient features from images, to improve speed and scalability of activity recognition. We have provided an extensive comparison of the proposed transformer neural networks with the contemporary CNN and RNN-based human activity recognition models in terms of speed and accuracy.

研究动机与目标

  • 为解决当前CNN-RNN模型在人类活动识别中的局限性,特别是其高计算复杂度和慢速推理时间。
  • 探索变换器神经网络(TNNs)作为深度残差CNN和RNN在基于视频的活动识别中的一种轻量化、可扩展的替代方案的潜力。
  • 评估结合循环变换器(ReT)与视觉变换器(ViT)在视频活动识别任务中的准确率、速度和内存效率方面的性能。
  • 证明在资源受限的边缘和物联网设备上部署基于TNN的模型以实现实时应用的可行性。

提出的方法

  • 该模型使用视觉变换器(ViT)通过将视频帧划分为图像块并应用可学习的位置嵌入和多头自注意力机制,从单个视频帧中提取空间特征。
  • 采用循环变换器(ReT)对视频帧序列中的时间依赖性进行建模,利用自注意力机制捕捉长距离时间关系。
  • ViT与ReT组件按顺序堆叠:ViT独立处理每一帧,ReT则处理生成的特征序列以做出最终预测。
  • 该架构通过标准交叉熵损失进行端到端训练,并使用反向传播和Adam或类似优化器进行优化。
  • 该方法避免使用ResNet中复杂的残差连接和分层特征学习,转而依赖基于注意力的特征聚合。
  • 通过推理速度、内存消耗和参数数量评估模型效率,并与标准CNN-RNN基线进行比较。

实验结果

研究问题

  • RQ1视觉变换器(ViT)能否有效从视频帧中提取空间特征用于人类活动识别,表现优于或至少匹配基于CNN的特征提取器?
  • RQ2循环变换器(ReT)模型是否能比传统的RNN(如LSTM或GRU)更高效地捕捉视频序列中的时间依赖性?
  • RQ3将ViT与ReT结合是否能实现高准确率的同时,显著提升推理速度和内存效率,相比CNN-RNN流水线?
  • RQ4TNNs在端到端人类活动识别系统中,能在多大程度上替代传统的CNN和RNN组件?

主要发现

  • ReT模型在准确率上与传统基于RNN的分类器相当,但速度更快、内存更少,证明了变换器在活动识别中序列建模的可行性。
  • ViT-ReT流水线在推理速度和内存效率方面显著优于传统CNN-RNN模型,使其适用于边缘和物联网设备的部署。
  • ViT用于空间特征提取与ReT用于时间建模的结合,相比传统的深层CNN与RNN堆叠,实现了更具可扩展性和并行性的架构。
  • 即使替换复杂的残差CNN和RNN,所提出的模型仍保持高准确率,表明自注意力机制可有效替代视频理解中的分层特征学习。
  • 结果表明,TNNs可作为CNN-RNN流水线的有力替代方案,尤其在实时和资源受限环境中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。