[论文解读] Residual Frames with Efficient Pseudo-3D CNN for Human Action Recognition
该论文提出了一种轻量级、高效的框架,通过利用残差帧(相邻RGB帧之间的差异)作为运动表征,以最小的计算成本捕捉显著的运动线索,实现人体动作识别。该框架引入了一种新型伪3D卷积模块,将标准3D卷积分解为2D空间和1D时间操作,从而降低计算成本与模型大小,并结合特征空间残差连接与自注意力机制,实现了SOTA性能:在UCF101数据集上达到83%的top-1准确率,同时将FLOPs从163G降低至30G。
Human action recognition is regarded as a key cornerstone in domains such as surveillance or video understanding. Despite recent progress in the development of end-to-end solutions for video-based action recognition, achieving state-of-the-art performance still requires using auxiliary hand-crafted motion representations, e.g., optical flow, which are usually computationally demanding. In this work, we propose to use residual frames (i.e., differences between adjacent RGB frames) as an alternative "lightweight" motion representation, which carries salient motion information and is computationally efficient. In addition, we develop a new pseudo-3D convolution module which decouples 3D convolution into 2D and 1D convolution. The proposed module exploits residual information in the feature space to better structure motions, and is equipped with a self-attention mechanism that assists to recalibrate the appearance and motion features. Empirical results confirm the efficiency and effectiveness of residual frames as well as the proposed pseudo-3D convolution module.
研究动机与目标
- 通过计算成本更低的运动表征替代光流,提升人体动作识别性能。
- 解决在不依赖昂贵手工设计运动特征的前提下建模视频数据时间动态性的挑战。
- 开发一种轻量化、参数高效的3D卷积模块,以增强运动与外观特征的学习能力。
- 验证残差帧作为RGB输入的互补模态在动作识别中的有效性。
- 证明特征空间残差连接与自注意力机制可显著提升识别性能。
提出的方法
- 通过计算相邻RGB帧之间的绝对差值来生成残差帧,即 $ x^{res}_{(t_1,s)} = |x_{t_1+s} - x_{t_1}| $,以提取与运动相关的特征,同时最小化背景与外观噪声的影响。
- 提出一种新型伪3D卷积模块,将标准3D卷积分解为并行的2D空间卷积与1D时间卷积,从而降低计算成本与模型大小。
- 在特征空间中引入时间相邻特征图的残差连接,以增强运动表征的学习能力。
- 引入自注意力机制,根据其与动作识别任务的相关性,重新校准外观特征与运动特征的重要性。
- 采用端到端方式联合训练RGB与残差帧输入的模型,并通过消融实验验证各组件的贡献。
- 在UCF101上通过top-1与top-5准确率、FLOPs以及消融分析,评估模态融合与各组件的有效性。
实验结果
研究问题
- RQ1作为帧差计算的残差帧,能否作为人体动作识别中光流的有效且高效的替代方案?
- RQ2在残差帧计算中,不同步长对动作识别性能有何影响?
- RQ3所提出的伪3D卷积模块在降低计算成本的同时,对识别准确率的提升程度如何?
- RQ4自注意力机制与特征空间残差连接在所提模块中的独立贡献分别是什么?
- RQ5融合RGB与残差帧输入是否能带来优于单一模态的性能表现?
主要发现
- 仅使用步长 $ s=1 $ 的残差帧,在UCF101上达到83.0%的top-1准确率,较仅使用RGB的模型高出2.6个百分点。
- 融合RGB与残差帧($ s=1 $)后,top-1准确率提升至85.6%,表明两种模态间存在互补信息。
- 所提出的伪3D模块将FLOPs从标准3D卷积的163G降低至30G,同时提升性能,验证了其高效性与有效性。
- 消融实验表明,若移除自注意力机制,top-1准确率下降1.8%(至83.8%);若移除特征空间残差连接,准确率下降2.1%(至83.5%)。
- 随着步长增大,性能下降:top-1准确率从 $ s=1 $ 时的83.0%降至 $ s=4 $ 时的80.2%,表明较小的时间步长更能保持运动信息的保真度。
- 完整模型(同时包含自注意力与特征空间残差连接)达到85.6%的top-1准确率,证实了两者的协同增益作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。