[论文解读] RGB-D Based Action Recognition with Light-weight 3D Convolutional Networks
本文提出轻量级3D卷积神经网络(IST、SST、GSST)用于基于RGB-D的动作识别,将3D卷积分解为空间与时间分量,结合通道混洗、分组卷积及基于tanh的融合策略。该模型在NTU(97.6%跨视角)和N-UCLA(95.5%)数据集上达到最先进准确率,同时显著减少参数量与推理时间,在效率上优于I3D,同时保持了具有竞争力的性能。
Different from RGB videos, depth data in RGB-D videos provide key complementary information for tristimulus visual data which potentially could achieve accuracy improvement for action recognition. However, most of the existing action recognition models solely using RGB videos limit the performance capacity. Additionally, the state-of-the-art action recognition models, namely 3D convolutional neural networks (3D-CNNs) contain tremendous parameters suffering from computational inefficiency. In this paper, we propose a series of 3D light-weight architectures for action recognition based on RGB-D data. Compared with conventional 3D-CNN models, the proposed light-weight 3D-CNNs have considerably less parameters involving lower computation cost, while it results in favorable recognition performance. Experimental results on two public benchmark datasets show that our models can approximate or outperform the state-of-the-art approaches. Specifically, on the RGB+D-NTU (NTU) dataset, we achieve 93.2% and 97.6% for cross-subject and cross-view measurement, and on the Northwestern-UCLA Multiview Action 3D (N-UCLA) dataset, we achieve 95.5% accuracy of cross-view.
研究动机与目标
- 解决当前最先进3D-CNN在动作识别中计算成本高、参数量大的问题。
- 利用RGB与深度模态在RGB-D视频中的互补信息,提升动作识别准确率。
- 设计高效3D-CNN架构,在计算开销最小化的同时保持高性能。
- 在公开的RGB-D基准数据集(包括NTU与N-UCLA)上验证轻量级3D-CNN的有效性。
提出的方法
- 将3D卷积分解为独立的空间与时间2D卷积,以减少参数量与计算量。
- 在残差块中应用通道混洗与通道分割,以增强特征表示能力并提升参数效率。
- 使用分组卷积进一步降低网络中的参数量与计算成本。
- 引入基于双曲正切函数的融合策略,以有效结合RGB与深度特征。
- 设计三种轻量级变体:IST(分离空间-时间)、SST(含分组卷积的空间-时间结构)、GSST(额外引入通道分割与分组卷积)。
- 保留第一层卷积层不进行压缩,以维持初始特征提取能力,将效率优化集中在深层网络。
实验结果
研究问题
- RQ1将3D卷积分解为空间与时间分量,是否能显著减少模型参数量与FLOPs,同时不损失准确率?
- RQ2与仅使用RGB的模型相比,融合深度数据在多大程度上能提升动作识别性能?
- RQ3轻量级3D-CNN在多大程度上可达到或超越如I3D等重型最先进模型的性能?
- RQ4不同架构组件(如分组卷积、通道混洗)在准确率、参数量与推理速度之间产生何种权衡?
主要发现
- 在NTU数据集上,所提出的GSST模型在跨视角评估中达到97.6%的准确率,效率优于I3D,同时保持了高准确率。
- 在N-UCLA数据集上,模型在跨视角评估中达到95.5%的准确率,展现出在多视角数据上的强大泛化能力。
- 与I3D相比,GSST模型在GeForce GTX TITAN上将推理时间减少了约45%,在Tesla K40c上减少了48%,每轮迭代执行时间分别为0.214秒与0.296秒。
- 尽管第一卷积层仅占总参数的0.5%至2.1%,却贡献了总FLOPs的23.8%至61.8%,凸显了对早期层进行效率优化的重要性。
- GSST中使用分组卷积导致准确率相比SST显著下降,表明压缩与表征能力之间可能存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。