[论文解读] Learning Gating ConvNet for Two-Stream based Methods in Action Recognition
本文提出一种端到端可训练的门控卷积神经网络,用于两流动作识别中的自适应融合,采用ReLU激活的融合权重而非固定的平均化方法。通过联合学习融合权重与动作分类,该方法在UCF101数据集上达到94.5%的准确率,优于固定权重方法,能够根据每段视频的可靠性动态分配更高的置信度给更可靠的流。
For the two-stream style methods in action recognition, fusing the two streams' predictions is always by the weighted averaging scheme. This fusion method with fixed weights lacks of pertinence to different action videos and always needs trial and error on the validation set. In order to enhance the adaptability of two-stream ConvNets and improve its performance, an end-to-end trainable gated fusion method, namely gating ConvNet, for the two-stream ConvNets is proposed in this paper based on the MoE (Mixture of Experts) theory. The gating ConvNet takes the combination of feature maps from the same layer of the spatial and the temporal nets as input and adopts ReLU (Rectified Linear Unit) as the gating output activation function. To reduce the over-fitting of gating ConvNet caused by the redundancy of parameters, a new multi-task learning method is designed, which jointly learns the gating fusion weights for the two streams and learns the gating ConvNet for action classification. With our gated fusion method and multi-task learning approach, a high accuracy of 94.5% is achieved on the dataset UCF101.
研究动机与目标
- 解决两流卷积神经网络中固定权重融合的局限性,该方法无法适应视频间空间与时间内容的差异。
- 通过基于双流输入特征的实例特定融合权重学习,提升模型的适应能力。
- 通过一种新颖的多任务学习策略,联合优化融合权重与动作分类,减少门控网络的过拟合。
- 实现门控机制的端到端训练,以提升动作识别基准上的泛化能力与性能。
提出的方法
- 引入一个门控卷积神经网络,以同一层的空间流与时间流的特征图拼接结果作为输入。
- 使用ReLU作为输出激活函数,生成空间流与时间流的两个非负融合权重。
- 设计一种多任务学习框架,联合训练门控网络以生成融合权重与执行动作分类。
- 在预测层应用门控卷积神经网络,将固定的平均化操作替换为每段视频样本的可学习、自适应融合。
- 探索门控网络输入的不同配置,包括拼接与卷积融合方式。
- 使用标准反向传播算法,通过联合优化融合与分类目标,实现整个系统的端到端训练。
实验结果
研究问题
- RQ1通过门控网络学习的自适应融合权重是否能超越固定权重平均化方法,在两流动作识别中取得更好性能?
- RQ2与基于Softmax的门控相比,使用ReLU作为门控输出激活函数是否能实现更快收敛并取得更优性能?
- RQ3联合学习融合权重与动作分类是否能提升泛化能力并减少门控网络的过拟合?
- RQ4所学习的融合权重在不同视频类别与输入类型中的分布如何变化?
- RQ5所提出方法在UCF101等标准基准上,对Top-1与Top-5准确率的提升程度如何?
主要发现
- 所提出的门控融合方法在UCF101上达到94.5%的Top-1准确率,优于固定权重平均化方法。
- 门控网络中使用ReLU相比Softmax基线,实现了更快收敛且保持了相当的最终准确率。
- 多任务学习扩展了融合权重的自适应选择空间,使融合决策更具动态性与上下文感知能力。
- t-SNE可视化结果表明,当门控卷积神经网络与动作分类联合训练时,其特征更具判别性。
- 在某一单一流不可靠的困难样本中,模型能学习到将更高权重分配给更准确的流,从而提升预测的置信度与正确性。
- 该方法通过消除对人工验证集试验以设定固定融合权重的依赖,降低了对超参数调优的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。