[论文解读] AdaFuse: Adaptive Temporal Fusion Network for Efficient Action Recognition
AdaFuse 提出了一种自适应时间融合网络,通过在推理过程中动态重用历史特征图并跳过冗余通道,实现高效的视频动作识别。通过使用 Gumbel-Softmax 学习可微策略,其在多个基准测试中将 FLOPs 减少约 40%,同时保持与最先进模型相当的准确率。
Temporal modelling is the key for efficient video action recognition. While understanding temporal information can improve recognition accuracy for dynamic actions, removing temporal redundancy and reusing past features can significantly save computation leading to efficient action recognition. In this paper, we introduce an adaptive temporal fusion network, called AdaFuse, that dynamically fuses channels from current and past feature maps for strong temporal modelling. Specifically, the necessary information from the historical convolution feature maps is fused with current pruned feature maps with the goal of improving both recognition accuracy and efficiency. In addition, we use a skipping operation to further reduce the computation cost of action recognition. Extensive experiments on Something V1 & V2, Jester and Mini-Kinetics show that our approach can achieve about 40% computation savings with comparable accuracy to state-of-the-art methods. The project page can be found at https://mengyuest.github.io/AdaFuse/
研究动机与目标
- 通过利用视频帧间特征冗余,解决深度卷积神经网络在视频动作识别中的高计算成本问题。
- 开发一种与模型无关的可微机制,以决定每个样本和每层是否跳过、重用或计算通道。
- 通过利用视频特征中的时间一致性,提升效率而不牺牲识别准确率。
- 提供一种与现有 2D-CNN 架构兼容的即插即用式解决方案,用于动作识别。
- 通过学习到的策略分布,揭示数据集特异性和层特异性的时序动态特性。
提出的方法
- 引入基于 Gumbel-Softmax 的可微决策策略,以在每个层的每个通道上选择三种操作之一:跳过、重用或计算。
- 使用学习到的注意力权重将当前剪枝后的特征与历史特征图进行融合,以保留时间上下文信息。
- 应用跳跃连接以减少计算量,避免在动态变化小的帧中重复计算特征。
- 通过反向传播联合训练策略网络与主网络,使用加权损失函数平衡准确率与 FLOP 减少。
- 设计轻量级且可扩展的策略网络,隐藏层大小和正则化超参数经调优以实现高效性。
- 将 AdaFuse 作为插件集成到现有 2D-CNN 主干网络(如 TSN、TSM 和 ResNet)中,实现即插即用的效率提升。
实验结果
研究问题
- RQ1自适应的通道级决策(跳过、重用、计算)是否能显著减少视频动作识别中的 FLOPs,同时不造成准确率下降?
- RQ2所学习的策略在不同视频数据集和网络层之间如何变化?这揭示了哪些关于时序动态的见解?
- RQ3在扩展策略网络容量时,模型大小、推理速度与准确率之间的权衡如何变化?
- RQ4与朴素或随机的通道选择相比,跳过与重用操作的组合在效率-准确率权衡方面表现如何?
- RQ5策略分布能否作为诊断工具,用于理解数据集特异性的时序特征,并指导未来网络架构设计?
主要发现
- AdaFuse 在 Something-Something V1 和 V2、Jester 以及 Mini-Kinetics 数据集上实现了约 40% 的 FLOP 减少,同时保持了最先进水平的准确率。
- ‘重用’操作对准确率提升贡献最大,与朴素跳过相比,Top-1 准确率提高了 21.5 个百分点。
- ‘跳过’操作是效率提升的主要驱动力,在 ‘Ada. Skip’ 消融实验中使 FLOPs 减少了 55%。
- 将策略网络的隐藏层大小从 1024 增加到 4096,使 Something-V2 上的 Top-1 准确率从 59.40% 提升至 60.00%,同时 FLOP 增加极少。
- 策略分布显示,早期层对时间变化不敏感,而深层则更动态地适应输入动态。
- 自适应策略优于随机或固定策略,在使用 TSN-R18 的 Something-V1 上实现了 10.3G FLOPs 和 36.9% Top-1 准确率的最佳准确率-效率权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。