[论文解读] Look More but Care Less in Video Recognition
本文提出了一种双分支2D-CNN架构——Ample and Focal Network (AFNet),通过轻量级导航模块动态聚焦显著帧,实现在仅需极少计算量的前提下处理所有输入帧,从而实现高效的视频识别。该方法通过在网络内部自适应选择帧来隐式建模时间动态,即使使用更少的帧也实现了比基线方法更高的准确率,同时降低了计算成本而不损失信息。
Existing action recognition methods typically sample a few frames to represent each video to avoid the enormous computation, which often limits the recognition performance. To tackle this problem, we propose Ample and Focal Network (AFNet), which is composed of two branches to utilize more frames but with less computation. Specifically, the Ample Branch takes all input frames to obtain abundant information with condensed computation and provides the guidance for Focal Branch by the proposed Navigation Module; the Focal Branch squeezes the temporal size to only focus on the salient frames at each convolution block; in the end, the results of two branches are adaptively fused to prevent the loss of information. With this design, we can introduce more frames to the network but cost less computation. Besides, we demonstrate AFNet can utilize fewer frames while achieving higher accuracy as the dynamic selection in intermediate features enforces implicit temporal modeling. Further, we show that our method can be extended to reduce spatial redundancy with even less cost. Extensive experiments on five datasets demonstrate the effectiveness and efficiency of our method.
研究动机与目标
- 通过使模型在不按比例增加计算量的前提下使用更多帧,解决视频识别中计算成本与识别准确率之间的权衡问题。
- 克服现有方法过早丢弃不重要帧所导致的信息损失与模型鲁棒性下降的局限性。
- 在模型内部引入一种动态、端到端可训练的帧选择机制,以增强时间建模与特征表示能力。
- 设计一种轻量级导航模块,使网络在每个卷积块上对显著帧进行选择性计算,从而减少冗余,且无需引入策略网络。
- 将框架扩展至处理空间冗余,通过将选择机制适配到选定帧的空间区域,进一步提升效率。
提出的方法
- 提出双分支架构:Ample分支对所有输入帧进行下采样与通道压缩,以低计算量保留完整的时序信息。
- 引入Focal分支,利用导航模块在每个卷积块上动态选择并仅对显著帧进行计算,从而减少时间维度上的计算量。
- 设计一种轻量级导航模块,基于中间特征生成帧选择权重,实现端到端训练,且无需额外策略网络。
- 实现两分支之间的自适应特征融合,结合Ample分支的全局上下文与Focal分支的聚焦表示。
- 通过将相同的动态选择机制应用于选定帧的空间区域,实现对空间冗余的减少。
- 端到端训练整个网络,使导航模块可通过反向传播学习任务特定的帧重要性。
实验结果
研究问题
- RQ1双分支网络设计是否能在减少计算成本的同时保留完整的输入帧信息?
- RQ2与在输入阶段进行选择相比,在网络内部进行动态帧选择是否能带来更优的时间建模效果,并在使用更少帧时提升准确率?
- RQ3轻量级可学习导航模块是否能替代复杂的策略网络实现帧选择,同时保持端到端训练与计算效率?
- RQ4所提方法在多大程度上能减少时间与空间冗余,而不会牺牲识别性能?
- RQ5与固定采样或随机选择相比,中间层的动态选择策略在准确率与效率方面表现如何?
主要发现
- AFNet在Something-Something V1数据集上仅选择50%的帧即达到75.9%的top-1准确率,优于使用100%帧的基线方法(74.6%准确率)。
- 在相同帧数下,采用自适应融合的双分支设计相比单分支模型,准确率最高提升3.4%。
- 导航模块在所有帧选择比例下均优于固定采样策略(随机、均匀、正态分布),尤其在低比例(如0.3)时,准确率差距最为显著。
- 该方法通过聚焦显著帧减少计算成本,同时保留所有输入信息,使在更少帧下实现更高准确率成为可能,优于静态采样方法。
- 动态选择机制隐式建模了时间关系,使网络能够比静态方法更有效地学习时间依赖性。
- 该框架可扩展至减少空间冗余,结合空间自适应方法后效率进一步提升,如消融实验所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。