[论文解读] Hierarchical Feature Aggregation Networks for Video Action Recognition
本文提出分层特征聚合网络(HF-Net),一种轻量级模块,通过卷积门实现相邻特征分支之间的动态、可学习交互,从而在每一层平衡特征差分与平均,提升视频动作识别性能。该方法在Something-Now数据集上性能提升超过24%,仅增加1.14%参数量和1.04% FLOPs,同时通过保守路由策略保持特征流动。
Most action recognition methods base on a) a late aggregation of frame level CNN features using average pooling, max pooling, or RNN, among others, or b) spatio-temporal aggregation via 3D convolutions. The first assume independence among frame features up to a certain level of abstraction and then perform higher-level aggregation, while the second extracts spatio-temporal features from grouped frames as early fusion. In this paper we explore the space in between these two, by letting adjacent feature branches interact as they develop into the higher level representation. The interaction happens between feature differencing and averaging at each level of the hierarchy, and it has convolutional structure that learns to select the appropriate mode locally in contrast to previous works that impose one of the modes globally (e.g. feature differencing) as a design choice. We further constrain this interaction to be conservative, e.g. a local feature subtraction in one branch is compensated by the addition on another, such that the total feature flow is preserved. We evaluate the performance of our proposal on a number of existing models, i.e. TSN, TRN and ECO, to show its flexibility and effectiveness in improving action recognition performance.
研究动机与目标
- 为解决视频动作识别中固定聚合策略的局限性,如僵化的特征差分或池化操作,这些方法无法适应输入相关的时序动态特性。
- 在不依赖昂贵的3D卷积或外部光流的情况下,使深层网络能够随时间扩展更大的感受野。
- 设计一种即插即用的模块,以极低的参数量和FLOP开销增强现有2D-CNN主干网络(如TSN、TRN、ECO)。
- 通过卷积门学习局部自适应的特征融合,动态选择每层的差分或平均操作。
- 在保持低推理成本的同时,实现在动作识别基准上的竞争力表现,适用于移动端部署。
提出的方法
- 核心组件是HF模块,该模块在CNN主干网络每一层的相邻特征分支上运行。
- 在每一层,网络计算一个门控残差:通过可学习的卷积门,将一个分支的特征减去后加到相邻分支上。
- 门控模块端到端训练,决定局部是否应用特征差分或平均,从而实现自适应的时序推理。
- 通过确保跨分支的总特征流保持不变,实现保守路由,防止信息丢失。
- 该模块即插即用,兼容任何基于2D-CNN的视频模型,包括TSN、TRN和ECO。
- 网络端到端训练,使门控模块能够学习输入相关的融合策略,从而提升时空表征学习能力。
实验结果
研究问题
- RQ1可学习的、动态的相邻特征分支间交互是否能超越固定聚合方法,提升视频动作识别性能?
- RQ2该机制是否能在不使用3D卷积的情况下,有效扩展2D-CNN主干网络的时序感受野?
- RQ3所提出的分层特征聚合方法是否能在计算开销极低的前提下实现性能增益?
- RQ4该方法是否能在不同主干架构和数据集上实现良好泛化?
- RQ5该模块是否能在低FLOP和参数量的前提下,实现长序列及复杂人机交互视频的强性能表现?
主要发现
- 在TSN上应用HF-Net后,Something-Now数据集上的准确率提升达24.2%,仅增加1.14%参数量和1.04% FLOPs。
- 在HMDB51数据集上,HF增强的模型(TSN、TRN、ECOLite)在所有基线模型上均实现超过2%的准确率增益,部分情况下优于更大的3D CNN。
- 在EPIC-KITCHENS数据集上,HF-TSN在RGB和光流双流设置下均优于TSN,S1设置下动作分类准确率提升12%,S2设置下提升8%。
- 该方法在三个基准数据集——Something-Now、HMDB51和EPIC-KITCHENS上均实现竞争力表现,同时保持低计算成本。
- HF模块在ECOLite上的性能提升显著,该模型的3D卷积数量少于完整3D CNN,表明在某些情况下,分层特征聚合优于密集3D卷积。
- 消融实验表明,可学习门控机制至关重要,固定差分或平均策略的性能均低于自适应路由机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。