[论文解读] Busy-Quiet Video Disentangling for Video Classification
该论文提出了一种新颖的运动带通模块(Motion Band-Pass Module, MBPM),通过在频域中过滤时空频率,将视频数据中的运动细节与静止背景内容解耦,使双流的繁忙-静音网络(Busy-Quiet Net, BQN)能够以高复杂度处理运动关键区域,以低复杂度处理静态区域。BQN通过利用频域运动滤波和高效的双路特征学习,在保持显著更低参数量(FLOPs)的同时,在Something-Something V1、Kinetics400、UCF101和HMDB51数据集上实现了最先进(SOTA)的分类准确率。
In video data, busy motion details from moving regions are conveyed within a specific frequency bandwidth in the frequency domain. Meanwhile, the rest of the frequencies of video data are encoded with quiet information with substantial redundancy, which causes low processing efficiency in existing video models that take as input raw RGB frames. In this paper, we consider allocating intenser computation for the processing of the important busy information and less computation for that of the quiet information. We design a trainable Motion Band-Pass Module (MBPM) for separating busy information from quiet information in raw video data. By embedding the MBPM into a two-pathway CNN architecture, we define a Busy-Quiet Net (BQN). The efficiency of BQN is determined by avoiding redundancy in the feature space processed by the two pathways: one operating on Quiet features of low-resolution, while the other processes Busy features. The proposed BQN outperforms many recent video processing models on Something-Something V1, Kinetics400, UCF101 and HMDB51 datasets.
研究动机与目标
- 为解决现有视频模型因在原始RGB视频中对静态背景和光滑纹理进行冗余处理而导致的效率低下问题。
- 开发一种可训练的端到端机制,从时空域中分离出运动相关的信息,去除低频冗余成分。
- 设计一种双路网络架构(繁忙-静音网络,BQN),根据运动内容自适应分配计算资源。
- 通过利用视频数据中频域稀疏性,提升视频分类准确率,同时降低计算成本。
- 实现在无需依赖光流或帧汇总的前提下,实现高效、实时的运动表征。
提出的方法
- 运动带通模块(MBPM)通过在频域中使用可学习的带通滤波器对视频序列进行过滤,提取与运动相关的关键特征,聚焦于快速运动边缘和边界被编码的特定频带。
- 对于每组连续的三帧RGB图像,MBPM输出一帧代表性图像,保留关键运动线索的同时减少时间冗余。
- 繁忙-静音网络(BQN)采用两条并行路径:繁忙路径处理来自MBPM输出的高分辨率运动特征,而静音路径处理静态内容的低分辨率下采样表示。
- 带通侧向连接(Band-Pass Lateral Connection, BPLC)模块在两条路径之间融合特征,实现对模型优化至关重要的跨路径信息交换。
- 该架构可与现有3D CNN主干网络(如TSM-R50、X3D-M和I3D)兼容,支持即插即用式集成到最先进模型中。
- 整个系统为端到端可训练,严格保持时间顺序,与帧汇总方法不同,支持长期时间建模。
实验结果
研究问题
- RQ1能否通过频域滤波从视频数据中有效分离出运动信息与冗余的静态内容?
- RQ2将繁忙与静音成分分离是否能通过按比例分配计算资源,实现更高效且更准确的视频分类?
- RQ3通过时空频率滤波学习得到的可学习运动表征,是否能在准确率和效率上超越光流或帧级汇总方法?
- RQ4BPLC模块在双路架构中在多大程度上提升了特征融合与整体模型性能?
- RQ5所提方法是否能在标准基准上实现最先进性能,同时相比现有3D CNN模型显著降低FLOPs?
主要发现
- 使用TSM-R50作为主干的BQN在Kinetics400上达到77.3%的top-1准确率,相比I3D提升+6.2%,相比Oct-I3D提升+2.7%,且FLOPs减少3.7倍。
- 在Something-Something V1上,使用TSM-R50的BQN 48f达到54.3%的top-1准确率,比第二好的方法(TEA 16f)高出+2.0%。
- 集成版本BQN En在Something-Something V1上达到57.1%的top-1准确率和84.2%的top-5准确率,创下新的最先进水平。
- 当使用X3D-M作为主干时,BQN处理的帧数是原始X3D-M的4倍,仅增加50%的FLOPs,展现出卓越的效率。
- 使用X3D-M作为主干的BQN相比TSM-R50 16f在top-1准确率上高出3.4%,但计算复杂度仅为后者的14%。
- 在UCF101和HMDB51上,使用TSM-R50的BQN分别达到97.6%和77.6%的平均类别准确率,优于大多数方法,仅I3D(使用光流)表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。