[论文解读] Multi-Fiber Networks for Video Recognition
本文提出多纤网络(MF-Net),一种稀疏连接的3D卷积神经网络架构,通过将深层网络分解为多个轻量级、独立的纤维,将计算成本降低一个数量级。通过集成轻量级多路复用器模块以实现纤维间的跨纤维信息流动,MF-Net在UCF-101、HMDB-51和Kinetics数据集上实现了最先进(SOTA)的准确率,其计算量仅为I3D的1/9、R(2+1)D的1/13,同时保持了高性能。
In this paper, we aim to reduce the computational cost of spatio-temporal deep neural networks, making them run as fast as their 2D counterparts while preserving state-of-the-art accuracy on video recognition benchmarks. To this end, we present the novel Multi-Fiber architecture that slices a complex neural network into an ensemble of lightweight networks or fibers that run through the network. To facilitate information flow between fibers we further incorporate multiplexer modules and end up with an architecture that reduces the computational cost of 3D networks by an order of magnitude, while increasing recognition performance at the same time. Extensive experimental results show that our multi-fiber architecture significantly boosts the efficiency of existing convolution networks for both image and video recognition tasks, achieving state-of-the-art performance on UCF-101, HMDB-51 and Kinetics datasets. Our proposed model requires over 9x and 13x less computations than the I3D and R(2+1)D models, respectively, yet providing higher accuracy.
研究动机与目标
- 降低当前限制其在大规模应用中使用的3D卷积神经网络在视频识别任务中的高计算成本。
- 在大幅降低浮点运算次数(FLOPs)的同时,保持或提升在视频基准测试上的最先进(SOTA)准确率。
- 解决标准3D CNN效率低下的问题,其每段视频的计算量超过100 GFLOPs,而2D网络仅为10–15 GFLOPs。
- 开发一种通用且高效的架构,可同时应用于图像和视频识别任务。
- 通过利用时空推理能力,使基于片段的模型在相同计算成本下,性能超越基于帧的模型。
提出的方法
- 多纤架构将深层3D CNN分解为N个独立的轻量级纤维,每个纤维处理通道的一个子集,使浮点运算次数(FLOPs)降低约N倍。
- 每个残差块均集成一个多路复用器模块,以实现纤维间的受控信息共享,从而在计算开销极小的情况下提升表征能力。
- 多路复用器采用可学习的路由机制,选择性地聚合来自不同纤维的特征,增强特征多样性与模型表达能力。
- 该架构可应用于2D与3D CNN,其中3D版本专为端到端视频动作识别设计。
- 模型通过标准优化方法进行端到端训练,多路复用器与网络其余部分联合训练。
- 该方法与现有主干网络(如ResNet)兼容,可轻松集成到紧凑模型中以提升性能。
实验结果
研究问题
- RQ1稀疏连接的3D CNN架构是否能在显著降低FLOPs的前提下,实现最先进(SOTA)的视频识别准确率?
- RQ2多路复用器模块在恢复因纤维独立性而损失的表征能力方面效果如何?
- RQ3多纤设计是否可泛化应用于提升图像与视频识别任务中的效率与准确率?
- RQ4所提出的架构是否在准确率与计算效率两方面均优于现有的3D CNN(如I3D与R(2+1)D)?
- RQ5该模型的失败模式是什么?其与视频内容特征(如动作持续时间、物体可区分性)有何关联?
主要发现
- 在UCF-101数据集上,MF-Net仅用11.1 GFLOPs即达到96.0%的Top-1准确率,优于I3D(152.4 GFLOPs)与R(2+1)D-34(130.5 GFLOPs),在准确率与效率上均表现更优。
- 在HMDB-51数据集上,MF-Net达到74.6%的Top-1准确率,较仅使用RGB帧的2D CNN高出15.5个百分点,且较使用光流的方法高出5%以上。
- 与I3D相比,MF-Net将计算成本降低逾9倍;与R(2+1)D相比,降低13倍以上,同时保持或超越其准确率。
- MF-Net在Top-1准确率上较Res3D(85.8%)提升超过10%,且计算量减少42%(19.3 GFLOPs vs. 11.1 GFLOPs)。
- 在Kinetics数据集上,400个类别中有190个类别准确率超过80%,349个类别超过50%,表明其在多样化动作上具有强大的泛化能力。
- 失败案例主要与短时动作或缺乏可区分物体的视频有关,证实了模型在捕捉瞬时或模糊运动方面的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。