[论文解读] Revisiting 3D ResNets for Video Recognition
本文提出3D ResNet-RS(R3D-RS),一种用于视频动作识别的3D ResNets扩展与训练变体,采用改进的训练策略、轻量级架构修改(ResNet-D主干、挤压-激励、自门控)以及一种简单联合缩放规则,同时提升模型深度与时间分辨率。该方法在从零训练时,Kinetics-400上达到81.0%的top-1准确率,Kinetics-600上达到83.8%;在Web Video Text数据集上进行预训练后,分别达到83.5%和84.3%。
A recent work from Bello shows that training and scaling strategies may be more significant than model architectures for visual recognition. This short note studies effective training and scaling strategies for video recognition models. We propose a simple scaling strategy for 3D ResNets, in combination with improved training strategies and minor architectural changes. The resulting models, termed 3D ResNet-RS, attain competitive performance of 81.0 on Kinetics-400 and 83.8 on Kinetics-600 without pre-training. When pre-trained on a large Web Video Text dataset, our best model achieves 83.5 and 84.3 on Kinetics-400 and Kinetics-600. The proposed scaling rule is further evaluated in a self-supervised setup using contrastive learning, demonstrating improved performance. Code is available at: https://github.com/tensorflow/models/tree/master/official.
研究动机与目标
- 探究现代训练与缩放策略是否能显著提升3D ResNet在视频识别基准上的性能。
- 评估轻量级架构修改(ResNet-D主干、挤压-激励、自门控)对3D ResNet准确率的影响。
- 提出并验证一种简单有效的联合缩放规则,同步提升模型深度与输入时间分辨率。
- 评估在大规模网络视频数据集上预训练及自监督对比学习带来的性能增益。
提出的方法
- 以3D ResNet(R3D)为基线,第一层采用5×3×3卷积核的3D ResNet-D主干,后续两层使用1×3×3卷积核,提升时间维度上的特征提取能力。
- 引入3D挤压-激励模块,采用3D全局平均池化,以0.25的通道重校准比对通道特征进行重校准。
- 在每个SE模块后引入自门控模块,通过可学习注意力机制进一步优化特征表示。
- 采用联合缩放规则,同步提升模型深度(从50层增至200层)与输入帧数(从32帧增至48帧),以增强时空建模能力。
- 使用数据增强(RandAugment、尺度抖动)、标签平滑(0.1)、权重衰减(4e-5)、随机深度(初始丢弃率0.2)以及训练至350个周期的训练策略。
- 评估在Kinetics-400上使用CVRL进行自监督预训练(800个周期)并进行线性评估,以衡量迁移性能。
实验结果
研究问题
- RQ1改进的训练策略与轻量级架构修改对3D ResNet在视频识别基准上的性能有何影响?
- RQ2是否一种简单联合缩放规则(同步提升模型深度与输入时间分辨率)能优于标准的3D ResNet缩放方式?
- RQ3在大规模网络视频数据集上预训练及自监督对比学习在多大程度上提升3D ResNet-RS的性能?
- RQ4架构与训练改进带来的性能增益是否会随着模型深度增加而趋于饱和?
主要发现
- R3D-RS-50在从零训练时于Kinetics-400上达到78.2%的top-1准确率,较R3D-50基线提升+3.8%。
- R3D-RS-200在未使用预训练的情况下,于Kinetics-400上达到81.0%的top-1准确率,于Kinetics-600上达到83.8%,展现出强大的端到端性能。
- 在Web Video Text(WVT)数据集上进行预训练后,R3D-RS-200在Kinetics-400上达到83.5%,在Kinetics-600上达到84.3%,表明大规模预训练带来显著性能增益。
- 在Kinetics-400上进行自监督预训练后,线性评估准确率从R3D-RS-50的66.1%提升至R3D-RS-270的67.5%,且在R3D-RS-200之后增益趋于平缓。
- 将输入帧数从32增至48,准确率提升+0.3%;而将模型深度进一步提升至R3D-RS-200以上则导致性能下降。
- 改进训练策略(如RandAugment、标签平滑)与架构改进(SE、自门控、D-stem)的结合,相较基线R3D-50带来+1.0%的准确率增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。