[论文解读] Three Branches: Detecting Actions With Richer Features
该论文提出了一种三分支框架,通过融合全局视频片段特征、短时人体区域特征和长时序特征,利用SlowFast主干网络和长时特征库(LFB)提升动作检测性能。该方法在Kinetics-700上达到21.59%的错误率,在AVA上达到32.49%的mAP,优于所有2018年AVA提交结果超过10%的mAP。
We present our three branch solutions for International Challenge on Activity Recognition at CVPR2019. This model seeks to fuse richer information of global video clip, short human attention and long-term human activity into a unified model. We have participated in two tasks: Task A, the Kinetics challenge and Task B, spatio-temporal action localization challenge. For Kinetics, we achieve 21.59% error rate. For the AVA challenge, our final model obtains 32.49% mAP on the test sets, which outperforms all submissions to the AVA challenge at CVPR 2018 for more than 10% mAP. As the future work, we will introduce human activity knowledge, which is a new dataset including key information of human activity.
研究动机与目标
- 通过整合来自视频理解多个层次的更丰富时空特征,提升动作检测性能。
- 通过长时特征库(LFB)引入长程时序依赖,弥补短时建模的局限性。
- 通过融合全局片段级特征、局部人体外观特征和长时运动模式,增强特征表示能力。
- 在Kinetics-700动作识别和AVA时空动作定位基准上实现最先进性能。
- 在训练过程中使用焦点损失(focal loss)缓解动作数据集中的类别不平衡问题,提升罕见动作的识别能力。
提出的方法
- 使用SlowFast 3D CNN主干网络从64帧片段中提取时空特征,其中慢速路径输入8帧,快速路径输入32帧。
- 在关键帧(每秒中间帧)上使用Faster R-CNN与ResNeXt-101-FPN主干网络检测人体边界框,用于裁剪短时人物特征。
- 采用3D区域感兴趣(RoI)池化,利用检测到的边界框从片段级特征中提取局部人体特征。
- 通过存储和检索时间步长上的特征,利用长时特征库(LFB)捕捉长程时序依赖。
- 在将全局片段特征、短时人物特征和长时LFB特征拼接后,输入最终分类器进行动作预测。
- 使用焦点损失缓解动作识别中的类别不平衡问题,尤其提升游泳或攀爬等罕见动作的识别效果。
实验结果
研究问题
- RQ1融合全局特征、局部人体特征和长时序特征是否能提升在复杂视频数据集上的动作检测性能?
- RQ2通过长时特征库(LFB)引入长程时序建模,对时空动作定位中的识别准确率有何影响?
- RQ3在Kinetics-700等大规模数据集上进行预训练,对下游动作检测性能的提升程度如何?
- RQ4与标准交叉熵损失相比,三分支架构在处理类别不平衡动作识别时的有效性如何?
- RQ5统一模型能否有效结合短时外观、运动和长时上下文,以提升动作检测性能?
主要发现
- 所提出的三分支模型在Kinetics-700测试集上实现了21.59%的平均top-1和top-5错误率,展现出在大规模动作识别任务上的强大性能。
- 在AVA数据集上,该模型达到32.49%的mAP,超过2018年AVA挑战赛所有提交结果超过10个百分点。
- 在Kinetics-700上微调预训练的SlowFast网络显著提升了性能,表明大规模预训练具有明显优势。
- 使用焦点损失显著提升了罕见动作类别的一般化能力,增强了长尾动作识别的鲁棒性。
- 多尺度测试增强和水平翻转技术通过稳定多样化视频输入下的预测结果,提升了mAP。
- LFB特征的引入显著增强了对跨越多个片段的长时程动作的识别能力,尤其在复杂场景中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。