Skip to main content
QUICK REVIEW

[论文解读] A Study on Action Detection in the Wild

Yubo Zhang, Pavel Tokmakov|arXiv (Cornell University)|Apr 29, 2019
Human Pose and Action Recognition参考文献 35被引用 13
一句话总结

本文针对真实世界中高度不平衡的数据集(如AVA)中的动作检测问题,其中罕见动作样本极少。提出了一种新型度量指标——采样mAP(mSAP),以公平评估尾部类别性能,并采用两阶段训练方法:先在头部类别上进行预训练,再在头部与尾部类别均衡混合的数据集上微调线性分类器,使尾部类别的mSAP提升6.2%,同时保持头部类别的性能不变。

ABSTRACT

The recent introduction of the AVA dataset for action detection has caused a renewed interest to this problem. Several approaches have been recently proposed that improved the performance. However, all of them have ignored the main difficulty of the AVA dataset - its realistic distribution of training and test examples. This dataset was collected by exhaustive annotation of human action in uncurated videos. As a result, the most common categories, such as `stand' or `sit', contain tens of thousands of examples, whereas rare ones have only dozens. In this work we study the problem of action detection in a highly-imbalanced dataset. Differently from previous work on handling long-tail category distributions, we begin by analyzing the imbalance in the test set. We demonstrate that the standard AP metric is not informative for the categories in the tail, and propose an alternative one - Sampled AP. Armed with this new measure, we study the problem of transferring representations from the data-rich head to the rare tail categories and propose a simple but effective approach.

研究动机与目标

  • 解决真实世界中高度不平衡数据集中罕见动作样本极少的场景下动作检测的挑战。
  • 识别标准mAP在评估测试集不平衡导致的尾部类别性能时的局限性。
  • 设计一种更具信息量的评估指标,公平反映对罕见动作类别的表现。
  • 提出一种有效的迁移学习策略,利用数据丰富的头部类别提升对罕见尾部类别的识别能力。
  • 证明仅在平衡数据集上微调分类器(同时冻结主干网络)可在不损害常见动作泛化能力的前提下,显著提升罕见动作的检测性能。

提出的方法

  • 提出一种新的评估指标——平均采样平均精度(mSAP),通过从测试集中多次抽取平衡样本并计算mAP的平均值得到。
  • 引入两阶段训练方案:首先仅在头部类别上训练I3D主干网络,以学习鲁棒特征。
  • 预训练完成后冻结I3D主干网络权重,然后仅在包含头部与尾部类别的平衡数据集上微调线性分类器。
  • 在两个阶段均使用随机梯度下降(SGD)优化损失函数,第二阶段采用类别平衡采样策略。
  • 将所提方法与多种基线方法对比,包括在完整数据集上端到端训练以及微调整个模型,以验证其有效性。
  • 通过消融实验分析第二阶段数据平衡的影响以及微调策略选择对头部与尾部类别性能的影响。

实验结果

研究问题

  • RQ1为何标准mAP在AVA数据集中对罕见类别性能评估不可靠?
  • RQ2如何设计更具信息量的评估指标,以公平评估长尾数据集中尾部类别的性能?
  • RQ3能否通过迁移数据丰富的头部类别的表征来提升对罕见尾部类别的检测性能?
  • RQ4何种训练策略可在不损害常见动作泛化能力的前提下,最大化头部与尾部类别的综合性能?
  • RQ5在微调过程中冻结主干网络是否能保持头部性能的同时提升尾部识别能力?

主要发现

  • 标准mAP指标对尾部类别具有误导性,因为测试集以负样本为主,导致误报率对得分影响过大。
  • 所提出的采样mAP(mSAP)指标通过使用平衡的测试样本,能更可靠且具有可操作性地评估模型在罕见动作类别上的表现。
  • 两阶段训练方法——先在头部类别上预训练,再在平衡数据集上微调线性分类器——相比基线方法,使尾部类别的mSAP提升了6.2%。
  • 在第二阶段冻结I3D主干网络可保持头部性能,同时显著提升尾部类别表现,优于端到端微调策略。
  • 在第二阶段进行数据平衡至关重要:若不进行平衡,尾部类别的mSAP性能将下降18%,主要受类别偏差影响。
  • 与其它微调策略相比,该方法在尾部类别的mSAP上实现了3%的提升,证明了其有效性与高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。