Skip to main content
QUICK REVIEW

[论文解读] An Evaluation of Action Recognition Models on EPIC-Kitchens

Will Price, Dima Damen|arXiv (Cornell University)|Aug 2, 2019
Human Pose and Action Recognition参考文献 13被引用 15
一句话总结

本论文在第一人称EPIC-Kitchens数据集上评估了三种动作识别模型——TSN、TRN和TSM,结果表明具备时序建模能力的模型(TSM和M-TRN)显著优于缺乏时序推理能力的TSN。主要贡献在于发布了预训练模型及基准结果,突出了长尾类别分布和未见厨房场景中的域偏移等挑战。

ABSTRACT

We benchmark contemporary action recognition models (TSN, TRN, and TSM) on the recently introduced EPIC-Kitchens dataset and release pretrained models on GitHub (https://github.com/epic-kitchens/action-models) for others to build upon. In contrast to popular action recognition datasets like Kinetics, Something-Something, UCF101, and HMDB51, EPIC-Kitchens is shot from an egocentric perspective and captures daily actions in-situ. In this report, we aim to understand how well these models can tackle the challenges present in this dataset, such as its long tail class distribution, unseen environment test set, and multiple tasks (verb, noun and, action classification). We discuss the models' shortcomings and avenues for future research.

研究动机与目标

  • 评估最先进动作识别模型——TSN、TRN和TSM——在第一人称EPIC-Kitchens数据集上的性能。
  • 研究模型性能如何受到长尾类别分布、域偏移(已见与未见厨房)以及输入模态(RGB与光流)的影响。
  • 评估时序建模、主干网络选择以及时序支持(片段数量)对识别准确率的影响。
  • 评估动作先验(动词-名词共现)在提升动作分类性能方面的有效性,尤其是在未见环境中的表现。
  • 发布预训练模型和测试预测结果,以支持可复现性与通过EPIC-Kitchens排行榜进行基准测试。

提出的方法

  • 所有模型均采用统一的8片段采样策略进行训练与评估:每个视频片段被划分为8个相等部分,每个片段采样一个片段。
  • TSN通过2D卷积神经网络主干网络提取的片段级分数进行平均池化或最大池化操作,缺乏片段间的时序建模能力。
  • TRN通过一个对顺序敏感的关系模块处理片段级特征,包含单尺度和多尺度变体(M-TRN),以捕捉片段间的关联关系。
  • TSM通过在时间维度上移动卷积核响应,对2D卷积神经网络主干网络进行修改,以在网络内部实现时序建模。
  • 性能通过在三个任务上的top-1和top-5准确率进行评估:动词分类、名词分类以及动作(动词-名词对)分类。
  • 通过拉普拉斯平滑的共现统计量应用动作先验,以重加权预测结果,提升在未见厨房场景中的零样本泛化能力。

实验结果

研究问题

  • RQ1TSN、TRN和TSM在EPIC-Kitchens数据集上的表现如何?在动词、名词和动作分类任务中,其top-1和top-5准确率分别如何?
  • RQ2通过TRN和TSM实现的时序建模在多大程度上提升了性能?相较于缺乏此类能力的TSN,提升效果如何?
  • RQ3与已见厨房测试集相比,模型在未见厨房测试集上的性能下降程度如何?导致这种域偏移的主要因素有哪些?
  • RQ4输入模态(RGB与光流)以及时序支持(片段数量)对识别准确率有何影响?
  • RQ5引入动作先验(动词-名词共现)是否能提升性能,尤其是在未见厨房划分上的表现?

主要发现

  • TSM和M-TRN在所有任务中均优于TSN,其中M-TRN在已见厨房的动作用任务中达到4.75%的top-1准确率,在未见厨房中为2.39%。
  • TSN由于在片段间平均分数,难以区分具有时序顺序的动作(如'put'与'take'),在细粒度动作上表现不佳。
  • 光流模型在增加时序支持(最多16个片段)时收益更明显,而RGB模型在8个片段时已趋于饱和,甚至在16个片段时出现性能下降,尤其在TSM+RGB设置下。
  • 动作先验在未见厨房测试集上将M-TRN+RGB的top-1准确率最高提升2.80个百分点,表明其显著改善了零样本泛化能力。
  • 所有模型在未见厨房测试集上均表现出显著的性能下降,凸显了第一人称动作识别中域偏移的挑战。
  • 在动作用任务中,TSM+RGB模型在已见厨房中达到4.70%的top-1准确率,在未见厨房中为2.39%,通过使用动作先验在未见集上提升了0.82个百分点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。