Skip to main content
QUICK REVIEW

[论文解读] Technical Report: Temporal Aggregate Representations

Fadime Şener, Dibyadip Chatterjee|arXiv (Cornell University)|Jun 6, 2021
Human Pose and Action Recognition参考文献 12被引用 4
一句话总结

该论文提出了一种用于长时视频理解的多粒度时间聚合框架,通过可扩展的片段特征和非局部注意力机制,建模近期与长期视频上下文。该方法在动作预测和识别任务中达到最先进性能,在Breakfast数据集上相比之前方法最高提升11.4%,并在EPIC-KITCHENS-100数据集上通过RGB、光流、目标检测和ROI特征的后期融合,实现了66.93%的top-5准确率。

ABSTRACT

This technical report extends our work presented in [9] with more experiments. In [9], we tackle long-term video understanding, which requires reasoning from current and past or future observations and raises several fundamental questions. How should temporal or sequential relationships be modelled? What temporal extent of information and context needs to be processed? At what temporal scale should they be derived? [9] addresses these questions with a flexible multi-granular temporal aggregation framework. In this report, we conduct further experiments with this framework on different tasks and a new dataset, EPIC-KITCHENS-100.

研究动机与目标

  • 为解决长时视频理解中的挑战,即需要在扩展的时间上下文中进行推理以实现准确的动作预测与识别。
  • 探究不同时间粒度和范围(近期 vs. 跨越)在视频理解任务中如何被有效建模。
  • 评估一种灵活的多尺度时间聚合框架在多种长时视频基准(包括EPIC-KITCHENS-100和Breakfast)上的有效性。
  • 展示所提出的框架相较于Timeception和PIC等现有方法在建模复杂长时活动方面的优越性。

提出的方法

  • 该方法使用两种类型的片段特征:'近期'片段覆盖当前帧前几秒的内容,'跨越'片段则捕捉长达十分钟的长期上下文。
  • 通过在不同时间粒度(例如,近期为K={2,3,5},跨越为{7,5,3})内对片段中的帧特征进行最大池化,计算多尺度表征。
  • 时间聚合模块(TAB)通过非局部模块将每个近期片段与所有跨越片段耦合,以建模长距离依赖关系和跨模态注意力。
  • 耦合模块(CB)对近期与跨越特征之间的关系进行非局部操作,多个TAB的输出串联用于最终预测。
  • 在EPIC-KITCHENS-100上,通过RGB、光流、目标检测和ROI特征的后期融合提升模型鲁棒性。
  • 框架使用Adam优化器、dropout(0.3)和学习率衰减进行训练,所有非分类头均使用512维线性层。

实验结果

研究问题

  • RQ1如何在长时视频理解中有效建模多尺度的时间关系?
  • RQ2在长视频中,准确进行动作预测与识别所需的最优时间范围和粒度是什么?
  • RQ3多粒度时间聚合方法与Timeception和PIC等现有方法相比,在建模长时活动时表现如何?
  • RQ4多模态特征(RGB、光流、目标检测、ROI)在如EPIC-KITCHENS-100等第一人称视频基准上能多大程度提升性能?
  • RQ5所提出的框架是否能在无需任务特定微调的情况下,泛化到包括预测与识别在内的多种视频任务?

主要发现

  • 在Breakfast数据集上,该方法在未进行微调的情况下达到80.8%的准确率,相比Timeception [5] 提升11.4%,相比I3D基线模型提升16.5%。
  • 使用微调后的I3D特征,该方法达到89.8%的准确率,超过PIC [6] 3.1%,在复杂长时活动中表现出色。
  • 在EPIC-KITCHENS-100上,所有模态(RGB、光流、目标检测、ROI)的后期融合在验证集上达到66.93%的top-5准确率,显著优于单一模态结果。
  • 仅使用RGB的模型在动词和名词识别上表现最佳,而特征融合在尾部类别和未见参与者上表现更优,表明对领域偏移具有鲁棒性。
  • 在测试集上,识别任务的top-1准确率为62.68%,top-5准确率为64.05%,对未见参与者的top-5召回率达到24.99%,显示出强大的泛化能力。
  • 在预测任务中,融合模型在测试集上的top-5召回率达到30.57%,对未见参与者的召回率为25.26%,表明其在预测未来动作方面具有有效建模能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。