Skip to main content
QUICK REVIEW

[论文解读] Toyota Smarthome Untrimmed: Real-World Untrimmed Videos for Activity Detection

Rui Dai, Srijan Das|arXiv (Cornell University)|Oct 28, 2020
Context-Aware Activity Recognition Systems被引用 8
一句话总结

本文提出了丰田智能家居未剪辑视频数据集(Toyota Smarthome Untrimmed, TSU),这是一个新颖的未剪辑视频数据集,包含自发的、真实世界中的日常活动,具有高时间变异性、多视角录制以及对基础活动与复合活动的密集标注。为应对持续时间变化大和摄像头构图不稳定的挑战,作者提出了一种基于多模态注意力的基线模型,利用光流引导RGB特征学习,在TSU和Charades数据集上均取得了最先进性能。

ABSTRACT

Designing activity detection systems that can be successfully deployed in daily-living environments requires datasets that pose the challenges typical of real-world scenarios. In this paper, we introduce a new untrimmed daily-living dataset that features several real-world challenges: Toyota Smarthome Untrimmed (TSU). TSU contains a wide variety of activities performed in a spontaneous manner. The dataset contains dense annotations including elementary, composite activities and activities involving interactions with objects. We provide an analysis of the real-world challenges featured by our dataset, highlighting the open issues for detection algorithms. We show that current state-of-the-art methods fail to achieve satisfactory performance on the TSU dataset. Therefore, we propose a new baseline method for activity detection to tackle the novel challenges provided by our dataset. This method leverages one modality (i.e. optic flow) to generate the attention weights to guide another modality (i.e RGB) to better detect the activity boundaries. This is particularly beneficial to detect activities characterized by high temporal variance. We show that the method we propose outperforms state-of-the-art methods on TSU and on another popular challenging dataset, Charades.

研究动机与目标

  • 解决现有活动检测数据集中缺乏真实世界、未剪辑视频数据的问题,以反映老年护理环境中日常活动的自发性与复杂性。
  • 通过创建更真实、更多样化的基准,克服现有数据集的局限性,如剧本化动作、持续时间短、固定摄像头构图以及缺乏密集标注。
  • 开发一种稳健的基线方法,以应对未剪辑视频分析中的关键现实挑战,包括高时间变异性、多视角差异以及背景/前景混淆。
  • 在新提出的TSU数据集和已建立的Charades数据集上,验证所提方法的有效性,证明其泛化能力与可扩展性。

提出的方法

  • 所提方法利用光流作为模态,生成注意力权重以引导RGB模态的特征学习,提升时间边界检测性能。
  • 引入多时间尺度注意力机制,以处理持续时间高度可变的活动,实现对短时(如2–3秒)和长时(如5–10分钟)动作的检测。
  • 采用基于人体裁剪的特征提取方法,以缓解因主体未居中或部分遮挡导致的低摄像头构图问题。
  • 在多视角场景中利用3D骨骼数据,提升对视角变化的鲁棒性。
  • 将注意力机制集成到时间卷积网络(SD-TCN)中,以增强在多样化时间尺度上的特征表示能力。
  • 模型使用RGB和光流输入进行训练,未来扩展中仅使用RGB进行推理,以提升实际部署的可行性。

实验结果

研究问题

  • RQ1自发行为、高时间变异性及多视角录制等真实世界挑战,如何影响现有活动检测模型的性能?
  • RQ2当前最先进方法在富含自然主义人类行为的未剪辑视频数据集上,其失效程度如何?
  • RQ3一种利用光流引导RGB特征学习的模态注意力机制,能否在复杂真实场景中提升检测准确率?
  • RQ4所提方法在新TSU数据集和已建立的Charades数据集上的有效性如何,体现其泛化能力?
  • RQ5多时间尺度建模在检测具有高度可变持续时间的活动时,发挥何种作用?

主要发现

  • 所提方法在TSU数据集上达到最先进性能,使用RGB + Flow模态时mAP比现有SOTA方法高出0.6%。
  • 在Charades数据集上,方法达到22.3%的mAP,超过先前SOTA方法(I3D + 3 TGMs + Super event),证实其在新基准之外的有效性。
  • 数据集揭示了活动持续时间的显著类内差异,实例从2秒到超过10分钟不等,凸显时间边界检测的挑战。
  • 当前SOTA方法在TSU上表现欠佳,表明现有模型对自发行为和多视角录制等真实世界变化缺乏鲁棒性。
  • 注意力机制显著提升了对高时间变异性活动的检测能力,尤其对短时或不规则持续时间的活动。
  • 利用光流生成注意力掩码可增强RGB特征学习,尤其在细微或低对比度运动场景中效果显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。