Skip to main content
QUICK REVIEW

[论文解读] On the Role of Event Boundaries in Egocentric Activity Recognition from Photostreams

Alejandro Cartas, Estefanía Talavera|arXiv (Cornell University)|Sep 2, 2018
Human Pose and Action Recognition参考文献 13被引用 3
一句话总结

本文研究了事件边界对从第一视角影像流中进行活动识别的影响,提出了一种利用SR-聚类自动提取的事件片段来提升识别性能的方法。基于15名用户全天影像流的新数据集,实验表明基于事件的时序分割显著提升了准确率——采用CNN+双向LSTM模型达到75.59%的准确率,优于固定大小滑动窗口方法,并显示出对未见用户的良好泛化能力。

ABSTRACT

Event boundaries play a crucial role as a pre-processing step for detection, localization, and recognition tasks of human activities in videos. Typically, although their intrinsic subjectiveness, temporal bounds are provided manually as input for training action recognition algorithms. However, their role for activity recognition in the domain of egocentric photostreams has been so far neglected. In this paper, we provide insights of how automatically computed boundaries can impact activity recognition results in the emerging domain of egocentric photostreams. Furthermore, we collected a new annotated dataset acquired by 15 people by a wearable photo-camera and we used it to show the generalization capabilities of several deep learning based architectures to unseen users.

研究动机与目标

  • 探究事件边界在提升第一视角影像流中活动识别性能方面的作用。
  • 评估深度学习模型在第一视角活动识别中对未见用户的泛化能力。
  • 比较不同时间分割策略——固定大小窗口、完整序列和基于事件的分割——对识别性能的影响。
  • 引入一个包含15名用户全天影像流的新型标注数据集,共102,227张图像。
  • 评估深度学习架构(尤其是双向LSTM)在事件分割序列上训练时的有效性。

提出的方法

  • 作者收集了一个新的第一视角影像流数据集,包含15名用户拍摄的102,227张图像,采样间隔约为30秒。
  • 通过SR-聚类自动提取事件边界,该方法将具有相似视觉和语义特征的时序相邻图像进行分组。
  • 训练了三种深度学习模型:CNN+LSTM、CNN+双向LSTM和CNN+RF+LSTM,分别使用完整序列和事件分割序列进行训练。
  • 通过准确率、宏平均精确率、宏平均召回率和宏平均F1分数,在不同时间分割策略下对模型进行评估。
  • 采用固定大小片段的滑动窗口方法作为基线进行对比。
  • 所有模型均使用Xception网络作为基础CNN,时序建模通过在图像嵌入上应用循环网络实现。

实验结果

研究问题

  • RQ1与固定大小滑动窗口相比,引入自动检测的事件边界是否能提升第一视角影像流中的活动识别性能?
  • RQ2不同时间分割策略(完整序列、固定大小片段和基于事件的分割)如何影响识别准确率和鲁棒性?
  • RQ3当在第一视角影像流上进行训练时,深度学习模型对未见用户的泛化程度如何?
  • RQ4基于事件的分割是否能提升识别性能,特别是在测试序列较短的情况下?
  • RQ5在此设置下,双向LSTM相较于单向LSTM和RF增强模型的相对性能如何?

主要发现

  • 当在事件分割序列上训练时,CNN+双向LSTM模型达到了75.59%的最高准确率,优于所有其他模型。
  • 基于事件的分割(SR-聚类)使三种LSTM模型中的两种性能优于固定大小滑动窗口,表明其能更好地捕捉时序一致性。
  • CNN+双向LSTM在事件分割数据上实现了51.21%的最佳宏平均F1分数,显著优于基线滑动窗口方法。
  • CNN+RF+LSTM模型的表现低于其基线,可能由于RF组件过拟合,尤其是在未见用户上表现更差。
  • 使用事件边界的模型在泛化方面表现最佳,体现在未见用户上的宏平均召回率和F1分数均有提升。
  • 事件分割在长序列中尤为有益,而固定大小窗口在短测试序列中表现更优,凸显了时序上下文的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。