Skip to main content
QUICK REVIEW

[论文解读] Recognizing Activities of Daily Living from Egocentric Images

Alejandro Cartas, Juan Marín|arXiv (Cornell University)|Apr 13, 2017
Context-Aware Activity Recognition Systems参考文献 8被引用 4
一句话总结

该论文提出了一种新颖的集成方法,通过将预训练卷积神经网络(CNN)多个层级的特征图与随机森林分类器结合,以提升从低时间分辨率的第一视角图像中进行活动识别的性能。该方法在 NTCIR-12 基准的 21 类数据集上实现了 86% 的总体准确率,通过整合全连接层的全局图像特征,相比基线 CNN 最高提升了 8.07%。

ABSTRACT

Recognizing Activities of Daily Living (ADLs) has a large number of health applications, such as characterize lifestyle for habit improvement, nursing and rehabilitation services. Wearable cameras can daily gather large amounts of image data that provide rich visual information about ADLs than using other wearable sensors. In this paper, we explore the classification of ADLs from images captured by low temporal resolution wearable camera (2fpm) by using a Convolutional Neural Networks (CNN) approach. We show that the classification accuracy of a CNN largely improves when its output is combined, through a random decision forest, with contextual information from a fully connected layer. The proposed method was tested on a subset of the NTCIR-12 egocentric dataset, consisting of 18,674 images and achieved an overall accuracy of 86% activity recognition on 21 classes.

研究动机与目标

  • 通过利用超越原始 CNN 预测的上下文视觉特征,提升从第一视角图像中进行活动识别的性能。
  • 在具有不同日常习惯的多个用户之间实现活动识别的泛化,避免依赖时间或颜色特征。
  • 减少对少数类和重叠类(如“独自饮用/进食”与“一起进食”)的过拟合,并提升性能。
  • 探索将多个 CNN 层(如 FC6、pool5/7x7、softmax)作为输入输入随机森林以提升分类性能的有效性。
  • 开发一种对第一视角生活记录中类内差异性和有限训练数据具有鲁棒性的方法。

提出的方法

  • 该方法使用两个预训练的 CNN——AlexNet 和 GoogLeNet——作为第一视角图像的特征提取器。
  • 将 softmax 概率输出与最终全连接层(FC6 或 pool5/7x7)的特征合并为每个图像的单一 1,045 维特征向量。
  • 使用包含 500 棵树的随机森林分类器对融合后的特征进行训练,以预测活动类别。
  • 通过使用 CNN 内部特征作为上下文先验,避免依赖时间或颜色直方图。
  • 在 NTCIR-12 数据集的一个子集上进行评估,该子集包含 18,674 幅图像和 21 个活动标签。
  • 对比不同 CNN 层和融合策略下的集成性能,并对超参数进行调优以获得最佳准确率。

实验结果

研究问题

  • RQ1与仅使用 softmax 层相比,将多个 CNN 层与随机森林结合是否能提升第一视角图像上活动识别的准确率?
  • RQ2在多用户设置中,使用 CNN 内部特征(如 FC6)作为上下文信息是否优于传统全局图像特征(如颜色直方图)?
  • RQ3所提出的集成方法在重叠或低频活动类别(如“独自饮用/进食”和“一起进食”)上的表现如何?
  • RQ4在数据量较少的情况下(如“户外步行”类别训练样本极少),该方法在多大程度上减少了过拟合?
  • RQ5该方法是否能在无需用户特定调整的情况下,泛化到具有多样化生活方式的用户?

主要发现

  • 所提出的集成方法在 21 类 NTCIR-12 第一视角数据集上实现了 86% 的总体准确率,显著优于基线 CNN。
  • 表现最佳的集成方法(GoogLeNet+RF 在 pool5/7x7+prob 上)相比其基线 CNN 提升了 7.93% 的准确率。
  • AlexNet+RF 在 FC6 上的集成相比其基线提升了 8.07%,表明在具有挑战性的类别上表现优异。
  • 该方法显著提升了低频类别(如“烹饪”和“清洁与杂务”)的召回率。
  • 重叠类别(如“独自饮用/进食”与“一起进食”)的混淆程度降低,表明分类器的判别能力更强。
  • 唯一性能下降出现在“骑自行车”类别(从 81.68% 降低),可能是因为随机森林的正则化在各类别间平衡了误差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。