Skip to main content
QUICK REVIEW

[论文解读] Recognizing Activities of Daily Living with a Wrist-mounted Camera

Katsunori Ohnishi, Atsushi Kanehira|arXiv (Cornell University)|Nov 20, 2015
Human Pose and Action Recognition参考文献 27被引用 7
一句话总结

本论文提出使用佩戴在手腕上的摄像头进行第一人称活动识别,实现对操作物体的大规模捕捉,无需依赖物体检测。该研究提出了一种判别性视频表征方法(DSTAR),能够保留空间和时间信息,在一个新型、公开可用的数据集中,相较于头戴式摄像头,平均准确率提升了28.1%,该数据集同步收录了手腕和头部摄像头的视频数据。

ABSTRACT

We present a novel dataset and a novel algorithm for recognizing activities of daily living (ADL) from a first-person wearable camera. Handled objects are crucially important for egocentric ADL recognition. For specific examination of objects related to users' actions separately from other objects in an environment, many previous works have addressed the detection of handled objects in images captured from head-mounted and chest-mounted cameras. Nevertheless, detecting handled objects is not always easy because they tend to appear small in images. They can be occluded by a user's body. As described herein, we mount a camera on a user's wrist. A wrist-mounted camera can capture handled objects at a large scale, and thus it enables us to skip object detection process. To compare a wrist-mounted camera and a head-mounted camera, we also develop a novel and publicly available dataset that includes videos and annotations of daily activities captured simultaneously by both cameras. Additionally, we propose a discriminative video representation that retains spatial and temporal information after encoding frame descriptors extracted by Convolutional Neural Networks (CNN).

研究动机与目标

  • 解决从可穿戴摄像头的第一人称视角中识别日常生活活动(ADL)的挑战。
  • 克服头戴式和胸戴式摄像头的局限性,如物体捕捉规模小以及对物体检测的依赖。
  • 构建一个新型数据集,同步收录手腕佩戴和头戴摄像头的视频数据,用于对比分析。
  • 提出一种保留空间和时间信息的视频表征方法,以提升第一人称场景下的识别性能。
  • 证明在无需边界框标注的情况下,手腕佩戴摄像头在ADL识别准确率上优于头戴式摄像头。

提出的方法

  • 将摄像头安装在用户主侧手腕上,以大规模捕捉操作中的物体,减少遮挡并提升可见性。
  • 开发一种新型、公开可用的数据集,包含来自手腕佩戴和头戴摄像头的同步视频及活动标注。
  • 提出一种判别性视频表征方法(DSTAR),通过可学习权重的空间与时间金字塔编码CNN特征。
  • 迭代且交替地优化空间与时间权重,以突出视频中的判别性区域和时间片段。
  • 采用双流方法:在手腕佩戴数据上使用DSTAR,在头戴数据上使用iDT,以融合互补特征。
  • 使用基于时间片段的分类方法进行模型训练与评估,通过不同空间与时间层级特征的晚期融合。

实验结果

研究问题

  • RQ1与头戴式摄像头相比,手腕佩戴摄像头是否能显著提升ADL识别准确率?
  • RQ2在第一人称场景中,保留空间与时间信息的视频表征方法是否优于标准视频编码方法?
  • RQ3在使用手腕佩戴摄像头时,物体检测在多大程度上可以被绕过?
  • RQ4手腕佩戴摄像头视频中的空间与时间偏差如何影响识别性能与模型设计?
  • RQ5结合手腕佩戴与头戴摄像头数据是否能进一步提升识别准确率?

主要发现

  • 在23个ADL类别中的18个类别上,手腕佩戴摄像头相比头戴式摄像头实现了28.1%的平均准确率提升。
  • 当应用于手腕佩戴摄像头数据时,DSTAR方法相比基线LCD方法平均提升了10.1%的识别准确率。
  • 在‘吸尘’类别中,DSTAR表现出最显著的性能提升,表明其能有效抑制无关背景特征。
  • 在‘擦干餐具’类别中,手腕佩戴摄像头的性能下降最大(18.5%),主要由于与‘洗餐具’类别混淆。
  • 将DSTAR在手腕佩戴数据上的结果与iDT在头戴数据上的结果进行融合,使14个类别的准确率得到提升,平均提升10.4%。
  • 对DSTAR权重的可视化分析证实,存在强烈的空间偏向性,集中于图像中心区域,时间偏向性较弱,但早期和晚期动作阶段略为更具判别性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。