Skip to main content
QUICK REVIEW

[论文解读] E$^2$(GO)MOTION: Motion Augmented Event Stream for Egocentric Action Recognition

Chiara Plizzari, Mirco Planamente|arXiv (Cornell University)|Dec 7, 2021
Advanced Memory and Neural Computing被引用 4
一句话总结

本文提出了 N-EPIC-Kitchens,这是首个基于事件的自指动作识别数据集,并提出了 E²(GO)MOTION,一种利用事件数据实现鲁棒动作识别的运动增强事件流框架。通过仅使用事件数据或在教师-学生设置下蒸馏光流,该方法在未见环境中的准确率比仅使用 RGB 的模型高出最多 4%,且在无需推理时计算光流的情况下,性能甚至优于 PWC-Net 光流模型,实现实时推理。

ABSTRACT

Event cameras are novel bio-inspired sensors, which asynchronously capture pixel-level intensity changes in the form of "events". Due to their sensing mechanism, event cameras have little to no motion blur, a very high temporal resolution and require significantly less power and memory than traditional frame-based cameras. These characteristics make them a perfect fit to several real-world applications such as egocentric action recognition on wearable devices, where fast camera motion and limited power challenge traditional vision sensors. However, the ever-growing field of event-based vision has, to date, overlooked the potential of event cameras in such applications. In this paper, we show that event data is a very valuable modality for egocentric action recognition. To do so, we introduce N-EPIC-Kitchens, the first event-based camera extension of the large-scale EPIC-Kitchens dataset. In this context, we propose two strategies: (i) directly processing event-camera data with traditional video-processing architectures (E$^2$(GO)) and (ii) using event-data to distill optical flow information (E$^2$(GO)MO). On our proposed benchmark, we show that event data provides a comparable performance to RGB and optical flow, yet without any additional flow computation at deploy time, and an improved performance of up to 4% with respect to RGB only information.

研究动机与目标

  • 为解决自指动作识别中事件数据的缺乏,特别是在快速运动和环境变化等挑战性条件下的问题。
  • 探究事件数据是否可作为在线自指动作识别中光流的鲁棒、低延迟替代方案。
  • 开发能够利用事件相机的高时间分辨率和运动敏感性,同时避免测试时昂贵光流计算的方法。
  • 评估事件基模型在已见和未见环境中的泛化能力,以减少环境偏差。
  • 通过发布 N-EPIC-Kitchens 数据集,为自指场景下的事件视觉建立基准。

提出的方法

  • 作者通过在 EPIC-Kitchens 数据集的 RGB 视频上模拟事件流,构建了 N-EPIC-Kitchens,同时保留了包括光流和音频在内的多模态数据。
  • 他们提出了 E²(GO),一种方法,通过修改卷积层以处理异步事件流,使 2D 和 3D 动作识别网络(如 I3D、TSM)能够直接处理事件数据。
  • 他们引入了 E²(GO)MO,一种基于蒸馏的方法,即在训练期间使用 TV-L1 的光流作为教师信号,让学生模型在事件数据上训练,从而在无需推理时进行光流推理的情况下实现运动感知表征。
  • 事件数据通过时间分箱策略编码为体素网格,以保留运动动态,同时与标准视频模型保持兼容。
  • 该框架采用教师-学生蒸馏管道,学生模型在训练期间学习模仿教师的光流感知表征,仅在离线阶段进行光流计算。
  • 该方法在已见和未见环境中均进行了评估,以测试对领域偏移的鲁棒性,并对模态融合和模型架构进行了消融研究。

实验结果

研究问题

  • RQ1仅使用事件数据是否能在自指动作识别中实现与 RGB 和光流相当的性能?
  • RQ2与基于 RGB 的模型相比,基于事件的学习是否在未见环境中泛化能力更强,从而减少环境偏差?
  • RQ3在训练期间将光流知识蒸馏到事件数据中,是否能实现在推理时无需光流计算的高性能?
  • RQ4在准确率和推理速度方面,事件基模型与端到端光流模型(如 PWC-Net)相比表现如何?
  • RQ5在快速运动、可穿戴设备场景中,事件数据和运动表征在多大程度上优于基于外观的模型?

主要发现

  • E²(GO)MO 仅使用事件数据和蒸馏的光流知识,在未见环境中的准确率达到 53.98%,相比 PWC-Net 光流最高提升 6% 的准确率,且推理时无需光流计算。
  • 仅使用事件数据的模型(E²(GO))在未见环境中的准确率为 38.76%,优于仅使用 RGB 的 I3D(35.65%)和 TSM(35.97%)模型,表明其对领域偏移具有鲁棒性。
  • E²(GO)MO 在已见数据上的准确率达到 57.87%,每帧推理时间仅 6ms,而 TV-L1 光流需 488ms,因此非常适合实时应用。
  • 仅使用事件数据在已见环境中的准确率为 55.54%,在某些设置下优于仅使用 RGB 的 I3D(58.49%),表明其具备强大的运动表征能力。
  • 尽管计算成本较高,TV-L1 光流在已见环境(58.47%)和未见环境(43.40%)中仍达到最高准确率,表明光流计算中的运动滤波可减少噪声并提升性能。
  • 结果表明,事件数据是光流的可行、低功耗替代方案,尤其适用于在线和资源受限的自指系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。