[论文解读] Event-based Action Recognition Using Timestamp Image Encoding Network
本文提出一种基于时间戳图像编码的2D CNN方法,用于事件驱动动作识别,将异步事件数据转换为保留运动动态的时空帧。该方法在手势识别任务上达到最先进性能,在真实世界动作数据集上也取得具有竞争力的结果,且无需使用RNN即可匹配基于RGB的基准性能。
Event camera is an asynchronous, high frequency vision sensor with low power consumption, which is suitable for human action recognition task. It is vital to encode the spatial-temporal information of event data properly and use standard computer vision tool to learn from the data. In this work, we propose a timestamp image encoding 2D network, which takes the encoded spatial-temporal images of the event data as input and output the action label. Experiment results show that our method can achieve the same level of performance as those RGB-based benchmarks on real world action recognition, and also achieve the SOTA result on gesture recognition.
研究动机与目标
- 通过有效编码时空信息,弥合事件数据与标准深度学习模型之间的差距。
- 证明事件数据中的时间信息对于动作识别至关重要,而不仅仅是静态的空间编码。
- 仅使用2D CNN,在真实世界动作识别任务中实现与基于RGB的方法相当的性能。
- 在手势识别基准上超越现有的事件驱动方法。
提出的方法
- 通过在固定时间间隔上滑动窗口,将事件数据编码为时间戳图像,其中像素强度反映该窗口内相对时间戳。
- 分别对正负极性事件进行编码,生成两张时间戳图像,随后将二者合并为单个多通道帧。
- 时空编码通过强调事件的时间演进过程,保留了与运动相关的动态特性,不同于静态事件图像直方图。
- 对编码后的时间戳图像帧应用标准2D CNN,实现端到端的动作分类。
- 该方法避免使用RNN或3D卷积,仅依赖2D CNN,从而提升效率与简洁性。
- 通过在合并前分别编码+1和-1极性事件,保留极性信息,确保表征中运动方向得以保留。
实验结果
研究问题
- RQ1时间戳图像编码能否有效捕捉事件数据中的时空动态以用于动作识别?
- RQ2通过时间戳编码引入时间信息,是否能提升纯空间事件图像编码的性能?
- RQ3基于2D CNN的模型在时间戳编码的事件数据上训练,能否实现与基于RGB模型相当的性能?
- RQ4与最先进事件驱动方法相比,该方法在手势识别任务上的表现如何?
- RQ5为何事件驱动识别在动作序列早期表现较差,尽管后期性能较强?
主要发现
- 在5折验证中,时间戳图像表示达到83.23%的准确率,优于事件图像表示(82.00%),证实了时间编码的重要性。
- 在EV-UCF-11数据集上,所提方法达到92.90%的准确率,与基于RGB的基准性能相当,并优于现有事件驱动方法如Motion map + MBH(75.13%)。
- 在DVS-128手势数据集上,使用80ms窗口时,方法达到97.35%的准确率,创下新SOTA记录,优于PointNet++(97.06%)和Time Cascade(96.49%)。
- 在10%观测比例下性能显著下降(79.78% vs. RGB的89.57%),表明事件驱动模型严重依赖运动动态,且在早期阶段缺乏上下文线索。
- 该方法优于使用3D CNN或点云表示的现有事件驱动模型,证明仅通过适当的编码,简单的2D CNN已足够且高效。
- 消融实验确认,时间戳图像中编码的时间信息至关重要,因为纯空间表示的准确率更低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。