[论文解读] Histogram of Oriented Principal Components for Cross-View Action Recognition
该论文提出了一种直方图方向主成分(HOPC)与时空关键点(STKs)方法,用于从点云序列中实现视角不变的3D动作识别。通过将局部时空体积对齐至主成分,并将特征向量投影到正十二面体上,HOPC在视角、尺度和速度变化下均表现出鲁棒性,在多视角和单视角数据集上显著优于九种最先进方法。
Existing techniques for 3D action recognition are sensitive to viewpoint variations because they extract features from depth images which are viewpoint dependent. In contrast, we directly process pointclouds for cross-view action recognition from unknown and unseen views. We propose the Histogram of Oriented Principal Components (HOPC) descriptor that is robust to noise, viewpoint, scale and action speed variations. At a 3D point, HOPC is computed by projecting the three scaled eigenvectors of the pointcloud within its local spatio-temporal support volume onto the vertices of a regular dodecahedron. HOPC is also used for the detection of Spatio-Temporal Keypoints (STK) in 3D pointcloud sequences so that view-invariant STK descriptors (or Local HOPC descriptors) at these key locations only are used for action recognition. We also propose a global descriptor computed from the normalized spatio-temporal distribution of STKs in 4-D, which we refer to as STK-D. We have evaluated the performance of our proposed descriptors against nine existing techniques on two cross-view and three single-view human action recognition datasets. The Experimental results show that our techniques provide significant improvement over state-of-the-art methods.
研究动机与目标
- 为解决3D点云序列中跨视角动作识别的挑战,现有依赖深度图像的方法对视角敏感。
- 开发一种视角不变的局部几何描述符,能够鲁棒地捕捉不同视角、尺度和动作速度下的形状与运动特征。
- 检测具有判别性的时空关键点(STKs),使其最适合HOPC描述符的提取,从而确保视角不变性。
- 提出一种基于STKs时空分布的全局描述符STK-D,以提升识别性能。
- 在新的和现有的多视角与单视角3D动作数据集上评估所提方法,证明其优越性能。
提出的方法
- HOPC通过将点云局部时空支撑体积的三个缩放特征向量投影到正十二面体的顶点上计算,编码局部几何与运动特征。
- 通过特征比阈值检测STK,识别具有独特局部结构的点,确保在不同视角下具有鲁棒性与判别性。
- 通过将每个STK的时空支撑体积对齐至其由主成分定义的局部坐标系,实现视角不变性,实现方向归一化。
- 通过自动时间尺度选择实现速度不变性,即在每个STK处最小化不同时间窗口大小下的特征比变化。
- STK-D全局描述符基于检测到的STK的归一化4D时空分布计算,捕捉全局动作模式。
- 将STK处的局部HOPC描述符与全局STK-D描述符结合,用于最终动作识别,充分利用局部与全局信息的互补性。
实验结果
研究问题
- RQ1能否设计一种局部几何描述符,使其在3D点云序列中对视角、尺度和动作速度变化具有鲁棒性?
- RQ2如何检测时空关键点,以确保与HOPC等视角不变局部描述符的兼容性?
- RQ3将局部HOPC描述符与全局STK-D描述符结合,能在多大程度上提升跨视角动作识别的准确率?
- RQ4所提方法在多视角与单视角3D动作识别基准上与最先进方法相比表现如何?
- RQ5在部分可见或非直立姿势等复杂场景下,该方法是否能在不依赖骨骼数据的情况下实现高性能?
主要发现
- 所提出的基于HOPC与STK的方法在Northwestern-UCLA Multiview Action3D与UWA3D Multiview Activity II数据集上均达到最先进性能,显著优于九种现有技术。
- 在STK数量范围(最多700个)内,识别准确率保持稳定,最优性能出现在400个STK时,表明对关键点数量变化具有鲁棒性。
- 当特征比阈值θ_STK在1.1至1.5之间时,识别准确率保持稳定,证明对关键点检测参数设置具有鲁棒性。
- 在标准机器上,每帧平均计算时间为2秒,准确率优于最接近的竞争对手AOG(1.4秒/帧),且计算效率可行。
- 局部HOPC与STK-D描述符的结合优于任一描述符单独使用,证实了其互补性。
- 所提方法优于基于骨骼的方法(如HOJ3D与LARP),尤其在部分可见或非直立姿势等场景下,因其直接处理点云且不依赖关节估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。