Skip to main content
QUICK REVIEW

[论文解读] 3D Skeleton-based Few-shot Action Recognition with JEANIE is not so Naïve

Lei Wang, Jun Liu|arXiv (Cornell University)|Dec 23, 2021
Human Pose and Action Recognition被引用 7
一句话总结

该论文提出 JEANIE,一种用于 3D 骨骼的 few-shot 动作识别框架,通过可微分的、基于投影几何的动态时间规整(DTW)变体,联合优化时间与模拟相机视角对齐。通过在四维时间-视角空间中建模平滑路径,并采用基于相似度的损失函数与轻量级图神经网络,JEANIE 在 NTU-60、NTU-120、Kinetics-skeleton 和 UWA3D Multiview Activity II 上实现了最先进性能,相比基线方法最高提升 6%,并展现出对新视角和 few-shot 条件的鲁棒性。

ABSTRACT

In this paper, we propose a Few-shot Learning pipeline for 3D skeleton-based action recognition by Joint tEmporal and cAmera viewpoiNt alIgnmEnt (JEANIE). To factor out misalignment between query and support sequences of 3D body joints, we propose an advanced variant of Dynamic Time Warping which jointly models each smooth path between the query and support frames to achieve simultaneously the best alignment in the temporal and simulated camera viewpoint spaces for end-to-end learning under the limited few-shot training data. Sequences are encoded with a temporal block encoder based on Simple Spectral Graph Convolution, a lightweight linear Graph Neural Network backbone (we also include a setting with a transformer). Finally, we propose a similarity-based loss which encourages the alignment of sequences of the same class while preventing the alignment of unrelated sequences. We demonstrate state-of-the-art results on NTU-60, NTU-120, Kinetics-skeleton and UWA3D Multiview Activity II.

研究动机与目标

  • 为解决 3D 骨骼序列中 few-shot 动作识别的挑战,即有限的标注数据阻碍了可靠的度量学习。
  • 通过联合建模时间与视角错位,提升查询序列与支持序列之间的匹配度,此类错位通常由运动速度变化和相机角度差异引起。
  • 开发一种可微分的、端到端可学习的对齐机制,可在时间与模拟相机视角空间中同时运行。
  • 在低 shot 设置下,利用 3D 骨骼数据实现对新动作类别的优越泛化能力。
  • 在如 NTU-120 和 UWA3D Multiview Activity II 等多视角 3D 骨骼数据集上建立新的 few-shot 动作识别基准。

提出的方法

  • 提出一种基于投影几何的可微分动态时间规整(DTW)变体,联合优化时间与模拟相机视角空间中的对齐。
  • 利用立体投影代数生成多个模拟相机视角,实现在无需真实相机标定的情况下实现视角不变的表征学习。
  • 采用基于简单谱图卷积(SGC)的时间块编码器作为轻量级主干网络,可选地引入 Transformer 变体以增强特征学习。
  • 引入基于相似度的损失函数,鼓励同类别动作序列之间的对齐,同时抑制不同类别序列间的对齐。
  • 通过在四维空间(时间 × 视角)中优化联合路径实现端到端训练,每一步对齐均受限于小幅度视角变化。
  • 使用固定长度 M 与步长 S 的时间块提取局部表征,再进行对齐,从而实现对长序列的高效处理。

实验结果

研究问题

  • RQ1在有限监督下,联合时间与视角对齐是否能提升 3D 骨骼序列中的 few-shot 动作识别性能?
  • RQ2通过立体投影几何建模视角对齐是否在 few-shot 设置下优于简单的欧拉角旋转?
  • RQ3所提出的可微分对齐机制在处理可变运动速度与相机视角方面有多高效?
  • RQ4基于相似度的损失在提升对新动作类别与未见视角的泛化能力方面有多显著?
  • RQ5所提出方法是否能跨多个相机视角泛化,并在多视角 3D 骨骼基准上实现最先进性能?

主要发现

  • 在 Kinetics-skeleton 的 few-shot 条件下,JEANIE 达到 52.5% 的准确率,相比基线(仅 soft-DTW)提升 12.9%,相比 Free Viewpoint Matching(FVM)提升 12.2%。
  • 在 UWA3D Multiview Activity II 上,使用 S 2 GC 主干的 JEANIE 达到 63.7% 的平均准确率,较 S 2 GC 基线提升 10.1%,较 FVM 提升 12.0%。
  • 在 NTU-120 多视角分类中,当在左视图与中视图上训练、在右视图上测试时,JEANIE 在新类别上达到 70.8% 的准确率,展现出对未见视角的强大泛化能力。
  • 引入 Transformer 编码器使 JEANIE 在 Kinetics-skeleton 上的性能提升 2%,表明更丰富的特征建模具有显著优势。
  • 与 2D 骨骼相比,使用 3D 骨骼在所有基准上均提升 3–4% 的性能,凸显了 3D 几何信息的优势。
  • 该方法在所有数据集与设置下均持续优于所有基线模型,包括同类别与新类别 few-shot 评估协议。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。