Skip to main content
QUICK REVIEW

[论文解读] ViA: View-invariant Skeleton Action Representation Learning via Motion Retargeting

Di Yang, Yaohui Wang|arXiv (Cornell University)|Aug 31, 2022
Human Pose and Action Recognition被引用 4
一句话总结

ViA 提出了一种自监督框架,通过将动作重定向作为先验任务,学习视图和主体无关的骨架动作表征。它通过潜在动作解耦模块分离动作与角色特征,实现在真实世界2D和实验室3D数据集上的跨视图与跨主体动作识别任务中的最先进性能。

ABSTRACT

Current self-supervised approaches for skeleton action representation learning often focus on constrained scenarios, where videos and skeleton data are recorded in laboratory settings. When dealing with estimated skeleton data in real-world videos, such methods perform poorly due to the large variations across subjects and camera viewpoints. To address this issue, we introduce ViA, a novel View-Invariant Autoencoder for self-supervised skeleton action representation learning. ViA leverages motion retargeting between different human performers as a pretext task, in order to disentangle the latent action-specific `Motion' features on top of the visual representation of a 2D or 3D skeleton sequence. Such `Motion' features are invariant to skeleton geometry and camera view and allow ViA to facilitate both, cross-subject and cross-view action classification tasks. We conduct a study focusing on transfer-learning for skeleton-based action recognition with self-supervised pre-training on real-world data (e.g., Posetics). Our results showcase that skeleton representations learned from ViA are generic enough to improve upon state-of-the-art action classification accuracy, not only on 3D laboratory datasets such as NTU-RGB+D 60 and NTU-RGB+D 120, but also on real-world datasets where only 2D data are accurately estimated, e.g., Toyota Smarthome, UAV-Human and Penn Action.

研究动机与目标

  • 解决现有自监督骨架动作表征方法在具有多样化主体和视角的真实世界视频中泛化能力差的问题。
  • 通过从2D估计骨架学习不变表征,提升在3D骨架数据不可用或存在噪声场景下的动作识别鲁棒性。
  • 仅通过在真实世界数据上进行自监督预训练,实现跨主体和跨视图动作分类的有效迁移学习。
  • 将骨架序列中的动作特异性特征与主体和视角特异性特征解耦,以实现不变性。
  • 证明动作重定向作为先验任务在学习通用、可迁移骨架表征方面的有效性。

提出的方法

  • 使用源骨架序列与驱动骨架序列之间的动作重定向作为先验任务,训练一个视图和主体无关的自编码器。
  • 采用潜在动作解耦(LMD)模块,通过正交分解将视觉表征分解为‘动作’(与动作相关)和‘角色’(与视角/体型相关)两部分。
  • 使用轻量级骨架序列解码器,通过在源序列和驱动序列之间交换‘动作’特征来重建序列。
  • 通过对比损失、循环重建损失、三元组损失和速度损失的组合优化模型,以强化视图不变性和动作判别能力。
  • 在大规模真实世界Posetics数据集上预训练视觉编码器,以学习通用表征,之后在下游任务上进行微调。
  • 采用线性评估和微调两种协议,评估在未见的2D真实世界和3D实验室数据集上的迁移能力。

实验结果

研究问题

  • RQ1动作重定向能否作为真实世界2D数据中学习视图和主体无关骨架表征的有效自监督先验任务?
  • RQ2解耦后的‘动作’特征在不同主体和摄像机视角下,其在动作识别中的泛化能力如何?
  • RQ3与在合成数据上预训练相比,在真实世界数据(如Posetics)上进行自监督预训练如何提升迁移性能?
  • RQ4每种损失组件(自重建、循环、三元组、速度)对最终表征质量和下游准确率的贡献如何?
  • RQ5所学习的表征是否能在不重新训练的情况下泛化到2D真实世界数据集和3D实验室数据集?

主要发现

  • ViA在跨视图和跨主体动作识别任务中达到最先进性能,在真实世界(Toyota Smarthome、UAV-Human、Penn Action)和实验室(NTU-RGB+D 60/120)数据集上均优于先前的自监督方法。
  • 在Toyota Smarthome数据集上采用微调时,ViA达到65.4%的top-1准确率,显著优于基线(61.7%)和先前方法。
  • 消融研究显示,将循环损失(+1.1%)和三元组损失(+2.1%)加入基线可带来最大性能提升,凸显其在增强视图不变性方面的作用。
  • 添加速度损失带来微小但稳定的增益(0.4%准确率提升),表明动作表征的时间一致性得到改善。
  • 定性结果证实了有效的解耦:无论输入视角如何,‘动作’特征均表示一种标准的、视图无关的动作,而‘角色’特征则控制体型和视角。
  • 在Mixamo上的t-SNE可视化显示,‘动作’特征无论主体或视角如何,均按动作类型聚类,验证了所学表征的解耦性和不变性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。