[论文解读] Unsupervised Motion Representation Learning with Capsule Autoencoders
本文提出运动胶囊自编码器(MCAE),一种基于胶囊的无监督框架,通过片段和段落胶囊的两级层次结构,学习对变换具有不变性的运动表征。通过建模局部运动片段,并利用姿态不变模板将它们聚合为更高层级的语义段落,MCAE 在参数更少的情况下,在新型合成数据集(Trajectory20)和真实世界基准上实现了无监督骨架动作识别的最先进性能。
We propose the Motion Capsule Autoencoder (MCAE), which addresses a key challenge in the unsupervised learning of motion representations: transformation invariance. MCAE models motion in a two-level hierarchy. In the lower level, a spatio-temporal motion signal is divided into short, local, and semantic-agnostic snippets. In the higher level, the snippets are aggregated to form full-length semantic-aware segments. For both levels, we represent motion with a set of learned transformation invariant templates and the corresponding geometric transformations by using capsule autoencoders of a novel design. This leads to a robust and efficient encoding of viewpoint changes. MCAE is evaluated on a novel Trajectory20 motion dataset and various real-world skeleton-based human action datasets. Notably, it achieves better results than baselines on Trajectory20 with considerably fewer parameters and state-of-the-art performance on the unsupervised skeleton-based action recognition task.
研究动机与目标
- 为解决在无监督设置下,特别是在视角和主体差异下,学习对变换具有不变性的运动表征的挑战。
- 开发一种分层运动表征框架,以捕捉局部短期运动与全局长期语义模式。
- 通过利用学习到的片段模板参数化段落模板,降低模型复杂度,同时保持判别能力。
- 在合成和真实世界骨架动作数据集上评估该框架,证明其鲁棒性与泛化能力。
提出的方法
- MCAE 采用两级胶囊层次结构:片段胶囊(SniCap)用于局部短时运动信号,段落胶囊(SegCap)用于更长且具有语义意义的运动段落。
- 每个胶囊维护一组学习到的模板(SniCap 为运动序列,SegCap 为由 SniCap 模板组合而成),并学习几何变换参数以重建输入运动。
- 通过将语义内容(编码于胶囊激活 ν)与几何变换(编码于变换参数 B)解耦,实现对变换的不变性。
- 该框架采用新颖的胶囊自编码器设计,结合注意力路由机制与正则化训练,以稳定姿态不变特征的学习。
- 段落胶囊通过层级方式从片段胶囊构建,从而在保持分层抽象的同时减少参数数量。
- 引入一个新的合成数据集 Trajectory20,用于评估在受控类内变化下运动表征的鲁棒性。
实验结果
研究问题
- RQ1胶囊自编码器能否在无监督条件下学习到对视角和个体特异性差异具有不变性的运动表征?
- RQ2两级片段-段落胶囊层次结构在捕捉局部运动动态与全局语义运动模式方面的有效性如何?
- RQ3将语义内容(ν)与几何变换(B)解耦,在多大程度上提升了对运动变换的鲁棒性?
- RQ4在真实世界骨架动作识别任务中,MCAE 相较于现有无监督方法,在准确率、参数效率与泛化能力方面表现如何?
- RQ5所提出的框架能否泛化到多样的运动模式,并在受控类内变化下保持鲁棒性?
主要发现
- MCAE 在无监督骨架动作识别基准上达到最先进性能,优于现有基线方法。
- 在新型 Trajectory20 数据集上,MCAE 以显著更少的参数量取得更优结果。
- 消融实验表明,语义内容(ν)与变换参数(B)的解耦可产生稳定且对变换鲁棒的表征。
- 该框架在多种运动模式下表现一致,包括在平移与旋转方面具有受控类内变化的样本。
- MCAE 学习到的段落模板在输入平移时表现出空间位置的单调变化,证实语义内容在几何变换下保持不变。
- 即使在大幅视角与运动扰动下,模型仍保持高重建保真度与稳定的激活模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。