[论文解读] CNN-based Action Recognition and Supervised Domain Adaptation on 3D Body Skeletons via Kernel Feature Maps
本文提出一种基于核函数的特征映射表示方法,用于3D人体骨骼序列,通过在CNN中采用监督域自适应实现有效的迁移学习。通过将时间关节序列编码为类似纹理的核映射,该方法在三个基准数据集上实现了最先进性能,通过对具有重叠动作类别的数据集之间进行类别分布对齐实现。
Deep learning is ubiquitous across many areas areas of computer vision. It often requires large scale datasets for training before being fine-tuned on small-to-medium scale problems. Activity, or, in other words, action recognition, is one of many application areas of deep learning. While there exist many Convolutional Neural Network architectures that work with the RGB and optical flow frames, training on the time sequences of 3D body skeleton joints is often performed via recurrent networks such as LSTM. In this paper, we propose a new representation which encodes sequences of 3D body skeleton joints in texture-like representations derived from mathematically rigorous kernel methods. Such a representation becomes the first layer in a standard CNN network e.g., ResNet-50, which is then used in the supervised domain adaptation pipeline to transfer information from the source to target dataset. This lets us leverage the available Kinect-based data beyond training on a single dataset and outperform simple fine-tuning on any two datasets combined in a naive manner. More specifically, in this paper we utilize the overlapping classes between datasets. We associate datapoints of the same class via so-called commonality, known from the supervised domain adaptation. We demonstrate state-of-the-art results on three publicly available benchmarks.
研究动机与目标
- 通过利用具有重叠动作类别的数据集之间的域自适应,解决3D人体动作识别中标签数据有限的挑战。
- 通过使强大的现成CNN(如ResNet-50)能够用于处理3D骨骼序列,克服递归神经网络(如LSTM)在处理3D骨骼序列时的局限性。
- 开发一种数学上严谨的表示方法,将3D骨骼序列转换为与标准CNN兼容的形式。
- 基于二阶散射矩阵对齐的监督域自适应框架,在源数据集和目标数据集之间实现知识迁移。
- 通过联合优化分类损失和域对齐损失,提升动作识别的泛化能力和性能。
提出的方法
- 使用数学上严谨的核方法,将3D身体关节坐标的序列转换为核特征映射,生成类似纹理的输入表示。
- 将核特征映射作为输入馈送到预训练的ResNet-50网络中,实现与标准CNN端到端的训练。
- 基于So-HoT方法实现监督域自适应框架,对齐源域和目标域之间的类别特定特征分布(均值和协方差)。
- 使用联合损失函数,结合Softmax交叉熵损失和域对齐损失($\hbar$),以最小化不同域之间类别均值和协方差的差异。
- 应用邻近损失($\eta \|\mathbf{W} - \mathbf{W}^*\|_F^2$),以促使源网络和目标网络的决策边界保持相似。
- 采用类别级批量采样策略,确保仅当源和目标样本属于同一类别时才应用对齐损失,从而提升训练稳定性和对齐质量。
实验结果
研究问题
- RQ1基于核函数的特征映射能否有效表示3D骨骼序列,以适用于标准CNN?
- RQ2基于二阶统计量的监督域自适应是否能在具有重叠动作类别的数据集之间迁移知识时,显著提升动作识别性能?
- RQ3当结合源数据集和目标数据集时,所提出方法与简单微调相比表现如何?
- RQ4超参数$\sigma_1$、$\sigma_2$、$Z_1$和$Z_2$对模型性能有何影响?
- RQ5该方法在具有部分类别重叠的多样化基准上是否具备泛化能力?
主要发现
- 所提出的核特征映射表示方法能够有效利用预训练的CNN(如ResNet-50)进行基于3D骨骼的动作识别。
- 该方法在三个公开基准数据集上均达到最先进性能:NTU RGB+D、UTKinect-Action3D和SBU-Kinect-Interaction。
- 基于类别均值和协方差对齐的监督域自适应显著优于在合并数据集上进行的朴素微调。
- 消融实验表明,对齐损失$\hbar$对性能至关重要,最优超参数为$\sigma_1 = 0.6$、$\sigma_2 = 0.6$、$Z_1 = 5$和$Z_2 = 15$(在UTK数据集上)。
- 该模型在不同数据集上均保持高准确率,表明在采用所提出的域自适应策略时,对域偏移具有强鲁棒性。
- 该方法是首个成功将监督域自适应应用于3D骨骼序列的CNN方法,而非RNN或LSTM。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。