[论文解读] Learning and Refining of Privileged Information-based RNNs for Action Recognition from Depth Sequences
该论文提出了一种基于特权信息的RNN(PRNN),用于从深度序列中进行动作识别,利用骨架关节点作为训练时的PI以增强特征学习和泛化能力。该方法采用三阶段流程——使用深度图和PI进行预训练、通过多任务学习将PI作为辅助任务进行利用、并通过桥接矩阵对潜在PI进行精炼以对齐隐式PI与分类输出——在多个基准数据集(包括一个新数据集)上实现了最先进性能,相较于基线CNN-RNN模型性能提升最高达15.7%。
Existing RNN-based approaches for action recognition from depth sequences require either skeleton joints or hand-crafted depth features as inputs. An end-to-end manner, mapping from raw depth maps to action classes, is non-trivial to design due to the fact that: 1) single channel map lacks texture thus weakens the discriminative power; 2) relatively small set of depth training data. To address these challenges, we propose to learn an RNN driven by privileged information (PI) in three-steps: An encoder is pre-trained to learn a joint embedding of depth appearance and PI (i.e. skeleton joints). The learned embedding layers are then tuned in the learning step, aiming to optimize the network by exploiting PI in a form of multi-task loss. However, exploiting PI as a secondary task provides little help to improve the performance of a primary task (i.e. classification) due to the gap between them. Finally, a bridging matrix is defined to connect two tasks by discovering latent PI in the refining step. Our PI-based classification loss maintains a consistency between latent PI and predicted distribution. The latent PI and network are iteratively estimated and updated in an expectation-maximization procedure. The proposed learning process provides greater discriminative power to model subtle depth difference, while helping avoid overfitting the scarcer training data. Our experiments show significant performance gains over state-of-the-art methods on three public benchmark datasets and our newly collected Blanket dataset.
研究动机与目标
- 解决单通道深度图在动作识别中判别能力有限的问题。
- 通过在训练过程中利用特权信息(PI)缓解小规模深度数据集上的过拟合问题。
- 实现在推理阶段无需骨架追踪的端到端学习,直接从原始深度图输入进行预测。
- 通过迭代精炼过程缩小外观特征与骨架PI之间的域差距。
- 提升基于深度图的动作识别基准测试中的模型泛化能力与性能表现。
提出的方法
- 使用深度序列和骨架关节点作为输入,对CNN-RNN编码器进行预训练,以学习外观特征与PI的联合嵌入表示。
- 通过结合交叉熵分类损失(主任务)与预测骨架关节点的回归损失(次任务,即PI)的多任务损失函数对编码器进行微调。
- 在精炼阶段引入桥接矩阵,以发现与分类输出分布对齐的潜在PI。
- 通过基于PI的分类损失强制潜在PI与预测类别分布之间的一致性,该损失函数会惩罚分布违反情况。
- 通过期望最大化(EM)过程联合优化桥接矩阵、潜在PI与网络参数。
- 在推理阶段仅使用深度图进行预测,从而消除对实时骨架追踪的需求。
实验结果
研究问题
- RQ1是否能在训练过程中有效利用特权信息(骨架关节点)以提升从深度序列中进行动作识别的性能?
- RQ2在多任务学习中将PI作为辅助任务是否能显著提升主分类任务的性能?
- RQ3通过发现潜在PI的桥接矩阵是否能有效弥合外观表示与骨骼表示之间的域差距?
- RQ4基于EM的迭代精炼过程是否能增强模型在小规模深度数据集上的泛化能力并减少过拟合?
- RQ5所提出的方法是否能在保持端到端训练与实时推理的前提下实现最先进性能?
主要发现
- 所提出的PRNN模型在Action3D数据集上达到94.9%的准确率,相较于基线CNN-RNN(87.3%)提升了7.6个百分点。
- 在SBU数据集上,PRNN达到89.2%的准确率,较基线模型提升10.0个百分点。
- 在CAD60数据集上,PRNN达到87.6%的准确率,较基线CNN-RNN提升6.1个百分点。
- 在新采集的Blanket数据集上,PRNN达到53.5%的准确率,较基线模型提升15.7个百分点。
- 消融实验证实,预训练、多任务学习以及基于潜在PI的精炼三个组件均对性能提升有显著贡献。
- 该模型在单张GPU上实现约38 FPS的实时推理速度,表明尽管采用三阶段训练流程,仍具备出色的计算效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。