[论文解读] Hierarchical Temporal Transformer for 3D Hand Pose Estimation and Action Recognition from Egocentric RGB Videos
该论文提出了一种分层时间变换器网络,通过利用短期时间线索进行姿态估计,长期时间线索进行动作识别,联合估计自指RGB视频中的3D手部姿态并识别动作。该框架采用具有不同感受野的两级级联变换器编码器,在FPHA和H2O基准上实现了最先进性能。
Understanding dynamic hand motions and actions from egocentric RGB videos is a fundamental yet challenging task due to self-occlusion and ambiguity. To address occlusion and ambiguity, we develop a transformer-based framework to exploit temporal information for robust estimation. Noticing the different temporal granularity of and the semantic correlation between hand pose estimation and action recognition, we build a network hierarchy with two cascaded transformer encoders, where the first one exploits the short-term temporal cue for hand pose estimation, and the latter aggregates per-frame pose and object information over a longer time span to recognize the action. Our approach achieves competitive results on two first-person hand action benchmarks, namely FPHA and H2O. Extensive ablation studies verify our design choices.
研究动机与目标
- 解决自指RGB视频中手部运动理解时的自遮挡和动作模糊性挑战。
- 通过利用帧间短期时间一致性,提升3D手部姿态估计的鲁棒性。
- 通过聚合来自每帧预测的长期时间上下文,识别复杂手部动作(例如“倒牛奶”、“放牛奶”)。
- 使用分层级联变换器架构,建模手部运动与物体操作之间的语义相关性。
- 开发一个端到端可训练的框架,联合优化姿态估计与动作识别,无需迭代优化或手工设计特征。
提出的方法
- 设计一个双分支分层变换器架构:短期姿态编码器(窗口大小t=16)和长期动作编码器(窗口大小T=128)。
- 使用视觉变换器主干网络从每帧提取图像特征,随后输入到姿态和动作变换器模块中。
- 姿态模块通过可学习查询机制输出每帧的3D手部关节点坐标和物体类别标签。
- 动作模块通过多头自注意力机制,在更长序列上聚合每帧的姿态和物体预测结果,使用可学习的类别标记。
- 将姿态和动作模块级联,使得动作模块的输入包含来自姿态模块的每帧姿态、物体标签和图像特征。
- 使用联合损失函数(包含3D关键点回归和动作分类交叉熵)端到端训练整个网络。
实验结果
研究问题
- RQ1在不同粒度上建模时间上下文是否能提升自指视频中3D手部姿态估计与动作识别的性能?
- RQ2与并行或单分支架构相比,级联变换器的分层设计在联合姿态与动作学习中的表现如何?
- RQ3手部运动与物体操作之间的语义相关性在多大程度上提升了动作识别的准确性?
- RQ4长距离时间建模是否能提升对单帧中模糊动作的识别能力?
- RQ5在该任务中,简单的端到端前馈变换器架构是否能超越迭代或多阶段方法?
主要发现
- 所提出的分层时间变换器在FPHA数据集上达到94.09%的动作识别准确率,在H2O数据集上达到86.36%,创下新的最先进结果。
- 消融实验表明,级联设计在FPHA上比并行架构高出0.87%,在H2O上高出6.19%,证实了分层建模的优势。
- 若从动作模块中移除每帧姿态或物体标签输入,准确率会下降(例如分别降至93.57%和91.65%),证明了其重要性。
- 注意力可视化结果表明,动作模块最关注定义动作的关键帧,例如“取出浓缩咖啡”动作的最终帧。
- 将时间窗口大小从16帧增加到128帧,使FPHA上的动作识别准确率从90.96%提升至94.09%,验证了长距离建模的有效性。
- 该模型通过利用完整序列上下文而非单帧线索,有效解决了动作模糊性问题——例如,能准确区分“倒牛奶”与“放牛奶”。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。