[论文解读] Occlusion-aware Hand Pose Estimation Using Hierarchical Mixture Density Network
本文提出分层混合密度网络(HMDN),一种新型的端到端可训练框架,将3D手部姿态估计建模为条件概率分布,以处理自遮挡问题。通过采用两级层次结构——对可见关节使用单个高斯分布,对遮挡关节使用高斯混合模型——HMDN能够捕捉多模态姿态分布,生成多样且可解释的候选样本,在遮挡严重的基准测试中显著优于当前最先进方法。
Learning and predicting the pose parameters of a 3D hand model given an image, such as locations of hand joints, is challenging due to large viewpoint changes and articulations, and severe self-occlusions exhibited particularly in egocentric views. Both feature learning and prediction modeling have been investigated to tackle the problem. Though effective, most existing discriminative methods yield a single deterministic estimation of target poses. Due to their single-value mapping intrinsic, they fail to adequately handle self-occlusion problems, where occluded joints present multiple modes. In this paper, we tackle the self-occlusion issue and provide a complete description of observed poses given an input depth image by a novel method called hierarchical mixture density networks (HMDN). The proposed method leverages the state-of-the-art hand pose estimators based on Convolutional Neural Networks to facilitate feature learning, while it models the multiple modes in a two-level hierarchy to reconcile single-valued and multi-valued mapping in its output. The whole framework with a mixture of two differentiable density functions is naturally end-to-end trainable. In the experiments, HMDN produces interpretable and diverse candidate samples, and significantly outperforms the state-of-the-art methods on two benchmarks with occlusions, and performs comparably on another benchmark free of occlusions.
研究动机与目标
- 解决判别式手部姿态估计方法仅输出单一确定性结果且无法在遮挡下建模多模态姿态分布的局限性。
- 克服在使用均方误差进行训练时,因对多个真实姿态取平均而导致遮挡关节预测出现物理上不合理的现象。
- 为输入的深度图像提供完整、概率化的手部姿态描述,尤其适用于频繁出现自遮挡的自视角场景。
- 实现端到端训练深度网络,联合学习特征并利用可微密度函数建模复杂、多模态的姿态分布。
- 通过单次前向传播生成多样且符合运动学约束的姿态假设,支持跟踪和多阶段估计等下游任务。
提出的方法
- 提出一种分层混合密度网络(HMDN),以两级方式建模关节位置分布:首先,通过潜在可见性变量判断关节是否可见或被遮挡。
- 对于可见关节,HMDN使用单个高斯分布(SGN)来建模关节位置的条件分布。
- 对于遮挡关节,HMDN采用高斯混合模型(GMM)以捕捉在相同输入图像下多个合理的姿态配置。
- HMDN框架堆叠在基于CNN的特征提取器之上,支持使用可微密度函数进行端到端训练。
- 网络通过负对数似然损失进行训练,以优化预测混合分布下真实姿态的似然性。
- 推理阶段,HMDN通过从遮挡关节的GMM采样和可见关节的SGN采样,生成多样化的候选姿态,从而在不确定性下实现鲁棒的姿态估计。
实验结果
研究问题
- RQ1深度学习框架能否以可微、端到端可训练的方式建模遮挡手部关节的多模态姿态分布?
- RQ2将可见性建模为潜在变量,能否提升在自遮挡条件下3D手部姿态估计的准确性和多样性?
- RQ3分层混合密度方法是否在准确性和样本多样性方面优于单一分布基线(如SGN)及现有多种假设方法?
- RQ4HMDN在不同遮挡程度的基准测试中表现如何,尤其与当前最先进方法(包括确定性和生成式方法)相比?
- RQ5HMDN的概率输出能否通过提供多样且合理的姿态假设,提升下游任务(如手部跟踪或混合姿态估计)的性能?
主要发现
- 在包含大量遮挡的MSHD数据集上,HMDN显著优于当前最先进方法,尤其在遮挡关节上表现突出。
- 在MSHD基准上,使用8个高斯分量的HMDN在100次采样下,遮挡关节的平均误差为11.8 mm,优于Tang等人[12](14.2 mm)和Ye等人[31](15.1 mm)。
- HMDN在所有组件数量下均显著优于HMDN hard和HMDN soft变体,其中HMDN soft在不同组件数量下均表现最佳。
- 在NYU数据集上,遮挡较少,HMDN与SGN性能相当,可见关节排名第二,遮挡关节排名第三,表明其在低遮挡场景下也具有鲁棒性。
- HMDN生成的样本既多样又准确,分布紧凑,避免了Tang等人[12](在决策森林中使用GMM)所见的高方差问题。
- 视觉对比显示,HMDN的样本比Ye等人[31]和Tang等人[12]更接近真实姿态,尤其在遮挡关节上,证实其能有效建模真实的多模态分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。