[论文解读] Hand Segmentation for Hand-Object Interaction from Depth map
本文提出了一种基于仅深度图的两阶段随机决策森林(RDF)方法,用于手-物体交互中的手部分割,克服了基于颜色方法的局限性。该方法首先检测手部区域,然后利用深度特征进行像素级分割,实现了高精度(F1得分:68.7%)和低处理时间(10.7毫秒),在速度上优于最先进方法,同时保持了具有竞争力的精度。
Hand segmentation for hand-object interaction is a necessary preprocessing step in many applications such as augmented reality, medical application, and human-robot interaction. However, typical methods are based on color information which is not robust to objects with skin color, skin pigment difference, and light condition variations. Thus, we propose hand segmentation method for hand-object interaction using only a depth map. It is challenging because of the small depth difference between a hand and objects during an interaction. To overcome this challenge, we propose the two-stage random decision forest (RDF) method consisting of detecting hands and segmenting hands. To validate the proposed method, we demonstrate results on the publicly available dataset of hand segmentation for hand-object interaction. The proposed method achieves high accuracy in short processing time comparing to the other state-of-the-art methods.
研究动机与目标
- 解决手-物体交互过程中鲁棒手部分割的挑战,因为基于肤色的方法会因光照、色素和物体颜色变化而失效。
- 开发一种仅依赖深度图的方法,避免对颜色信息的依赖,从而在不同光照和肤色条件下保持鲁棒性。
- 在涉及紧密相邻身体部位(如手臂)以及与手部深度相似的物体的复杂场景中,提升分割精度。
- 实现实时性能,适用于增强现实、机器人技术及人机交互等应用。
- 在新收集的、公开可用的深度图数据集上验证该方法,该数据集包含27,525个标注的手-物体交互样本。
提出的方法
- 该方法采用两阶段RDF框架:首先通过全局深度图分析检测手部区域,然后在检测到的区域中细化分割。
- RDF中的每棵决策树使用深度图上两个相对点之间的深度差特征作为分裂标准:$ f(\boldsymbol{x},\boldsymbol{D},\boldsymbol{u},\boldsymbol{v}) = D_{\boldsymbol{x}+\boldsymbol{u}/\boldsymbol{D}_{\boldsymbol{x}}}} - D_{\boldsymbol{x}+\boldsymbol{v}/\boldsymbol{D}_{\boldsymbol{x}}}} $。
- 在叶节点处,训练期间学习条件概率分布,并在推理过程中用于分配类别标签(手部或非手部)。
- 应用空间与深度加权滤波器以优化预测结果,使用高斯函数:$ g_r(r) = \exp(-r^2 / (2\sigma_r^2)) $,$ g_s(s) = \exp(-s^2 / (2\sigma_s^2)) $,其中 $ \sigma_r = \sigma_s = 100 $。
- 第一阶段使用整个深度图作为感兴趣区域(ROI);第二阶段将处理限制在检测到的手部区域,以提高效率和精度。
- 该方法在包含27,525对深度图-标签的自定义数据集上进行训练,数据通过Microsoft Kinect v2采集,涵盖多样化的交互场景与被试。
实验结果
研究问题
- RQ1仅使用深度图的方法是否能在手-物体交互中实现对光照和肤色变化不敏感的鲁棒手部分割?
- RQ2两阶段RDF框架相较于单阶段方法,在复杂交互场景中如何提升分割精度?
- RQ3在深度数据上,RDF方法与深度学习模型相比,在精度与处理时间之间存在何种权衡?
- RQ4空间与深度感知滤波是否能提升RDF方法在重叠或模糊区域的手部分割性能?
- RQ5在F1得分与推理速度方面,该方法与最先进深度基手部分割技术相比表现如何?
主要发现
- 所提方法在使用11×11滤波器时取得68.7%的F1得分,相较于基线RDF方法(F1:53.7%)实现了25%的相对提升。
- 该方法平均处理时间为10.7毫秒,比FCN-8s快42倍(377毫秒),适用于实时应用。
- 与基线RDF相比,两阶段RDF框架将召回率从72.7%提升至77.4%,表明对真正手部像素的检测能力更强。
- 该方法在精度和F1得分上均优于基线RDF及其与所提优化步骤结合的版本,证明了级联设计的有效性。
- 该方法的精度高于基线RDF(F1:53.7%),且比FCN-8s的F1得分低7%(72.3%),但推理时间显著减少。
- 视觉对比显示,所提方法在手部与物体或手臂接触的区域生成了更准确、更连贯的手部掩码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。