[论文解读] BusyHands: A Hand-Tool Interaction Database for Assembly Tasks Semantic Segmentation
本文提出 BusyHands,一个全新的 RGB+D 数据集,包含 7,905 幅真实与合成图像,标注了 16 个语义类别,涵盖手部、工具和工件等,旨在推动复杂手-工具交互场景中的语义分割研究。该数据集支持最先进模型的基准测试,表明结合真实与合成数据可使 mIOU 相比仅使用真实数据训练提升高达 80%。
Visual segmentation has seen tremendous advancement recently with ready solutions for a wide variety of scene types, including human hands and other body parts. However, focus on segmentation of human hands while performing complex tasks, such as manual assembly, is still severely lacking. Segmenting hands from tools, work pieces, background and other body parts is extremely difficult because of self-occlusions and intricate hand grips and poses. In this paper we introduce BusyHands, a large open dataset of pixel-level annotated images of hands performing 13 different tool-based assembly tasks, from both real-world captures and virtual-world renderings. A total of 7906 samples are included in our first-in-kind dataset, with both RGB and depth images as obtained from a Kinect V2 camera and Blender. We evaluate several state-of-the-art semantic segmentation methods on our dataset as a proposed performance benchmark.
研究动机与目标
- 为解决当前缺乏大规模、完全标注的数据集以支持装配任务中人手与工具交互的语义分割问题。
- 提供一个基准数据集,支持在复杂的真实世界与合成手-工具交互场景中训练和评估深度学习模型。
- 推动面向工业和个人制造场景中鲁棒、可泛化语义分割模型的研究。
- 探索合成数据增强在提升真实世界手-工具交互数据分割性能方面的有效性。
提出的方法
- 该数据集包含 7,905 对 RGB 与深度图像,由 Kinect V2 捕获并使用 Blender 渲染,覆盖 13 种基于工具的装配任务。
- 通过人工与自动标注流程,为 16 个语义类别(包括手部、工具(如螺丝刀、扳手)、工件和背景)创建了像素级标注。
- 数据集包含真实世界采集与合成渲染图像,其中合成数据通过 3D 建模与逼真渲染生成,以提升多样性与可扩展性。
- 采用 mIOU 作为主要指标,对多种最先进语义分割模型(包括 FRRN、DeepLabV3+、MobileUNet 和 SegNet)进行了对比评估。
- 在数据划分上评估了多种训练策略:仅真实数据、仅合成数据、真实+合成混合数据,以评估域泛化能力与数据效率。
- 考虑了基于斑点几何分析的后处理技术以减少分割输出中的噪声,但未在主要实验中应用。
实验结果
研究问题
- RQ1当模型仅在真实世界数据或仅在合成数据上训练时,其语义分割性能如何变化?
- RQ2将合成数据与真实数据结合后,在真实世界测试集上的分割准确率能提升多少?
- RQ3不同最先进架构在典型手-工具交互任务中复杂、遮挡和杂乱场景下的表现如何?
- RQ4深度模态(RGB+D)在手-工具交互场景中的分割准确率上产生何种影响?
- RQ5合成数据能否有效泛化到真实世界场景中的手-工具交互分割任务?其局限性是什么?
主要发现
- FRRN-B 模型在所有类别中均达到最高 mIOU,优于其他架构(包括 DeepLabV3+ 和 SegNet-Skip)。
- 在真实测试集上,使用真实与合成数据联合训练使 mIOU 从仅真实数据训练的 0.336(FRRN-A,仅真实)提升至 0.502,相对提升达 50%。
- 合成数据带来的性能提升在大多数模型中保持一致,mIOU 提升最高达 80%,但 MobileUNet 表现略有下降。
- 对手部、工具和肢体的分割通常准确,但随机桌面上的物体常被误分类为工具,表明预测中存在噪声。
- 引入深度数据显著提升了分割质量,表现为 mIOU 更高且边界贴合更精确,相较于 COCO 和 ADE20K 等数据集表现更优。
- 仅使用合成数据即达到较高的 mIOU(FRRN-A 为 0.714),表明当与真实数据结合时,其在域泛化方面具有强大潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。