Skip to main content
QUICK REVIEW

[论文解读] Ego2Hands: A Dataset for Egocentric Two-hand Segmentation and Detection

Fanqing Lin, Price, Brian|arXiv (Cornell University)|Nov 14, 2020
Hand Gesture Recognition Systems参考文献 34被引用 12
一句话总结

该论文提出了 Ego2Hands,一个大规模的自指 RGB 数据集,包含约 180,000 个半自动标注的右手实例,以及 2,000 个手动验证的双人手分割与检测帧。通过采用一种与颜色无关的合成技术,将翻转的右手图像作为左手使用,该方法能够训练出具有领域泛化能力的模型,在未见过的环境中无需领域自适应即可实现高精度,其在数据多样性、标注质量与泛化能力方面均优于以往基准。

ABSTRACT

Hand segmentation and detection in truly unconstrained RGB-based settings is important for many applications. However, existing datasets are far from sufficient in terms of size and variety due to the infeasibility of manual annotation of large amounts of segmentation and detection data. As a result, current methods are limited by many underlying assumptions such as constrained environment, consistent skin color and lighting. In this work, we present Ego2Hands, a large-scale RGB-based egocentric hand segmentation/detection dataset that is semi-automatically annotated and a color-invariant compositing-based data generation technique capable of creating training data with large quantity and variety. For quantitative analysis, we manually annotated an evaluation set that significantly exceeds existing benchmarks in quantity, diversity and annotation accuracy. We provide cross-dataset evaluation as well as thorough analysis on the performance of state-of-the-art models on Ego2Hands to show that our dataset and data generation technique can produce models that generalize to unseen environments without domain adaptation.

研究动机与目标

  • 解决真实世界部署中缺乏大规模、多样化且精确标注的自指手部分割与检测数据集的问题。
  • 克服现有数据集依赖受限光照、肤色一致性或存在领域偏移的合成数据的局限性。
  • 开发一种半自动标注流程与基于合成的数据生成技术,以在保持真实感与多样性的同时扩展数据收集规模。
  • 在无需对新场景进行领域自适应的前提下,实现基于 RGB 的手部分割与检测模型的领域泛化能力。
  • 为评估最先进模型在真实世界自指手部感知任务中的表现提供基准,涵盖手部相互遮挡与光照变化等复杂情况。

提出的方法

  • 使用绿色屏幕设置收集约 180,000 个独特的右手实例,以支持半自动分割标注。
  • 通过水平翻转右手图像生成左手实例,从而实现包含手部相互遮挡的逼真双手组合。
  • 引入一种与颜色无关的输入空间,使用灰度图像与边缘图,以提升对光照与肤色变化的鲁棒性。
  • 开发一种半自动的热力图能量标注方法,以支持手部检测任务与分割任务并行进行。
  • 采用基于合成的数据生成技术,合成包含逼真手部姿态、背景与光照条件的多样化训练样本。
  • 在 Ego2Hands 数据集上训练并评估深度学习模型(如 ICNet、RefineNet、UNet 变体),以评估其泛化与适应性能。

实验结果

研究问题

  • RQ1基于合成的数据生成方法能否生成训练数据,使模型在无需领域自适应的情况下泛化到未见过的自指环境?
  • RQ2与完全人工标注相比,所提出的半自动标注流程在可扩展性与标注准确性方面表现如何?
  • RQ3在真实世界场景中,使用灰度图与边缘图作为输入在多大程度上提升了模型对光照与肤色变化的鲁棒性?
  • RQ4不同网络架构(如 UNet、ICNet、RefineNet)在 Ego2Hands 基准上如何在精度、推理速度与模型大小之间进行权衡?
  • RQ5在 Ego2Hands 上训练的模型能否在跨数据集评估中实现高性能,特别是在包含多样化肤色与光照条件的未见场景中?

主要发现

  • Ego2Hands 数据集包含约 180,000 个独特的右手实例与 2,000 个手动标注的评估帧,其数量与多样性显著超过现有基准。
  • 在未见环境中,无需领域自适应,基于 Ego2Hands 训练的模型在不同光照与肤色条件下均表现出良好的泛化能力,分割与检测精度均较高。
  • ICNet 在中等模型尺寸与推理速度下表现优异,实现了精度与效率之间的良好平衡。
  • RefineNet 在所有评估模型中实现了最高的泛化精度,证明了深度架构在结合 Ego2Hands 数据时的有效性。
  • 轻量级 $ ext{UNet}_{1/8}$ 模型以极少的参数量与快速推理速度实现了令人满意的精度,适用于实时应用。
  • 添加边缘图与能量输出通道可提升分割与检测性能,其中能量图为下游任务提供了有用的检测信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。