[论文解读] Egocentric Human Segmentation for Mixed Reality
本文提出一种基于轻量级半合成数据集(15,000张图像)和改进的ThunderNet架构的实时自指人体分割方法。该方法在720×720图像上实现16ms推理时间,使混合现实中高保真度视频自体化身成为可能,从而在不牺牲实时性能的前提下增强沉浸感与身体存在感。
The objective of this work is to segment human body parts from egocentric video using semantic segmentation networks. Our contribution is two-fold: i) we create a semi-synthetic dataset composed of more than 15, 000 realistic images and associated pixel-wise labels of egocentric human body parts, such as arms or legs including different demographic factors; ii) building upon the ThunderNet architecture, we implement a deep learning semantic segmentation algorithm that is able to perform beyond real-time requirements (16 ms for 720 x 720 images). It is believed that this method will enhance sense of presence of Virtual Environments and will constitute a more realistic solution to the standard virtual avatars.
研究动机与目标
- 解决缺乏公开可用、高质量的带有像素级标注的自指人体分割数据集的问题。
- 开发一种能够处理全身自指视角(包括手臂、腿部及多样化人口统计特征)的实时语义分割模型。
- 通过使用来自自指摄像头的实时视频自体化身,替代合成化身,从而提升虚拟环境中的用户沉浸感与身体存在感。
- 克服以往基于颜色和深度的方法在非受控光照和着装条件下存在的局限性。
- 在保持高分割精度的同时,实现实时性能(每张720×720图像16ms)。
提出的方法
- 通过将拍摄于色键背景前的真实自指身体部位(手臂、腿部)与真实感背景进行合成,构建了半合成数据集,避免了手动像素级标注。
- 采用改进的ThunderNet架构,其编码器基于ResNet-18,解码器包含感受野采样因子为6、12、18、24的金字塔池化模块(PPM),并使用转置卷积块进行解码。
- 在编码器与解码器之间添加了三条长跳跃连接,以优化边界预测并提升分割精度。
- 采用加权交叉熵损失函数进行端到端训练(背景:0.56,人体:3.27),以缓解类别不平衡问题。
- 应用了包括色度增强和裁剪增强在内的数据增强技术,以提升对光照和空间变化的鲁棒性。
- 使用Adam优化器,批量大小为8,训练25个周期,初始权重为预训练的ImageNet权重,并将学习率设为1e-5进行微调。
实验结果
研究问题
- RQ1半合成自指人体分割数据集能否有效用于训练实时深度学习模型?
- RQ2轻量级语义分割网络是否能在720×720分辨率图像上实现≤16ms的实时推理,同时保持高精度?
- RQ3与先前方法相比,所提出的架构在不同肤色和服装类型下的分割质量与鲁棒性如何?
- RQ4损失加权与数据增强对减少背景区域误检的影响是什么?
- RQ5能否实现足够保真度的全身自指分割,以增强混合现实中的沉浸感与身体存在感?
主要发现
- 在配备双GTX-1080 Ti GPU的标准PC上,该方法在720×720图像上实现16ms的推理时间,满足实时性要求。
- 该模型在多个基准数据集上保持了具有竞争力的交并比(IoU)得分,包括在GTEA数据集上达到0.54的IoU,以及在TEgO wild数据集上达到0.53的IoU。
- 定性结果表明,与先前方法相比,边界精度更高,误检更少,尤其在复杂光照和遮挡场景中表现更优。
- 使用加权交叉熵损失显著增强了对人身体部位的关注,尽管背景变化大,仍有效减少了背景过拟合。
- 色度增强与裁剪增强显著提升了模型对光照变化和自指视角中空间位置变化的鲁棒性。
- 尽管有所改进,背景区域仍存在部分误检,表明可通过高级损失函数或两阶段训练进一步优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。