[论文解读] SharinGAN: Combining Synthetic and Real Data for Unsupervised Geometry Estimation
SharinGAN 提出了一种新颖的域自适应框架,通过将合成图像和真实图像映射到共享的、与任务相关的表征空间中,以提升无监督几何估计性能。通过训练生成器在保留与任务相关的域特定特征的同时最小化这些特征中的域差距,该方法在无需真实数据标注的情况下,实现了单目深度估计和人脸法线估计的最先进性能。
We propose a novel method for combining synthetic and real images when training networks to determine geometric information from a single image. We suggest a method for mapping both image types into a single, shared domain. This is connected to a primary network for end-to-end training. Ideally, this results in images from two domains that present shared information to the primary network. Our experiments demonstrate significant improvements over the state-of-the-art in two important domains, surface normal estimation of human faces and monocular depth estimation for outdoor scenes, both in an unsupervised setting.
研究动机与目标
- 解决阻碍无监督几何估计中迁移学习的合成图像与真实图像之间的域差距问题。
- 在无需昂贵真实数据标注的情况下,提升深度神经网络在真实世界几何估计任务中的性能。
- 开发一种方法,将两个域映射到共享表征空间,仅对与任务相关的关键特征进行对齐,同时保留无关的域特定细节。
- 通过减少任务相关特征的分布差异,实现使用合成与真实数据联合训练主回归器。
提出的方法
- 训练一个共享生成器网络 SharinGAN,将真实图像和合成图像映射到一个共同的潜在空间,使与任务相关的特征对齐。
- 使用重建损失将生成器预训练为自编码器,以保留身份映射并维持与任务无关的域特定细节。
- 在对抗性框架中与主任务网络联合训练生成器,利用判别器强制实现与任务相关的特征的域不变表征。
- 训练目标结合重建损失、对抗损失和任务特定回归损失,实现生成器与主网络的端到端优化。
- 该方法明确避免移除与任务无关的域特定特征(如发色、纹理),使主网络能够学会忽略这些特征。
- 该方法确保仅与主任务相关的域特定特征(如深度线索、表面法线)被映射到共享表征空间,从而最小化不必要的转换。
实验结果
研究问题
- RQ1通过域自适应结合合成与真实图像,能否在无监督几何估计上超越当前最先进方法?
- RQ2仅将与任务相关的域特定特征映射到共享空间,是否比完整的域到域翻译带来更好的泛化性能?
- RQ3重建损失在确保模型泛化到未见真实域方面有多重要?
- RQ4一个被训练为保留无关域特定特征的生成器,是否仍能实现主任务的有效域对齐?
- RQ5所提出方法在单目深度估计与人脸法线估计任务上的性能提升程度如何?
主要发现
- 在 KITTI eigen 测试集上,SharinGAN 相较于之前最先进方法,将单目深度估计的绝对误差降低了 23.77%。
- 在 Make3D 数据集上,该方法相比最强基线,实现了 6.45% 的绝对误差相对降低。
- 在 Photoface 数据集上的人脸法线估计任务中,SharinGAN 将预测结果在 20° 以内与真实值匹配的准确率提升了 4.3 个百分点(从 43.6% 提升至 47.88%)。
- 消融实验表明,SharinGAN 模块和重建损失对最优性能均至关重要,尤其在未见域上表现显著。
- 定性结果表明,即使未在测试集上进行微调,SharinGAN 在泛化到未见数据方面也优于 SfSNet。
- 该方法在保留与任务无关的域特定视觉细节的同时实现了显著的性能提升,展现出强大的鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。