[论文解读] Cross-modal Deep Face Normals with Deactivable Skip Connections
本论文提出了一种跨模态深度学习框架,通过可禁用的跳跃连接和共享潜在空间,从野外采集的RGB图像中估计高质量的面部表面法线。通过联合使用成对与非成对的图像-法线数据进行训练,该方法在Florence数据集上将角度误差降低了近10%,并生成了更清晰、更逼真的三维人脸重建结果。
We present an approach for estimating surface normals from in-the-wild color images of faces. While data-driven strategies have been proposed for single face images, limited available ground truth data makes this problem difficult. To alleviate this issue, we propose a method that can leverage all available image and normal data, whether paired or not, thanks to a novel cross-modal learning architecture. In particular, we enable additional training with single modality data, either color or normal, by using two encoder-decoder networks with a shared latent space. The proposed architecture also enables face details to be transferred between the image and normal domains, given paired data, through skip connections between the image encoder and normal decoder. Core to our approach is a novel module that we call deactivable skip connections, which allows integrating both the auto-encoded and image-to-normal branches within the same architecture that can be trained end-to-end. This allows learning of a rich latent space that can accurately capture the normal information. We compare against state-of-the-art methods and show that our approach can achieve significant improvements, both quantitative and qualitative, with natural face images.
研究动机与目标
- 为解决从单张野外RGB图像中准确估计面部表面法线的挑战,该挑战受限于成对训练数据的稀缺性。
- 通过利用成对与非成对的图像与法线数据,提升三维人脸重建的泛化能力与细节恢复能力。
- 设计一种统一架构,实现在图像与法线模态之间有效特征迁移,同时通过跨模态约束保持鲁棒性。
- 通过引入一种新型可禁用机制,克服标准跳跃连接在多分支网络中的局限性,该机制可根据训练模态动态控制连接性。
提出的方法
- 该方法采用双分支编码器-解码器架构并共享潜在空间,其中一条分支处理图像(图像编码器 $E_I$ 和法线解码器 $D_N$),另一条分支处理法线(法线编码器 $E_N$ 和图像解码器 $D_I$),从而实现在成对与非成对数据上的联合训练。
- 在图像编码器 $E_I$ 与法线解码器 $D_N$ 之间引入可禁用跳跃连接,可在训练过程中根据输入模态动态开启或关闭,防止在图像到法线转换过程中法线编码器引入干扰。
- 模型采用端到端训练,结合自编码重建损失(图像到图像与法线到法线)和循环一致性损失,以对齐共享潜在空间。
- 该架构通过激活的跳跃连接,实现从图像域到法线域的精细面部细节迁移,而自编码分支则通过法线到法线与图像到图像的重建提供强几何先验。
- 可禁用跳跃机制确保在仅使用图像数据训练时,跳跃连接处于非激活状态,避免来自法线编码器的虚假梯度;而在成对数据训练期间,跳跃连接处于激活状态,以保持细节保真度。
- 该框架通过组合法线上的L1损失、图像上的感知损失以及循环一致性损失的多任务损失进行优化,实现鲁棒且泛化能力强的特征学习。
实验结果
研究问题
- RQ1统一的深度学习架构能否有效利用成对与非成对的图像-法线数据,从而在非受限环境中提升面部法线估计性能?
- RQ2在多模态自编码设置中,如何设计跳跃连接,以实现从图像到法线的细节迁移,同时避免无关分支的干扰?
- RQ3与标准编码器-解码器模型相比,引入具有双自编码分支的共享潜在空间在多大程度上提升了法线预测的鲁棒性与准确性?
- RQ4所提出的可禁用跳跃连接机制是否在角度误差与视觉质量方面相比固定或标准跳跃连接带来可测量的性能提升?
主要发现
- 所提方法在Florence数据集上实现了11.3° ± 1.5的平均角度误差,相比先前最先进方法相对降低了近10%。
- 在Photoface数据集上,模型实现了22.8° ± 6.5的平均角度误差,且74.1%的法线与真实值的夹角在30°以内,优于消融实验变体。
- 消融研究证实,若移除法线编码器 $E_N$ 或图像解码器 $D_I$,性能将显著下降,尤其在野外图像上,凸显了跨模态自编码的重要性。
- 定性结果表明,完整模型在保留细粒度面部细节(如眼睑轮廓与明暗模式)方面优于其他方法,尤其在复杂光照与纹理条件下表现更优。
- 可禁用跳跃连接至关重要:缺乏它们的模型会损失细节保真度,而缺乏跨模态分支的模型则因域偏移问题,在真实世界图像上泛化能力差。
- 失败案例揭示了在极端光照、遮挡、低质量图像及异常纹理处理上的局限性——这些是真实世界数据中的常见异常值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。