[论文解读] Face Completion with Semantic Knowledge and Collaborative Adversarial Learning
本文提出一种协作生成对抗网络(collaGAN)用于人脸补全,通过联合训练图像修复、关键点检测和语义分割,提升结构真实感与语义一致性。通过采用专用损失方案强化图像修复任务,并在各任务间共享特征,该模型在图像修复质量与辅助任务准确率方面均达到当前最先进水平,优于单任务及非协作GAN基线模型。
Unlike a conventional background inpainting approach that infers a missing area from image patches similar to the background, face completion requires semantic knowledge about the target object for realistic outputs. Current image inpainting approaches utilize generative adversarial networks (GANs) to achieve such semantic understanding. However, in adversarial learning, the semantic knowledge is learned implicitly and hence good semantic understanding is not always guaranteed. In this work, we propose a collaborative adversarial learning approach to face completion to explicitly induce the training process. Our method is formulated under a novel generative framework called collaborative GAN (collaGAN), which allows better semantic understanding of a target object through collaborative learning of multiple tasks including face completion, landmark detection, and semantic segmentation. Together with the collaGAN, we also introduce an inpainting concentrated scheme such that the model emphasizes more on inpainting instead of autoencoding. Extensive experiments show that the proposed designs are indeed effective and collaborative adversarial learning provides better feature representations of the faces. In comparison with other generative image inpainting models and single task learning methods, our solution produces superior performances on all tasks.
研究动机与目标
- 解决传统基于GAN的人脸修复方法缺乏对人脸结构显式语义理解的局限性。
- 通过显式整合关键点检测与语义分割等关联任务的语义知识,提升人脸补全的结构真实感。
- 构建统一的生成框架,实现多个与人脸相关任务之间的知识共享,以获得更优的特征表示。
- 证明聚焦于图像修复而非自编码的优化策略可带来更优的重建质量。
提出的方法
- 提出一种新型协作GAN(collaGAN)框架,单一生成器通过共享的编码器-解码器特征,同时完成人脸修复、关键点检测与语义分割任务。
- 在编码器与解码器之间引入跳跃连接,以保留空间细节并提升重建保真度。
- 采用条件GAN结构,为每项任务配置专用判别器,以增强生成结果的质量与一致性。
- 设计面向图像修复的损失方案,优先关注遮挡区域的重建而非上下文自编码,从而强化对缺失区域的关注。
- 在各项任务间共享大部分网络参数,以促进知识迁移与协作学习。
- 采用多任务监督,分别使用SSIM/PSNR损失(图像修复)、Dice系数损失(语义分割)与定位误差损失(关键点检测)。
实验结果
研究问题
- RQ1与单任务GAN相比,多个与人脸相关任务的协作训练是否能提升人脸修复的逼真度与结构一致性?
- RQ2通过联合学习语义分割与关键点检测显式引入语义知识,是否能带来生成器中更优的特征表示?
- RQ3与标准自编码目标相比,面向图像修复的损失方案在重建质量方面表现如何?
- RQ4任务间的知识共享在多大程度上提升了所有任务的性能,包括主要的图像修复任务?
- RQ5在多种遮挡配置下,所提出的协作GAN框架是否能超越当前最先进生成模型的人脸补全性能?
主要发现
- 所提方法M*i,s,d*在左眼遮挡区域取得最高的SSIM(92.4%)与PSNR(27.76 dB),相比SOTA方法GFC提升1.8%(SSIM)与0.6 dB(PSNR)。
- 在下颌区域遮挡(O6)下,模型达到91.7% SSIM与27.81 dB PSNR,显著优于GFC(90.0%/27.13 dB)与SII(87.8%/24.84 dB)。
- 协作模型M*i,s,d*将关键点检测平均误差由单任务模型M_d的2.38像素降低至1.72像素,改善27.7%。
- 语义分割Dice分数由M_s的76.1%提升至M*i,s,d*的77.2%,关键区域如下唇(82.8%)与鼻子(91.0%)表现最佳。
- 面向图像修复的损失方案相比标准自编码目标,能生成更优的修复结果,表现为所有遮挡类型下SSIM与PSNR均更高。
- 模型在各项任务间产生视觉一致的结果:分割掩码与修复后的人脸高度对齐,表明知识共享有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。