[论文解读] Face Hallucination via Split-Attention in Split-Attention Network
本文提出了一种用于人脸幻觉的分心网络(SISN),通过使用外部-内部分心注意力组(ESAG)分别处理面部结构和纹理特征,再进行融合,从而同时提升面部结构的一致性和纹理细节的保真度。该方法在人脸幻觉任务中达到最先进性能,并显著提高了下游人脸识别的准确率。
Recently, convolutional neural networks (CNNs) have been widely employed to promote the face hallucination due to the ability to predict high-frequency details from a large number of samples. However, most of them fail to take into account the overall facial profile and fine texture details simultaneously, resulting in reduced naturalness and fidelity of the reconstructed face, and further impairing the performance of downstream tasks (e.g., face detection, facial recognition). To tackle this issue, we propose a novel external-internal split attention group (ESAG), which encompasses two paths responsible for facial structure information and facial texture details, respectively. By fusing the features from these two paths, the consistency of facial structure and the fidelity of facial details are strengthened at the same time. Then, we propose a split-attention in split-attention network (SISN) to reconstruct photorealistic high-resolution facial images by cascading several ESAGs. Experimental results on face hallucination and face recognition unveil that the proposed method not only significantly improves the clarity of hallucinated faces, but also encourages the subsequent face recognition performance substantially. Codes have been released at https://github.com/mdswyz/SISN-Face-Hallucination.
研究动机与目标
- 解决现有基于CNN的人脸幻觉方法无法同时保持面部结构一致性和纹理细节保真度的局限性。
- 克服依赖额外先验信息(如关键点、语义分割图)的形状导向方法的缺点,这些方法会增加模型复杂度并可能引入错误。
- 开发一种端到端、参数高效的架构,以同时提升内部特征相关性与外部多路径特征融合,实现高质量的人脸超分辨率。
- 通过从低分辨率输入生成逼真、高分辨率的面部图像,提升下游人脸识别性能。
提出的方法
- 提出一种内部特征分心注意力(ISA)机制,通过分割并分类特征图的通道维,以增强内部相关性并聚焦于信息丰富的区域。
- 设计一种内部特征分心注意力模块(ISAB),利用ISA突出深层语义特征学习中的人脸纹理细节恢复。
- 引入一种外部-内部分心注意力组(ESAG),融合两条并行路径:一条通过级联ISAB处理纹理细节,另一条通过ISA建模面部结构。
- 将多路径特征融合作为外部特征注意力,以增强结构与纹理表征之间的相关性。
- 通过堆叠多个ESAG构建分心注意力分心网络(SISN),逐步优化高分辨率人脸图像。
- 使用感知损失和对抗性损失端到端训练SISN模型,以生成具有更高结构和纹理保真度的逼真输出。

实验结果
研究问题
- RQ1统一的深度学习框架能否有效平衡人脸幻觉中面部结构一致性和高频纹理细节恢复?
- RQ2所提出的分心注意力机制是否在保持全局人脸布局和细粒度纹理方面优于传统的注意力机制或残差网络?
- RQ3在不使用外部先验信息(如关键点、语义分割图)的情况下,是否仍能以不增加模型复杂度的方式生成高质量的人脸幻觉结果?
- RQ4与现有方法相比,该方法在提升下游人脸识别性能方面有多大程度的改进?
主要发现
- 在SCface数据集上,所提出的SISN方法在所有对比方法中实现了最高的平均人脸相似度(0.540106),在人脸识别任务中显著优于基线模型和最先进模型。
- SISN通过将归一化相似度分数从基线低分辨率(LR)的0.490079提升至SISN重建结果的0.540106,显著增强了特征一致性,从而提升了人脸识别性能。
- 在LFW数据集上,SISN的PSNR达到0.475734,SSIM达到0.599383,优于RCAN、SRFBN和MTC,证明了其在图像重建质量上的优越性。
- SISN成功重建出清晰度和自然度更高的逼真人脸高分辨率图像,该结果通过定量指标和定性视觉对比均得到验证。
- 即使在低分辨率和画质差的监控图像上,该模型仍保持高性能,证实了其在真实应用场景中的鲁棒性。
- 消融实验表明,分心注意力机制有效增强了内部特征相关性与路径间特征融合,从而提升了重建保真度。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。