[论文解读] TANet: A new Paradigm for Global Face Super-resolution via Transformer-CNN Aggregation Network
本文提出TANet,一种新颖的Transformer-CNN聚合网络,用于全局人脸超分辨率,通过联合利用自注意力机制进行长距离全局人脸结构建模以及CNN进行细粒度局部细节恢复。通过融合两条并行路径的特征,TANet在人脸重建质量与下游人脸识别准确率方面均达到最先进性能,在SCFace数据集上8×超分辨率下的匹配准确率达到16.92%。
Recently, face super-resolution (FSR) methods either feed whole face image into convolutional neural networks (CNNs) or utilize extra facial priors (e.g., facial parsing maps, facial landmarks) to focus on facial structure, thereby maintaining the consistency of the facial structure while restoring facial details. However, the limited receptive fields of CNNs and inaccurate facial priors will reduce the naturalness and fidelity of the reconstructed face. In this paper, we propose a novel paradigm based on the self-attention mechanism (i.e., the core of Transformer) to fully explore the representation capacity of the facial structure feature. Specifically, we design a Transformer-CNN aggregation network (TANet) consisting of two paths, in which one path uses CNNs responsible for restoring fine-grained facial details while the other utilizes a resource-friendly Transformer to capture global information by exploiting the long-distance visual relation modeling. By aggregating the features from the above two paths, the consistency of global facial structure and fidelity of local facial detail restoration are strengthened simultaneously. Experimental results of face reconstruction and recognition verify that the proposed method can significantly outperform the state-of-the-art methods.
研究动机与目标
- 为解决现有面部超分辨率方法忽略全局结构或依赖不准确人脸先验的问题。
- 开发一种全局人脸超分辨率范式,有效利用自注意力机制捕捉长距离依赖关系。
- 同时保持全局人脸结构的一致性并恢复高保真度的局部面部细节。
- 提升真实监控场景中人脸超分辨率的性能,特别是针对下游人脸识别任务。
提出的方法
- TANet采用双路径架构:一条路径使用基于纯CNN的自校准多路径融合网络(SMFN)来恢复局部面部细节。
- 另一条路径使用资源友好、轻量级的Transformer,通过自注意力机制建模长距离视觉依赖关系,捕捉全局人脸结构。
- 通过可学习的融合模块聚合两条路径的特征图,以结合全局上下文与局部纹理表征。
- 将Transformer的嵌入维度与CNN特征维度对齐,以在保持性能的同时最小化计算成本。
- 采用感知损失和对抗性损失进行端到端训练,以增强真实感与结构保真度。
- 在SCFace数据集上以8×超分辨率进行评估,并开展消融实验与最先进方法的对比。
实验结果
研究问题
- RQ1基于自注意力机制的全局建模方法是否能在捕捉人脸超分辨率中的长距离面部结构依赖关系方面优于传统CNN?
- RQ2轻量级Transformer路径是否能有效建模全局面部上下文,同时显著降低计算成本?
- RQ3融合全局Transformer特征与局部CNN特征是否能提升人脸重建质量与下游识别性能?
- RQ4在低质量、低分辨率输入条件下,所提出的TANet与先前方法相比在人脸识别准确率方面表现如何?
主要发现
- 在SCFace数据集上,TANet在8×超分辨率下实现了16.92%的匹配准确率,优于所有基线方法。
- TANet的平均相似度得分为0.292729,是所有对比方法中最高,表明其识别特征质量得到提升。
- 图5的视觉结果表明,与其它方法相比,TANet生成了更具真实感和细节的面部纹理。
- 消融实验证实,采用独立的全局与局部特征学习的双路径设计,显著优于单路径或基于先验的方法。
- 该方法在低质量场景下表现出鲁棒性,在基于Transformer的方法中实现了最高的人脸识别性能。
- 尽管性能有所提升,但16.92%的匹配准确率在实际部署中仍不理想,表明仍有进一步改进的空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。