Skip to main content
QUICK REVIEW

[论文解读] SAGAN: Adversarial Spatial-asymmetric Attention for Noisy Nona-Bayer Reconstruction

S M A Sharif, Rizwan Ali Naqvi|arXiv (Cornell University)|Oct 16, 2021
Image Processing Techniques and Applications被引用 8
一句话总结

本文提出SAGAN,一种新颖的端到端深度学习框架,用于从噪声Nona-Bayer CFA图案重建高质量RGB图像。通过将空间非对称注意力模块与对抗性训练相结合,SAGAN有效减少了视觉伪影并提升了感知质量,在定量指标和用户偏好研究中均优于最先进方法。

ABSTRACT

Nona-Bayer colour filter array (CFA) pattern is considered one of the most viable alternatives to traditional Bayer patterns. Despite the substantial advantages, such non-Bayer CFA patterns are susceptible to produce visual artefacts while reconstructing RGB images from noisy sensor data. This study addresses the challenges of learning RGB image reconstruction from noisy Nona-Bayer CFA comprehensively. We propose a novel spatial-asymmetric attention module to jointly learn bi-direction transformation and large-kernel global attention to reduce the visual artefacts. We combine our proposed module with adversarial learning to produce plausible images from Nona-Bayer CFA. The feasibility of the proposed method has been verified and compared with the state-of-the-art image reconstruction method. The experiments reveal that the proposed method can reconstruct RGB images from noisy Nona-Bayer CFA without producing any visually disturbing artefacts. Also, it can outperform the state-of-the-art image reconstruction method in both qualitative and quantitative comparison. Code available: https://github.com/sharif-apu/SAGAN_BMVC21.

研究动机与目标

  • 解决从受噪声影响的Nona-Bayer CFA图案重建高保真RGB图像的挑战,此类图案常伴有结构失真和虚假色彩伪影。
  • 克服现有联合去马赛克与去噪(JDD)方法在噪声条件下产生视觉干扰伪影的局限性。
  • 开发一种端到端深度学习模型,通过新颖的注意力机制联合学习双向空间变换与全局上下文。
  • 通过引入对抗性训练提升感知图像质量,生成更自然的纹理与色彩。
  • 在真实世界噪声数据上验证所提方法的有效性,并通过用户研究与基准对比验证性能。

提出的方法

  • 提出一种空间非对称注意力模块,用于在Nona-Bayer CFA图案中分别学习垂直与水平像素变换的独立注意力图。
  • 在空间非对称模块中集成大感受野全局注意力,以捕捉长程依赖关系并提升特征表示能力。
  • 将空间非对称注意力模块与渐进式上下文学习(PCL)模块结合,以在不同色彩空间中保持色彩一致性。
  • 采用生成对抗网络(GAN)判别器,引导生成器生成更逼真的纹理与自然的色彩分布。
  • 使用L1损失、感知损失与对抗性损失的组合,端到端训练完整SAGAN模型,以同时优化像素级精度与感知质量。
  • 采用多尺度训练策略,噪声水平σ = 10、20与30,以提升对不同噪声条件的鲁棒性。

实验结果

研究问题

  • RQ1新颖的空间非对称注意力机制是否能有效减少从噪声Nona-Bayer CFA中重建RGB图像时的视觉伪影?
  • RQ2与仅使用监督学习的基线方法相比,将对抗性训练与空间非对称注意力结合,在多大程度上提升了感知图像质量?
  • RQ3空间非对称注意力、PCL与GAN判别器等各组件对噪声Nona-Bayer重建的整体性能分别有何贡献?
  • RQ4所提方法是否在真实世界噪声传感器数据上具有良好泛化能力,经由用户研究验证?
  • RQ5该模型是否能在多样化的图像内容与噪声水平下,同时在定量指标与定性感知方面实现卓越性能?

主要发现

  • 在σ = 30噪声条件下,SAGAN在线性RGB图像上达到33.47 dB的PSNR与0.9292的SSIM,显著优于次优方法(BaseGAN:27.45 dB PSNR)。
  • 在sRGB图像上,SAGAN的DeltaE为2.48,表明其色彩保真度优于基线模型(10.63 DeltaE)与最先进方法。
  • 在用户偏好研究中,SAGAN的平均意见得分(MOS)为0.87,远高于原始噪声输入的0.13,证实其具有显著的感知优势。
  • 消融研究显示,若移除任一组件——空间非对称注意力、PCL或GAN判别器——均会导致PSNR、SSIM与DeltaE显著下降,证实其各自贡献与协同效应。
  • 定性结果表明,SAGAN能有效抑制虚假色彩伪影与结构失真,尤其在高对比度与文字密集区域表现更优。
  • 该模型在真实世界噪声数据上泛化良好,定性结果表明其生成纹理自然,色彩还原准确,与真实图像对比优异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。