Skip to main content
QUICK REVIEW

[论文解读] SPI-GAN: Towards Single-Pixel Imaging through Generative Adversarial Network

Nazmul Karim, Nazanin Rahnavard|arXiv (Cornell University)|Jul 3, 2021
Random lasers and scattering media参考文献 78被引用 14
一句话总结

该论文提出SPI-GAN,一种基于生成对抗网络(GAN)的单像素成像框架,采用类似残差网络(ResNet)的生成器和多损失目标函数(均方误差 + 感知损失),在低采样率下实现高质量图像重建。在5%采样率下,PSNR达到17.92 dB,SSIM为0.487,支持高达22 fps的实时视频重建,对未见图像具有强泛化能力,并对噪声具有鲁棒性。

ABSTRACT

Single-pixel imaging is a novel imaging scheme that has gained popularity due to its huge computational gain and potential for a low-cost alternative to imaging beyond the visible spectrum. The traditional reconstruction methods struggle to produce a clear recovery when one limits the number of illumination patterns from a spatial light modulator. As a remedy, several deep-learning-based solutions have been proposed which lack good generalization ability due to the architectural setup and loss functions. In this paper, we propose a generative adversarial network-based reconstruction framework for single-pixel imaging, referred to as SPI-GAN. Our method can reconstruct images with 17.92 dB PSNR and 0.487 SSIM, even if the sampling ratio drops to 5%. This facilitates much faster reconstruction making our method suitable for single-pixel video. Furthermore, our ResNet-like architecture for the generator leads to useful representation learning that allows us to reconstruct completely unseen objects. The experimental results demonstrate that SPI-GAN achieves significant performance gain, e.g. near 3dB PSNR gain, over the current state-of-the-art method.

研究动机与目标

  • 解决传统迭代法和基于深度学习的单像素成像方法存在的计算成本高、重建速度慢以及泛化能力差的问题。
  • 克服标准均方误差(MSE)损失函数在图像重建中导致输出模糊和表征能力有限的问题。
  • 实现在极低采样率(如5%)下快速、高质量的单像素图像重建,适用于视频应用。
  • 通过采用深层残差生成器架构实现稳健的特征学习,提升对未见图像的泛化能力。
  • 开发一种基于GAN的框架,结合对抗训练与感知损失,以增强结构信息和高频细节的恢复能力。

提出的方法

  • 采用具有残差连接的类似残差网络(ResNet)的生成器网络,以提升特征表征能力,并支持更深网络的训练。
  • 引入判别器网络,用于区分真实图像与重建图像,促使生成器输出更逼真的结果。
  • 使用混合损失函数,结合均方误差(MSE)与基于预训练VGG网络特征的感知相似性损失,以提升结构保真度并减少模糊。
  • 采用极小化极大(minimax)目标函数,以对抗方式联合训练生成器与判别器,同时优化重建精度与感知质量。
  • 在推理阶段将采样率固定为5%,以评估在极端低采样条件下的性能表现。
  • 在多样化数据集上训练模型100个周期,以确保对未见数据的鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1基于GAN的框架是否能在低采样率下超越当前最先进的深度学习与迭代方法,在单像素图像重建中表现更优?
  • RQ2采用类似残差网络(ResNet)的生成器架构是否能提升单像素成像中的特征表征与重建质量?
  • RQ3结合MSE与感知损失是否能相比仅使用MSE的基线方法,生成更清晰、更真实的重建图像?
  • RQ4SPI-GAN在完全未见过的图像与数据集上具有多大程度的泛化能力?
  • RQ5SPI-GAN是否能在低采样率下实现高保真度的实时视频重建(如15–22 fps)?

主要发现

  • SPI-GAN在5%采样率下实现17.92 dB的PSNR与0.487的SSIM,显著优于现有方法。
  • 该方法支持高达22 fps的实时单像素视频重建(在5%采样率下),总成像时间仅为0.065秒。
  • SPI-GAN展现出强大的泛化能力,在CBSD68数据集上平均PSNR达18.28 dB,在BSDS300数据集上达18.49 dB,优于DLGI与Deepghost。
  • 在Urban100与SunHays-80数据集中,SPI-GAN分别实现17.15 dB与17.85 dB的PSNR,而Deepghost仅为14.21 dB与14.84 dB,表明其具备更优的鲁棒性与表征学习能力。
  • 感知损失组件显著提升了重建质量,相比仅使用MSE的基线,有效减少了模糊并增强了高频细节。
  • 训练100个周期后,SPI-GAN在验证集上达到18.95 dB的PSNR与0.545的SSIM,证实了模型的稳定收敛与高性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。