[论文解读] DMDC: Dynamic-mask-based dual camera design for snapshot Hyperspectral Imaging
本文提出DMDC,一种基于动态掩码的双相机系统,结合RGB相机与CASSI相机,以提升快照式高光谱成像性能。通过利用RGB图像提供的空间先验信息,动态优化SLM掩码,并采用交叉注意力机制融合多模态数据,该方法在显著降低参数量与浮点运算量的前提下,相较SOTA方法实现超过9 dB的PSNR提升。
Deep learning methods are developing rapidly in coded aperture snapshot spectral imaging (CASSI). The number of parameters and FLOPs of existing state-of-the-art methods (SOTA) continues to increase, but the reconstruction accuracy improves slowly. Current methods still face two problems: 1) The performance of the spatial light modulator (SLM) is not fully developed due to the limitation of fixed Mask coding. 2) The single input limits the network performance. In this paper we present a dynamic-mask-based dual camera system, which consists of an RGB camera and a CASSI system running in parallel. First, the system learns the spatial feature distribution of the scene based on the RGB images, then instructs the SLM to encode each scene, and finally sends both RGB and CASSI images to the network for reconstruction. We further designed the DMDC-net, which consists of two separate networks, a small-scale CNN-based dynamic mask network for dynamic adjustment of the mask and a multimodal reconstruction network for reconstruction using RGB and CASSI measurements. Extensive experiments on multiple datasets show that our method achieves more than 9 dB improvement in PSNR over the SOTA. (https://github.com/caizeyu1992/DMDC)
研究动机与目标
- 解决CASSI系统中空间光调制器(SLMs)因固定掩码编码而导致的动态调制能力受限问题。
- 通过利用互补的RGB与CASSI测量数据,突破单输入网络在高光谱重建中的性能瓶颈。
- 通过整合来自RGB图像的空间先验信息,指导动态SLM编码,从而提升重建保真度与效率。
- 设计一种基于多模态、可逆先验的网络架构,有效融合光谱与空间特征,且无需事先知晓相机响应特性。
- 在参数量与浮点运算量方面均低于现有基于Transformer的方法,实现SOTA性能。
提出的方法
- 设计双相机系统,采用并行的RGB与CASSI光路,实现快照式互补测量。
- 实现一种动态掩码网络,利用RGB图像特征实时引导SLM调制,优化场景内容相关的编码策略。
- 提出DMDC-Net,一种双流架构,包含一个基于小型CNN的动态掩码网络与一个多模态重建网络。
- 在光谱与空间特征之间引入交叉注意力机制,以挖掘两个域中的局部相似性与全局相关性。
- 在重建分支中嵌入噪声估计器与空间注意力模块,以增强鲁棒性与特征学习能力。
- 采用可逆先验框架,将复杂映射转化为残差学习,支持迭代优化与性能提升。
实验结果
研究问题
- RQ1在RGB先验引导下,动态掩码自适应是否能显著提升CASSI重建质量,相较固定或随机掩码?
- RQ2RGB与CASSI测量的多模态融合在多大程度上提升了快照式高光谱成像中的空间与光谱保真度?
- RQ3交叉注意力机制与可逆先验设计的结合,如何在降低模型复杂度的同时提升重建性能?
- RQ4所提系统是否能在显著降低FLOPs与参数量的前提下,实现SOTA性能,相较现有基于Transformer的CASSI方法?
- RQ5在多样化场景下,动态掩码策略相较人工或随机掩码编码,在重建精度与鲁棒性方面表现如何?
主要发现
- DMDC-9stg在ARAD_1K数据集上达到49.14 dB PSNR、99.49% SSIM、0.0357 MRAE与0.0038 RMSE,显著优于SOTA方法。
- 在ARAD_1K上,相较λ-net提升15.85 dB PSNR、14.32 dB相较TSA-net、10.65 dB相较MST++,且SSIM高出7.86%。
- DMDC-1stg相较CST-L提升4.62 dB PSNR,相较MST++提升5.13 dB,同时仅使用35.0%的参数量与83.8%的FLOPs。
- 仅动态掩码组件本身带来的性能增益,与RGB分支相当,相较固定掩码使MRAE降低0.0245。
- 噪声估计器使PSNR提升0.80 dB,交叉注意力机制在DMDC-1stg上提升1.00 dB,在DMDC-3stg上提升0.74 dB。
- DMDC-5stg在帧率超过12 FPS时实现超过49 dB的PSNR,证明了高速重建下卓越的精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。