[论文解读] Imaging through the Atmosphere using Turbulence Mitigation Transformer
本文提出湍流抑制变换器(Turbulence Mitigation Transformer, TMT),一种深度学习框架,通过整合基于物理的退化建模、用于高效特征提取的新颖时序-通道联合注意力机制,以及一种快速、精确的湍流模拟器,提升了多帧大气湍流恢复性能。TMT 在真实世界湍流数据上实现了最先进性能,在泛化能力、速度和内存效率方面优于现有方法,尤其在仅使用合成数据训练时表现突出。
Restoring images distorted by atmospheric turbulence is a ubiquitous problem in long-range imaging applications. While existing deep-learning-based methods have demonstrated promising results in specific testing conditions, they suffer from three limitations: (1) lack of generalization capability from synthetic training data to real turbulence data; (2) failure to scale, hence causing memory and speed challenges when extending the idea to a large number of frames; (3) lack of a fast and accurate simulator to generate data for training neural networks. In this paper, we introduce the turbulence mitigation transformer (TMT) that explicitly addresses these issues. TMT brings three contributions: Firstly, TMT explicitly uses turbulence physics by decoupling the turbulence degradation and introducing a multi-scale loss for removing distortion, thus improving effectiveness. Secondly, TMT presents a new attention module along the temporal axis to extract extra features efficiently, thus improving memory and speed. Thirdly, TMT introduces a new simulator based on the Fourier sampler, temporal correlation, and flexible kernel size, thus improving our capability to synthesize better training data. TMT outperforms state-of-the-art video restoration models, especially in generalizing from synthetic to real turbulence data. Code, videos, and datasets are available at \href{https://xg416.github.io/TMT}{https://xg416.github.io/TMT}.
研究动机与目标
- 解决基于深度学习的图像恢复中,合成数据到真实湍流数据泛化能力不足的问题。
- 克服多帧视频恢复变换器在内存和速度方面的限制。
- 开发一种快速、精确且基于物理的模拟器,用于大规模训练数据生成。
- 设计一种神经网络架构,通过去倾斜和去模糊分解显式建模湍流物理特性。
- 实现仅使用合成训练数据对真实世界湍流退化序列进行盲恢复。
提出的方法
- TMT 将恢复任务分解为两个阶段:去倾斜以校正波前倾斜,去模糊以消除空间变化的模糊,从而提升物理合理性与泛化能力。
- 引入一种时序-通道联合注意力(Temporal-Channel Joint Attention, TCJA)模块,沿时序轴应用自注意力机制,降低内存占用并支持更长的有效帧序列处理。
- 采用多尺度损失函数,在多个分辨率上监督训练,增强特征学习能力与鲁棒性。
- 提出一种新型湍流模拟器,采用基于傅里叶的采样器实现密集场模拟,结合时间相关性与灵活的核尺寸,提升真实感与训练数据多样性。
- 该模拟器可实现快速、精确且可扩展的合成湍流数据生成,无需插值或启发式近似。
- TMT 在合成数据上以监督方式训练,并在真实世界序列上进行评估,无需微调,展现出强大的零样本泛化能力。
实验结果
研究问题
- RQ1仅在合成湍流数据上训练的深度学习模型,能否有效泛化到真实世界湍流退化?
- RQ2如何重新设计注意力机制,以在保持长视频序列性能的同时降低内存消耗?
- RQ3对湍流的物理建模——特别是去倾斜与去模糊——在提升恢复精度与泛化能力方面发挥何种作用?
- RQ4能否设计一种快速、物理精确的模拟器,以生成多样化、高质量的湍流恢复训练数据?
- RQ5与标准视频恢复变换器相比,所提出的多尺度监督与TCJA注意力机制在速度、内存与性能方面表现如何?
主要发现
- 在真实世界湍流序列上,TMT 的 PSNR 达到 28.4543,SSIM 为 0.8539,LPIPS 为 0.1640,优于最先进方法如 VRT 和 TSRWGAN。
- 该模型在无需微调的情况下即可良好泛化至真实世界数据,尽管仅在合成数据上训练,仍展现出强大的零样本能力。
- 时序-通道联合注意力(TCJA)机制显著降低内存使用,并支持比标准视频变换器更长帧序列的处理。
- 所提出的模拟器可生成高保真、密集场的湍流数据,具备更优的时间相关性与核尺寸灵活性,从而提升训练数据多样性。
- TMT 在视觉质量上超越传统方法如 CLEAR [4] 和 Mao et al. [5],生成更清晰、更自然的重建结果,且细节保留更佳。
- 当在合成数据上微调时,TSRWGAN 在真实世界数据集上表现显著提升,证实了所提出合成数据分布的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。