[论文解读] Eformer: Edge Enhancement based Transformer for Medical Image Denoising
Eformer 提出了一种基于 Transformer 的新型架构,用于医学图像去噪,该架构在 U-Net 类编码器-解码器框架中集成可学习的 Sobel-Feldman 边缘增强模块,并采用非重叠窗口自注意力机制。该方法在 AAPM-Mayo Clinic 低剂量 CT 数据集上实现了最先进性能,PSNR 达到 43.487,RMSE 为 0.0067,SSIM 为 0.9861,采用残差学习策略。
In this work, we present Eformer - Edge enhancement based transformer, a novel architecture that builds an encoder-decoder network using transformer blocks for medical image denoising. Non-overlapping window-based self-attention is used in the transformer block that reduces computational requirements. This work further incorporates learnable Sobel-Feldman operators to enhance edges in the image and propose an effective way to concatenate them in the intermediate layers of our architecture. The experimental analysis is conducted by comparing deterministic learning and residual learning for the task of medical image denoising. To defend the effectiveness of our approach, our model is evaluated on the AAPM-Mayo Clinic Low-Dose CT Grand Challenge Dataset and achieves state-of-the-art performance, $i.e.$, 43.487 PSNR, 0.0067 RMSE, and 0.9861 SSIM. We believe that our work will encourage more research in transformer-based architectures for medical image denoising using residual learning.
研究动机与目标
- 解决低剂量 CT 扫描中噪声退化问题,同时保留关键解剖边缘和结构。
- 探索视觉 Transformer 在医学图像去噪中的有效性,该领域此前其应用较为有限。
- 通过将可学习边缘增强模块集成到 Transformer 架构中,提升去噪性能。
- 在医学图像去噪背景下,比较残差学习与直接回归的性能,并评估其对重建质量的影响。
- 通过结合多尺度感知损失的混合 Transformer-CNN 架构,建立低剂量 CT 去噪的新最先进基准。
提出的方法
- Eformer 采用基于 LeWin Transformer 块的 U-Net 风格编码器-解码器架构,利用基于非重叠窗口的自注意力机制以降低计算成本。
- 通过将可学习的 Sobel-Feldman 滤波器应用于输入图像实现边缘增强,其输出与编码器和解码器路径中的中间特征进行拼接。
- 模型结合多尺度感知损失与均方误差(MSE)损失,以在重建图像中保持结构和像素级保真度。
- 在编码器和解码器阶段之间使用跳跃连接,且所有层共享同一边缘增强特征图 $ S(I) $,以维持边缘一致性。
- 最终输出通过可学习的卷积投影层生成,将最终特征图转换为单通道去噪图像。
- 网络采用混合损失进行训练:$ L_{final} = \lambda_{mse}L_{mse} + \lambda_{msp}L_{msp} $,其中 $ L_{msp} $ 为从预训练主干网络提取的多尺度感知损失。
实验结果
研究问题
- RQ1与现有基于 CNN 的模型相比,基于 Transformer 的架构结合边缘增强是否能提升低剂量 CT 图像的去噪性能?
- RQ2在基于 Transformer 的框架中,残差学习是否在医学图像去噪任务中优于直接回归?
- RQ3在 Transformer 编码器-解码器中集成可学习 Sobel 滤波器在保留细节和边缘方面有多有效?
- RQ4多尺度感知损失在多大程度上提升了重建低剂量 CT 图像的结构相似性和视觉质量?
- RQ5在 Transformer 中采用非重叠窗口自注意力机制是否能在避免过高计算成本的前提下实现高效率和高性能?
主要发现
- 采用残差学习的 Eformer 在 AAPM-Mayo Clinic 低剂量 CT Grand Challenge 数据集上达到 PSNR 43.487,RMSE 0.0067,SSIM 0.9861,优于所有先前的最先进方法。
- 与确定性(直接回归)版本相比,Eformer 的残差学习变体在 PSNR 和 RMSE 方面均有显著提升,后者 PSNR 为 42.2371,RMSE 为 0.0077。
- 可学习 Sobel-Feldman 滤波器的集成增强了边缘保持能力,从而提升了重建图像的结构相似性和感知质量。
- 结合多尺度感知损失与 MSE 损失可实现更好的结构保真度,表现为高 SSIM 值和更清晰的视觉图像。
- 非重叠窗口自注意力机制有效降低了计算复杂度,同时保持了具有竞争力的性能,使该模型适用于临床部署。
- Eformer 表明,Transformer 可被有效适配于医学图像去噪任务,树立了新基准,并为该方向的进一步研究提供了激励。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。