Skip to main content
QUICK REVIEW

[论文解读] CTformer: Convolution-free Token2Token Dilated Vision Transformer for Low-dose CT Denoising

Dayang Wang, Fenglei Fan|arXiv (Cornell University)|Feb 28, 2022
Medical Imaging Techniques and Applications被引用 5
一句话总结

本文提出CTformer,一种无需卷积、基于扩张注意力机制的视觉变换器,用于低剂量CT去噪。该方法通过自适应的token重排与扩张特征图,替代卷积操作,以增强长距离上下文捕捉能力。在计算量更低的同时,实现了SOTA性能,并通过注意力可视化与动态流追踪提升了可解释性。此外,通过重叠推理机制,有效减少了边界伪影。

ABSTRACT

Low-dose computed tomography (LDCT) denoising is an important problem in CT research. Compared to the normal dose CT (NDCT), LDCT images are subjected to severe noise and artifacts. Recently in many studies, vision transformers have shown superior feature representation ability over convolutional neural networks (CNNs). However, unlike CNNs, the potential of vision transformers in LDCT denoising was little explored so far. To fill this gap, we propose a Convolution-free Token2Token Dilated Vision Transformer for low-dose CT denoising. The CTformer uses a more powerful token rearrangement to encompass local contextual information and thus avoids convolution. It also dilates and shifts feature maps to capture longer-range interaction. We interpret the CTformer by statically inspecting patterns of its internal attention maps and dynamically tracing the hierarchical attention flow with an explanatory graph. Furthermore, an overlapped inference mechanism is introduced to effectively eliminate the boundary artifacts that are common for encoder-decoder-based denoising models. Experimental results on Mayo LDCT dataset suggest that the CTformer outperforms the state-of-the-art denoising methods with a low computation overhead.

研究动机与目标

  • 为解决低剂量CT(LDCT)图像中严重的噪声与伪影问题,这些因素限制了其临床应用价值。
  • 探索纯视觉变换器在LDCT去噪中的潜力,克服CNN在捕捉长距离依赖关系方面的局限。
  • 开发一种不仅高效且可解释的模型,以增强临床信任,通过注意力可视化与动态流追踪实现。
  • 通过重叠推理机制,消除编码器-解码器架构中常见的边界伪影。
  • 证明纯Transformer方法在LDCT去噪中可超越混合CNN-Transformer模型,且计算成本更低。

提出的方法

  • CTformer用Token2Token Dilated(T2TD)模块替代卷积操作,通过在空间区域间重排token,实现无需卷积的局部与全局特征融合。
  • 采用扩张与偏移的特征图,扩大感受野,捕捉长距离依赖关系,提升上下文表征能力。
  • 模型采用分层自注意力机制并引入循环移位操作,实现在不同层级上的动态多尺度特征学习。
  • 提出重叠推理策略,在测试阶段通过重叠感受野缓解边界伪影。
  • 通过静态注意力图分析与基于TopK及局部最大值(LM)图的动态注意力流追踪,实现可解释性。
  • 模型在Mayo LDCT数据集上端到端训练,使用重建损失将噪声LDCT图像映射至对应的正常剂量CT(NDCT)图像。

实验结果

研究问题

  • RQ1纯视觉变换器架构是否能在不使用卷积操作的前提下,超越基于CNN与混合模型的LDCT去噪性能?
  • RQ2所提出的T2TD模块结合扩张与偏移特征图,相较于标准ViT或Swin Transformer设计,在特征表征方面有何改进?
  • RQ3CTformer中的自注意力图在多大程度上可被解释,以揭示模型内部决策过程,从而增强临床信任?
  • RQ4所提出的重叠推理机制是否能有效减少自编码器风格去噪模型中常见的边界伪影?
  • RQ5从性能与训练效率角度出发,CTformer的最优深度(即Transformer块数量)是多少?

主要发现

  • 在Mayo LDCT数据集上,CTformer的SSIM达到0.9121,RMSE为9.0233,相比SOTA方法Solve-ViT,SSIM提升0.0235,RMSE降低3.3362。
  • 仅使用一个Transformer块的模型达到最佳性能,表明更深的网络无法提升去噪效果,且显著增加训练时间。
  • T2TD模块提升了特征整合能力,有效减少了Sole-ViT基线模型中常见的斑驳伪影,后者采用固定区域的token化方式与单一卷积操作。
  • 与无循环移位的CTformer相比,循环移位操作使SSIM提升0.0026,RMSE降低0.1337。
  • 注意力可视化显示一致的动态流:各层中的局部最大值激活集中在相同空间位置,表明结构组件在去噪过程中保持一致的协同激活。
  • 所提出的解释框架——结合TopK与LM图——成功追踪了分层注意力流,实现了对模型潜在行为的可视化与动态理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。