Skip to main content
QUICK REVIEW

[论文解读] GANBERT: Generative Adversarial Networks with Bidirectional Encoder Representations from Transformers for MRI to PET synthesis

Hoo-Chang Shin, Alvin Ihsani|arXiv (Cornell University)|Aug 10, 2020
Generative Adversarial Networks and Image Synthesis参考文献 17被引用 11
一句话总结

GANBERT 提出了一种新颖的 GAN 框架,利用 BERT 的掩码语言建模和下一句预测作为判别器,从 T1 加权 MRI 扫描中合成高保真、强度准确的 PET 图像。通过将 MRI 强度映射到宽范围的浮点数区间,并训练 BERT 以预测掩码的 PET 值,该方法在无需手动预/后处理的情况下实现了最先进性能,在 AV45-PET 合成任务中 PSNR 达到 57.58,SSIM 为 0.31。

ABSTRACT

Synthesizing medical images, such as PET, is a challenging task due to the fact that the intensity range is much wider and denser than those in photographs and digital renderings and are often heavily biased toward zero. Above all, intensity values in PET have absolute significance, and are used to compute parameters that are reproducible across the population. Yet, usually much manual adjustment has to be made in pre-/post- processing when synthesizing PET images, because its intensity ranges can vary a lot, e.g., between -100 to 1000 in floating point values. To overcome these challenges, we adopt the Bidirectional Encoder Representations from Transformers (BERT) algorithm that has had great success in natural language processing (NLP), where wide-range floating point intensity values are represented as integers ranging between 0 to 10000 that resemble a dictionary of natural language vocabularies. BERT is then trained to predict a proportion of masked values images, where its "next sentence prediction (NSP)" acts as GAN discriminator. Our proposed approach, is able to generate PET images from MRI images in wide intensity range, with no manual adjustments in pre-/post- processing. It is a method that can scale and ready to deploy.

研究动机与目标

  • 解决从 MRI 合成 PET 图像的挑战,尤其针对强度值范围极广且多变(例如 -100 到 1000)的情况,这些值难以被标准 GAN 建模。
  • 消除先前方法中在 PET 图像合成时对人工预处理或强度范围调整的需求。
  • 利用 BERT 的表征能力——原本专为自然语言处理设计——通过将 PET 图像强度视为词汇表中的离散标记,实现对罕见和偏态强度分布的建模。
  • 通过结合对抗训练、掩码预测和 L1 损失,提升跨模态 MRI 到 PET 合成中的图像保真度和结构相似性。
  • 开发一种可扩展、可部署的方法,直接从 MRI 生成标准化摄取值比(SUVR)单位的 PET 图像,适用于阿尔茨海默病诊断等临床应用。

提出的方法

  • 将 MRI 强度值(0–255)映射到浮点数范围(-100 到 1000),以匹配 PET 图像的动态范围。
  • 将 PET 图像强度表示为离散标记(0 到 10^4),以支持 BERT 的掩码语言建模(MLM)和下一句预测(NSP)目标。
  • 训练一个类似 U-Net 的生成器,从 MRI 输入生成 PET 图像,其输出作为强度标记序列输入 BERT。
  • 将 BERT 的 NSP 任务用作对抗性判别器:判别器基于上下文连贯性评估生成的 PET 序列是真实还是伪造。
  • 使用多目标损失优化生成器:对抗损失(NSP)、掩码预测损失(MLM)和 L1 重建损失,由超参数加权(λNSP=20, λMLM=1, λL1=20)。
  • 使用不同的优化器分别训练生成器和 BERT,保持 GAN 框架的同时利用 BERT 的预训练能力,以更好地表征偏态强度分布。

实验结果

研究问题

  • RQ1BERT 的预训练目标——掩码语言建模和下一句预测——能否被有效重用于 GAN 中作为医学图像合成的判别器?
  • RQ2对于具有宽范围且偏态分布的 PET 图像强度,能否在不损失保真度的前提下,将其有效建模为类似 BERT 框架中的离散标记?
  • RQ3将 BERT 的 NSP 作为判别器,结合 MLM 和 L1 损失,是否能相比标准 GAN(如 Pix2Pix)提升 MRI 到 PET 合成的质量与准确性?
  • RQ4所提出的方法能否在无需手动强度缩放或后处理调整的情况下,直接生成原始 SUVR 单位的 PET 图像?
  • RQ5引入额外的 CNN 判别器对 GANBERT 框架在 MRI 到 PET 合成中的性能与泛化能力有何影响?

主要发现

  • GANBERT 在无额外 CNN 判别器的情况下,AV45-PET 合成任务中实现了 57.58 的 PSNR 和 0.27 的 SSIM,显著优于使用 tanh 激活的标准 Pix2Pix-GAN(PSNR: 50.41, SSIM: 0.0)。
  • 增加 CNN 判别器后,PSNR 略降至 56.53,但 SSIM 提升至 0.31,表明在结构相似性方面有所改善,但 RMSE 略有上升。
  • 在 AV1451-PET 上,GANBERT 在无 CNN-D 的情况下实现了 51.05 的 PSNR 和 0.25 的 SSIM,表明其在不同 PET 示踪剂下具有鲁棒性。
  • 在 FDG-PET 上,GANBERT 在无 CNN-D 的情况下实现了 56.53 的 PSNR 和 0.11 的 SSIM,但使用 CNN-D 时 SSIM 显著下降至 0.38,提示可能存在模式崩溃或分布偏移。
  • 视觉对比显示,GANBERT 生成的 PET 图像在解剖结构和强度模式上与原始 PET 扫描高度相似,尤其在皮层区域表现突出。
  • 该方法成功在原始 SUVR 单位下合成 PET 图像,且预处理极少,完全消除了对手动强度缩放或后处理调整的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。