[论文解读] Unsupervised Domain Adaptation via Disentangled Representations: Application to Cross-Modality Liver Segmentation
本文提出了一种用于医学图像分割中无监督跨模态域自适应的解耦表征框架,将图像分解为域不变内容空间与模态特异性风格空间,以实现多对多映射。在仅使用CT数据进行训练的情况下,该方法在MRI肝脏分割任务中取得了0.81的Dice相似系数,优于CycleGAN(0.72),并在多期相MRI和联合域学习中表现出鲁棒性。
A deep learning model trained on some labeled data from a certain source domain generally performs poorly on data from different target domains due to domain shifts. Unsupervised domain adaptation methods address this problem by alleviating the domain shift between the labeled source data and the unlabeled target data. In this work, we achieve cross-modality domain adaptation, i.e. between CT and MRI images, via disentangled representations. Compared to learning a one-to-one mapping as the state-of-art CycleGAN, our model recovers a many-to-many mapping between domains to capture the complex cross-domain relations. It preserves semantic feature-level information by finding a shared content space instead of a direct pixelwise style transfer. Domain adaptation is achieved in two steps. First, images from each domain are embedded into two spaces, a shared domain-invariant content space and a domain-specific style space. Next, the representation in the content space is extracted to perform a task. We validated our method on a cross-modality liver segmentation task, to train a liver segmentation model on CT images that also performs well on MRI. Our method achieved Dice Similarity Coefficient (DSC) of 0.81, outperforming a CycleGAN-based method of 0.72. Moreover, our model achieved good generalization to joint-domain learning, in which unpaired data from different modalities are jointly learned to improve the segmentation performance on each individual modality. Lastly, under a multi-modal target domain with significant diversity, our approach exhibited the potential for diverse image generation and remained effective with DSC of 0.74 on multi-phasic MRI while the CycleGAN-based method performed poorly with a DSC of only 0.52.
研究动机与目标
- 解决医学图像分割中CT与MRI之间域偏移的问题,且无需成对数据。
- 克服CycleGAN中一对一映射的局限性,后者缺乏多样性且可能损害语义特征的保留。
- 通过学习对模态不变的共享内容空间并解耦风格信息,实现有效的无监督域自适应。
- 推广至联合域学习,通过在未配对的CT和MRI数据上联合训练单一模型,提升在两种模态上的性能。
- 在高度多变的多模态目标域(如多期相MRI)下保持鲁棒性,并支持多样化图像生成。
提出的方法
- 该模型将图像表征分解为共享内容空间(保留解剖语义)和特定域的风格空间(编码模态特征)。
- 采用双编码器架构:每个模态配备一个内容编码器和一个风格编码器,分别将图像映射到其对应的内容码和风格码。
- 内容码在不同域之间共享,实现域不变特征学习;而风格码为模态特异,可被调控以实现多样化风格迁移。
- 通过重建损失确保内容码与风格码能够重建原始图像,从而保持图像保真度。
- 用基于解耦的损失替代循环一致性损失,支持多对多映射,增强表征多样性。
- 分割网络仅在源域(CT)的内容表示上进行训练,推理时则使用目标域(MRI)的内容码。
实验结果
研究问题
- RQ1与一对一映射相比,解耦表征是否能在医学图像分割中实现更有效的跨模态域自适应?
- RQ2当目标域具有高度多样性(如多期相MRI)时,该方法在未配对的CT和MRI数据上的表现如何?
- RQ3该解耦表征框架能否支持联合域学习,即在多个模态的未配对数据上联合训练单一模型?
- RQ4与CycleGAN相比,该模型是否能更好地保留语义内容,特别是在复杂、多模态的目标域中?
- RQ5通过操控风格码,该模型能否在保持解剖结构的前提下生成多样且逼真的风格迁移图像?
主要发现
- 所提出的DADR方法在仅使用CT训练数据的情况下,于增强前MRI分割任务中取得了0.81的Dice相似系数(DSC),显著优于基于CycleGAN的方法(0.72)。
- 在包含三个对比相位的多期相MRI上,DADR模型保持了稳健性能,DSC达0.74,而基于CycleGAN的方法性能急剧下降至0.52。
- 该模型在联合域学习中表现出强大泛化能力,联合训练未配对数据后,CT的DSC达到0.912,MRI的DSC达到0.891,优于分别在每种模态上训练的独立模型。
- 解耦表征通过调整风格码实现了多样化风格迁移,仅用一个内容码即可生成多个逼真的MRI相位(增强前、动脉期、门静脉期)。
- 共享内容空间有效保留了跨域的语义解剖信息,即使在存在显著域偏移和高目标域多样性的情况下,也能实现鲁棒适应。
- 与CycleGAN相比,该方法在鲁棒性和表征质量方面表现更优,尤其体现在对特征级语义的保留,而非依赖像素级风格迁移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。