[论文解读] Multimodal Interactive Lung Lesion Segmentation: A Framework for Annotating PET/CT Images based on Physiological and Anatomical Cues
本文提出了一种用于PET/CT肺部病灶标注的多模态交互式分割框架,通过利用解剖学(CT)和生理学(PET)线索,减少人工标注的工作量。通过采用新颖的椭球体用户模拟方法与RoI优化的测地距离变换,该方法实现了更快、更准确的分割,专家用户在每个体积上的标注时间相比基线方法减少了约12.5%。
Recently, deep learning enabled the accurate segmentation of various diseases in medical imaging. These performances, however, typically demand large amounts of manual voxel annotations. This tedious process for volumetric data becomes more complex when not all required information is available in a single imaging domain as is the case for PET/CT data. We propose a multimodal interactive segmentation framework that mitigates these issues by combining anatomical and physiological cues from PET/CT data. Our framework utilizes the geodesic distance transform to represent the user annotations and we implement a novel ellipsoid-based user simulation scheme during training. We further propose two annotation interfaces and conduct a user study to estimate their usability. We evaluated our model on the in-domain validation dataset and an unseen PET/CT dataset. We make our code publicly available: https://github.com/verena-hallitschke/pet-ct-annotate.
研究动机与目标
- 解决3D医学图像分割中高标注负担的问题,特别是对于在单一模态下不清晰可见的多模态PET/CT数据。
- 通过仅需最少用户输入(如涂抹标记)的交互式分割,减少对大规模体素级标注的依赖。
- 通过在标注过程中整合PET(代谢活性)和CT(解剖细节)模态,提升分割的准确性和效率。
- 评估不同用户界面设计——并行显示与顺序查看——对标注速度和质量的影响。
- 展示模型在未见数据集上的泛化能力,证明其在训练分布之外的鲁棒性。
提出的方法
- 通过在提议网络(P-Net)和精炼网络(R-Net)中共享相同的CNN架构,将DeepIGeoS模型适配为处理双模态输入(PET与CT)。
- 提出一种新颖的椭球体用户模拟方案,在训练期间生成逼真的前景与背景涂抹标记,提升模型泛化能力。
- 采用基于感兴趣区域(RoI)的测地距离变换编码用户交互,降低计算成本,同时保留空间上下文信息。
- 实现两种用户界面设计:(1) PET与CT并排显示,实现并行查看;(2) 可切换模态视图,实现专注观察。
- 使用3D Slicer与MONAI Label构建交互式标注插件,支持实时模型推理与迭代优化。
- 在AutoPET数据集上端到端训练模型,并在域内与域外(Lung-PET-CT-Dx)数据集上进行评估,以检验泛化性能。

实验结果
研究问题
- RQ1在用户界面中同时显示PET与CT模态是否能比顺序查看方式实现更快、更准确的肺部病灶分割?
- RQ2多模态交互式分割框架是否能显著减少在PET/CT体数据中标注肺部病灶的时间与工作量?
- RQ3所提出的基于椭球体的用户模拟方案在无真实用户交互的情况下,是否能有效提升模型训练过程中的鲁棒性?
- RQ4该模型在未见的PET/CT数据集上,通过交互式精炼能多大程度上改善初始深度学习预测结果?
- RQ5与单模态方法相比,整合生理(PET)与解剖(CT)线索如何提升分割性能?
主要发现
- 与GraphCut及单视图设置相比,双视图界面(并行显示PET与CT)将标注时间减少了约12.5%,证实多模态可视化可提升标注效率。
- 所有用户在使用本方法的双视图界面时均获得了可接受的Dice分数(>0.7),而GraphCut未能生成可用分割结果,Dice分数接近零。
- 单视图界面在大多数用户中获得的Dice分数与双视图界面相当,但标注速度显著更慢,表明并行查看可显著提升效率。
- 该模型成功改进了在未见数据集(Lung-PET-CT-Dx)上的初始P-Net预测结果,展示了在不同数据分布间强大的泛化能力。
- 在研究结束后反馈中,所有专家认为多模态界面具有帮助性,并对模型初始预测的速度与质量表示高度满意。
- 通过优化用户交互建模,结合生理与解剖线索,该框架在PET/CT交互式分割任务中达到了当前最先进性能。
![Fig. 2 : The workflow of our proposed method. Blue boxes indicate the segmentation models which are adapted from Wang et al. [ 6 ] to multimodal inputs.](https://ar5iv.labs.arxiv.org/html/2301.09914/assets/images/final_architecture.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。