[论文解读] FocusNet: Imbalanced Large and Small Organ Segmentation with an End-to-End Deep Neural Network for Head and Neck CT Images
FocusNet 是一种端到端的 3D 卷积神经网络,通过使用主干网络处理大器官,同时利用基于 ROI-pooling 的多尺度特征对小器官进行专用子网络分割,有效解决了头颈部 CT 中大器官与小器官之间分割不平衡的问题。该方法在真实患者数据和 MICCAI 2015 数据集上均取得了当前最优性能,平均 95% Hausdorff 距离为 2.62,Dice 评分达到 80.29,显著优于以往方法,尤其在视神经和视交叉等小器官上的表现尤为突出。
In this paper, we propose an end-to-end deep neural network for solving the problem of imbalanced large and small organ segmentation in head and neck (HaN) CT images. To conduct radiotherapy planning for nasopharyngeal cancer, more than 10 organs-at-risk (normal organs) need to be precisely segmented in advance. However, the size ratio between large and small organs in the head could reach hundreds. Directly using such imbalanced organ annotations to train deep neural networks generally leads to inaccurate small-organ label maps. We propose a novel end-to-end deep neural network to solve this challenging problem by automatically locating, ROI-pooling, and segmenting small organs with specifically designed small-organ sub-networks while maintaining the accuracy of large organ segmentation. A strong main network with densely connected atrous spatial pyramid pooling and squeeze-and-excitation modules is used for segmenting large organs, where large organs' label maps are directly output. For small organs, their probabilistic locations instead of label maps are estimated by the main network. High-resolution and multi-scale feature volumes for each small organ are ROI-pooled according to their locations and are fed into small-organ networks for accurate segmenting small organs. Our proposed network is extensively tested on both collected real data and the \emph{MICCAI Head and Neck Auto Segmentation Challenge 2015} dataset, and shows superior performance compared with state-of-the-art segmentation methods.
研究动机与目标
- 解决头颈部 CT 中因小器官(如晶状体、视神经)体积远小于大器官(如腮腺)而导致的分割不平衡问题,从而提升小结构的模型性能。
- 开发一种端到端的深度学习框架,实现对大器官与小器官的高精度同步分割,克服标准 CNN 在数据不平衡情况下训练的局限性。
- 模仿临床标注流程,先定位小器官,再对高分辨率、多尺度特征进行处理,以实现精确分割。
- 通过引入加权焦点损失与广义 Dice 损失的组合,缓解类别不平衡问题,提升小器官的泛化能力与鲁棒性。
- 在自建的 50 例患者扫描数据集和 MICCAI 2015 头颈部自动分割挑战赛数据集上对方法进行验证。
提出的方法
- FocusNet 采用三部分架构:用于大器官的强主分割网络(S-Net),用于预测小器官中心位置的定位分支(SOL-Net),以及用于高精度分割的小器官分割分支(SOS-Net)。
- S-Net 使用密集连接的空洞空间金字塔池化(DenseASPP)与挤压-激励模块,以增强特征表示并保持大器官分割的准确性。
- SOL-Net 经训练可预测小器官的概率中心图,用于引导主干网络中高分辨率、多尺度特征的 ROI-pooling 操作。
- 经过 ROI-pooling 的特征被送入 SOS-Net,以实现对小器官的细粒度、高分辨率分割,从而在低对比度和小尺寸条件下仍能实现精确的边界预测。
- 整个网络通过联合优化损失函数进行端到端训练,该损失函数结合了加权焦点损失与广义 Dice 损失,以应对大器官与小器官之间严重的类别不平衡问题。
- 所有分支共享特征图,确保参数效率与一致的特征学习。
实验结果
研究问题
- RQ1统一的深度学习框架是否能在极端尺寸不平衡的头颈部 CT 中,同时实现对大器官与小器官的优越分割性能?
- RQ2通过多尺度特征的 ROI-pooling 实现小器官定位与分割的解耦,是否能相比标准 U-Net 风格网络提升分割精度?
- RQ3专门设计的定位分支(SOL-Net)若能预测小器官中心位置,是否可提升后续分割网络(SOS-Net)的性能?
- RQ4加权焦点损失与广义 Dice 损失的组合对类别不平衡分割任务中的模型收敛与性能有何影响?
- RQ5所提方法是否在真实临床数据与 MICCAI 2015 等基准数据集上具有良好泛化能力,尤其在体积小的器官上表现优异?
主要发现
- 在 MICCAI 2015 测试集上,FocusNet 的平均 95% Hausdorff 距离为 2.62,显著优于次优方法(6.72),展现出更优的边界定位能力。
- 在 MICCAI 2015 数据集上,FocusNet 的平均 Dice 评分达到 80.29,超过最优对比方法(79.24),在视神经与视交叉等小器官上优势明显。
- 对于视神经(左、右),FocusNet 分别取得 73.5 ± 9.6 和 74.4 ± 7.2 的 Dice 评分,优于所有先前方法,包括使用额外训练数据的方法。
- 仅使用 Zhu 等人 15% 训练数据量的 S-Net 主干网络,在 MICCAI 2015 上即达到 79.25 的 Dice 评分,表明其具备强大的特征表示能力。
- 消融实验表明,单纯增加网络容量(如 Fat U-Net)而未解决类别不平衡问题,并未提升性能,证明网络架构设计与损失函数配置至关重要。
- 最优的 ROI 尺寸被确定为器官边长的 3 倍,该设置在上下文信息与分辨率之间取得最佳平衡,实现最优分割效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。