Skip to main content
QUICK REVIEW

[论文解读] Imbalance-Aware Self-Supervised Learning for 3D Radiomic Representations

Hongwei Li, Fei-Fei Xue|arXiv (Cornell University)|Mar 6, 2021
Radiomics and Machine Learning in Medical Imaging参考文献 24被引用 4
一句话总结

本文提出一种3D孪生自监督学习框架,通过无监督重加权和批量组成平衡来缓解数据不平衡问题,从而增强医学图像分析中的放射组学表征。该方法在脑肿瘤分类和肺癌分期任务中达到当前最优性能,优于传统放射组学和有监督学习方法,尤其在标签稀缺条件下表现更优。

ABSTRACT

Radiomic representations can quantify properties of regions of interest in medical image data. Classically, they account for pre-defined statistics of shape, texture, and other low-level image features. Alternatively, deep learning-based representations are derived from supervised learning but require expensive annotations from experts and often suffer from overfitting and data imbalance issues. In this work, we address the challenge of learning representations of 3D medical images for an effective quantification under data imbalance. We propose a \emph{self-supervised} representation learning framework to learn high-level features of 3D volumes as a complement to existing radiomics features. Specifically, we demonstrate how to learn image representations in a self-supervised fashion using a 3D Siamese network. More importantly, we deal with data imbalance by exploiting two unsupervised strategies: a) sample re-weighting, and b) balancing the composition of training batches. When combining our learned self-supervised feature with traditional radiomics, we show significant improvement in brain tumor classification and lung cancer staging tasks covering MRI and CT imaging modalities.

研究动机与目标

  • 解决3D医学影像自监督表征学习中的数据不平衡问题,尽管此类问题在临床数据集中普遍存在,但相关研究仍较匮乏。
  • 开发一种无需标注数据即可学习高层判别性特征的自监督3D孪生网络。
  • 将自监督表征与传统放射组学相结合,以提升神经影像学与肿瘤学中的下游诊断性能。
  • 评估无监督策略(样本重加权与平衡批量组成)在缓解自监督训练中类别不平衡问题上的有效性。
  • 证明在标签数据有限时,自监督特征可优于或补充有监督学习。

提出的方法

  • 采用权重共享的3D孪生网络,通过比较同一3D医学影像体积的两个增强视图来学习不变表征。
  • 在四个类别中应用广泛的数据增强:仿射变换、外观增强、对比度变化和噪声注入,以生成正样本对。
  • 引入一种无监督重加权策略(RE),根据类别频率调整损失权重,降低对多数类别的偏差。
  • 提出一种基于聚类的采样策略(SE),通过将样本分组为聚类并在每个聚类中采样,确保各类别在批量中的均衡表示。
  • SE模块使用k-means聚类构建具有相等类别分布的新批量,从而提升训练稳定性和表征质量。
  • 最终模型采用晚期融合策略,将自监督特征与经典放射组学特征结合,用于下游分类任务。

实验结果

研究问题

  • RQ1自监督3D表征学习能否在类别不平衡的医学影像数据集中提升放射组学特征质量?
  • RQ2无监督重加权与平衡批量采样策略如何缓解自监督3D医学图像学习中的数据不平衡问题?
  • RQ3在低资源数据环境下,将自监督特征与传统放射组学结合是否能超越有监督学习?
  • RQ4与基于代理任务的自监督学习方法(如魔方任务)相比,所提方法在判别能力方面表现如何?
  • RQ5SE模块中最优聚类数(k)是多少,以在表征质量与泛化能力之间取得平衡?

主要发现

  • 在全标签条件下,传统放射组学与自监督3D表征(3DSiam+SE)在脑肿瘤分类中达到91.6%的敏感度与71.1%的特异度,优于有监督学习方法(88.8%/71.1%)。
  • 在仅使用50%训练标签时,混合方法达到84.8%的敏感度与76.3%的特异度,优于有监督学习(80.4%/56.6%)的相同设置。
  • SE模块降低了特征冗余性,表现为协方差分析中相关系数更低,表明表征更紧凑且更具判别性。
  • SE模块中最优聚类数(k)为3,因为更高值(如k=5)会导致采样偏差,进而降低AUC性能。
  • 所提方法在脑肿瘤与肺癌任务中均优于基于代理任务的自监督学习方法(如魔方任务),表明直接自监督表征学习具有更强的判别能力。
  • 在肺癌分期任务中,混合模型在全标签条件下实现53.8%的整体准确率与37.5%的小类准确率,优于有监督学习(52.6%/37.5%)与传统放射组学(49.0%/37.5%)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。