[论文解读] Video Pretraining Advances 3D Deep Learning on Chest CT Tasks
本论文表明,在大规模域外数据集(如 Kinetics)上进行视频预训练可显著提升3D深度学习在胸部CT任务中的性能,优于2D模型和域内预训练。在七个3D模型和两项临床任务(肺栓塞检测与结节检测)中,视频预训练持续提升了性能,尤其在小样本数据集上表现突出,确立了大规模视频预训练作为数据稀缺的3D医学影像任务的更优策略。
Pretraining on large natural image classification datasets such as ImageNet has aided model development on data-scarce 2D medical tasks. 3D medical tasks often have much less data than 2D medical tasks, prompting practitioners to rely on pretrained 2D models to featurize slices. However, these 2D models have been surpassed by 3D models on 3D computer vision benchmarks since they do not natively leverage cross-sectional or temporal information. In this study, we explore whether natural video pretraining for 3D models can enable higher performance on smaller datasets for 3D medical tasks. We demonstrate video pretraining improves the average performance of seven 3D models on two chest CT datasets, regardless of finetuning dataset size, and that video pretraining allows 3D models to outperform 2D baselines. Lastly, we observe that pretraining on the large-scale out-of-domain Kinetics dataset improves performance more than pretraining on a typically-sized in-domain CT dataset. Our results show consistent benefits of video pretraining across a wide array of architectures, tasks, and training dataset sizes, supporting a shift from small-scale in-domain pretraining to large-scale out-of-domain pretraining for 3D medical tasks. Our code is available at: https://github.com/rajpurkarlab/chest-ct-pretraining
研究动机与目标
- 评估大规模视频预训练是否能提升3D深度学习模型在胸部CT任务中的性能,特别是在低数据量场景下。
- 比较域外视频预训练(如 Kinetics)与域内CT预训练及顺序预训练的有效性。
- 评估视频预训练在多样化3D模型架构与临床任务中在医学影像中的泛化能力。
- 理解预训练性能如何随下游数据集规模变化,特别是在医学中常见的小样本设置下。
- 为未来3D医学AI发展提供一个涵盖模型、任务与数据场景的全面预训练策略基准。
提出的方法
- 在 ImageNet 和 Kinetics 数据集上对七个3D模型(如 MViT、Swin-T、SlowFast)及三个2D模型进行预训练,以实现视频预训练。
- 通过先在域内斯坦福肺栓塞检测数据集上预训练,再在 Kinetics 上预训练,开展顺序预训练,以隔离视频预训练的影响。
- 在两个公开的胸部CT数据集上微调所有模型:RSNA 用于肺栓塞检测,LIDC-IDRI 用于肺结节检测。
- 在三种训练数据集规模(1%、10%、100%)下评估性能,以分析预训练策略的数据效率与可扩展性。
- 使用标准指标(AUC)并结合95%置信区间,比较不同预训练策略与模型架构下的模型性能。
- 在模型与预训练协议之间进行超参数搜索,以确保比较的公平性与泛化性。

实验结果
研究问题
- RQ1与 ImageNet 预训练或无预训练相比,在大规模域外视频(如 Kinetics)上进行视频预训练是否能提升3D医学图像分类性能?
- RQ2在小样本下游数据集上,视频预训练与域内CT预训练相比,性能增益如何,尤其在小样本设置下?
- RQ3视频预训练的优势是否随3D胸部CT分析中模型架构多样性与任务种类的增加而提升?
- RQ4在不同下游数据集规模下,视频预训练模型与2D基线模型的性能表现如何比较?
- RQ5在低数据医学影像设置中,预训练策略与下游数据集规模之间是否存在交互作用?
主要发现
- 在 RSNA 和 LIDC 数据集上,无论下游数据集规模如何,Kinetics 上的视频预训练均提升了七个3D模型的平均性能。
- 在 RSNA 数据集仅使用1%训练数据(50项研究)时,视频预训练的AUC达到0.599,显著优于2D基线(AUC 0.517)和域内预训练(AUC 0.510)。
- 在 LIDC 数据集使用10%训练数据(71项研究)时,视频预训练的AUC达到0.831,超过2D基线(AUC 0.530)和域内预训练(AUC 0.500)。
- 视频预训练使3D模型在所有数据集规模下均优于2D模型,且在低数据量场景(1%和10%训练数据)中相对增益最大。
- 在 Kinetics 上预训练的性能优于在通常规模的域内CT数据集上预训练,表明域外视频预训练对3D医学任务更具有效性。
- 顺序预训练(先域内后Kinetics)并未优于仅Kinetics预训练,表明视频预训练的优势并非叠加效应,且仅Kinetics预训练已足够且更优。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。