[论文解读] Inflation of test accuracy due to data leakage in deep learning-based classification of OCT images
本研究表明,深度学习用于OCT图像分类时,若数据分割方式不当——特别是以2D切片级别而非3D体素或受试者级别进行分割——将导致显著的数据泄露,使测试准确率最高膨胀30%(MCC提升0.07–0.43)。作者证明,当训练集与测试集存在重叠时,模型会高估泛化性能,强调必须采用体素或受试者级别分割,以确保OCT基础深度学习研究中评估结果的可靠性。
In the application of deep learning on optical coherence tomography (OCT) data, it is common to train classification networks using 2D images originating from volumetric data. Given the micrometer resolution of OCT systems, consecutive images are often very similar in both visible structures and noise. Thus, an inappropriate data split can result in overlap between the training and testing sets, with a large portion of the literature overlooking this aspect. In this study, the effect of improper dataset splitting on model evaluation is demonstrated for three classification tasks using three OCT open-access datasets extensively used, Kermany's and Srinivasan's ophthalmology datasets, and AIIMS breast tissue dataset. Results show that the classification performance is inflated by 0.07 up to 0.43 in terms of Matthews Correlation Coefficient (accuracy: 5% to 30%) for models tested on datasets with improper splitting, highlighting the considerable effect of dataset handling on model evaluation. This study intends to raise awareness on the importance of dataset splitting given the increased research interest in implementing deep learning on OCT data.
研究动机与目标
- 调查不恰当的数据分割策略对基于深度学习的OCT图像分类中模型评估的影响。
- 证明文献中常见的逐图像分割方法会导致数据泄露,原因在于连续2D OCT切片之间具有高度相似性。
- 量化在OCT数据集中,由于训练集与测试集重叠而导致的测试准确率和MCC的膨胀程度。
- 倡导采用体素或受试者级别分割作为标准,以确保OCT研究中模型评估的无偏性。
提出的方法
- 实现了一个自定义的数据分割函数,分别采用逐图像与逐体素/受试者策略创建训练集与测试集。
- 采用LightOCT模型,该模型为浅层双卷积层CNN,包含ReLU激活函数与最大池化层,后接一个全连接层并输出softmax概率。
- 使用随机梯度下降优化器(动量m=0.9)、恒定的初始学习率(0.0001)、批量大小64,并在250个周期内从头开始训练模型,未使用早停策略。
- 采用十次重复的五折交叉验证,以确保不同分割下结果的可靠性。
- 为每个类别计算评估指标,包括马修斯相关系数(MCC)、准确率、精确率、召回率、F1分数和AUC。
- 通过10,000次模拟进行随机标签实验以检测偏差:将训练随机标签的模型所得MCC与无重叠情况下构建的零分布进行比较,使用单样本Wilcoxon检验计算p值。
实验结果
研究问题
- RQ1在OCT图像分类的深度学习模型中,逐图像数据分割在多大程度上导致了测试准确率的膨胀?
- RQ2由于训练集与测试集存在重叠而导致的数据泄露,对OCT分类任务中的马修斯相关系数(MCC)产生何种影响?
- RQ3与正确的体素级别分割相比,使用重叠数据分割时性能膨胀的幅度有多大?
- RQ4随机标签实验能否检测到模型评估中的数据泄露?此类测试中的p值如何反映重叠的存在?
主要发现
- 由于逐图像分割导致的数据泄露,在三个OCT数据集中使测试准确率膨胀5%至30%,MCC提升0.07至0.43。
- 在Kermany的OCT2017版本2数据集中,92%的测试图像所属的受试者ID也出现在训练集中,表明存在显著重叠。
- Kermany数据集的original_v3分割版本中无受试者ID重叠,但original_v2版本存在显著泄露,解释了以往研究中性能被高估的原因。
- 随机标签实验在重叠分割上检测到统计显著的偏差(p < 0.05),证实了数据泄露的影响。
- 研究发现,使用original_v2分割的模型报告准确率为99.6%,这很可能因数据泄露而被高估,而采用正确的体素级别分割将提供更可靠的性能估计。
- 作者结论认为,不恰当的分割方式会损害模型泛化能力的评估,因此在OCT深度学习研究中,体素或受试者级别分割是确保评估有效性的必要标准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。