[论文解读] Towards Reliable Dermatology Evaluation Benchmarks
本文提出一种资源高效的文档清洗协议,结合算法排名与专家确认,从六个公开的皮肤科基准数据集中识别并移除无关样本、近似重复样本及标签错误。该方法在AUPRG指标上将性能差异减少最多达3.6%,从而实现更可靠的模型评估,并提供经修订的文件列表以提升临床AI基准测试的可靠性。
Benchmark datasets for digital dermatology unwittingly contain inaccuracies that reduce trust in model performance estimates. We propose a resource-efficient data-cleaning protocol to identify issues that escaped previous curation. The protocol leverages an existing algorithmic cleaning strategy and is followed by a confirmation process terminated by an intuitive stopping criterion. Based on confirmation by multiple dermatologists, we remove irrelevant samples and near duplicates and estimate the percentage of label errors in six dermatology image datasets for model evaluation promoted by the International Skin Imaging Collaboration. Along with this paper, we publish revised file lists for each dataset which should be used for model evaluation. Our work paves the way for more trustworthy performance assessment in digital dermatology.
研究动机与目标
- 为解决因标签错误、无关样本及近似重复等数据质量问题导致的数字皮肤科缺乏可靠评估基准的问题。
- 开发一种可扩展、资源高效的协议,结合算法排名与专家验证,实现数据整理。
- 通过清洗仍含有隐藏不准确性的高度整理皮肤科数据集,减少模型评估中的性能差异。
- 证明非专家标注者可可靠识别近似重复图像,从而降低数据整理成本。
- 发布六大数据集经修订的清洗后文件列表,以增强模型性能评估的可重现性与可信度。
提出的方法
- 利用SelfClean方法,将数据清洗重新定义为排名问题而非分类问题,以识别包括无关样本、近似重复和标签错误在内的候选问题。
- 采用基于置信度的排名策略,优先处理最可能包含数据质量问题的样本,减轻人工专家的负担。
- 采用多专家确认流程,由三位皮肤科医生验证排名后的候选样本,确保问题检测的高可靠性。
- 基于专家一致性的直观停止准则,高效终止确认流程,避免过度标注。
- 引入非专家标注用于近似重复检测,以评估成本效益,并通过统计方法验证标注一致性水平。
- 发布六大数据集的经修订文件列表,替换原始评估划分,以确保模型评估的一致性与可靠性。
实验结果
研究问题
- RQ1结合算法排名与专家确认的混合协议是否能有效检测并清除皮肤科基准中的数据质量问题?
- RQ2标签错误、无关样本及近似重复在已整理的皮肤科数据集中在多大程度上影响模型性能估计?
- RQ3非专家是否能可靠识别皮肤科数据集中的近似重复图像,从而降低数据整理成本?
- RQ4使用清洗后与原始基准数据集进行性能评估时,性能差异有多大?
- RQ5数据质量问题对皮肤科模型评估中的关键指标(如AUROC、AUPRG和AP)有何影响?
主要发现
- 该协议在六个数据集中移除了最多1.8%的无关样本和最多2.8%的近似重复样本,显著减少了评估集中的噪声。
- 在所有数据集中估计了标签错误的普遍程度,其中在AUPRG指标上观察到最显著的性能下降,模型性能在清洗后的基准上最高下降3.6%。
- 与原始版本相比,模型在清洗后数据集上评估时,AUROC、AP和AUPRG的性能差异分别为-1.0%、-1.4%和-3.6%。
- 专家在近似重复检测上的一致性很高,且与非专家无显著差异,表明近似重复标注可能无需医学专业知识。
- 该协议在保持高可靠性的同时显著加快了整理速度,停止准则有效限制了不必要的标注。
- 经修订的文件列表已公开发布于 https://github.com/Digital-Dermatology/SelfClean-Revised-Benchmarks,以支持数字皮肤科中可重现且可信的模型评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。