[论文解读] The Data Addition Dilemma
本文提出了数据添加困境(Data Addition Dilemma),即在模型扩展过程中,尽管数据量增加,但来自多样化医疗来源的数据添加可能因分布偏移而导致性能下降。本文提出了基于分布偏移的启发式方法,以指导数据源选择,表明当新数据引入有害的统计偏移时,模型准确率可能下降,并提出了一个正式框架,用于预测在医疗机器学习系统中数据添加是提升还是损害性能。
In many machine learning for healthcare tasks, standard datasets are constructed by amassing data across many, often fundamentally dissimilar, sources. But when does adding more data help, and when does it hinder progress on desired model outcomes in real-world settings? We identify this situation as the extit{Data Addition Dilemma}, demonstrating that adding training data in this multi-source scaling context can at times result in reduced overall accuracy, uncertain fairness outcomes, and reduced worst-subgroup performance. We find that this possibly arises from an empirically observed trade-off between model performance improvements due to data scaling and model deterioration from distribution shift. We thus establish baseline strategies for navigating this dilemma, introducing distribution shift heuristics to guide decision-making on which data sources to add in data scaling, in order to yield the expected model performance improvements. We conclude with a discussion of the required considerations for data collection and suggestions for studying data composition and scale in the age of increasingly larger models.
研究动机与目标
- 将多源医疗机器学习中的数据扩展挑战形式化,其中数据集规模增大可能导致模型性能因分布偏移而下降。
- 识别在真实临床环境中,添加新数据源导致性能下降而非提升的条件,特别是当性能下降时。
- 开发考虑各数据源间分布变化的实际数据添加启发式方法,确保预期的性能提升。
提出的方法
- 将数据添加困境形式化为多源训练数据中性能增益与分布偏移导致的性能损失之间的权衡。
- 使用f-散度度量(如Kullback-Leibler散度)量化训练数据与测试数据之间的分布偏移。
- 利用Jensen不等式和f-散度的凸性,推导出一个理论条件,以判断添加新数据源是否会改善或恶化模型性能。
- 提出一种启发式方法:仅当新数据源与测试分布的散度超过依赖于整体训练分布和数据构成的阈值时,才应添加该数据源。
- 在来自多家医院的真实ICU数据集上,通过逐步增加数据进行实证验证,比较模型在不同数据添加阶段的性能表现。
- 提出一个平衡数据规模与数据构成的框架,使从业者能够就应包含哪些数据源做出明智决策。

实验结果
研究问题
- RQ1在什么条件下,尽管训练数据规模增加,从额外医疗来源添加数据仍会导致模型性能下降?
- RQ2在异构数据源之间,分布偏移如何影响医疗机器学习中的模型准确率、公平性及最差群体性能?
- RQ3我们能否推导出一个正式标准,以判断在多源数据扩展中添加新数据源是否会改善或降低模型性能?
- RQ4在现实世界医疗应用中,数据构成的变化在多大程度上会削弱数据扩展的预期收益?
- RQ5从业者应如何做出数据添加决策,以在面对分布偏移时保持或提升模型性能?
主要发现
- 即使总训练数据规模增加,从新分布外的数据源添加数据仍可能降低整体模型准确率,原因在于分布偏移。
- 本文识别出数据扩展带来的性能增益与分布偏移导致的性能下降之间的权衡,这是数据添加困境的核心。
- 基于f-散度阈值的启发式方法成功预测了新数据源是否将改善或损害模型性能。
- 当添加新数据源时,模型在最差子群体上的表现通常会下降,即使整体准确率有所提升。
- 在多所医院的ICU数据集上的实证验证表明,数据添加决策显著影响模型结果,部分数据源导致可测量的性能下降。
- 本研究表明,数据构成在扩展过程中的变化是医疗机器学习模型开发中一个关键但被低估的因素。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。