[论文解读] Cost-Sensitive Diagnosis and Learning Leveraging Public Health Data
本文提出了一种面向医疗应用的成本敏感学习框架,基于来自 NHANES 的约 10 万名个体的新型数据集,其特征获取成本来源于众包调查的实测数据。在糖尿病、心脏病和高血压分类任务中,评估了最先进的方法——如基于敏感性的方法、强化学习和贪心获取策略——结果表明,成本感知的特征选择在提升预测效率的同时,可降低患者负担和数据采集成本。
Traditionally, machine learning algorithms rely on the assumption that all features of a given dataset are available for free. However, there are many concerns such as monetary data collection costs, patient discomfort in medical procedures, and privacy impacts of data collection that require careful consideration in any real-world health analytics system. An efficient solution would only acquire a subset of features based on the value it provides while considering acquisition costs. Moreover, datasets that provide feature costs are very limited, especially in healthcare. In this paper, we provide a health dataset as well as a method for assigning feature costs based on the total level of inconvenience asking for each feature entails. Furthermore, based on the suggested dataset, we provide a comparison of recent and state-of-the-art approaches to cost-sensitive feature acquisition and learning. Specifically, we analyze the performance of major sensitivity-based and reinforcement learning based methods in the literature on three different problems in the health domain, including diabetes, heart disease, and hypertension classification.
研究动机与目标
- 解决医疗机器学习中缺乏真实世界特征成本数据的问题,特别是针对成本敏感的诊断任务。
- 开发一种方法,基于患者不适感、隐私顾虑和经济成本等因素,为特征获取成本分配现实且由人类判断支持的数值。
- 在真实医疗分类任务中,评估并比较最先进的成本敏感学习方法——基于敏感性的方法、强化学习和贪心获取策略。
- 通过在预测时优先选择高价值、低成本的特征,实现更高效、更符合患者意愿且更具成本效益的诊断系统。
- 提供一个公开可获取的数据集,包含特征成本,以支持未来在成本感知医疗信息学领域的研究。
提出的方法
- 从 NHANES(1999–2016)构建了一个全面的健康数据集,整合了约 10 万名个体的人口统计学信息、实验室检测结果、体检数据和问卷调查数据。
- 通过在 Amazon Mechanical Turk 上开展的众包调查,为各项特征分配成本,参与者在 0–5 的量表上对每项特征的感知不便程度进行评分。
- 使用线性变换将调查结果映射为成本数值,确保成本值能真实反映数据采集中的实际权衡。
- 评估了四种主要的成本敏感学习方法:OL(机会学习)、FACT(基于置信度阈值的特征获取)、穷举搜索和基于强化学习的方法。
- 将特征获取过程建模为一个序列决策问题,其中模型根据预测的性价比动态选择特征。
- 使用标准分类模型(如逻辑回归、随机森林)作为基础预测器,并在推理阶段应用成本感知的获取策略。
实验结果
研究问题
- RQ1在实际医疗分类任务中,当使用真实特征成本时,不同成本敏感的特征获取策略表现如何?
- RQ2将真实世界成本数据(来自人类感知)纳入模型在多大程度上提升了医疗机器学习的实际可行性和效率?
- RQ3在糖尿病、心脏病和高血压诊断中,基于敏感性的方法、强化学习方法或贪心获取方法中,哪一种在预测准确率与特征获取成本之间实现了最佳平衡?
- RQ4公开可获取的、包含真实特征成本的数据集能否支持在健康信息学领域对成本敏感学习算法进行更可靠的基准测试?
- RQ5与传统的全特征方法相比,动态的、上下文感知的特征获取在多大程度上降低了患者负担和数据采集成本?
主要发现
- 所提出的数据集包含约 10 万名个体,超过 10,000 项唯一变量,并附有真实、由人类估算的特征获取成本。
- 基于众包不便程度评分的成本分配方法,生成了一个从 0 到 5 的现实且可扩展的成本量表,真实反映了患者和临床实践中的权衡。
- 基于强化学习和基于敏感性的方法(如 FACT)在所有三项健康分类任务中,均优于贪心和穷举搜索方法,在准确率与成本之间实现了更优平衡。
- 在高血压分类任务中,OL(机会学习)方法在低成本水平下实现了最高准确率,展现出优异的特征选择效率。
- 准确率与成本曲线显示,基于敏感性的方法(FACT)即使在低成本获取阈值下仍能保持高性能,表明其具有强大的实际应用价值。
- 本研究揭示,特征获取成本是模型部署中的关键因素,忽略该因素将导致次优、高成本且患者依从性差的诊断工作流程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。