[论文解读] Quantifying Health Inequalities Induced by Data and AI Models
本文提出了分配恶化(DA)框架,这是一种新颖的方法,通过测量分配-恶化曲线之间的面积,量化人工智能模型及嵌入医疗数据中所引发的健康不平等。研究发现,人工智能模型加剧了既有的不平等,非白人患者在资源分配中的不平等程度比白人患者最高高出43.2%;女性在重症监护病房(ICU)环境中面临高达33%的预后恶化程度加剧。
AI technologies are being increasingly tested and applied in critical environments including healthcare. Without an effective way to detect and mitigate AI induced inequalities, AI might do more harm than good, potentially leading to the widening of underlying inequalities. This paper proposes a generic allocation-deterioration framework for detecting and quantifying AI induced inequality. Specifically, AI induced inequalities are quantified as the area between two allocation-deterioration curves. To assess the framework's performance, experiments were conducted on ten synthetic datasets (N>33,000) generated from HiRID - a real-world Intensive Care Unit (ICU) dataset, showing its ability to accurately detect and quantify inequality proportionally to controlled inequalities. Extensive analyses were carried out to quantify health inequalities (a) embedded in two real-world ICU datasets; (b) induced by AI models trained for two resource allocation scenarios. Results showed that compared to men, women had up to 33% poorer deterioration in markers of prognosis when admitted to HiRID ICUs. All four AI models assessed were shown to induce significant inequalities (2.45% to 43.2%) for non-White compared to White patients. The models exacerbated data embedded inequalities significantly in 3 out of 8 assessments, one of which was >9 times worse. The codebase is at https://github.com/knowlab/DAindex-Framework.
研究动机与目标
- 为解决当前在人工智能驱动的医疗系统中检测和量化健康不平等所面临的严重技术工具缺失问题。
- 开发一种通用、可可视化且可量化的框架,用于衡量数据中嵌入的不平等与模型引发的不平等。
- 通过合成数据和真实世界的ICU数据集评估该框架的性能,重点关注性别与种族差异。
- 探究人工智能模型如何在临床决策场景中无意间放大现有的健康不平等。
- 为人工智能从业者提供一种实用的开源工具,用于审计、调试并减轻医疗人工智能系统中的偏见。
提出的方法
- 该框架定义了两个指标:分配指数(来自人工智能模型输出,如风险评分)和恶化指数(来自预后客观临床指标)。
- 患者被映射为二维空间中(分配指数,恶化指数)的点,通过拟合回归曲线来表示群体层面的趋势。
- 健康不平等通过两个不同人口群体(如非白人与白人、女性与男性)的恶化曲线之间的面积来量化。
- 该方法解决了核密度估计中的边界偏差问题,以及在恶化指数计算中处理离散随机变量的技术挑战。
- 该框架应用于两个真实世界的ICU数据集(HiRID和MIMIC-III),并在多种临床决策场景中进行测试。
- 通过标准化临床指标(如肌酐最大值、标准化共病计数)的得分,确保不同患者群体之间的可比性。
实验结果
研究问题
- RQ1在真实世界的ICU数据集中,健康不平等在多大程度上由性别和种族因素所嵌入?
- RQ2用于临床决策的人工智能模型在多大程度上放大或缓解了资源分配中的既有健康不平等?
- RQ3分配-恶化框架能否有效且准确地量化数据和模型输出中的健康不平等?
- RQ4在不同临床场景(如肾手术预测)中,人工智能模型引发的不平等程度有多大?
- RQ5不同模型架构(如逻辑回归与随机森林)如何影响所引发的健康不平等水平?
主要发现
- 与男性相比,非白人患者在HiRID ICU中经历了高达33%的预后指标恶化,表明存在嵌入的性别不平等。
- 非白人患者的预后显著差于白人患者,女性中肾功能恶化不平等达35.06%,男性中为19.94%。
- 所有四种测试的人工智能模型均引发了显著的健康不平等,非白人与白人患者之间的不平等程度在2.45%至43.2%之间。
- 在八项评估中的三项中,人工智能模型加剧了数据中已存在的不平等,其中一项案例显示不平等程度恶化超过九倍。
- 分配-恶化曲线清晰表明,在临床决策区域(如分配指数 > 0.5)内,非白人患者的恶化程度更高,尤其在肾手术预测中表现明显。
- 该框架成功量化了多种场景下的不平等,证明其在医疗人工智能系统审计与调试中的实用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。