[论文解读] What is Interpretable? Using Machine Learning to Design Interpretable Decision-Support Systems
本文提出了一种基于强化学习(RL)的临床决策支持系统(DSS),旨在学习哪些形式的模型解释(如特征重要性、模型准确率或患者特异性风险敏感性)能够最大化临床医生对黑箱机器学习模型的信任。关键发现是,机器学习专家无法预测哪些解释能提升临床医生的信任,揭示了专家假设与医疗AI系统中真实用户信任之间的关键差距。
Recent efforts in Machine Learning (ML) interpretability have focused on creating methods for explaining black-box ML models. However, these methods rely on the assumption that simple approximations, such as linear models or decision-trees, are inherently human-interpretable, which has not been empirically tested. Additionally, past efforts have focused exclusively on comprehension, neglecting to explore the trust component necessary to convince non-technical experts, such as clinicians, to utilize ML models in practice. In this paper, we posit that reinforcement learning (RL) can be used to learn what is interpretable to different users and, consequently, build their trust in ML models. To validate this idea, we first train a neural network to provide risk assessments for heart failure patients. We then design a RL-based clinical decision-support system (DSS) around the neural network model, which can learn from its interactions with users. We conduct an experiment involving a diverse set of clinicians from multiple institutions in three different countries. Our results demonstrate that ML experts cannot accurately predict which system outputs will maximize clinicians' confidence in the underlying neural network model, and suggest additional findings that have broad implications to the future of research into ML interpretability and the use of ML in medicine.
研究动机与目标
- 为解决机器学习可解释性研究中缺乏实证验证的问题,即关于何种因素使模型可解释的假设未在最终用户身上得到检验。
- 探究强化学习是否可用于学习哪些类型的模型解释能有效提升非专家用户(如临床医生)的信任。
- 比较临床医生的实际信任反应与机器学习专家对其预测:哪些解释会提升信任。
- 探讨提供更多模型信息是否总是提升信任,还是可能导致信息过载而降低信心。
提出的方法
- 在MAGGIC数据集上训练深度神经网络,以预测心力衰竭患者的1年死亡率风险。
- 设计了一种基于强化学习的DSS,动态呈现可解释性模块及其支持证据(如数据来源、模型准确率、特征敏感性)的序列给临床医生。
- 强化学习智能体采用多臂赌博机方法(UCB1)探索并利用证据序列,以优化使临床医生自我报告的信心最大化。
- 临床医生与DSS互动,并在每次序列后评分其信心;机器学习专家则预测哪些序列会提升信任。
- 系统同时评估了通用模型证据(如训练数据、模型性能)和患者特异性情景(如特征敏感性、结果预测)。
- 信心评分被归一化至[0,1]区间,并对临床医生的反应与机器学习专家的预期进行了统计比较。
实验结果
研究问题
- RQ1强化学习能否有效识别出可解释性模块与支持证据的组合,以最大化临床医生对黑箱机器学习模型的信任?
- RQ2机器学习专家在多大程度上能准确预测哪些解释会提升临床医生对ML驱动DSS的信任?
- RQ3提供更多关于模型的信息(如数据、方法、准确率)是否总是提升用户信任,还是可能导致信息过载?
- RQ4不同类型的证据(如特征敏感性、结果预测或模型性能指标)如何影响临床医生对模型的感知信任?
主要发现
- 机器学习专家在预测哪些证据序列能最大化临床医生信心方面始终不准确,尤其在模型方法与特征敏感性的影响预期上存在显著偏差。
- 临床医生在能够与特征敏感性互动的序列中报告了更高的信心(如改变患者特征如何影响风险),尽管机器学习专家预期情况相反。
- 第一部分中持续时间最长的证据序列(H)的平均信心低于较短序列,表明即使信息量增加,信息过载仍可能降低信任。
- 包含患者特异性风险敏感性和结果预测的序列对信心的影响微乎其微,表明临床医生更重视交互式理解而非静态结果报告。
- 由RL引导的DSS设计成功识别出机器学习专家无法预测的高信任证据序列,证明了用户参与式学习的价值。
- 研究结果挑战了‘更简单模型或标准可解释性模块(如LIME、决策树)本质上更具可解释性’的假设,凸显了可解释性的主观性与情境依赖性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。