[论文解读] Sibyl: Understanding and Addressing the Usability Challenges of Machine Learning In High-Stakes Decision Making
本文介绍了 Sibyl,一种视觉分析工具,旨在通过使局部因素贡献可解释且可交互,提升机器学习在高风险儿童福利决策中的可用性。通过与领域专家的迭代设计以及两次正式的用户研究,Sibyl 有效缓解了信任、人机模型分歧和伦理问题等关键可用性挑战,通过提供直观的、针对具体案例的解释,增强了决策透明度和用户信心。
Machine learning (ML) is being applied to a diverse and ever-growing set of domains. In many cases, domain experts - who often have no expertise in ML or data science - are asked to use ML predictions to make high-stakes decisions. Multiple ML usability challenges can appear as result, such as lack of user trust in the model, inability to reconcile human-ML disagreement, and ethical concerns about oversimplification of complex problems to a single algorithm output. In this paper, we investigate the ML usability challenges that present in the domain of child welfare screening through a series of collaborations with child welfare screeners. Following the iterative design process between the ML scientists, visualization researchers, and domain experts (child screeners), we first identified four key ML challenges and honed in on one promising explainable ML technique to address them (local factor contributions). Then we implemented and evaluated our visual analytics tool, Sibyl, to increase the interpretability and interactivity of local factor contributions. The effectiveness of our tool is demonstrated by two formal user studies with 12 non-expert participants and 13 expert participants respectively. Valuable feedback was collected, from which we composed a list of design implications as a useful guideline for researchers who aim to develop an interpretable and interactive visualization tool for ML prediction models deployed for child welfare screeners and other similar domain experts.
研究动机与目标
- 识别并解决非专家领域专家在使用机器学习模型进行高风险决策时面临的可用性挑战。
- 研究可解释人工智能(XAI)技术,特别是局部因素贡献,如何提升定性决策领域中的可解释性与可用性。
- 与儿童福利筛查员共同设计一款视觉分析工具,以支持透明、可问责且合乎伦理的决策。
- 通过非专家和专家参与者的正式用户研究,评估该工具的有效性。
- 为未来在类似高风险、非技术性领域中的 XAI 工具开发,提炼可操作的设计启示。
提出的方法
- 对 55 篇关于机器学习与可解释性的文献进行全面回顾,识别人类-机器学习交互中反复出现的可用性挑战。
- 与儿童福利筛查员、机器学习科学家及可视化研究人员进行迭代协作,共同设计 Sibyl,聚焦于局部因素贡献作为核心解释技术。
- 将 Sibyl 实现为一个视觉分析平台,展示案例特定的特征贡献、相似案例以及反事实推理,以支持决策。
- 在界面设计中关注认知偏差,包括通过调整因素贡献的排序顺序以减少可得性偏差。
- 开展两次正式用户研究:一次针对 12 名非专家参与者,另一次针对 13 名专家参与者,使用合成数据评估可用性与感知有用性。
- 收集定性反馈与信心评分,以评估不同解释类型对用户信任与决策清晰度的影响。
实验结果
研究问题
- RQ1非专家领域专家在高风险、定性决策情境中使用机器学习模型时,面临的主要可用性挑战是什么?
- RQ2如何可视化局部因素贡献,以有效支持儿童福利筛查中的决策?
- RQ3交互式视觉解释在多大程度上能提升用户信任、减少人机模型分歧,并增强感知问责性?
- RQ4认知偏差(如代表性偏差、因果与相关性混淆、可得性偏差)如何影响用户对机器学习解释的解读?
- RQ5从用户反馈中涌现出哪些设计原则,可指导未来在非技术性高风险领域中 XAI 工具的开发?
主要发现
- 用户对理解模型内部机制兴趣较低,仅有一名筛查员表现出对模型内部结构的好奇,表明透明度的重要性低于可操作的、针对具体案例的洞察。
- 局部因素贡献解释被视作最有效的工具,用于调和人机模型分歧并建立信任,优于全局解释和性能指标。
- 将因素贡献按降序排列(正向因素优先)相比升序排列(负向因素优先),可降低可得性偏差的风险。
- 用户更可能将反事实解释误解为因果关系,凸显了强化相关性与因果性混淆风险的可能性。
- 相似案例功能可能引发代表性偏差,因用户倾向于基于案例相似性而非个体特征做出决策。
- 尽管使用了合成数据,参与者仍报告 Sibyl 具有高度的感知有用性,尤其在理解预测驱动因素和在复杂、伦理敏感情境中为决策提供依据方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。