Skip to main content
QUICK REVIEW

[论文解读] Learning "What-if" Explanations for Sequential Decision-Making

Ioana Bica, Daniel Jarrett|arXiv (Cornell University)|Jul 2, 2020
Advanced Causal Inference Techniques参考文献 47被引用 5
一句话总结

本文提出反事实逆强化学习(CIRL),一种批量逆强化学习方法,通过基于‘若非’反事实结果的偏好学习可解释的奖励函数,对专家的序列决策进行建模。通过将反事实推理整合到离线IRL中,CIRL在无需主动环境交互的情况下,实现了对专家行为的准确、可解释且可审计的解释——尤其适用于医疗领域,在脓毒症治疗数据集上匹配专家行为的准确率达到83.4%。

ABSTRACT

Building interpretable parameterizations of real-world decision-making on the basis of demonstrated behavior -- i.e. trajectories of observations and actions made by an expert maximizing some unknown reward function -- is essential for introspecting and auditing policies in different institutions. In this paper, we propose learning explanations of expert decisions by modeling their reward function in terms of preferences with respect to "what if" outcomes: Given the current history of observations, what would happen if we took a particular action? To learn these cost-benefit tradeoffs associated with the expert's actions, we integrate counterfactual reasoning into batch inverse reinforcement learning. This offers a principled way of defining reward functions and explaining expert behavior, and also satisfies the constraints of real-world decision-making -- where active experimentation is often impossible (e.g. in healthcare). Additionally, by estimating the effects of different actions, counterfactuals readily tackle the off-policy nature of policy evaluation in the batch setting, and can naturally accommodate settings where the expert policies depend on histories of observations rather than just current states. Through illustrative experiments in both real and simulated medical environments, we highlight the effectiveness of our batch, counterfactual inverse reinforcement learning approach in recovering accurate and interpretable descriptions of behavior.

研究动机与目标

  • 开发一种在主动实验不可行的真实场景(如医疗领域)中解释专家序列决策的方法。
  • 不将专家行为建模为黑箱策略,而是基于对反事实结果(‘若非’情景)偏好的奖励函数参数化。
  • 解决标准批量逆强化学习的局限性,包括不可解释的奖励表示形式以及对完全可观测马尔可夫状态的假设。
  • 通过恢复反映临床医生治疗优先级的可解释奖励权重,实现对临床决策过程的审计与分析。
  • 通过使用反事实估计专家行为下的特征期望,支持在批量设置下的离策略评估。

提出的方法

  • CIRL将奖励函数表述为反事实结果的加权和:$ R(h_t, a_t) = w_u \mathbb{E}[U_{t+1}[a_t] \mid h_t] + w_z \mathbb{E}[Z_{t+1}[a_t] \mid h_t] $,其中 $ U $ 和 $ Z $ 为肿瘤体积和副作用等患者结果。
  • 该方法将反事实推理整合到批量逆强化学习中,即使在环境动态未知的情况下,也能估计不同策略下动作的期望结果。
  • 采用最大间隔模仿学习框架,学习最能解释观测数据集中专家行为的奖励权重 $ w_u $ 和 $ w_z $。
  • 反事实结果通过在历史数据上训练的模型进行估计,使该方法能够处理部分观测的历史和非马尔可夫动态。
  • 该方法被应用于模拟和真实世界的医疗决策任务,包括脓毒症中的抗生素给药。
  • CIRL通过使用反事实估计专家策略下的特征期望,实现离策略评估,克服了标准批量IRL的局限性。

实验结果

研究问题

  • RQ1当无法与环境进行主动交互时,如何学习专家序列决策的可解释奖励函数?
  • RQ2反事实推理在现实世界领域(如医疗)的批量逆强化学习中,能在多大程度上提升可解释性和准确性?
  • RQ3基于‘若非’结果的奖励函数能否揭示临床有意义的偏好,例如优先减少肿瘤体积而非最小化副作用?
  • RQ4CIRL在恢复专家行为和解释决策模式方面,与现有批量IRL方法相比表现如何?
  • RQ5恢复的奖励权重能否反映已知的临床指南和治疗优先级,例如体温和白细胞计数在脓毒症管理中的重要性?

主要发现

  • CIRL在脓毒症治疗数据集上匹配专家行为的准确率达到83.4%,优于基准方法如MB(h)-IRL(77.5%)和DSFN(h)(75.3%)。
  • 该方法成功恢复了反映临床医生优先降低发热和恢复正常白细胞计数的奖励权重,与既定医学指南一致。
  • CIRL表明,当肿瘤减小权重的绝对值($ |w_u| $)超过副作用最小化权重的绝对值($ |w_z| $)时,专家会采取更积极的治疗策略,反映出临床优先级。
  • 基于反事实的奖励函数实现了对策略行为的可解释解释,揭示了临床医生在抗生素决策中更重视体温和白细胞计数等结果,而非其他特征。
  • 该方法通过基于完整历史建模动作,有效处理了非马尔可夫动态,避免了对完全可观测状态的假设。
  • CIRL在保持高准确率的同时,提供了可解释且可审计的解释,证明可解释性并不以牺牲预测性能为代价。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。