[论文解读] Contrastive Explanations for Reinforcement Learning via Embedded Self Predictions
本文提出嵌入式自预测(ESP)模型,一种深度强化学习架构,通过广义价值函数(GVFs)对比人类可理解的未来预测来解释动作偏好。该模型训练GVFs使其能够自预测代理的最优策略,从而通过梯度积分法和最小充分解释实现可靠、对比性的解释,并在一款复杂的实时战略游戏中得到验证,结果具有洞察力且可被人类理解。
We investigate a deep reinforcement learning (RL) architecture that supports explaining why a learned agent prefers one action over another. The key idea is to learn action-values that are directly represented via human-understandable properties of expected futures. This is realized via the embedded self-prediction (ESP)model, which learns said properties in terms of human provided features. Action preferences can then be explained by contrasting the future properties predicted for each action. To address cases where there are a large number of features, we develop a novel method for computing minimal sufficient explanations from anESP. Our case studies in three domains, including a complex strategy game, show that ESP models can be effectively learned and support insightful explanations.
研究动机与目标
- 开发一种深度强化学习智能体,通过人类可理解的对比性未来预测而非原始Q值来解释动作偏好。
- 通过将有意义的、领域提供的特征嵌入价值函数,解决在高维状态空间中解释复杂动作偏好的挑战。
- 通过训练GVFs使其自预测代理自身的贪婪策略,确保解释的可靠性。
- 在高特征设置中通过最小充分解释和梯度积分法实现特征归因,以简化解释。
提出的方法
- ESP模型将广义价值函数(GVFs)嵌入动作价值函数中,其中每个GVF预测未来轨迹上人类提供的特征的期望折扣累积值。
- GVFs通过自预测进行训练:从Q函数导出的策略必须与最大化预测GVF值的策略保持一致。
- 提出ESP-DQN算法,在表格设置中具有理论收敛保证,并在深度强化学习中得到实证验证。
- 应用梯度积分法(IG)计算特征归因,以解释为何一个动作优于另一个,确保归因的可靠性。
- 使用最小充分解释(MSE)识别保留解释有效性的最小特征集合,从而在高维特征空间中提升可解释性。
- 在三个领域中评估该框架,包括一款复杂的实时战略游戏(星际争霸II),通过GPF预测和归因的定性和定量分析进行评估。
实验结果
研究问题
- RQ1深度强化学习智能体能否使用人类可理解的未来属性而非原始Q值,提供动作偏好的对比性解释?
- RQ2如何以确保智能体策略与预测未来属性一致的方式将GVFs嵌入Q函数?
- RQ3梯度积分法能否在GVFs背景下产生对特征贡献到动作偏好具有可靠性的归因?
- RQ4如何计算最小充分解释以在不损失保真度的前提下简化复杂且高维的解释?
- RQ5ESP模型生成的解释在多大程度上与领域知识一致,并能揭示智能体行为中的有效推理和缺陷?
主要发现
- 在星际争霸II案例研究中,ESP模型正确识别出购买+8个陆战队员可加快胜利,因为其减少了敌方冥卫的伤害并提升了友方陆战队员靠近敌方基地的位置。
- 该模型揭示了次优动作会导致更高的预期伤害和基地摧毁概率,与游戏机制一致,验证了模型推理的合理性。
- 梯度积分法将最高偏好归因于防御敌方冥卫(F94),表明智能体优先考虑威胁缓解而非单位数量。
- 最小充分解释成功减少了相关特征的数量,使用户能够聚焦于影响动作偏好的最关键因素。
- 该模型发现了GVF预测中的缺陷,例如预期存活单位数为负,表明训练中需要引入ReLU等输出约束。
- 解释与已知游戏机制一致——例如陆战队员对抗冥卫,异虫爆熊对抗陆战队员——表明模型捕捉到了与领域相关的战略逻辑。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。