Skip to main content
QUICK REVIEW

[论文解读] Understanding Learned Reward Functions

Eric J. Michaud, Adam Gleave|arXiv (Cornell University)|Dec 10, 2020
Explainable Artificial Intelligence (XAI)参考文献 27被引用 4
一句话总结

本文提出使用显著性图与反事实分析来审计强化学习中的学习型奖励函数,发现其往往依赖于虚假的、与环境相关的特征,而非核心偏好。尽管奖励输出发生大幅变化,基于这些函数训练的策略仍能表现良好,表明当前可解释性方法无法准确预测策略鲁棒性,且可能突出显示无关的改变。

ABSTRACT

In many real-world tasks, it is not possible to procedurally specify an RL agent's reward function. In such cases, a reward function must instead be learned from interacting with and observing humans. However, current techniques for reward learning may fail to produce reward functions which accurately reflect user preferences. Absent significant advances in reward learning, it is thus important to be able to audit learned reward functions to verify whether they truly capture user preferences. In this paper, we investigate techniques for interpreting learned reward functions. In particular, we apply saliency methods to identify failure modes and predict the robustness of reward functions. We find that learned reward functions often implement surprising algorithms that rely on contingent aspects of the environment. We also discover that existing interpretability techniques often attend to irrelevant changes in reward output, suggesting that reward interpretability may need significantly different methods from policy interpretability.

研究动机与目标

  • 为解决在人工指定不可行的真实世界强化学习任务中,验证学习型奖励函数是否真正反映人类偏好的挑战。
  • 探究诸如显著性图等可解释性技术能否检测出奖励函数中的故障模式,例如对虚假相关性的依赖。
  • 评估现有可解释性方法是否能预测基于学习型奖励函数训练出的策略的鲁棒性。
  • 识别当前可解释性工具在奖励函数语境下的局限性,这些局限性与策略可解释性存在根本性差异。
  • 倡导开发针对奖励函数数学结构(尤其是其对单调变换的不变性)量身定制的新可解释性方法。

提出的方法

  • 应用显著性方法以识别对学习型奖励函数输出影响最大的输入特征。
  • 使用反事实输入(如移除或修改特定环境特征)来测试奖励函数输出的变化。
  • 将显著性图与反事实变化结果同真实奖励函数进行比较,以评估可解释性的保真度。
  • 在 TwoGoals 和 Seaquest 等环境中,评估奖励输出变化是否与策略性能变化相关。
  • 评估在修改后的奖励函数上训练的策略的鲁棒性,以判断显著性方法是否能预测策略的可迁移性。
  • 使用 EPIC 作为基准,将学习型奖励函数与真实奖励函数进行比较,尽管承认在缺乏真实奖励函数时其存在局限性。

实验结果

研究问题

  • RQ1学习型奖励函数是否依赖于虚假或依赖环境的特征,而非核心人类偏好?
  • RQ2基于显著性的可解释性方法能否可靠地识别出奖励函数所依赖的特征?
  • RQ3奖励函数输出的变化在多大程度上能预测基于其训练的策略行为的变化?
  • RQ4为何某些奖励输出的大幅变化未能影响策略性能?这对可解释性意味着什么?
  • RQ5需要何种类型的可解释性方法,才能验证学习型奖励函数是否真实反映了人类偏好?

主要发现

  • 学习型奖励函数通常实现反直觉的算法,依赖于依赖环境的特征,例如在驾驶任务中依赖刹车指示器的状态。
  • 显著性方法经常关注于对策略行为无影响的奖励输出无关变化,例如乘法缩放。
  • 即使由于特征移除导致奖励函数输出发生显著变化,策略仍能获得高回报,表明当前可解释性工具的预测能力较差。
  • 在噪声或受损特征(例如在 Seaquest 中移除得分)上训练的奖励函数,仍能训练出优于随机的策略,表明其对输出扰动具有鲁棒性。
  • 可解释性方法缺乏对单调变换的不变性,可能导致其突出显示误导性差异,从而降低其在审计奖励函数中的实用性。
  • 迫切需要开发新型可解释性技术,以考虑奖励函数独特的数学结构,例如对正仿射变换的不变性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。