Skip to main content
QUICK REVIEW

[论文解读] Learning from Ambiguous Demonstrations with Self-Explanation Guided Reinforcement Learning

Yan Zha, Lin Guan|arXiv (Cornell University)|Oct 11, 2021
Explainable Artificial Intelligence (XAI)参考文献 35被引用 4
一句话总结

该论文提出SERLfD,一种由自解释引导的强化学习框架,通过让智能体推断任务相关的物体关系(例如基于空间或颜色的谓词)作为自解释,从而改善从模糊人类示范中学习的效果。通过将自解释预测器(SE-Net)集成到GAN-IRL中,该方法增强了策略学习的稳定性和性能,尤其在示范模糊或噪声较大的任务中表现更优,优于标准的RLfD基线方法。

ABSTRACT

Our work aims at efficiently leveraging ambiguous demonstrations for the training of a reinforcement learning (RL) agent. An ambiguous demonstration can usually be interpreted in multiple ways, which severely hinders the RL-Agent from learning stably and efficiently. Since an optimal demonstration may also suffer from being ambiguous, previous works that combine RL and learning from demonstration (RLfD works) may not work well. Inspired by how humans handle such situations, we propose to use self-explanation (an agent generates explanations for itself) to recognize valuable high-level relational features as an interpretation of why a successful trajectory is successful. This way, the agent can provide some guidance for its RL learning. Our main contribution is to propose the Self-Explanation for RL from Demonstrations (SERLfD) framework, which can overcome the limitations of traditional RLfD works. Our experimental results show that an RLfD model can be improved by using our SERLfD framework in terms of training stability and performance.

研究动机与目标

  • 为解决从模糊人类示范中训练强化学习智能体的挑战,其中多种解释会阻碍稳定和高效的训练。
  • 克服现有RLfD方法在示范存在噪声或缺乏明确任务相关信号时的局限性。
  • 通过使智能体生成自解释——识别相关物体关系——来模拟人类的内省过程,作为消除示范模糊性的机制。
  • 在涉及显式运动动作和隐式关系知识的复杂现实世界机器人任务中,提升样本效率和策略性能。
  • 开发一种框架,利用领域谓词的背景知识来指导示范的消歧,而无需显式标注。

提出的方法

  • 提出一种由自解释引导的强化学习框架(SERLfD),将生成对抗逆强化学习(GAN-IRL)与非线性自解释预测器(SE-Net)结合,从未观测原始数据中推断任务相关的谓词效用。
  • 训练SE-Net以基于示范轨迹预测符号谓词的效用权重(例如,'block_at_yellow','ring_at_blue'),使智能体能够识别对任务成功最相关的关联关系。
  • 通过将预测的自解释融入RL智能体的状态或奖励函数,以指导策略学习,提升泛化能力并降低对噪声或模糊示范的敏感性。
  • 在GAN-IRL中使用判别器来区分成功与失败的轨迹,同时由SE-Net提供解释性信号,以提升判别能力和策略优化效果。
  • 利用领域谓词的共享词汇表和分类器,将符号关系与视觉观测对齐,实现在原始感官输入上的符号推理。
  • 端到端地联合训练SE-Net与RL策略,采用对抗性模仿学习,使智能体学习生成与成功示范一致的解释。

实验结果

研究问题

  • RQ1自解释机制能否提升智能体在从模糊人类示范中学习时的训练稳定性和性能?
  • RQ2智能体如何从未专家、非结构化的示范中推断出任务相关的物体关系(例如空间或颜色谓词),而无需显式标注?
  • RQ3在奖励函数或状态空间中引入自解释,能在多大程度上提升RLfD中的样本效率和泛化能力?
  • RQ4自解释如何帮助消除对同一示范的冲突性解释,例如根据颜色或位置将物体分配到目标区域?
  • RQ5SE-Net能否在复杂机器人任务中有效识别并优先考虑因果上重要的关系(例如,'block_at_yellow' 优先于 'block_at_L1')?

主要发现

  • 与标准RLfD基线相比,SERLfD框架在模糊示范环境中显著提升了训练稳定性和最终性能。
  • 在Robot-Push领域中,SACfD+SE与TD3fD+SE模型成功学习到优先关注任务相关的谓词,如 'block_at_yellow' 和 'ring_at_blue',即使示范模糊,也能与人类意图保持一致。
  • 在Robot-Remove-and-Push领域中,模型正确识别出高价值谓词,如 'is_cube_pushedTo_blue' 和 'is_cylinder_pushedTo_yellow',有效引导了复杂操作任务中的行为。
  • 在离散Pacman领域中,增强SE-Nets的RL智能体优于基线方法,展现出在最优时机摄取能量豆以捕捉幽灵方面的改进决策能力。
  • 自解释预测器(SE-Net)成功学习到随时间推移为相关谓词分配更高的效用权重,预测结果从不相关关系逐渐转向更关键的任务关系。
  • 自解释的可视化结果表明,模型能动态调整对任务相关关系的解释,例如在后期步骤中,当仅剩一个目标时,更倾向于选择 'ring_at_L1' 而非 'ring_at_blue'。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。