Skip to main content
QUICK REVIEW

[论文解读] Widening the Pipeline in Human-Guided Reinforcement Learning with Explanation and Context-Aware Data Augmentation

Lin Guan, Mudit Verma|arXiv (Cornell University)|Jun 26, 2020
Explainable Artificial Intelligence (XAI)参考文献 65被引用 15
一句话总结

本文提出 EXPAND,一种新型的人机协同强化学习方法,通过将人类视觉解释(如突出显示相关图像区域的显著性图)整合到深度强化学习中,以提升样本效率。通过仅对解释中不相关的区域进行扰动的上下文感知数据增强,EXPAND 提升了策略学习效果,在与基线方法相比,人类反馈信号减少超过30%,且在环境样本效率方面表现更优。

ABSTRACT

Human explanation (e.g., in terms of feature importance) has been recently used to extend the communication channel between human and agent in interactive machine learning. Under this setting, human trainers provide not only the ground truth but also some form of explanation. However, this kind of human guidance was only investigated in supervised learning tasks, and it remains unclear how to best incorporate this type of human knowledge into deep reinforcement learning. In this paper, we present the first study of using human visual explanations in human-in-the-loop reinforcement learning (HRL). We focus on the task of learning from feedback, in which the human trainer not only gives binary evaluative "good" or "bad" feedback for queried state-action pairs, but also provides a visual explanation by annotating relevant features in images. We propose EXPAND (EXPlanation AugmeNted feeDback) to encourage the model to encode task-relevant features through a context-aware data augmentation that only perturbs irrelevant features in human salient information. We choose five tasks, namely Pixel-Taxi and four Atari games, to evaluate the performance and sample efficiency of this approach. We show that our method significantly outperforms methods leveraging human explanation that are adapted from supervised learning, and Human-in-the-loop RL baselines that only utilize evaluative feedback.

研究动机与目标

  • 通过引入超越二元评价判断的人类反馈,解决深度强化学习(DRL)样本效率有限的问题。
  • 探究人类视觉解释(如显著性标注)如何被有效整合到 DRL 中以提升学习效率。
  • 通过利用现成的目标检测器和跟踪器实现半自动显著性标注,降低人类提供解释所需的努力。
  • 开发一种数据增强策略,通过聚焦于不相关区域的扰动来增强人类解释的有用性。
  • 在合成环境和人机协同设置中评估该方法,证明其在环境样本效率和人类反馈样本效率方面的优越性。

提出的方法

  • EXPAND 使用人机协同强化学习框架,其中智能体向人类训练者查询二元的‘好’或‘坏’反馈以及状态图像上的视觉显著性标注。
  • 其采用上下文感知的数据增强模块,仅对人类解释中识别出的非显著区域应用扰动(例如高斯模糊),以保留与任务相关的特征。
  • 该方法引入双损失机制:不变性损失强制同一状态在不同增强视图下的预测保持一致,优势损失则比较增强前后状态的预测差异。
  • 显著性图通过预训练的目标检测器和跟踪器从人类标注的目标中自动生成,从而减轻标注负担。
  • 智能体使用改进的 DQN 算法进行训练,联合优化策略,同时利用二元反馈和增强后的解释信号。
  • 通过有针对性地扰动相关与不相关特征,该框架在低数据场景下保持稳定且高效。

实验结果

研究问题

  • RQ1与仅使用二元反馈相比,人类视觉解释是否能显著提升深度强化学习中的样本效率?
  • RQ2如何设计上下文感知的数据增强方法,以增强强化学习中人类解释的有用性?
  • RQ3是否可行通过目标检测与跟踪技术,以低努力、半自动方式收集人类视觉解释?
  • RQ4通过数据增强整合人类解释是否优于标准的数据增强技术?
  • RQ5所提出的方法是否能减少所需的人类反馈信号数量,同时保持或提升学习性能?

主要发现

  • 在包括 Pixel-Taxi 和四个 Atari 游戏在内的五个任务中,EXPAND 在环境样本效率方面显著优于 DQN-Feedback 和基于解释的监督学习基线方法。
  • 与基线方法相比,该方法将人类反馈信号需求减少了超过30%,证明了人类反馈效率的提升。
  • 在人机协同用户研究中,EXPAND 在30分钟交互窗口内性能优于 DQN-Feedback,人类训练者平均提供了 2,026 对反馈-解释数据。
  • 上下文无关的数据增强方法(如随机裁剪和高斯模糊)在部分任务中导致性能下降,表明其效果不如上下文感知的扰动。
  • 消融实验证实,结合不变性损失与优势损失的增强数据可获得最佳性能,且单独使用任一损失组件均显著优于基线。
  • 使用现成的目标检测器和跟踪器实现了半自动显著性标注,每次查询的人工标注时间平均约为5分钟,证实了人类工作量的降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。