[论文解读] DQN-TAMER: Human-in-the-Loop Reinforcement Learning with Intractable Feedback
DQN-TAMER 将 Q 学习分支和 TAMER 风格的人类反馈分支结合起来,在现实世界的人类反馈条件(二元、延迟、随机、不可持续以及自然反应)下更快地学习。它在迷宫和出租车任务中优于基线,并且能够在真实世界演示中利用隐式面部表情反馈。
Exploration has been one of the greatest challenges in reinforcement learning (RL), which is a large obstacle in the application of RL to robotics. Even with state-of-the-art RL algorithms, building a well-learned agent often requires too many trials, mainly due to the difficulty of matching its actions with rewards in the distant future. A remedy for this is to train an agent with real-time feedback from a human observer who immediately gives rewards for some actions. This study tackles a series of challenges for introducing such a human-in-the-loop RL scheme. The first contribution of this work is our experiments with a precisely modeled human observer: binary, delay, stochasticity, unsustainability, and natural reaction. We also propose an RL method called DQN-TAMER, which efficiently uses both human feedback and distant rewards. We find that DQN-TAMER agents outperform their baselines in Maze and Taxi simulated environments. Furthermore, we demonstrate a real-world human-in-the-loop RL application where a camera automatically recognizes a user's facial expressions as feedback to the agent while the agent explores a maze.
研究动机与目标
- 通过解决长时域信用分配和慢 reward 传播的问题来推动机器人强化学习。
- 建模包括二元、延迟、随机性、不可持续性,以及自然反应的人类在环反馈的现实性。
- 开发一种有效融合即时人类反馈与远距离环境奖励以加速学习的算法。
- 在仿真和基于相机的人脸表情反馈系统的真实场景中展示方法的鲁棒性。
提出的方法
- 引入两种价值函数:Q 表示环境奖励,H 表示人类反馈。
- 定义组合策略 pi(s) = argmax_a [ alpha_q * Q_hat(s,a) + alpha_h * H_hat(s,a) ],其中 alpha_h 随时间衰减到零。
- 在 DQN 基础上扩展一个辅助的 TAMER-like 模块,通过二元反馈学习 H,使用损失 L(H_hat) 以及 episodic/local/global 回放缓冲区。
- 允许延迟、随机且可能不完美的反馈,并展示对反馈停止(不可持续性)和自然反应误差的鲁棒性。
- 提供一个实时系统,其中通过面部表情分类生成隐式反馈并整合到 DQN-TAMER 中。
实验结果
研究问题
- RQ1当人类反馈二元、延迟、随机,且在收敛前可能停止时,DQN-TAMER 的表现如何?
- RQ2代理是否能有效地将即时人类反馈与远距离环境奖励结合,以加速学习?
- RQ3对隐式反馈的识别错误(如面部表情分类器的误识别)方法是否鲁棒?
- RQ4该方法是否能推广到真实世界的人类在环情景,而不仅限于仿真反馈?
主要发现
- DQN-TAMER 在迷宫和出租车任务中相较于奖励塑形的 DQN 与 Deep TAMER 学得更快、表现更好。
- 该方法对延迟、随机性和反馈不可持续性具有鲁棒性,在基线方法表现不佳时仍保持优越性能。
- 来自人类反馈的初始引导加速探索,而当 alpha_h 衰减后,环境奖励主导学习。
- 在现实世界演示中,使用面部表情反馈(快乐/消极)的汽车机器人能够在分类器存在误差(约 15% 的错误率)的情况下学习迷宫导航。
- 该方法对 TAMER 和 DQN 具有泛化性,当 alpha_h 为零时表现为 DQN,当 alpha_q 为零时表现为 Deep TAMER。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。